Beschreibung
Prior Labs sucht einen Infrastrukturingenieur, der die Verantwortung für die Weiterentwicklung einer GPU-Infrastruktur mit mehreren Clustern für das Training tabellarischer Foundation Models übernimmt. Die Rolle umfasst die Clusterarchitektur für Slurm und GCP, Scheduling, Zuverlässigkeit, Kostenoptimierung, GPU-Auslastung, die Leistung verteilten Trainings, Hardwareauswahl, Kapazitätsplanung und Tools zur Steigerung der Entwicklerproduktivität. Bewerber sollten mindestens drei Jahre Erfahrung im Aufbau und Betrieb produktiver GPU-Infrastrukturen oder verteilter Trainingssysteme, fundierte Kenntnisse in Slurm und Python/PyTorch sowie nachweisliche Erfolge bei der Verbesserung des Trainingsdurchsatzes oder der Kosteneffizienz mitbringen. Das Team ist in Berlin, Freiburg und New York ansässig; in Ausnahmefällen ist Remote-Arbeit möglich.

