Beschreibung
Die Rolle ist für die Entwicklung, den Betrieb und die Optimierung der groß angelegten AWS-HyperPod-GPU-Clusterinfrastruktur von NEURA verantwortlich, die das Training von Foundation Models und kundenseitige Fine-Tuning-Workloads unterstützt. Zu den Aufgaben gehören die Konfiguration der HyperPod-/Slurm- und HyperPod-/EKS-Orchestrierung, die Verbesserung der Clusterstabilität und Fehlertoleranz, die Verwaltung von Workload-Prioritäten und GPU-Auslastung, die Entwicklung von Self-Service-Tools, die Erstellung von Benutzerdokumentation sowie die Aushandlung von AWS-Kapazitäts- und Kostenstrategien. Für die Position sind mindestens fünf Jahre Erfahrung im Infrastruktur- oder Systems Engineering mit Schwerpunkt auf GPU-Clustern oder HPC-Betrieb erforderlich, außerdem praktische Erfahrung mit AWS HyperPod, Kenntnisse in Slurm und Kubernetes, Expertise im verteilten Training sowie Kompetenzen im Cloud-Kostenmanagement.

