Beschreibung
Tools for Humanity sucht einen Senior ML-Plattform- und Betriebsingenieur, der den gesamten Lebenszyklus des maschinellen Lernens verantwortet – von den Daten bis zur Bereitstellung auf Edge-Geräten. Die Rolle konzentriert sich auf den Aufbau und Betrieb produktionsreifer Infrastruktur für Training, Evaluierung, Telemetrie und Bereitstellung; die Wartung von CI/CD und automatisierten Pipelines; die Umsetzung gestaffelter Rollouts und Rollback-Funktionen für Orbs, Orb Mini und mobile Apps; die Entwicklung sicherer APIs und Backend-Dienste; die Implementierung von Modellüberwachung und Drift-Erkennung; sowie die Zusammenarbeit mit Forschungs-, Produkt- und Firmware-Teams. Für die Position sind mindestens fünf Jahre Erfahrung im Aufbau von ML-Infrastruktur oder Produktionssystemen im großen Maßstab erforderlich, ebenso Fachkenntnisse in GPU-Training, Containerisierung, Kubernetes, Terraform, Python oder Go sowie modernen Observability-Praktiken.
