Beschreibung
CloudFactory stellt einen Site Reliability Engineer ein, der für die Zuverlässigkeit, Observability, Entwicklerwerkzeuge, Automatisierung und standardmäßig sichere Infrastruktur seiner KI-Plattform und Kerndienste verantwortlich ist. Die Rolle umfasst Model Serving und Inferenzinfrastruktur, GPU-gestützte Endpunkte, Autoscaling, SLOs, Incident Response, ML- und LLM-Observability, GitOps, Terraform und wiederverwendbare Plattformkomponenten. Bewerber benötigen mindestens fünf Jahre Erfahrung in den Bereichen Infrastruktur, DevOps oder SRE, Erfahrung im Produktionsbetrieb mit Kubernetes, Cloud- und Skripting-Kenntnisse sowie eine ausgeprägte funktionsübergreifende Zusammenarbeit; Erfahrung mit KI-Plattformen ist ausdrücklich erwünscht.
