Beschreibung
NVIDIA stellt einen Senior Site-Reliability-Ingenieur ein, der große Kubernetes-Cluster betreut und verbessert, die DGX Cloud für KI-Forschende und Unternehmenskunden unterstützen. Die Rolle umfasst die betriebliche Zuverlässigkeit, das Management von SLO/SLI und Fehlerbudgets, die Einführung von Diensten und die Überwachung nach dem Start, die Optimierung von GPU-Workloads bei großen Cloud-Anbietern, Automatisierung, die Erstbewertung von Vorfällen, Ursachenanalysen und Bereitschaftsdienst. Bewerber benötigen einen Bachelorabschluss (BS) in Informatik oder einem verwandten technischen Fachgebiet oder gleichwertige Erfahrung, mindestens 10 Jahre Erfahrung im Betrieb von Produktivdiensten sowie Fachkenntnisse in Kubernetes, Containerisierung, Microservices, Infrastrukturautomatisierung, Programmierung, Linux, Netzwerken, Cloud-Sicherheit, Observability und SRE-Praktiken.
