Descrizione
NVIDIA assume un ingegnere senior di affidabilità dei siti per mantenere e migliorare cluster Kubernetes su larga scala a supporto di DGX Cloud per ricercatori nel campo dell’IA e clienti aziendali. Il ruolo comprende l’affidabilità operativa, la gestione di SLO/SLI e dei budget di errore, il lancio dei servizi e il monitoraggio successivo al lancio, l’ottimizzazione dei carichi di lavoro GPU presso i principali provider cloud, l’automazione, il triage degli incidenti, l’analisi delle cause principali e il supporto di reperibilità. I candidati devono avere una laurea triennale (BS) in informatica o in un campo tecnico correlato, oppure esperienza equivalente, almeno 10 anni di esperienza nelle operazioni di servizi in produzione e competenze in Kubernetes, containerizzazione, microservizi, automazione dell’infrastruttura, programmazione, Linux, reti, sicurezza cloud, osservabilità e pratiche SRE.
