说明
NVIDIA 正在招聘一名高级站点可靠性工程师,负责维护和改进大规模 Kubernetes 集群,为 AI 研究人员和企业客户提供 DGX Cloud 支持。该职位涵盖运营可靠性、SLO/SLI 和错误预算管理、服务上线及上线后监控、跨主要云服务提供商的 GPU 工作负载优化、自动化、事件分诊、根本原因分析以及值班支持。候选人需拥有计算机科学或相关技术领域的学士学位(BS),或具备同等经验;至少 10 年生产服务运营经验;并精通 Kubernetes、容器化、微服务、基础设施自动化、编程、Linux、网络、云安全、可观测性和 SRE 实践。
