跳至主要内容

高级站点可靠性工程师,DGX Cloud at NVIDIA

部门:Site Reliability Engineering

语言
工作方式
远程
地点
苏黎世,苏黎世,瑞士 · 中国
级别
senior
发表

说明

NVIDIA 正在招聘一名高级站点可靠性工程师,负责维护和改进大规模 Kubernetes 集群,为 AI 研究人员和企业客户提供 DGX Cloud 支持。该职位涵盖运营可靠性、SLO/SLI 和错误预算管理、服务上线及上线后监控、跨主要云服务提供商的 GPU 工作负载优化、自动化、事件分诊、根本原因分析以及值班支持。候选人需拥有计算机科学或相关技术领域的学士学位(BS),或具备同等经验;至少 10 年生产服务运营经验;并精通 Kubernetes、容器化、微服务、基础设施自动化、编程、Linux、网络、云安全、可观测性和 SRE 实践。

对于求职者

准备好寻找真正适合的角色了吗?

上传您的简历,启动求职主题,让 Metaintro 根据您的经验对真实空缺职位进行排名,然后引导您从搜索到录用。

匹配

将在招职位与你现有的证据对照。

定位

把证明项目转化为针对岗位的申请。

提升

用市场反馈保持技能计划的更新。

返回导航