说明AWS 正在招聘一名系统开发工程师,负责为大规模 AI/ML 加速器和 GPU 服务器集群构建自动化、诊断工具以及预测性健康基础设施。该职位涵盖集群健康监控、预测性故障检测、测试自动化、Linux 和 GPU 子系统调试、遥测数据管道、CI/CD,以及与硬件、固件、软件、运营和 ODM 团队的跨职能协作。该职位要求定期到制造合作伙伴现场办公,并要求具备丰富的编程、系统设计、Linux 和专业软件开发经验,以及学士学位或同等工作经验。