说明
该职位是核心技术岗位,负责设计、实施和维护基准测试,以评估前沿 AI 智能体在真实、特定领域工作流程中的表现。职责包括与领域专家共同定义评估任务、构建可扩展的模型和智能体基础设施、开发指标和统计分析方法、根据现实世界的预期验证基准测试表现,以及编写技术文档。该职位要求具备 2 至 4 年研究或机器学习工程经验,熟练掌握 Python、Docker 和 Linux,并拥有 AI 智能体或大型语言模型评估环境的实践经验。该职位要求在新加坡现场办公,年薪范围为 150,000 至 250,000 美元(USD),并可提供签证担保。
