说明Inferact 正在招聘一名推理运行时工程师,负责开发和优化用于大型语言模型和扩散模型的 vLLM 推理引擎。该职位侧重于在多种硬件和架构上执行模型,包括 Transformer 变体、KV-cache 和前缀缓存系统、混合式服务以及多模态推理。候选人需拥有学士学位或同等经验,具备扎实的 Python 和 PyTorch 技能,并拥有 LLM 推理系统相关经验。该职位位于新加坡,年薪为 200,000 至 400,000 新加坡元,另加股权,并提供医疗、牙科和视力保险。