Description
The role focuses on developing and deploying reinforcement-learning policies for closed-loop, safety-critical autonomous driving. Responsibilities include training and deploying RL policies, scaling training across massively parallel simulation systems, designing reward functions, improving sim-to-real transfer, and integrating models into production systems. The position requires modern RL and RLHF algorithms, distributed training, Python and PyTorch, simulation, and knowledge of driving behavior; publications, open-source contributions, LLM fine-tuning, safe RL, and autonomous-vehicle safety standards are preferred.
