Description
The Platform Systems team at OpenAI builds engineering and research infrastructure for training OpenAI’s flagship models on large, custom-built supercomputers. They develop core model training software and work deep in the stack, focusing on collective communication, compute efficiency, parallelism strategies, fault tolerance, failure detection, and observability. This role involves designing and building distributed systems for visibility and reliable operation of large-scale AI training workloads, specifically working on failure detection, tracing, and profiling systems to improve observability, reliability, and performance across OpenAI’s training platform.
