Beschreibung
NVIDIA stellt eine:n Senior-Softwareentwickler:in mit Spezialisierung auf Deep-Learning-Inferenz ein, um GPU-beschleunigte Software für die Bereitstellung von Sprachmodellen und generativen KI-Modellen im großen Maßstab zu entwerfen, zu entwickeln und zu optimieren. Die Rolle konzentriert sich auf die Verbesserung von SGLang, vLLM, FlashInfer und verwandten Inferenzbibliotheken, die Skalierung der Leistung über Datacenter-GPUs und Edge-SoCs hinweg sowie den Einsatz von CUDA, CUTLASS, OAI Triton, NCCL und weiteren Open-Source-Tools. Bewerber:innen benötigen einen Masterabschluss oder einen PhD in einem relevanten Fachgebiet, mindestens fünf Jahre Erfahrung in der Softwareentwicklung, fundierte C/C++-Kenntnisse und Erfahrung mit der Inferenz von DL-Modellen, Profiling oder GPU-Architektur.
