description
Kog recrute un ingénieur GPU pour travailler sur l’exécution de bas niveau et les performances GPU de son moteur d’inférence. Le poste porte principalement sur un pipeline de décodage monokernel, l’optimisation de kernels AMD et NVIDIA, l’exécution limitée par la mémoire, le profilage, la communication inter-GPU et la mise à l’échelle de modèles MoE tiers. Les candidats doivent avoir de l’expérience en dessous de la couche des frameworks, concernant le comportement ou les performances du matériel, notamment avec CUDA, HIP, PTX, CDNA ISA, les kernels, le profilage ou des travaux sur des systèmes connexes. Le poste est basé à Paris, avec au moins une semaine de déplacement par mois et une aide à l’hébergement pour les candidats résidant hors de la région.
