description
Anthropic recrute un ingénieur de recherche pour son équipe de post-entraînement afin de mettre en œuvre, d’optimiser et de déployer à grande échelle des techniques de post-entraînement telles que Constitutional AI, le RLHF et d’autres méthodes d’alignement sur des modèles de pointe. Le poste consiste à développer des pipelines de réglage fin et d’évaluation, à mesurer les performances des modèles, à déboguer les problèmes d’entraînement et à transformer la recherche en systèmes prêts pour la production. Les candidats doivent posséder une solide expérience en génie logiciel et en apprentissage automatique, connaître les grands modèles de langage et maîtriser Python, les frameworks d’apprentissage profond et le calcul distribué. Le poste est hybride, exige au moins un diplôme de bachelor dans un domaine pertinent et peut nécessiter une intervention en cas d’incident avec un préavis court.

