Beschrijving
Boskalis zoekt een stagiair reinforcement learning om een bestaand discrete-eventsimulatie- en reinforcement-learningmodel uit te breiden voor optimalisatie van grondstromen in dijkbouwprojecten. De stagiair configureert en breidt het model uit, ontwerpt beloningsfuncties, traint en evalueert Maskable PPO-agents, analyseert het trainingsgedrag, valideert de prestaties aan de hand van projecttoepassingen en documenteert aanbevelingen. Het betreft een flexibele studentenstage van 2–5 dagen per week, gevestigd in Papendrecht, waarbij regelmatige aanwezigheid op kantoor de voorkeur heeft. De stage kan in oktober of november beginnen.
