Description
This project-based opportunity focuses on creating challenging tasks and evaluation criteria for AI coding agents. The goal is to build a dataset to test, evaluate, and improve AI systems by simulating realistic developer environments and designing tasks that challenge frontier models. Responsibilities include crafting prompts, defining success metrics, verifying agent solutions, and iterating based on feedback.

