Deterministic benchmark and RL environment for evaluating autonomous AI agents on hidden system invariant discovery, failure diagnosis, and safe code interventions.
docker debugging benchmark reinforcement-learning software-engineering autonomous-agents ai-agents deterministic-environment llm-evaluation ai-evals
-
Updated
Sep 1, 2026 - Python