Co-Evolving Inspectable Verifiers Mitigate Reward Hacking in Self-Improving Agents
October 9, 2026
This method evolves verifiers as inspectable expressions of deterministic detectors rather than black-box LLM judges. On MBPP+, the approach achieved +0.21 held-out agreement over hand-authored rubrics, using anchored reference sets to prevent verifiers from collapsing into vacuous, always-pass graders.
HOW THIS AFFECTS YOU
●
builderYou can use inspectable verifiers to prevent reward hacking in agentic loops.
●
researcherThis method provides a way to validate co-evolved verifiers using anchored reference sets.