Really interesting concept -- instead of optimizing against static benchmarks or internally generated reward models, agents are evaluated through r… | HACKOBAR_