Co-RL: Unsupervised Reasoning via Multi-Agent Reinforcement Learning
August 18, 2026
Co-RL enables unsupervised reasoning by using cooperative multi-agent training to derive reward signals from model completions. This approach mitigates the training collapse and bias common in single-model self-rewarding reinforcement learning.
HOW THIS AFFECTS YOU
●
researcherYou can reduce dependence on costly human-annotated verifiable rewards for reasoning tasks.