Limits of Recursive Social Improvement in Multi-Agent LLMs
October 1, 2026
Research into recursive social improvement shows that LLMs pursuing individual rewards often perform worse than solo learners. In controlled environments, multi-agent populations using social-learning algorithms earned less reward per token due to narrow exploration or premature token exhaustion.
HOW THIS AFFECTS YOU
●
researcherThis highlights a critical bottleneck in scaling multi-agent systems via independent agent optimization.