Asymmetry in Compositional Reasoning via Reinforcement Learning
September 18, 2026
A dependency-graph framework reveals an asymmetry in RL post-training: training on decomposed skills does not transfer to composed tasks, but training on composed tasks improves decomposed skill performance. The study uses data-structure tasks to demonstrate this transfer gap.
HOW THIS AFFECTS YOU
●
researcherFocus your RL post-training on complex, composed tasks rather than atomized skills if you want to improve general reasoning.