Counterfactual Sensitivity Reallocates Credit for Long-CoT Reasoning
July 31, 2026
This method identifies unequal token contributions in long-chain-of-thought reasoning by re-scoring trajectories under opposing correctness conditions. It addresses the limitation of methods like GRPO that broadcast response-level rewards uniformly across all tokens in a sequence.
HOW THIS AFFECTS YOU
●
researcherYou can improve RLVR efficiency by applying more granular, counterfactually-grounded credit assignment.