On-Policy Delta Distillation for Reasoning Transfer
July 15, 2026
On-policy delta distillation transfers reasoning capabilities by using a delta signal defined as the difference between a teacher and a base model. This approach provides token-level supervision that captures changes induced by reasoning tuning rather than simple distribution imitation.
HOW THIS AFFECTS YOU
●
researcherYou can improve reasoning distillation by focusing on the delta signal rather than direct imitation.