DRACO: Dynamic Rubrics for Credit Assignment in Long-Horizon RL
September 2, 2026
DRACO optimizes long-horizon agent training by dynamically generating multi-criteria rubrics during training. It redistributes single-trajectory rubric scores into per-step advantages for GRPO via a closed-form method, addressing the sparse reward problem in outcome-blind environments.
HOW THIS AFFECTS YOU
●
builderThis method provides a path to training agents for complex, long-step tasks using rubric-based feedback.
●
researcherYou can improve credit assignment in RL without programmatic checkers.