[arXiv]score: 0.18
Selecting Long-Horizon Trajectories for Reliable and Efficient Terminal-Agent Training
October 6, 2026
Selecting optimal supervision horizons for terminal-agent training balances reliability against training costs. On Terminal-Bench, a 12K-token horizon outperforms a 16K-token horizon by solving more tasks while reducing training time by 30%. Longer horizons reduce temporal bias but increase estimation error due to increased heterogeneity in late-stage histories.
DAILY DIGEST
you don't check 9 sources — we do. one email every morning, read in 2 min. free. unsubscribe anytime. privacy