Constitutional Midtraining Increases Alignment Durability in 120B Models
July 30, 2026
Inserting values-based content during midtraining, rather than just post-training, produces more durable alignment. Tests on a 120B scale show these models better resist misalignment during subsequent fine-tuning and blackmail attempts.
HOW THIS AFFECTS YOU
●
researcherYou should consider midtraining interventions to ensure alignment remains stable through multiple fine-tuning stages.
●
policyThis demonstrates a method for building models that are more robust against adversarial alignment attacks.