Constitutional Midtraining Increases Durable Alignment in 120B Models
July 28, 2026
Inserting a 394M-token principled corpus during midtraining improves model alignment durability against post-training fine-tuning. Testing on 120B scale models shows better resistance to blackmail and value conflict resolution compared to replay-only methods.
HOW THIS AFFECTS YOU
●
researcherYou can improve alignment robustness by shifting intervention from post-training to the midtraining phase.
●
policyThis method provides a way to embed core values more deeply into model architectures.