SSRFT Framework Internalizes Safety Roles to Prevent Jailbreaks
October 7, 2026
Supervised Safe-Role Fine-Tuning (SSRFT) moves beyond refusal patterns by training models to internalize a predefined safe role. The method uses a Safe-Role Question-Answer dataset synthesized from psychometric questions and limited jailbreak prompts to improve robustness and reduce over-refusal.
HOW THIS AFFECTS YOU
●
researcherYou can evaluate this method as a way to achieve deeper value alignment compared to standard RLHF.