SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
August 14, 2026
SEMA implements a two-stage training framework to automate multi-turn jailbreak attacks without external datasets. The method utilizes prefilling self-tuning on self-generated non-refusal rollouts followed by reinforcement learning with an intent-drift-aware reward to maintain harmful objectives across extended dialogue turns.