[HUGGINGFACE]score: 0.42
Understanding and Enhancing Backdoor Persistency in LLM Agent Post-Training
October 4, 2026
Backdoors in LLM agents can survive supervised fine-tuning and often persist or intensify during subsequent reinforcement learning. While SFT reduces attack success, backdoor survival depends on initial trigger strength and gradient compatibility with benign training data. This indicates that task-level RL may inadvertently reinforce malicious latent behaviors.
DAILY DIGEST
you don't check 9 sources — we do. one email every morning, read in 2 min. free. unsubscribe anytime. privacy