●builderDo not rely solely on standard safety guards to block adversarial harmful content.
●researcherYou can mitigate this by using sparse complementary masking during fine-tuning.
●policyThis highlights a critical failure mode in current automated safety guardrails.