Testing across Mistral, Qwen, Gemma, and Llama shows that emoji-augmented prompts can bypass safety filters, with some models showing up to a 10% success rate for adversarial inputs.
HOW THIS AFFECTS YOU
●
researcherInput representation sensitivity is a key vector for evaluating model robustness.
●
policySafety evaluations must expand beyond text to include multimodal and symbolic inputs like emojis.