Cross-Lingual Vulnerability of Training Data Extraction Attacks
October 6, 2026
Training Data Extraction (TDE) attacks successfully recover PII from multilingual models even when prompts are translated into non-English languages. The research demonstrates that English-centric pre-training data remains vulnerable to attacks prompted in Italian, Spanish, French, and German.
HOW THIS AFFECTS YOU
●
builderYou cannot rely on language-specific barriers to protect sensitive training data from extraction attacks.
●
policyYou must consider cross-lingual data leakage when evaluating the safety and privacy of multilingual LLMs.