Aggregating acoustic, prosodic, and linguistic cues across multiple utterances allows multimodal automatic speaker verification (ASV) systems to outperform unimodal models. This cross-utterance information accumulation poses a significant threat to current speaker anonymization techniques.
HOW THIS AFFECTS YOU
●
researcherYou must account for multi-utterance information leakage when designing robust anonymization protocols.
●
policyCurrent privacy standards for anonymized speech may be insufficient against multimodal aggregation attacks.