Cosine Similarity Underestimates Persona Structure in 7-8B Dialogue Models
September 22, 2026
Linear probes achieve 0.73-0.97 AUC in recovering persona structure from hidden states, whereas cosine kNN only reaches 0.56-0.77. This mismatch demonstrates that ambient cosine similarity fails to capture linearly decodable information in dialogue-conditioned transformer representations.
HOW THIS AFFECTS YOU
●
researcherYou should avoid relying solely on cosine similarity for representation analysis in dialogue models.