Diversity Metrics in LLM Ensembles Often Confuse Capability with Diversity
July 24, 2026
An audit of 31,900 LLM subsets reveals that most diversity metrics are highly collinear with model accuracy. While latent complementarity is ubiquitous, simple majority voting only beats the strongest member in 9.98% of size-3 subsets on MMLU-Pro.
HOW THIS AFFECTS YOU
●
builderBe cautious when selecting models for ensembles based purely on traditional diversity metrics.
●
researcherStandard diversity measures may be unreliable proxies for true ensemble gain due to capability entanglement.