E-MoE Enhances Non-Factorized Diffusion Language Models
September 28, 2026
E-MoE utilizes a Mixture-of-Experts backbone to create a mixture of factorized distributions over a discrete shared latent in masked diffusion models. This aims to improve sample quality in few-step regimes without increasing active parameter counts.
HOW THIS AFFECTS YOU
●
researcherThis addresses posterior collapse in continuous Gaussian latents for diffusion-based text generation.