vLLM Fixes DiffusionGemma Attention Mask Freezing in CUDA Graphs
September 30, 2026
A bug in vLLM that caused DiffusionGemma to silently freeze attention masks during CUDA graph replay has been resolved. This ensures correct attention mechanisms during accelerated inference.
HOW THIS AFFECTS YOU
●
builderYou can now use CUDA graphs with DiffusionGemma without encountering silent failures in attention masking.