STAMP decouples dialogue from mask prediction in MLLMs
August 2, 2026
STAMP enables efficient multimodal segmentation by decoupling autoregressive dialogue from non-autoregressive mask prediction. It uses a <SEG> trigger and hybrid attention to classify all tokens as foreground or background in a single pass, preserving dialogue ability while maintaining fast inference.
HOW THIS AFFECTS YOU
●
builderYou can achieve faster inference in multimodal segmentation tasks without sacrificing reasoning capabilities.
●
researcherYou can explore a new approach to solving the MLLM segmentation trilemma.