FlexComp Enables Any-Ratio Context Compression with a Single Model
September 11, 2026
FlexComp uses Matryoshka-style training to decouple compression ratios from training, allowing a single model to handle variable memory budgets per input. Using cascade routing or a learned predictor, it achieves up to 266x average compression while maintaining 98% accuracy of fixed-ratio specialists.
HOW THIS AFFECTS YOU
●
builderYou can dynamically adjust context compression ratios per request to balance latency and accuracy without deploying multiple models.
●
researcherThis provides a method-agnostic framework for studying variable-budget context compression.