The vLLM project has merged a fix for block FP8 Multi-Token Prediction (MTP) support within ModelOpt mixed checkpoints to improve inference runtime compatibility.
HOW THIS AFFECTS YOU
●
builderYou can now use mixed-precision ModelOpt checkpoints more reliably in vLLM inference pipelines.