vLLM 官方博客(网页)·· 10 小时前精选AI 评分76
vLLM 首发支持 MiniMax M3:实现 1M 上下文多模态稀疏注意力推理
MiniMax M3 in vLLM: Day-0 Serving for 1M-Token Multimodal ReasoningJun 12, 2026·21 min readHow vLLM serves MiniMax M3 with MiniMax Sparse Attention, multimodal and reasoning parsers, MXFP8 weights, and long-context deployment recipes.
AI 导读
vLLM 宣布首发支持 MiniMax M3 的 BF16 与 MXFP8 检查点,提供 1M token 上下文的原生多模态推理服务。该方案针对 MiniMax 稀疏注意力(MSA)设计了 128-token 粒度的分块预填充与解码算子,集成 EAGLE3 投机解码及工具与思考解析器。
推荐理由
文章给出了稀疏注意力算子实现、投机解码调优及软硬件启动参数,为百万长上下文多模态模型的低延迟上线提供了具体参考。
来源:vLLM 官方博客(网页) · vllm.ai