跳到正文
原文
vLLM 官方博客(网页)·· 7 小时前精选AI 评分73

vLLM 预览 Kimi K3 生产级推理支持:重构 KDA 前缀缓存并优化 MXFP4 MoE

A Preview of Production-Scale Kimi K3 Support on vLLMJul 22, 2026·13 min readA preview of production-scale Kimi K3 support in vLLM, including KDA-aware prefix caching, fused kernels, optimized MXFP4 MoE, multimodal integration, and initial NVIDIA and AMD paths.

AI 导读

vLLM 宣布将为月之暗面(Moonshot AI)预计 7 月 27 日开源的 2.8T 参数模型 Kimi K3 提供 Day-0 生产级推理支持。针对 KDA 循环注意力机制,vLLM 将物理状态块大小与前缀匹配粒度解耦,实现了细粒度前缀缓存命中与写时复制。

推荐理由

文章详细拆解了针对 KDA 循环注意力与 MXFP4 MoE 的前缀缓存重构及算子优化,读者可据此了解超大混合架构在开源引擎中的工程落地细节。

来源:vLLM 官方博客(网页) · vllm.ai