vLLM 官方博客(网页)·· 12 小时前精选AI 评分81
vLLM 宣布首日支持月之暗面 Kimi K3
Kimi K3 Is Here: Efficient Day-0 Support on vLLMJul 27, 2026·24 min readvLLM delivers day-0 Kimi K3 serving with hybrid KDA prefix caching, DSpark speculative decoding, production-scale disaggregation, and optimized kernels across NVIDIA and AMD GPUs.
AI 导读
vLLM 宣布首日支持月之暗面 2.8T 参数模型 Kimi K3,提供混合 KDA 前缀缓存与 DSpark 投机解码等生产级部署方案。在 16 卡 NVIDIA GB300 NVL72 上配合 DSpark 投机解码单用户吞吐可达 370 tok/s,解码速度提升 3.14 倍。
推荐理由
文章详细拆解了针对超大混合架构模型的缓存改造与投机解码方案,为同类长上下文 MoE 的高效部署提供了完整参考。
来源:vLLM 官方博客(网页) · vllm.ai