vLLM 官方博客(网页)·· 8 小时前精选AI 评分69
vLLM 优化 Qwen3.5 解耦推理:单 GPU 吞吐达 25K TPS
vLLM Reaches 25K Total TPS/GPU on Qwen3.5Aug 6, 2026·9 min readHow vLLM reaches 25K total TPS/GPU on Qwen3.5-397B-A17B-NVFP4 with GB200 NVL72 disaggregated serving, Blackwell GDN kernels, HMA cache transfer, async scheduling fixes, and srt-slurm recipes.
AI 导读
vLLM 团队公布了基于 GB200 NVL72 系统的 Qwen3.5-397B-A17B-NVFP4 解耦推理优化方案,实现单 GPU 总吞吐超过 25,000 TPS。
推荐理由
原文展示了混合注意力架构模型在解耦推理下的状态传输与算子优化方案,读者可参考其配置配方提升大模型吞吐。
来源:vLLM 官方博客(网页) · vllm.ai