跳到正文
原文
vLLM 官方博客(网页)·· 7 小时前精选AI 评分65

vLLM 详解 Qwen3.8-2.4T 的 PD 分离推理优化实践

PD Serving of Qwen3.8-2.4TSep 21, 2026·17 min readHow vLLM reaches 5K throughput and 180 interactivity on Qwen3.8-2.4T with GB300 NVL72 PD serving and how to reproduce results yourself.

AI 导读

vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。

推荐理由

文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。

来源:vLLM 官方博客(网页) · vllm.ai