vLLM 官方博客(网页)·· 1 小时前精选AI 评分76
vLLM 正式支持 NVIDIA Vera Rubin NVL72,单卡吞吐量达 GB200 的 7.8 倍
vLLM Support for NVIDIA Vera Rubin NVL72: 7.8x Throughput over GB200 NVL72Oct 9, 2026·11 min readvLLM now runs on NVIDIA Vera Rubin NVL72 with day-0 model support, Rubin-tuned FlashInfer kernels, and locality-aware MoE, delivering 7.8x the per-GPU throughput of GB200 NVL72 on AgentX.
AI 导读
vLLM 官方宣布支持 NVIDIA Vera Rubin NVL72 平台,在 AgentX 基准测试中单 GPU 吞吐量达到 GB200 NVL72 的 7.8 倍。
推荐理由
文章详述了利用 locality domain 拆分 MoE 权重的工程设计,为大模型推理引擎适配新一代硬件架构提供了具体参考。
来源:vLLM 官方博客(网页) · vllm.ai