跳到正文
原文
vLLM 官方博客(网页)·· 12 小时前精选AI 评分63

vLLM 集成腾讯混元 HPC-Ops Attention 与 MoE 高性能后端

vLLM × HPC-Ops: High-Performance Attention and MoE Backends from Tencent HunyuanJul 6, 2026·12 min readHow HPC-Ops integrates Hopper-optimized attention and FP8 MoE backends into vLLM for Tencent Hunyuan Hy3, improving mixed-length decode, MoE latency, TTFT, and TPOT on NVIDIA H20.

AI 导读

腾讯混元 AI Infra 团队打造的高性能算子库 HPC-Ops 正式合入 vLLM 主干分支,作为第一类原生 Attention 与 MoE 后端提供支持。

推荐理由

原文给出了动态负载均衡解码调度与全融合 FP8 MoE 算子的实测数据,读者可以参考其在长短序列混杂推理与 H20 硬件上的延迟优化收益。

来源:vLLM 官方博客(网页) · vllm.ai