vLLM 官方博客(网页)·· 12 小时前精选AI 评分63
vLLM 集成腾讯混元 HPC-Ops Attention 与 MoE 高性能后端
vLLM × HPC-Ops: High-Performance Attention and MoE Backends from Tencent HunyuanJul 6, 2026·12 min readHow HPC-Ops integrates Hopper-optimized attention and FP8 MoE backends into vLLM for Tencent Hunyuan Hy3, improving mixed-length decode, MoE latency, TTFT, and TPOT on NVIDIA H20.
AI 导读
腾讯混元 AI Infra 团队打造的高性能算子库 HPC-Ops 正式合入 vLLM 主干分支,作为第一类原生 Attention 与 MoE 后端提供支持。
推荐理由
原文给出了动态负载均衡解码调度与全融合 FP8 MoE 算子的实测数据,读者可以参考其在长短序列混杂推理与 H20 硬件上的延迟优化收益。
来源:vLLM 官方博客(网页) · vllm.ai