vLLM 官方博客(网页)·· 22 小时前精选AI 评分79
vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型推理
Day 0 Support for Qwen3.8-2.4T-A95B on vLLMAug 12, 2026·4 min readDay-0 vLLM support for Qwen3.8-2.4T-A95B: a 2.4-trillion-parameter hybrid MoE model served out of the box, with FP8/BF16 checkpoints plus NVFP4 and MXFP4 quantized weights, and co-developed kernels on NVIDIA and AMD hardware.
AI 导读
vLLM 宣布首日支持千问 Qwen3.8-2.4T-A95B 开源模型,提供开箱即用的推理服务。该模型为 2.4T 参数的稀疏混合专家(MoE)架构,包含 512 个专家并采用全注意力与线性注意力的混合主干。除官方 FP8 和 BF16 权重外,vLLM 还支持 NVFP4 与 MXFP4 量化版本,可在单节点 NVIDIA B300 或 AMD MI355X 上完成高效推理。
推荐理由
原文提供了超大混合专家模型的推理部署命令与多硬件算子优化细节,便于工程团队评估大模型服务资源。
来源:vLLM 官方博客(网页) · vllm.ai