跳到正文
原文
vLLM 官方博客(网页)·· 22 小时前精选AI 评分70

vLLM 推出 AFD 插件:解耦 Attention 与 FFN 实现 MoE 灵活推理

Announcing vLLM AFD Plugin: Disaggregating Attention and FFN for Flexible MoE ServingJul 23, 2026·9 min readWhat vLLM AFD Plugin adds to the vLLM ecosystem: Attention–FFN disaggregation for MoE serving, GPU and Ascend NPU backends, connector-based execution, and graph and ubatching support.

AI 导读

vLLM 发布实验性插件 vLLM AFD Plugin,通过将 MoE 模型的 Attention 与 FFN 拆分为独立部署的服务,实现两者的独立扩缩容。插件支持 NVIDIA GPU 与华为昇腾 NPU 后端,兼容 DeepSeek V2/V3 及 GLM MoE 等架构,无需修改 vLLM 源码即可通过标准插件接口接入。

推荐理由

原文解析了通过解耦 Attention 与 FFN 服务实现 MoE 独立扩缩容的架构设计与实测数据,为大模型推理部署优化提供了参考。

来源:vLLM 官方博客(网页) · vllm.ai