热点事件持续更新
vLLM发布AFD插件支持MoE注意力与FFN解耦部署
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
2026年9月30日,vLLM官方博客宣布推出实验性插件vLLM AFD Plugin。该插件旨在将MoE模型的Attention与FFN拆分为独立部署的服务,从而实现两者的独立扩缩容。在硬件与模型兼容性方面,该插件支持NVIDIA GPU与华为昇腾NPU后端,并兼容DeepSeek V2/V3及GLM MoE等架构。用户无需修改vLLM源码,即可直接通过标准插件接口接入使用。
AI 根据报道生成 · 5 小时前更新
最新进展9月30日 10:25
vLLM推出AFD插件,支持MoE模型Attention与FFN解耦独立扩缩容。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- vLLM 官方博客精选vLLM 推出 AFD 插件:解耦 Attention 与 FFN 实现 MoE 灵活推理
vLLM 发布实验性插件 vLLM AFD Plugin,通过将 MoE 模型的 Attention 与 FFN 拆分为独立部署的服务,实现两者的独立扩缩容。插件支持 NVIDIA GPU 与华为昇腾 NPU 后端,兼容 DeepSeek V2/V3 及 GLM MoE 等架构,无需修改 vLLM 源码即可通过标准插件接口接入。
本事件热度走势
当前热度 9·可比范围峰值 10(9月30日 11:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。