热点事件持续更新
vLLM支持多款并行推测解码算法并发布Speculators v0.5.0
2 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
2026年9月30日,Speculators与vLLM宣布全面开源支持P-EAGLE、DFlash和DSpark三种并行推测解码算法,摆脱了EAGLE-3等传统框架自回归逐词生成候选token的延迟瓶颈。同日,vLLM发布投机采样训练框架Speculators v0.5.0,引入DFlash块扩散算法并统一了在线与离线训练流程。该算法采用非因果注意力与锚点位置机制,可在单次前向传播中生成整块草稿token,并在Gemma 4 31B评测中取得了低于Eagle 3的token间延迟。
AI 根据报道生成 · 9 小时前更新
最新进展9月30日 10:25
vLLM发布Speculators v0.5.0,支持DFlash算法并统一在线离线训练流程。事件进展
2 个进展
- 9月30日 10:25 · 1 篇报道Speculators发布v0.5.0版本vLLM 官方博客:vLLM 发布 Speculators v0.5.0:支持 DFlash 算法与统一在线离线训练
- 9月30日 10:25 · 1 篇报道vLLM开源支持三款并行投机解码算法vLLM 官方博客:vLLM 与 Speculators 支持 P-EAGLE、DFlash 和 DSpark 并行推测解码算法
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- vLLM 官方博客精选vLLM 发布 Speculators v0.5.0:支持 DFlash 算法与统一在线离线训练
vLLM 发布投机采样训练框架 Speculators v0.5.0,引入 DFlash 块扩散算法并统一了在线与离线训练流程。DFlash 采用非因果注意力与锚点位置机制,在单次前向传播中生成整块草稿 token,在 Gemma 4 31B 评测中取得了低于 Eagle 3 的 token 间延迟。
- vLLM 官方博客精选vLLM 与 Speculators 支持 P-EAGLE、DFlash 和 DSpark 并行推测解码算法
Speculators 与 vLLM 宣布全面开源支持 P-EAGLE、DFlash 和 DSpark 三种并行推测解码算法,摆脱了 EAGLE-3 等传统框架自回归逐词生成候选 token 的延迟瓶颈。
本事件热度走势
当前热度 8·可比范围峰值 10(9月30日 11:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。