跳到正文
热点事件持续更新

vLLM支持多款并行推测解码算法并发布Speculators v0.5.0

2 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

2026年9月30日,Speculators与vLLM宣布全面开源支持P-EAGLE、DFlash和DSpark三种并行推测解码算法,摆脱了EAGLE-3等传统框架自回归逐词生成候选token的延迟瓶颈。同日,vLLM发布投机采样训练框架Speculators v0.5.0,引入DFlash块扩散算法并统一了在线与离线训练流程。该算法采用非因果注意力与锚点位置机制,可在单次前向传播中生成整块草稿token,并在Gemma 4 31B评测中取得了低于Eagle 3的token间延迟。

AI 根据报道生成 · 9 小时前更新

事件进展

2 个进展
  1. 9月30日 10:25 · 1 篇报道
    Speculators发布v0.5.0版本
    vLLM 官方博客:vLLM 发布 Speculators v0.5.0:支持 DFlash 算法与统一在线离线训练
  2. 9月30日 10:25 · 1 篇报道
    vLLM开源支持三款并行投机解码算法
    vLLM 官方博客:vLLM 与 Speculators 支持 P-EAGLE、DFlash 和 DSpark 并行推测解码算法

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. vLLM 官方博客精选
    vLLM 发布 Speculators v0.5.0:支持 DFlash 算法与统一在线离线训练

    vLLM 发布投机采样训练框架 Speculators v0.5.0,引入 DFlash 块扩散算法并统一了在线与离线训练流程。DFlash 采用非因果注意力与锚点位置机制,在单次前向传播中生成整块草稿 token,在 Gemma 4 31B 评测中取得了低于 Eagle 3 的 token 间延迟。

  2. vLLM 官方博客精选
    vLLM 与 Speculators 支持 P-EAGLE、DFlash 和 DSpark 并行推测解码算法

    Speculators 与 vLLM 宣布全面开源支持 P-EAGLE、DFlash 和 DSpark 三种并行推测解码算法,摆脱了 EAGLE-3 等传统框架自回归逐词生成候选 token 的延迟瓶颈。

本事件热度走势

当前热度 8·可比范围峰值 10(9月30日 11:00)·近 24 小时可比范围变化 –

02.557.5109月30日11:009月30日14:009月30日16:009月30日19:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。