vLLM 官方博客(网页)·· 5 小时前精选AI 评分62
vLLM 发布 Speculators v0.5.0:支持 DFlash 算法与统一在线离线训练
Speculators v0.5.0: DFlash Support and Online TrainingMay 28, 2026·6 min readWhat Speculators v0.5.0 adds for vLLM speculative decoding: DFlash block-diffusion draft models, unified online and offline training, native hidden-state extraction, and Gemma 4 latency results.
AI 导读
vLLM 发布投机采样训练框架 Speculators v0.5.0,引入 DFlash 块扩散算法并统一了在线与离线训练流程。DFlash 采用非因果注意力与锚点位置机制,在单次前向传播中生成整块草稿 token,在 Gemma 4 31B 评测中取得了低于 Eagle 3 的 token 间延迟。
推荐理由
材料详细介绍了单次前向传播生成草稿词的机制与训练解耦方案,为大模型推理加速与投机采样落地提供了参考路径。
来源:vLLM 官方博客(网页) · vllm.ai