跳到正文
原文
arXiv 自然语言处理· Jungseob Lee, Chanjun Park, Sugyeong Eo, Hyeonseok Moon·· 1 天前AI 评分36

恢复投机解码中的离策略监督

Recovering Off-Policy Supervision for Speculative Decoding

AI 导读

针对投机解码块草稿器因离策略 token 丢失后续监督信号的问题,研究人员提出一种基于 rollout 的训练框架,通过锚标签重标记(ALR)与 Rollout 内部锚点(IRA)恢复完整监督。在固定视觉语言和文本语料库中,该框架将贪婪接受长度相比 DFlash 提升最高达 36.5%,且相关代码已开源。

来源:arXiv 自然语言处理 · arxiv.org