跳到正文
原文
arXiv 自然语言处理· Yixuan Tang, Yi Yang·· 6 小时前AI 评分59

同策略蒸馏可传授多步推理技能但无法注入新事实知识

On-Policy Distillation Teaches New Skills but Not New Knowledge

AI 导读

arXiv 论文研究指出,同策略蒸馏(OPD)能有效向学生模型迁移未见结构的组合推理技能,但无法扩展模型的参数化事实知识。跨 3 个模型家族 4 款模型的实验显示,反向 KL OPD 能在不增加事实记忆的前提下显著提升数学与问答推理能力;将反向 KL 替换为正向 KL 可恢复事实迁移,而学生采样展开(rollouts)则专门负责增强多步推理执行能力。

来源:arXiv 自然语言处理 · arxiv.org