跳到正文
原文
arXiv 人工智能· Yuxiang Zhang, Ding Cao, Shuting Cui, Lei Wang, Weijieying Ren, Tianxiang Zhao·· 3 小时前AI 评分39

通过分段 On-Policy 蒸馏(Seg-OPD)学习修正大语言模型推理

Learning to Revise Reasoning with Segment-wise On-Policy Distillation

AI 导读

研究人员提出分段同策略蒸馏(Seg-OPD),通过基于不确定性指标获取教师模型的重写片段并指导学生模型学习修正中间推理步骤,同时保留密集的 token 级监督。在数学推理与竞赛编程任务中,Seg-OPD 取得了更高的修正成功率,使推理准确率相比 SOTA 基线平均相对提升 5.22%,相关代码已开源。

来源:arXiv 人工智能 · arxiv.org