跳到正文
原文
arXiv 自然语言处理· Chenglei Shen, Haoyang Yao, Weijie Yu, Song Jin, Xiao Zhang, Jun Xu·· 5 小时前AI 评分34

从修复推理中学习:根因引导的同策略蒸馏 RC-OPD

Learning from Repaired Reasoning: Root-Cause-Guided On-Policy Distillation

AI 导读

研究提出根因引导同策略蒸馏 RC-OPD,通过定位并修复学生模型自身推理中的实质错误,解决传统参考解法带来的推理不匹配与蒸馏陷阱问题。该方法采用迭代的“诊断-修复-续写”流程,针对错误片段使用根因诊断监督,并以修复后的中间结果作为锚点指导有效前缀。多数据集与多模型规模实验表明,RC-OPD 带来了显著的性能提升。

来源:arXiv 自然语言处理 · arxiv.org