跳到正文
热点事件持续更新

研究团队提出分段在线策略蒸馏方法Seg-OPD

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月5日,arXiv发布的研究显示,研究团队提出了分段同策略蒸馏方法(Seg-OPD)。该方法通过基于不确定性指标获取教师模型的重写片段,指导学生模型学习修正中间推理步骤,并在此过程中保留密集的 token 级监督。实验结果表明,在数学推理与竞赛编程任务中,Seg-OPD 取得了更高的修正成功率,使模型推理准确率相比现有 SOTA 基线平均相对提升 5.22%。目前,相关研究代码已正式开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv 人工智能
    通过分段 On-Policy 蒸馏(Seg-OPD)学习修正大语言模型推理

    研究人员提出分段同策略蒸馏(Seg-OPD),通过基于不确定性指标获取教师模型的重写片段并指导学生模型学习修正中间推理步骤,同时保留密集的 token 级监督。在数学推理与竞赛编程任务中,Seg-OPD 取得了更高的修正成功率,使推理准确率相比 SOTA 基线平均相对提升 5.22%,相关代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。