arXiv 人工智能· Xiang Chen, Futao Su, Kong Wang, Jiayi Chen, TanLin Li·· 1 天前AI 评分38
SR-OPD:基于成功参考的高效同策略知识蒸馏方法
Spend Teacher Tokens Where They Matter: Success-Referenced On-Policy Distillation
AI 导读
研究人员提出基于成功参考的同策略知识蒸馏方法 SR-OPD,通过利用学生模型自身的成功生成轨迹作为参考来筛选失败样本,大幅减少教师模型的计算开销。在 3 个教师-学生组合与 6 个数学推理基准评测中,SR-OPD 仅需 Vanilla OPD 3.46-5.02% 的教师输入 token,即可保持相当的推理性能。
来源:arXiv 人工智能 · arxiv.org