arXiv 机器学习· Langlin Huang, Hao Liu, Mononito Goswami, Xinyu Li, Prithwith Jana, Nikos Kanakaris, Patrick Bl\"obaum, Purak Jain·· 6 小时前AI 评分35
论在线策略知识蒸馏中的离线教师问题
On the Off-Policy Teacher in On-Policy Distillation
AI 导读
针对在线策略蒸馏(OPD)中教师模型面对学生生成前缀时性能下降的不对称问题,研究人员提出了 SCOUT 协同训练框架。SCOUT 在标准 OPD 基础上,通过带可验证奖励的强化学习定期优化教师模型,使其适应从学生前缀继续生成。实验表明,该方法在多种模型规模与推理领域中均显著提升了在线蒸馏效果。
来源:arXiv 机器学习 · arxiv.org