AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 72/10009月28日 12:00

利用策略内自蒸馏实现推理能力的递归自我提升

该研究探讨了大模型推理能力的递归自我提升方法。针对传统的策略内蒸馏(OPD)依赖外部教师模型提供密集的token级监督,研究提出了策略内自蒸馏(OPSD)机制。该机制通过复制一份冻结的学生模型,并在其上下文中提供真实标签作为特权教师模型,引导仅接收问题的学生模型进行模仿学习,从而在无需更强外部教师的情况下实现模型的自主迭代强化。

推荐理由探索了摆脱外部强教师模型的模型自我演化与推理蒸馏路径,对LLM自训练与强化学习研究具参考价值。

原标题:Recursive Self-Improvement via On-Policy Distillation for Reasoning

阅读 arXiv 自然语言处理 原文 ↗

同一事件的其他来源

arXiv 自然语言处理09月28日 12:00

针对黑盒在线策略蒸馏的持久负样本对抗优化方法

该论文针对黑盒在线策略蒸馏(OPD)场景展开研究。在黑盒对抗蒸馏中,判别器通过区分教师与学生生成结果来提供策略奖励,但每步仅从最新学生模型采样负样本会导致奖励函数面临“移动目标”问题。研究团队提出持久负样本对抗蒸馏方法,通过动态负样本池缓解分布剧烈变化带来的训练不稳定,提升黑盒知识蒸馏效果。