利用策略内自蒸馏实现推理能力的递归自我提升
该研究探讨了大模型推理能力的递归自我提升方法。针对传统的策略内蒸馏(OPD)依赖外部教师模型提供密集的token级监督,研究提出了策略内自蒸馏(OPSD)机制。该机制通过复制一份冻结的学生模型,并在其上下文中提供真实标签作为特权教师模型,引导仅接收问题的学生模型进行模仿学习,从而在无需更强外部教师的情况下实现模型的自主迭代强化。
推荐理由探索了摆脱外部强教师模型的模型自我演化与推理蒸馏路径,对LLM自训练与强化学习研究具参考价值。
原标题:Recursive Self-Improvement via On-Policy Distillation for Reasoning
阅读 arXiv 自然语言处理 原文 ↗