arXiv 自然语言处理· Di Huang, Hao Li, Yixin Chen, Fuhai Li·· 1 天前AI 评分36
当截断反转纠错:点向前向 KL 在线策略自蒸馏的失效动态
When Clipping Reverses Correction: Failure Dynamics of Pointwise Forward-KL On-Policy Self-Distillation
AI 导读
研究发现在线策略自蒸馏(OPSD)中常用的点向前向 KL 截断机制,会导致模型生成显著更多且持续至结尾的重复内容。理论与实验证明,截断目标不仅无法将学生模型纠正至教师模型,反而会将 token 概率推离教师分布。在重复片段中,截断后的学生模型跳出重复的概率明显低于教师模型且更倾向于继续重复。
来源:arXiv 自然语言处理 · arxiv.org