跳到正文
原文
arXiv 自然语言处理· Yang Li, Gongle Xue, Yuheng Yuan, Yijia Guo, Shizhe Zhang, Liwen Hu, Lei Ma·· 1 天前AI 评分43

推理大语言模型的同策略自蒸馏(OPSD)机制诊断研究

Diagnosing On-Policy Self-Distillation for Reasoning Language Models

AI 导读

新研究针对 0.6B–8B 参数规模的模型系统诊断了同策略自蒸馏(OPSD)在数学推理中的表现。结果显示教师信号受推理模式对齐和完整前缀影响,OPSD 仅在狭窄兼容区间内能提升推理能力,否则会导致长度无效增长、性能退化或行为崩溃。Token 级分析表明其信号不稳定且无法预测下游表现,属于高度敏感而非普遍可靠的推理后训练方法。

来源:arXiv 自然语言处理 · arxiv.org