arXiv 机器学习· Qiwei Di, Xuheng Li, Kaixuan Ji, Chenggong Zhang, Heyang Zhao, Quanquan Gu·· 6 小时前AI 评分35
理解策略外与策略内知识蒸馏:不同训练目标之辨
Understanding Off- vs On-Policy Distillation: A Tale of Distinct Training Objectives
AI 导读
该研究深入对比了多教师顺序知识蒸馏中策略外与策略内知识蒸馏(OPD)的机制差异。研究证明前向与反向 KL 散度分别对应加权算术与几何聚合目标,在表格设定下建立了对数遗憾界。分析表明反向 KL 能更好保留高置信度专家的偏好,但对赋予正确响应极低概率的教师更敏感,且在长视界下可能倾向错误前缀。
来源:arXiv 机器学习 · arxiv.org