跳到正文
原文
arXiv 自然语言处理· Siyan Zhao, Yonggan Fu, Jindong Jiang, Shih-Yang Liu, Song Bian, Byung-Kwan Lee, Sharath Turuvekere Sreenivas, Wenliang Dai, Hanrong Ye, Aditya Grover, Pavlo Molchanov·· 5 小时前AI 评分44

何时需要在策略蒸馏?基于离线学生采样蒸馏往往更优

When Do We Need On-Policy Distillation? Distilling on Offline Student Rollouts Is Often Better

AI 导读

新研究提出 Semi-OPD 方法,通过基于初始学生模型的离线采样进行知识蒸馏,在准确率与效率上普遍优于传统的在策略蒸馏(OPD)。在涵盖 1.5B 至 235B 参数的 17 组师生模型评测中,Semi-OPD 在 14 组表现更优,带来最高 +13.6% 的准确率提升与 11.4x 训练加速。实验表明,仅在师生模型输出 token 重合率极高时 OPD 才具优势。

来源:arXiv 自然语言处理 · arxiv.org