跳到正文
原文
arXiv 机器学习· Roy Xie, Dan Friedman, Feng Nan, Yukun Huang, Zhichao Xu, Chengjiu Zhang, Jun Xu, Manaal Faruqui, Vivek Rathod, Bhuwan Dhingra·· 3 小时前AI 评分46

重新审视多教师能力合并中的自蒸馏

Rethinking Self-Distillation for Multi-Teacher Capability Merging

AI 导读

一项研究表明,多教师策略内蒸馏(MOPD)与监督微调(SFT)等离线方法准确率几乎相同,但 MOPD 消耗了 SFT 达 14.8–23.1 倍的训练 GPU 小时。在 4 个模型与 11 个基准上的测试显示,MOPD 先前报道的性能优势主要源于超参数优化与训练设计,充分调优的离线基线和权重合并是更高效的替代方案。

来源:arXiv 机器学习 · arxiv.org