跳到正文
原文
arXiv 机器学习· Heng Liang, Xinwen Zhang, Hongchang Gao·· 3 小时前AI 评分34

面向大语言模型自蒸馏的双层 Top-K Token 选择方法 BiToK-SD

Learning What to Distill: Bilevel Top-K Token Selection for Self-Distillation in Large Language Models

AI 导读

研究人员提出面向大语言模型在线策略自蒸馏的方法 BiToK-SD,通过双层优化自适应学习最有益于蒸馏的 token 位置。该方法将下层的 Top-K token 选择建模为可微阈值松弛以跟随学生策略演化,并在上层对选定位置执行知识蒸馏。数学推理基准测试表明,BiToK-SD 仅需轻量额外计算即可取得最佳平均表现。

来源:arXiv 机器学习 · arxiv.org