跳到正文
原文
arXiv 自然语言处理· Chenxu Wang, Chaozhuo Li, Xinze Shi, Songyang Liu, Kyrie You Wu, Ziluowen Luo, Shun Zhang, Chenxi Li, Litian Zhang·· 1 天前AI 评分38

当更新不再带来学习:通过可学习信息增益重新审视 LLM 自我进化

When Updating Stops Being Learning: Rethinking LLM Self-Evolution via learnable information gain

AI 导读

针对大语言模型利用自身生成数据迭代时出现的自我进化退化问题,研究者提出基于可学习信息增益的整体分析框架。该方法通过小语言模型拟合上一轮数据并使用负对数似然评估新数据增益,据此推出自适应训练调控方法 ATRI。ATRI 可在轮内重加权样本并在信息增益过低时跨轮停止训练,在公开数据集上验证了其有效性。

来源:arXiv 自然语言处理 · arxiv.org