arXiv 自然语言处理· Valeria Ruscio, Seth Nabarro, Keiran Thompson·· 4 小时前AI 评分34
优化器历史与答案概率流失:语言模型微调中的遗忘机制研究
A Step Towards Forgetting: Optimiser History and the Loss of Answer Mass
AI 导读
研究发现大语言模型在微调中发生遗忘的关键原因之一是优化器的动量记忆,其累积的历史梯度会对抗当前梯度并导致旧答案概率流失。跨 3 个语言模型族的实验表明,遗忘的负面影响主要来自新任务的较旧梯度,导致模型虽能区分旧答案却降低了生成概率。通过重置 Adam 动量可有效恢复答案概率质量,并在后续训练中降低旧任务的最终损失。
来源:arXiv 自然语言处理 · arxiv.org