跳到正文
热点事件持续更新

研究揭示优化器动量历史导致语言模型微调遗忘机制

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月6日发表于arXiv的研究指出,大语言模型在微调中发生遗忘的关键原因之一是优化器的动量记忆,其累积的历史梯度会对抗当前梯度,从而导致旧答案的概率流失。跨3个语言模型族的实验表明,遗忘的负面影响主要来源于新任务的较旧梯度,这会导致模型虽然仍能区分旧答案,但其生成概率显著降低。此外,研究证实通过重置Adam优化器的动量,可以有效恢复答案的概率质量,并在后续训练中降低旧任务的最终损失。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. arXiv 自然语言处理
    优化器历史与答案概率流失:语言模型微调中的遗忘机制研究

    研究发现大语言模型在微调中发生遗忘的关键原因之一是优化器的动量记忆,其累积的历史梯度会对抗当前梯度并导致旧答案概率流失。跨 3 个语言模型族的实验表明,遗忘的负面影响主要来自新任务的较旧梯度,导致模型虽能区分旧答案却降低了生成概率。通过重置 Adam 动量可有效恢复答案概率质量,并在后续训练中降低旧任务的最终损失。

本事件热度走势

当前热度 9·可比范围峰值 10(10月6日 13:00)·近 24 小时可比范围变化 –

02.557.51010月6日13:0010月6日14:0010月6日14:0010月6日15:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。