arXiv 自然语言处理· Tejas Dahiya, Cole Blondin·· 7 小时前AI 评分34
先复制后抑制:探究大语言模型训练中表现低于随机水平的成因
Copying Before Suppression: What Drives a Below-Chance Dip During Language Model Training?
AI 导读
研究揭示了大语言模型在间接宾语识别任务训练早期准确率跌破 50% 的成因,根源在于写入与抑制重复名称的注意力头计算失衡。在 Pythia 160M、410M 与 1B 模型中,将成熟抑制头参数移植至早期检查点可恢复 35% 至 68% 的 logit 改善。类似反转现象在 GPT-2 和 OLMo 中同样存在,证实成熟回路会掩盖训练早期的暂态因果构型。
来源:arXiv 自然语言处理 · arxiv.org