跳到正文
原文
arXiv 机器学习· Yizhou Liu, Sara Kangaslahti, Jeff Gore·· 2 天前AI 评分45

注意力集中机制如何驱动 LLM 涌现 1/3 缩放定律

Emergent One-Third Scaling Law as Attention Tries to Concentrate

AI 导读

大语言模型(LLM)中任何学习尖锐分布的 softmax 都会使 logit 幅度以 1/3 幂律增长并成为训练瓶颈,从而驱动整体 loss 遵循指数为 1/3 的缩放定律。实验证实 LLM 的 loss 缩放符合该 1/3 预测。动态分析进一步揭示,注意力头而非语言建模头是驱动这一 1/3 训练缩放定律的关键瓶颈。

来源:arXiv 机器学习 · arxiv.org