跳到正文
原文
arXiv 机器学习· Arda Fazla, Antesh Upadhyay, Ege C. Kaya, M. Berk Sahin, Abolfazl Hashemi·· 4 小时前AI 评分39

自适应批大小为何有助于 LLM 预训练?基于无界方差视角的解释

Why Does Adaptive Batching Help LLM Pretraining? A Perspective from Unbounded Variance

AI 导读

针对 LLM 预训练中梯度方差无界增长的问题,研究人员提出泛化 BG-$a$ 噪声模型,并设计出通过动态调整批大小控制方差增长的自适应调度器。在 C4 数据集上预训练高达 1B 参数的 OLMo2 模型实验显示,该调度器在相同 token 预算下取得了比固定小批和大批训练更低的验证损失,且所需迭代次数不到小批训练的 10%。

来源:arXiv 机器学习 · arxiv.org