arXiv 机器学习· Sungyoon Kim, Kaan Ozkara, Youngsuk Park·· 3 小时前AI 评分37
用 Chained LMO 优化大语言模型
Optimizing Large Language Models with Chained LMOs
AI 导读
研究人员提出 chained LMO 框架以统一 Muon 衍生出的多矩阵归一化方法,并推出新型优化器 TensorChain。该优化器将跨层兼容的权重矩阵堆叠为 3D 张量并沿各轴执行归一化。在千问(Qwen3)0.6B 与 1.7B 预训练中,TensorChain 的平均 token 效率超越所有链式基线,在匹配验证损失下比 Muon 平均节省 9.6% token。
来源:arXiv 机器学习 · arxiv.org