arXiv 机器学习· Xuchen Gong, Junfei Sun, Tian Li·· 7 小时前AI 评分33
基于混合梯度的语言模型规范化 Top-$k$ 选择方法
Principled Top-$k$ Selection for Language Models with Hybrid Gradients
AI 导读
针对大语言模型在 RAG 文档选择与 MoE 专家路由等场景下的 Top-$k$ 选择训练难题,研究提出了一种结合监督梯度与策略梯度的混合梯度训练目标。该算法收敛速率达 $O(1/\sqrt{T})$,能通过平衡偏差与方差实现最优上界。在合成回归、RAG 与 MoE 等任务测试中,该方法在 next-token 预测困惑度及问答准确率上均显著优于基线。
来源:arXiv 机器学习 · arxiv.org