跳到正文
原文
arXiv 机器学习· Xuchen Gong, Junfei Sun, Tian Li·· 7 小时前AI 评分33

基于混合梯度的语言模型规范化 Top-$k$ 选择方法

Principled Top-$k$ Selection for Language Models with Hybrid Gradients

AI 导读

针对大语言模型在 RAG 文档选择与 MoE 专家路由等场景下的 Top-$k$ 选择训练难题,研究提出了一种结合监督梯度与策略梯度的混合梯度训练目标。该算法收敛速率达 $O(1/\sqrt{T})$,能通过平衡偏差与方差实现最优上界。在合成回归、RAG 与 MoE 等任务测试中,该方法在 next-token 预测困惑度及问答准确率上均显著优于基线。

来源:arXiv 机器学习 · arxiv.org