跳到正文
原文
arXiv 机器学习· Bolian Li, Ting-Yao Hu, Cheng-Yu Hsieh, Sanjoy Chowdhury, Oncel Tuzel, Raviteja Vemulapalli·· 3 小时前AI 评分37

面向智能体强化学习的 MoE 专家选择结构化设计

Structuring MoE Expert Selection for Agentic Reinforcement Learning

AI 导读

针对标准强化学习未利用 MoE 专家选择与智能体操作天然对齐特性的问题,研究人员提出了面向智能体任务的分层路由控制框架。该框架显式促使轮次级专家选择与智能体操作对齐,正则化 token 级专家选择以保持局部一致性,并引入熵门控机制保障后训练稳定性。实验结果显示,该路由控制框架在所有评测基准上的任务成功率均提升超过 10 个百分点。

来源:arXiv 机器学习 · arxiv.org