跳到正文
原文
arXiv 机器学习· Xin Teng, Muxiao Li, Hongyi Wen·· 5 小时前AI 评分36

DRMoET:面向混合专家(MoE)模型的分布鲁棒训练方法

Distributionally Robust Mixture-of-Experts Training

AI 导读

研究人员提出 DRMoET 训练目标,将层级专家视为内生鲁棒性分组并优化高损失路由结果,以解决 MoE 模型路由不完善导致的可靠性问题。在 FLAME-MoE 配方及 10.3B 总参数、67B 训练 token 规模下,DRMoET 将 7 项任务平均得分从 0.6625 提升至 0.6767,且强制错误路由下的超额损失降低 4.3%。该项目代码已开源。

来源:arXiv 机器学习 · arxiv.org