arXiv 自然语言处理· Junxiang Qiu, Zhengsu Chen, Xinting Hu, Shuo Wang, Hengheng Zhang, Shaofeng Zhang, Changcheng Li, Boyu Shi, Qi Tian·· 2 天前AI 评分34
HERO-MoE:基于保尺度融合的历史专家路由机制
HERO-MoE: Historical Expert Routing with Scale-Preserving Fusion
AI 导读
研究人员提出 HERO-MoE 路由框架,通过复用前序层路由分布为 MoE 注入历史路由先验,并引入保尺度融合机制稳定历史信号。该框架无需辅助路由损失,兼容标准 top-k 等稀疏分发。在 100B tokens 训练的约 8B 参数(0.5B 激活参数)MoE 实验中,损失从 1.6393 降至 1.6184,峰值显存与 FLOPs 仅分别增加 0.44% 和 0.64%。
来源:arXiv 自然语言处理 · arxiv.org