arXiv 机器学习· Dezhi Li, Lujun Li, Qiyuan Zhu, Hao Gu, Bei Liu, Sirui Han, Yike Guo·· 2 天前AI 评分33
OMP-MoE:基于正交匹配追踪的 MoE 大语言模型高效专家剪枝
OMP-MoE: Efficient Expert Pruning for Mixture-of-Experts LLMs via Orthogonal Matching Pursuit
AI 导读
研究人员提出免训练的 MoE 大语言模型压缩框架 OMP-MoE,通过正交匹配追踪算法将专家剪枝转化为稀疏信号重构任务。该方法在 Qwen、DeepSeek-V2、GPT-OSS 和 Mixtral MoE 的 25-50% 剪枝率测试中均优于现有方案。针对 Qwen3-30B-A3B 进行 50% 压缩时可保留 93.3% 性能,并实现 33x 搜索加速与 1.55x 推理加速。
来源:arXiv 机器学习 · arxiv.org