跳到正文
原文
NVIDIA Developer Blog· Elizabeth Goodman·· 15 天前AI 评分42

Dense 与 MoE 模型对比:激活参数、吞吐量与架构选型

Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each

AI 导读

混合专家模型(MoE)通过为每个 token 仅激活子集参数,在保持大模型容量的同时提升计算效率。以 Nemotron 3.5 Lightning 为例,该 30B 参数模型在处理每个 token 时仅激活 3B 参数。文章深入对比了 Dense 与 MoE 两种主流模型架构在激活参数与吞吐量等维度的表现,并提供架构选型参考。

来源:NVIDIA Developer Blog · developer.nvidia.com