跳到正文
原文
NVIDIA Developer Blog· Elizabeth Goodman·· 16 天前AI 评分22

NVIDIA Nemotron 3.5 Lightning 解析:Dense 与 MoE 模型的活跃参数、吞吐量与选型

Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each

AI 导读

NVIDIA 以 Nemotron 3.5 Lightning 为例说明 MoE 架构如何让 30B 参数模型每个 token 仅激活 3B 参数,同时保留大模型容量。文章对比 Dense 与 MoE 两种主流架构,指出参数组织方式与参数规模同样关键,并讨论活跃参数、吞吐量及各自适用场景。

来源:NVIDIA Developer Blog · developer.nvidia.com