跳到正文
原文
NVIDIA Developer Blog· Michelle Horton·· 7 天前AI 评分22

NVIDIA 谈生物基础模型的高效 MoE 训练

Efficient MoE Training for Biological Foundation Models

AI 导读

随着语言模型规模扩大,稠密架构的扩展成本越来越高,因为每个 token 都要经过所有层,训练和推理算力随之上升。MoE 架构改用多个子网络(专家),每个 token 只激活其中一小部分,从而以不同方式实现扩展。

来源:NVIDIA Developer Blog · developer.nvidia.com