NVIDIA Developer Blog· Michelle Horton·· 7 天前AI 评分22
NVIDIA 谈生物基础模型的高效 MoE 训练
Efficient MoE Training for Biological Foundation Models
AI 导读
随着语言模型规模扩大,稠密架构的扩展成本越来越高,因为每个 token 都要经过所有层,训练和推理算力随之上升。MoE 架构改用多个子网络(专家),每个 token 只激活其中一小部分,从而以不同方式实现扩展。
来源:NVIDIA Developer Blog · developer.nvidia.com