
图片由 AI 生成
近日,华为 CANN 社区公开《基于昇腾 950 超节点的万亿 MoE 模型预训练系统参考实践》。
其中在介绍 DeepSeek 预训练支持时明确提到,基于 PyTorch 原生训练框架和昇腾 950 超节点,结合 DeepSeek-V4-Flash 训练验证,分析 550B、1.6T 模型的切分策略,以及向 10T 规模外推时的部署权衡。

这也是目前公开的 DeepSeek 相关训练技术材料中,模型规模明确触及 10 万亿参数量级的一次披露。
这套方案主要针对超大规模 MoE 模型训练。
CANN 在昇腾 950 超节点内部和节点之间设计 FSDP、EP、CP 等并行部署策略,同时针对模型规模扩大后出现的显存、通信和计算效率问题进行优化。
除模型规模扩展外,方案还覆盖超长序列、多模态、高可用训练等场景,并针对训练过程中的参数、梯度、优化器状态和激活值进行内存优化。
CANN 同时引入 FlexMuon 分布式优化器以及大容量记忆表分布式训练等方案。
全文:
更新时间:2026-10-07
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号