DeepSeek 冲向 10 万亿参数?

图片由 AI 生成

近日,华为 CANN 社区公开《基于昇腾 950 超节点的万亿 MoE 模型预训练系统参考实践》。

其中在介绍 DeepSeek 预训练支持时明确提到,基于 PyTorch 原生训练框架和昇腾 950 超节点,结合 DeepSeek-V4-Flash 训练验证,分析 550B、1.6T 模型的切分策略,以及向 10T 规模外推时的部署权衡。

这也是目前公开的 DeepSeek 相关训练技术材料中,模型规模明确触及 10 万亿参数量级的一次披露。

这套方案主要针对超大规模 MoE 模型训练。

CANN 在昇腾 950 超节点内部和节点之间设计 FSDP、EP、CP 等并行部署策略,同时针对模型规模扩大后出现的显存、通信和计算效率问题进行优化。

除模型规模扩展外,方案还覆盖超长序列、多模态、高可用训练等场景,并针对训练过程中的参数、梯度、优化器状态和激活值进行内存优化。

CANN 同时引入 FlexMuon 分布式优化器以及大容量记忆表分布式训练等方案。

全文:

展开阅读全文

更新时间:2026-10-07

标签:科技   参数   模型   节点   规模   分布式   方案   华为   策略   切分   梯度

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top