
DeepSeek 在官方公众号上发了一则短公告,字数不多,分量不轻。
公告说的是:他们把为昇腾平台准备的一整套基础设施组件正式开源了。消息一出,行业里的讨论立刻热了起来。这道题,正是国产算力这几年最难啃的一块。
先说题面是什么。高端 GPU 越来越难拿到之后,摆在面前的问题很直白:最先进的卡弄不到了,模型还训不训?DeepSeek 这次给出的是其中一部分答案。而这份答案的重点,并不止于「把英伟达的卡换成昇腾」这一步。他们同时在动手重建一件更难替换的东西:围绕硬件长出来的那套软件生态。这一层补齐了,国产芯片才真的顺手好用,也才谈得上训练前沿模型。
英伟达在大模型训练上的优势,从来不只是 GPU 本身。围绕它长出来的整套软件生态,尤其是 CUDA,同样是关键。手里有了英伟达的卡,开发者就等于拿到一套成熟工具:写程序、调性能、把成千上万张卡拉在一起协同干活,全都有现成的路子。
「不积跬步,无以至千里。」这一圈东西是十几年一年一年垒起来的,哪家公司都不是砸一笔钱就能追上。
这也正是昇腾长期以来的难点。做出能用的硬件只算半道题,另外半道是软件好不好上手、开发者能不能把芯片的性能真正榨出来。
这次开源的一批组件,覆盖的正是这一层,包括 TileLang,以及 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 等一组底座工具。
用大白话说:TileLang 是一门高层语言,让开发者更容易告诉芯片该干什么;DeepGEMM 负责大模型计算核心的矩阵运算;DeepEP 管训练时大量芯片之间的高速通信;TileKernels 提供数据处理常用的向量计算和访存算子;FlashMLA 提供稀疏注意力算子,专门对付长上下文;DeepSelect 负责高效的数据挑选。
DeepSeek 说,在多组关键测试里,这些组件的计算和通信性能都已经逼近昇腾硬件自身的极限。
这里面最有意思的是 TileLang。按 DeepSeek 的说法,训练 V4 系列模型用到的绝大多数算子,如今都是用 TileLang 写出来的;而他们训练中在用的每一个 TileLang 算子,在昇腾上眼下都有了对应的高性能实现。
昇腾版的 TileLang 把昇腾 C 的指令封装在下面,往上提供高层编程接口,同时不牺牲硬件性能。相比 CUDA,TileLang 的编程模型更简单,开发效率更高,代码逻辑也更清爽。他们还说,推出这版开源,也是想给更多 AI 芯片搭一套顺手的软件生态留个参考。
「他山之石,可以攻玉。」TileLang 最早是在英伟达的成熟平台上验证出来的,如今同一套路子被搬到了昇腾上。先在别处磨利的方法,回头用来打磨自家芯片,省掉的是最贵的那段时间。
DeepSeek 要干的事,是在模型和芯片之间垫一层抽象。同一套开发方式,既能架在英伟达的卡上,也能架在昇腾上。这条路要是走顺了,把 AI 负载从英伟达挪到国产硬件上的成本和难度,都会明显往下掉。
公告里还有第二个信号:DeepSeek 明确说了,这事不是他们一家做成的。华为的团队深度参与了开发。双方还在联合推进一个基于昇腾 950 的 128 卡超节点方案,同时对计算和芯片间通信做深度优化。
「问渠那得清如许,为有源头活水来。」对昇腾生态来说,这套工具就是一股活水:过去缺的那几块基础件,如今有人把样子做出来,还开源摆在了明面上。
所以,事情已经不只是「DeepSeek 支持华为芯片」这么简单。两家公司在啃的是一个更深的问题:国产的硬件和软件,怎么才能真正合在一起,稳稳当当地把前沿模型训出来。
原文链接:
https://www.geopolitechs.org/p/deepseek-builds-for-huawei-ascend
更新时间:2026-10-06
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号