DeepSeek 联合华为暴击英伟达,重塑全球AI底层格局

这两天,技术圈里传得最快的一件事,是两个中国团队——DeepSeek和华为,联手把一套给国产AI芯片用的开发工具,全部放到网上开源了。开源是啥,就是把源代码公开出来,谁都能下载、能用、能改,不是只让你看个热闹。

这件事为什么动静这么大?因为过去很多年,全球搞AI的人,基本都绕不开英伟达那套叫CUDA的东西。你可以把CUDA理解成一套“修路、造车、开加油站、培训司机”的全套体系。AI模型要训练,要跑推理,要开发各种小工具,很多都要靠这套体系。

时间一长,大家就习惯了,甚至觉得离开它就没法干活。可问题是,这套东西是海外公司的,规则人家定,价格人家定,什么时候改、什么时候限制,也是人家说了算。国内很多开发者不是不想用国产算力,而是用起来太费劲:工具不全,资料少,适配麻烦,性能还容易打折。


这次DeepSeek和华为干的事,说白了,就是把这套“路、加油站、修车铺、导航图”一起给补上了。而且不是小打小闹,不是只放出一个模型代码,也不是零散给几个工具,而是一整套面向华为昇腾算力架构的底层基础设施。按照原文里的说法,这套东西对标的就是英伟达CUDA那种全栈能力,六大核心软件模块一起开源,覆盖从底层算子开发、代码编译优化、算力调度计算,到多设备分布式通信的整个流程。

咱们上了年纪的人可能不天天写代码,但可以这么理解:以前国产AI芯片像一口好锅,可你只有锅,没有铲子、没有灶台、没有菜谱,想做一桌菜很难。现在DeepSeek和华为把锅、铲子、灶台、菜谱、甚至切菜配菜的一套流程都摆出来了,还告诉你怎么用。这个意义就大了。

先说最核心的亮点,叫TileLang。这个名字听着洋气,其实可以把它理解成一种专门写给昇腾芯片用的编程语言。以前开发者想让昇腾芯片干某个活,往往得懂很深的硬件底层,得会写很复杂的指令,门槛高,学习时间长,普通人碰起来头大。TileLang做的事情,就是把华为昇腾底层的AscendC指令重新包装了一层。

包装之后,开发者不用把机器底层摸得那么透,也能写出高性能的自定义算子。“算子”又是啥?可以把它想成芯片干活时的一道道小工序。比如算加法、算乘法、做矩阵运算、处理图像、跑神经网络,都是一道道工序。以前写这些工序,得像老师傅一样懂机器脾气。现在TileLang把很多复杂东西藏到后面,开发者用更简单的方式写,机器性能还能尽量保留。

这个变化,对开发者来说,省的是时间,降的是门槛,提的是效率。过去国产算力最大的难处,不是芯片完全不行,而是软件配套跟不上。芯片是硬件,工具是软件。硬件再强,如果没有好用的编程语言、好用的计算库、稳定的通信组件,开发者就不愿意来。开发者不来,生态就起不来;生态起不来,芯片就更难普及。这是一个圈,过去很多年一直卡在这里。

很多人嘴上说支持国产,真到干活的时候,还是得回到CUDA,因为那边工具熟、资料多、项目多、遇到问题好找答案。DeepSeek和华为这次联合开源,就是冲着这个死结去的。双方不是各干各的,而是联合攻坚。按照原文说法,他们不仅完成了全栈基础设施的适配开发,还针对昇腾950超节点等核心硬件,做了128卡超节点方案的落地优化。


什么叫超节点?您可以把很多台服务器、很多张卡连成一个大算力池,像把几十口小灶连成一个大厨房,大家一起炒菜。可机器一多,最怕什么?最怕互相传话慢,最怕有的干得多、有的干得少。所以他们对设备计算链路、跨卡通信链路做了细致调优,让整套开源体系能适配昇腾全系列硬件,从终端推理设备到大型超节点集群,都能比较顺畅地跑起来。

更关键的是,这套工具链做得比较轻,容易部署,也容易迁移。开发者只要简单配置环境,就能把原本适配CUDA的AI项目往昇腾平台上搬。这个事听起来不热闹,但实际很重要。因为开发者最怕麻烦。你让一个人重新学一套东西,他可能就放弃了;你让他用原来熟悉的方式,稍微改改就能跑,他愿意试。愿意试的人多了,生态就慢慢活了。


再说这次开源的价值。它不是简单把技术放出来,而是把选择权放出来。过去行业里想搞高性能AI算力开发,基本只能依赖英伟达那套封闭的商业生态。开发者要遵守人家的技术协议,要承担高昂的算力成本和工具授权成本,技术研发的主动权不完全在自己手里。万一出现技术限制、生态封锁或者授权变动,国内AI产业的模型研发、算力部署、产业落地都会受到冲击。这个风险,不是吓唬人,是实实在在摆在那儿的。

而DeepSeek和华为这次开源的昇腾全栈基础设施,秉持的是完全开放、全球共享的路子。没有权限封锁,没有商业绑定,没有技术保留。全球任何个人开发者、企业团队、科研机构,都可以免费下载、自由使用、二次开发、自主迭代,不是只给自家人用,而是摆到全球桌面上,谁有本事谁都能来用,谁有想法谁都能来改。这才叫底层技术的普惠共享。

从实际效果看,这套东西也不是纸上谈兵。原文提到,双方团队在联合研发过程中,依托昇腾CANN架构的端到端异构计算能力,通过算子融合、多流并行、精准量化等核心技术,持续优化模型推理和训练效率。CANN您可以理解成华为给昇腾芯片配的软件底座。算子融合,就是把几道小工序合成一道,少折腾;多流并行,就是让多条活儿同时干,别排队;精准量化,就是在尽量不影响效果的前提下,把计算弄得更省更快。

这些词听着专业,道理跟咱们过日子一样:能合并的步骤就合并,能同时干的就别一个个来,能省的地方就省,最后效率和成本就下来了。在昇腾A3超节点的实测场景中,优化后的DeepSeek V4模型推理时延能够稳定控制在50毫秒以内。50毫秒是啥概念?您眨一下眼,大概还要几百毫秒。50毫秒以内,基本就是人刚问完,结果很快就出来了。

整体吞吐量相比传统方案提升近十倍。吞吐量可以理解成“每秒能处理多少内容”,提升近十倍,不是多挤出来一点点,是效率大幅往上走。在CloudMatrix 384超节点的部署测试中,50毫秒时延约束下的单卡解码吞吐可以突破1920 Token每秒。Token可以粗略理解成字或者词。单卡每秒能解码1920个Token,这个速度相当可观。

在Atlas 800I A2推理服务器部署场景下,100毫秒时延约束下单卡吞吐可达808 Token每秒。这样的表现,原文说已经全面对标甚至超越了同规格英伟达算力方案。这个结论如果站得住,那就说明国产算力软硬件协同确实有了硬实力,也说明这套开源体系具备大规模商业化落地和规模化普及的条件。


当然,咱们听这种消息,也要有个平常心。技术突破是好事,但具体数字、具体型号、具体测试条件,最好还是以官方发布为准。您要是拿出去讲,最好再对着官方资料核一遍,别让旁人挑出毛病。可大方向是清楚的:国产AI算力不再只是“能用”,而是在往“好用、快用、大家一起用”的方向走。

这次合作也不是一锤子买卖。原文说,双方的合作是体系化、长期化、全链路的生态共建。DeepSeek是国内顶尖的大模型研发企业,懂模型,懂开发者,懂上层应用怎么落地;华为则有多年的芯片研发和算力架构积淀,懂底层硬件,懂架构迭代,懂怎么把芯片能力压出来。一个在上层,一个在底层,强强联合,互相补位。以前国产算力生态常见的问题是什么?硬件和软件脱节,模型和硬件适配不好,工具迭代慢。现在这两家绑在一起干,就能把这些问题往前推。


而且在这次全栈基础设施开源之前,双方已经完成了多款DeepSeek主力模型对昇腾全系列产品的全域适配。从轻量化蒸馏模型到旗舰级大参数模型,从日常推理场景到大规模集群训练场景,都能兼容。还能做到新版本模型发布后,昇腾平台零日适配。零日适配是啥意思?就是新模型一出来,昇腾这边第一时间就能支持,不让开发者干等。这个能力很重要,因为AI技术变化快,今天一个新模型,明天一个新版本,如果适配总慢半拍,开发者就会跑掉。

对全球数百万AI开发者来说,这次开源带来的改变是全方位的。普通个人开发者,可以免费使用全套高性能开发工具,不用再依赖昂贵的海外算力设备和商业开发套件。以前一个人想搞大模型训练、算子开发、算法优化,光是工具和算力成本就能把人挡在门外。现在门槛低了,成本降了,愿意尝试的人就会多起来。

信息来源:


展开阅读全文

更新时间:2026-10-06

标签:科技   华为   英伟   底层   格局   全球   开发者   模型   芯片   算子   节点   硬件   工具

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034844号

Top