DeepSeek联手华为国庆放大招!大家在国庆堵车的路上,DeepSeek悄悄干了件大事:把整座"军火库"开源给了华为昇腾!
国庆长假第一天,无数人堵在高速上刷手机的时候,AI圈炸了一颗深水炸弹。9月30日上午,DeepSeek通过官方公众号低调宣布:正式开源面向华为昇腾算力平台的全套基础设施组件。
TileLang高级语言编译工具、DeepGEMM矩阵计算库、DeepEP分布式通信库、FlashMLA稀疏注意力算子……一个不落,全部开源。所有组件与此前面向英伟达平台的开源组件一一对应。
翻译成大白话:DeepSeek把过去两年在英伟达平台上打磨出来的全部底层工具链,一口气搬到了华为昇腾上,而且免费公开给全世界用。
这不是简单的代码移植。这是把一套完整的“武器生产线”从英伟达的车间,搬进了华为昇腾的厂房。
通信方面同样恐怖。DeepEP-Ascend在MoE调度场景下,互联带宽实测达到Dispatch 375 GB/s、Combine 347 GB/s,接近硬件理论上限。万亿参数模型的跨节点通信瓶颈,被这套通信库直接打通了。
更关键的是,DeepSeek实现了Python API层面的跨平台统一。同一套代码,在英伟达GPU上跑完,切到昇腾NPU上直接能用,不需要针对不同架构重写底层接口。过去开发者不愿意碰国产芯片,最大的顾虑就是CUDA生态迁移成本太高。现在这个门槛,被DeepSeek一脚踹平了。
华为这边的配合也够意思。华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换网络和256K卡两层交换网络,支持超低时延推理和前沿基座模型的大规模训练。
双方深度协同,完成了昇腾950的128卡超节点方案落地,针对计算和通信链路做了深度调优。
实测数据更能说明问题。基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不带框架纯模型性能可实现TPOT=5ms,每卡输出吞吐2469 tokens/s;TPOT=10ms时每卡输出吞吐达到5102 tokens/s。这组数字放在全球AI推理性能排行榜上,都是第一梯队的水平。
这件事真正值得琢磨的地方,不在于技术参数有多漂亮,在于它传递的信号。
英伟达在中国市场的收入从46亿美元跌到零。华为昇腾拿走了这块蛋糕的绝大部分。摩根士丹利预测,2026年华为将占据中国AI加速器市场62%的份额。国产AI芯片整体拿下了约80%的市场,英伟达在国内AI芯片市场的份额可能已经只剩5%左右。
DeepSeek把整座“军火库”开源给昇腾,等于给这个趋势又踩了一脚油门。
过去中国企业用国产芯片,最头疼的不是硬件性能不够,是软件生态跟不上。英伟达的CUDA生态积累了十几年,全球几百万开发者在上面写代码、调参数、分享经验。国产芯片的软件栈起步晚,开发者迁移成本高,很多企业宁可多花钱买英伟达,也不愿意折腾国产方案。
DeepSeek这次开源,等于把昇腾平台的“入门大礼包”直接送到了开发者手上。TileLang昇腾版本让开发者可以用更简单的高级语言写算子,不损失硬件性能。
DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect这些组件覆盖了矩阵运算、跨设备通信、向量计算、稀疏注意力、数据筛选等几乎所有大模型训练和推理的核心环节。目前DeepSeek训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。
中国AI芯片的市场规模正在爆发。中信证券预测,到2026年中国AI芯片市场规模将突破3000亿元。国产AI芯片出货量将从2025年的110万颗增至2026年的240万颗,2027年的480万颗,2030年达到1100万颗,对应市场规模从940亿元扩大到6460亿元。
DeepSeek在国庆当天还放了一个彩蛋。官方桌面客户端正式上线,登录就送6块钱赠金,整个假期都是闲时价格收费,相当于忙时价格的五折。一边是底层“军火库”全部开源,一边是面向普通用户的桌面端产品上线,两条线同时在推。
国庆堵车的时候,很多人可能不知道,中国AI产业刚刚完成了一次关键的基础设施迁移。
英伟达在中国市场从46亿美元营收跌到零,华为昇腾拿走了六成以上的份额,DeepSeek把整座软件工具库开源到昇腾平台上。三件事叠在一起,国产AI算力的闭环正在从一个概念,变成一个可以跑起来的事实。

