国庆假期第一天,国产AI圈传来硬核消息!DeepSeek正式开源面向华为昇腾的全套基础组件——节后开盘,国产算力软件栈这条线,逻辑又硬了一层。
9月30日收盘后,DeepSeek官方公告:面向华为昇腾算力平台的基础设施组件全部开源,涵盖TileLang高级语言编译工具、计算库、分布式通信库共六大组件,与之前面向英伟达平台的开源组件一一对应。
这事的分量,得拆三层看。
第一层:TileLang才是核心,它不是普通算子库
英伟达垄断AI算力二十年,靠的从来不是芯片本身——芯片再强,没有软件生态都是铁疙瘩。真正的护城河是CUDA:全球开发者写了二十年的算子、积累了二十年的工具链和调试习惯,迁移成本极高,这才是英伟达最狠的壁垒。
TileLang就是DeepSeek自己造的"国产高级语言"。相对于英伟达CUDA,编程更简单、开发效率更高;相对于其他同类高级语言,它的编程模型能直接吃透芯片特性,压到硬件性能上限。
关键是——TileLang不是实验室Demo,它已经承载了DeepSeek V4系列模型训练中大部分算子的实现。万亿参数级模型实战验证过的工具链,不是PPT。这次开源的昇腾版本,把昇腾Ascend C底层指令全部封装成高级编程方式,性能不打折。DeepSeek原话:训练中用到的每一个TileLang算子,在昇腾上都有对应高性能实现。
第二层:六大组件全套端出来,不是单点突破
这次不是只扔一门语言,是连配套工具箱一起开了:
DeepGEMM管通用矩阵运算,大模型训练的核心算力单元;DeepEP管大规模跨设备通信,万卡集群的命脉;TileKernels负责常规向量计算和访存算子;FlashMLA是稀疏注意力算子,长上下文处理效率倍增;DeepSelect实现高效数据筛选。
一套组合拳打下来,等于把大模型训练最核心的算子库、通信库、编译工具全部开源给昇腾生态。开发者不用再从零手写Ascend C底层指令,直接用高级语言就能写出逼近硬件极限的性能。
第三层:"芯模协同"才是真正的信号
公告里有句话值得细品:华为团队给予了"毫无保留的大力支持",双方共同推进基于昇腾950的128卡超节点方案,对计算与通信深度优化。
这不是DeepSeek单方面适配昇腾,而是芯片厂商和大模型公司深度绑定、联合定义。昇腾950PR单卡FP4算力已达2 PFLOPS,推理效率是H20的近3倍;超节点技术最多支持1024卡高速互联,总算力直接拉满。现在DeepSeek把自家训练验证过的全套算子开源回昇腾生态,等于给整个行业做了一次"最佳实践示范"——别人照着这套工具链适配模型,门槛大幅降低。
映射到节后盘面,逻辑分三档:
第一档是昇腾整机与服务器厂商,直接受益于算力需求放量和超节点方案落地;第二档是核心零部件与高速互联供应商,128卡超节点对互联带宽和PCB、连接器的需求是量级跳升;第三档是软件生态与算子适配厂商,这次开源相当于给整个国产软件栈打了一针强心剂——以前是"有芯片没人会写",现在是"高级语言开箱即用"。
但说句实在话:国产算力的真瓶颈,从来不是单卡算力能不能追上H100——而是CUDA生态二十年积累的开发者习惯、算子库丰富度、调试工具链成熟度,这套软壁垒才是最难啃的硬骨头。旧方案为什么触顶?靠政策补贴堆芯片数量,没有软件生态承接,买回来的卡跑不满效率,模型迁移损失动辄20%-30%的性能。
DeepSeek这次开源TileLang昇腾版,本质上是用自己万亿参数模型的实战经验,给国产算力生态铺了一条"高性能开发捷径"。但捷径能不能走通,还要看社区采纳速度、更多模型公司愿不愿意跟进适配、以及昇腾下一代芯片能不能持续跟上节奏。
节后开盘,你手里拿的标的,是真有算子开源落地、芯模协同深度绑定的硬逻辑,还是蹭"国产替代"概念的空壳?答案决定你吃的是这波生态红利,还是接最后一棒。
学术探讨,非投资建议。
