众力资讯网

昇腾950超节点(Atlas 950 SuperPoD):国产算力的里程碑式突破

一、产品亮相历程:国产顶级超节点正式走向全球舞台昇腾950超节点(Atlas 950 SuperPoD),是华为昇腾团队

一、产品亮相历程:国产顶级超节点正式走向全球舞台

昇腾950超节点(Atlas 950 SuperPoD),是华为昇腾团队倾力打造的新一代国产顶级AI算力集群。这款重磅产品最早在2025年9月华为全联接大会上,由轮值董事长徐直军正式对外公布。

在正式亮相节奏上,它先走向国际、再回归国内:2026年3月,它登陆巴塞罗那世界移动通信大会,完成海外首次展出;2026年7月17日至20日的上海世界人工智能大会,将是它在国内的首次真机公开亮相。

从硬件规模来看,昇腾950超节点以单柜64张昇腾950DT计算卡为基础单元,最大可支持8192张算力卡高速联动工作。对比上一代Atlas 900超节点的384卡规模,整体集群能力直接提升20倍以上,实现了国产算力集群的跨越式升级。

二、核心技术突破:不靠堆硬件,补齐万卡集群最大短板

在AI算力行业,很多集群只是简单堆砌芯片,算力利用率低、传输延迟高。而昇腾950超节点最大的不同,是靠自研底层架构,真正打通了万卡级集群的运行瓶颈。

它依托华为独创的“韬定律”理论,搭配自研灵衢2.0全光互联协议,搭建起UB‑Mesh递归直连拓扑结构。让8192张算力卡实现全链路无损互联,精准解决了万亿参数大模型训练中,跨芯片传输慢、带宽不足、算力浪费的行业普遍难题。

更关键的是,从硬件芯片、互联协议到配套软件,整套系统实现100%国产化,彻底摆脱了对海外互联技术的依赖。

核心硬件昇腾950DT芯片实力同样扎实:采用双Die UMA架构,搭载144GB国产HBM高速内存,内存访问带宽可达4TB/s,单卡互联带宽2TB/s,还原生适配FP8、MXFP4等主流AI高精度、高效率计算格式,完美适配各类大模型训练与推理需求。

三、行业重大突破:国产算力首次站稳万卡集群赛道

在此之前,全球高端大规模AI超算集群,几乎被英伟达NVL体系垄断,国产算力集群大多只能做到几百卡规模,始终无法突破上限。

而昇腾950超节点的问世,直接将国产算力集群的上限拉升至8192卡万卡级无收敛集群,补齐了国产高端算力的最大短板。

依托自研灵衢2.0全光互联技术,在华为实验室最优测试环境下,集群通信带宽提升15倍,单跳通信时延从2微秒降至200纳秒,降幅高达10倍,同时支持长距离无损互联。

这一突破验证了全新的算力发展思路:不用一味追求先进芯片制程,靠系统架构创新,也能实现算力性能大幅跃升,为国产芯片发展开辟了全新的突围路径。

四、两大底层创新:重新定义国产算力发展逻辑

1. 韬定律:跳出摩尔定律的算力新范式

长久以来,行业算力提升高度依赖摩尔定律,靠缩小晶体管尺寸提升性能,瓶颈越来越明显。

2026年5月25日,华为半导体业务总裁何庭波在国际权威电路与系统研讨会上,正式发布韬定律(τ定律)。这套新理论以信号传输时间常数为核心,不再纠结芯片制程微缩,而是从器件、电路、芯片、系统全链条,压缩信号传输延迟,以此实现算力性能跃迁。

截至目前,华为依托这套技术思路,6年间已成功设计并量产381款芯片。按照规划,到2031年,通过这套系统级优化方案,华为高端芯片可实现媲美1.4纳米制程的晶体管密度效果。

2. 灵衢2.0:国产自主可控的高速互联标杆

灵衢2.0(UB‑Mesh)是华为完全自主研发的高速互联协议,彻底脱离了海外CXL、PCI‑E协议体系的束缚。

为推动国产算力生态共同发展,华为已对外开放灵衢2.0全部技术规范。其独有的全光Mesh全对等互联拓扑,是8192张算力卡高效协同、稳定运行的核心基石,也是国产超大算力集群的核心技术壁垒。

五、国际实力对比:集群能力领跑全球,单卡仍有提升空间

我们结合行业主流产品,做一次客观、清晰的横向对比(数据基于官方公开参数):

本次8192卡集群对比数据,为昇腾950整体集群对标英伟达NVL144单机柜单元,单柜层级性能差距会相对更小。

- 硬件配置:华为单柜搭载64张昇腾950DT,英伟达NVL144单柜配置72颗Rubin GPU

- 整体算力规模:昇腾950超节点8192卡集群,FP8总算力8 EFLOPS、FP4总算力16 EFLOPS,总互联带宽16.3 PB/s,总内存1152 TB

- 英伟达NVL144机柜:FP8算力1.2 EFLOPS,内存75TB,互联带宽13TB/s

从整体集群来看,昇腾950超节点卡规模是NVL144的56.8倍,总算力为其6.7倍,互联带宽达其62倍,内存容量是其15倍。

即便是对标英伟达计划2027年上市的NVL576产品,昇腾950在集群规模、互联带宽、总内存等核心指标上,依旧具备明显优势。

客观来看,英伟达Rubin GPU的单卡算力仍有优势,国产单卡芯片还有追赶空间。但徐直军也明确表示:在万卡级超节点品类中,昇腾950超节点未来多年,都将保持全球领先水平。

六、落地应用场景:赋能大模型与全行业高端科研

昇腾950超节点的核心定位,就是服务万亿参数超大模型训练、高并发AI推理场景。

目前,国产主流大模型DeepSeek V4已完成昇腾平台适配。在强化学习训练、智能体高速服务等对延迟要求极高的场景中,昇腾平台可实现最高1.96倍的推理加速,大幅提升AI服务效率。

DeepSeek官方也透露,目前高端算力不足导致Pro版服务产能受限,待2026年下半年昇腾950超节点批量上市后,其高端AI服务价格将大幅下调,让普惠AI更进一步。

除了大模型领域,这款超节点还能全面适配自动驾驶仿真训练、生物医药分子研发、气象精准预测、工业仿真模拟、多模态AI模型训练等高端科研产业。

当前国内头部云厂商、运营商均已进入产品评估阶段,2026年下半年,将成为国产万卡级超节点规模化落地的关键节点。

七、行业发展展望:国产算力从硬件追赶迈向全栈自主

过去国产AI算力的短板,不止是芯片性能不足,更关键的是互联协议、集群调度系统、大模型适配框架,长期依赖海外技术,生态受制于人。

随着昇腾950超节点落地,搭配华为CANN软件栈的持续迭代,DeepSeek、智谱AI、通义千问等头部国产大模型已完成深度适配。国产算力正式告别“单卡硬件追赶”阶段,迈入芯片、互联协议、调度软件、大模型适配全栈自主的全新发展阶段。

根据华泰证券2026年4月行业研报测算,2028年国产超节点市场规模将达到3414亿元,市场前景广阔。而华为“架构创新弥补制程短板”的技术路线,也为国内整个芯片行业提供了全新的发展参考。

八、战略核心意义:铸就国产AI算力自主基石

昇腾950超节点的落地,是中国AI算力发展的里程碑事件,标志着国产算力从单纯的硬件追赶,升级为拥有超大集群体系竞争力的顶尖水平。

它用实力证明:无需依赖海外高端GPU,依托国产自研芯片、自主互联协议、创新系统架构,我们也能搭建出全球顶级的万卡级AI算力集群,彻底打破海外对高端超大算力集群的长期垄断。

在国内芯片制造受限的大环境下,这款产品验证了“系统创新弥补单芯片制程差距”的可行性,同时带动光通信、先进封装、高速连接器、EDA软件等上下游产业链协同升级,为我国构建完全自主可控的AI算力基础设施,筑牢了核心战略根基。

下面图片是Atlas 950 SuperPoD: