众力资讯网

都在盯着算力芯片,但你们可能没注意到,AI 真正致命的瓶颈早就不在芯片本身了,而

都在盯着算力芯片,但你们可能没注意到,AI 真正致命的瓶颈早就不在芯片本身了,而是电费和散热!今年英伟达的老黄干了件极其反直觉的事。他没有去吹新款芯片跑分有多快,而是转身拉着 Emerald AI 和六家电力公司搞起了跨界合作。
他们想干嘛?要把那些吃电如流水的 AI 工厂,变成“可灵活调度的电网资产”。说得接地气一点,就是让服务器学会“看电网脸色”吃饭。电网负荷高、快撑不住的时候,AI 就得乖乖降功耗省电;等电网有余量了,再把算力马力拉满。
连英伟达都在为“电”发愁,这就释放了一个强烈的信号:算力竞赛的上半场拼的是谁家芯片牛,下半场拼的绝对是系统的后勤保障。无独有偶,工信部刚刚批准发布了三项高性能计算机新标准,正好完美回应了老黄的这种焦虑。
这三项新标准是中科曙光牵头编制的,涵盖了电气、机械、固件三个核心维度。这可不是什么务虚的文件,而是直接跑到芯片之外的系统级问题上去立规矩,专门解决“高级芯片插上主板之后怎么活下去”的工程难题。
你看标准里规定的细节就懂了。电气规范里,直接引入了高压直流供电的能力,专门解决庞大规模的送电问题。到了机械规范这块,要求更苛刻。现在的算力怪兽都得靠水冷来降温,新标准对冷板液冷和浸没液冷的密封性、抗压能力、甚至插拔精度,都做了极为严苛的限制。
固件规范更是相当于给服务器配了个重症监护室。它明确要求 BMC 系统必须死死盯着液冷设备。温度多少、压力大不大、冷媒有没有泄漏、液位还在不在安全线之上,这些全都得全天候实时监控,一点纰漏都不能出。
这套规矩不仅写在纸上,中科曙光已经在自家的曙光8000上把这套体系彻底跑通了。他们硬生生把 PUE 压到了低至1.04的极限水平,WUE 更是近乎为零。能做到这种极致,绝不是单靠某一颗芯片的功劳,而是整套系统协同设计砸出来的结果。
未来的算力江湖,比的已经不是谁兜里的 GPU 数量多,而是谁能率先把供电、散热、运维这套庞大复杂的系统工程彻底吃透。在这件事上,中科曙光和英伟达显然都早早看透了游戏的终局。
眼看着大模型越来越聪明,耗电量也在疯狂上涨。你们觉得在不久的将来,这些不知疲倦的“算力怪兽”,会不会真的影响到咱们普通人的生活用电呢?