央视播曙光8000:2.7次故障背后的网络革命
今晚看完央视大型纪录片《超级工程》第三集,躺床上半天没睡着,脑子里全是那个2.7次。
曙光8000十万张芯片要协同工作,网络就是它们的神经。但有个数学题绕不过去:规模越大,传输错误越不是偶然。按测算,十万卡集群每小时会出现2.7次传输错误。
问题不在于错误本身,在于纠错时间。一万卡时,查找故障、重新规划路径要超过30秒。到了十万卡,这个时间可能长达5分钟。5分钟通信中断,意味着所有计算付诸东流。
高速互连网络总架构师万伟没有继续押注“更快的中心调度”。他从北京繁华路口的观察得到灵感:没有人站在路口逐一指挥,每个人根据眼前情况做出选择,人流依然有序通过。团队在交换芯片中植入“智能开关”,并为地址预设备用路径。一旦发现链路异常,毫秒级切换,不等调度中心指令。
测试时工程师手动断开一条通路,监控画面只轻微波动就恢复了稳定。
我当时看到这儿,脑子里就一句话:这不就跟小区门口不设保安、全靠大家自己找路一个道理吗?规模大到一定程度,中央指挥反而成了瓶颈。这个思路转变,比技术本身更值得琢磨。
第四集明晚晚19:27,CCTV-9,最后一集。
曙光8000 高速网络

