十万卡跑满还不排队,曙光8000把“爆满”玩出了反常识
满载却不堵车,这听起来多少有点反常识。
曙光8000上线首周已经满负荷运行,日均处理作业超过15万个,单日峰值超过50万个,同时还要应对百万级并发。训练任务动辄占用数千张卡,推理请求短而密,科学计算又需要大量读写,三类任务挤在一起,调度稍微粗糙一点就会排成长队。
曙光的解法是利用智能调度和数据亲和性算法自动分流,让任务尽量靠近所需数据,减少芯片空转和跨节点搬运。
华为Atlas 950这次也露脸了,整体上更擅长解决超节点内部的通信问题,通过灵衢互联和统一内存编址,让上千张卡协作得更像一台机器;曙光8000处理的是十万卡范围内的“全城交通”,除了通信,还包括数据、任务、芯片差异和用户并发。
前者追求单个车队跑得更整齐,后者要保证整座城市高峰期不瘫。
首周最有价值的指标未必是50万个作业,而是高负载状态下仍能保持流转。卡贵不贵是采购问题,卡等不等数据、等不等任务,才是运营利润。

