前几天在社区里风头无两的神秘大模型“Ox Alpha”(牛来大模型),底牌终于被掀开了——它竟然就是智谱的 GLM-5.3-Flash!
看完这套刚刚曝出来的架构解构图,我只能感叹:现在的国产大模型,已经把“架构创新”和“极致算力压榨”玩到了化境。
这哪里是一套普通的升级方案,分明是一场大模型工程界的“超级大缝合”!
这里面藏着的工程智慧极其硬核:
第一,堪称艺术级的 3:1 超级混合注意力机制。
它没有死板地沿用全注意力,而是大胆组装了 34 层 Kimi 的 KDA(线性注意力)加 11 层 DeepSeek 的 MLA/DSA(隐空间/稀疏注意力)。
这套组合拳打下来,上下文 KV Cache 占用直接被砍掉了 4.4 倍,计算量骤降 3 倍!在大文本推理时,简直就像开了加速挂。
第二,残差网络彻底变天。
它放弃了传统单条残差叠加的旧路线,直接采用了 DeepSeek 风格的 mHC(流形约束超连接),拉出了 4 条并行残差流。
这意味着信息在神经网络深层流动时不再拥挤堵塞,深层训练和推理的表达能力上限被大幅拉高。
第三,极度“抠搜”却又极度高效的 MoE 骨架。
总参数量虽然高达 320B,但通过 288 个专家和动态路由,每个 Token 激活的参数竟然只有 18B,激活率低至 5.6%。
相比于前代 744B 的体量,这种精瘦身材不仅没让智商打折,反而让算力利用率达到了惊人的地步。
这背后的行业信号太强烈了:大模型竞赛的下半场,已经从“拼卡多、比谁烧钱狠”的蛮力时代,彻底转向了“架构级极致算力缝合”的工程艺术。
智谱把 Kimi 的长文本基因、DeepSeek 的计算降维打击以及自家的 MoE 骨架拿进摇摇杯里调了一杯极品鸡尾酒,硬是在国产 AI 芯片上跑出了每天 100 万亿 Token 的吞吐量,性价比直接拉满。
甚至看到“18B 动态激活”时,我的第一反应是:这难道不是给我咬牙入手高配 Mac Studio M5 Ultra 找的绝佳理由吗?
把这种级别的模型跑在本地,真机体验简直不敢想。
当顶级 Lab 们不再固步自封,开始毫不避讳地融合彼此最顶级的架构创新时,最压力山大的恐怕不再是国产芯片的算力瓶颈,而是那些还在用旧架构硬扛 Scaling Law 的硅谷巨头们了。
