众力资讯网

现在大家搞AI多模型协作,本质上像极了两个顶级科学家在隔空飞鸽传书: A模型苦

现在大家搞AI多模型协作,本质上像极了两个顶级科学家在隔空飞鸽传书:

A模型苦思冥想生成了一万字的推理过程,变成文字打出来;B模型再把这一万字重新读一遍、翻译成自己能懂的向量,接着干活。

硅谷烧掉几百亿美金买显卡,很大一部分算力就耗在两个硅基大脑互相说废话的转换损耗上。

来自俄罗斯的一家硬核团队Mostik,干的事情极其粗暴且优雅:直接传“脑电波”。

这个只有15个人、手握12个博士、由2010年菲尔兹奖得主Stanislav Smirnov领头的数学家天团,做了一个叫Mostik(俄语里意为“桥”)的连结架构。

他们不搞模型蒸馏,也不让大模型写一大段推理长文给小模型读,而是直接把两个完全不同架构的模型内部数学表达给缝合在了一起。

他们拿两个中国开源模型做了一场堪称降维打击的实验:一个是753B参数的GLM-5.2,另一个是只有4B参数、能轻松跑在手机上的Qwen-3.5。

当大模型的内部神经状态直接以数学向量的形式无缝倒灌进小模型时,奇迹出现了:这个混合系统的性能稳稳落在两者之间,但运行成本暴跌到了完整GLM-5.2的二十分之一。

顺便,他们还凭这套方案悄无声息地冲上了ARC-AGI 3排行榜的第一名。

这件事最深刻的地方,在于它可能直接推翻了硅谷当下的算力军备竞赛。

过去大家都在疯狂堆算力,以为AGI必须是一个吞噬全人类电力的万亿参数超级单体。但Mostik证明了,AI的未来完全可以是“分布式脑神经网格”。

未来你的手机、电脑甚至具身机器人上,永远低功耗运行着一个4B的小模型。

平常干活时它独立运转,一旦遇到天坑级别的逻辑难题,它根本不需要生成几千个Token传上云端,而是直接打包当前的隐层思考状态,向云端发出一道“神经信号”。云端的753B超级大模型在隐空间里轻轻点拨最难的10%逻辑,再把神经状态传回手机,让小模型继续执行后续细节。

整个过程没有冗余文字,没有文本延迟,大模型不再是事必躬亲的干电池,而是变成了随时按需调用的高阶思考器。

当硅谷大佬们还在为了建十万卡集群去到处找核电站供电时,俄罗斯数学家已经用最纯粹的线性代数告诉世界:与其造一个无所不知的巨型硅基神明,不如建立一个神经递质随时互通的模型网络。

这哪是在卷大模型,这分明是在给硅基大脑之间,搭起一座直接传递神念的神经桥梁。