印度一吹牛就坏事了!吹嘘自研大模型比DeepSeek还牛,结果有AI玩家不服气,扒开底裤一看,发现架构竟然是DeepSeek的山寨缩水版!被玩家一顿嘲讽。看来中国大模型不仅养活了全球开发者,还养活了不少套壳忽悠本国政府补贴的软件公司!
其实这事属于“挖坟”,因为发生在今年2月份。之所以现在又被翻出来“鞭尸”,是因为7月31日DeepSeek发布了最新的V4-Flash版,模型性能实在太惊艳了,“高速、低价、轻量”六个字就可以形容。
速度怎么个高法呢?海外开发者实测,GPT-5.6 Sol耗时107秒的任务,V4-Flash只要40秒就完成了,速度翻倍。
低价是这么个低法呢?以GPT-5.6 Sol为例,每百万Token输入36元、输出216元;而DeepSeek V4-Flash输入1元、输出2元,缓存命中的话还低至0.02元。同等开发工作量,综合调用成本只有GPT的1/50到1/100。
轻量又是这么个轻量法呢?V4-Flash总参数284B的MoE架构,大概是当前顶尖闭源模型的十分之一,单次推理仅激活13B参数,模型权重仅162GB。
7月31日的V4-Flash版本只做了大规模GRPO后训练,没有增加任何参数,而是优化了MoE专家分配,证明行业过去一味堆参数的内卷路线存在巨大的升级空间。传统稠密70B模型推理时全部参数参与计算,算力浪费严重;V4-Flash每次任务只路由匹配当前需求的13B专家模块,算力利用率提升了7到10倍。
DeepSeek又小又快还便宜,完成任务的质量还非常优秀,发布后在全球再次引发了一股“DeepSeek时刻”的狂潮。因为现在发布的只是V4-Flash版本,过阵子还会发布Pro版本,大家迫切想知道:这个V4-Flash版本已经秒杀全球顶尖大模型了,这个Pro版得狂野成什么样呢?
DeepSeek V4-Flash确实成了继7月16日Kimi K3模型发布后最受瞩目的大模型。然而就在此时,一个印媒吹嘘过比中国DeepSeek还要牛的大模型进入了大家的视线,这就是本文开头提到的印度本土主权大模型厂商Sarvam AI旗下的Sarvam-105B旗舰大模型。
2月18日发布后,印度顶级财经媒体Moneycontrol报道称:“Sarvam AI推出的105B模型在关键基准测试中的表现优于DeepSeek-R1和Gemini Flash。”Sarvam AI联合创始人、首席科学家Pratyush Kumar博士表示:“总参数只有105B,但在绝大多数推理基准上,击败了600B总参数的DeepSeek-R1。”
你印度大模型在印度语种上击败DeepSeek-R1不是很正常么?谁花那么多时间来学习印地语这种小语种?Sarvam AI这么高调,引发了很多AI玩家的不满。有玩家发现,Sarvam-105B的架构与DeepSeek在2024年公开的MLA(多头隐注意力)、MoE专家路由、GRPO强化学习等全套方案完全一致。Sarvam-105B完整复用了这套技术栈,仅缩小了参数量、调整了专家容量,配置文件结构高度近似,这个“105B”也就坐实了DeepSeek山寨缩水版的身份。
不过也算是Sarvam AI有点自知之明,仅仅只敢宣布超过DeepSeek-R1!另外也确认了Sarvam AI尽管抄了架构,但大致是完整从头预训练出来的。这相当于抄了中国从小学到大学的教育架构,然后用了一样的课本,重新培养了个高中生出来。怎么说呢,谁让你开源呢?这不还怪人家学了不成?
当时社交媒体上就有网友嘲笑中国的开源策略,养出了很多“白眼狼”,拿着你的底座搞开发,搞出来不仅不认你的好,还处处针对你,被嘲笑拿着中国的科研补贴全世界。其实从某种意义上理解,中国做开源就是要达到这个效果!
现在美国的闭源大模型是不是有一种高处不胜寒的感觉?全球AI玩家不是投奔中国,就是各国主权模型学着中国开源架构搞开发。第一个结果就是,美国闭源大模型是不是收不到钱了?想圈起来高额收费,还要制裁中国GPU算力资源?那就别怪中国人掀桌子了!
第二个结果呢?中国优秀开源大模型现在正在往非英伟达算力的路线上狂奔,未来基于中国大模型搞出来的主权模型,是不是天生就支持中国国产的算力卡?
Kimi K3告诉你,顶尖大模型并不是非得选美国那些准备圈钱的闭源大模型;DeepSeek告诉你,更高的性能、更快的速度,不是非得堆砌GPU资源,而且也可以用中国的GPU算力资源。用最少的资源办最大的事情,一直都是中国大模型最擅长的事情!
现在中国玩的这个套路,就是从软件逻辑上击败美国大模型,从硬件逻辑上摧毁美国大模型的叙事逻辑,并且从价格上堵死美国大模型的退路。全球AI玩家围攻光明顶,先把美国人的大模型给干翻,中国人想要的结果大概就是这样!







