我有一种预感:第二个震惊硅谷的“梁文峰”,已经出现了!
谁能想到,DeepSeek之后,第二个让华尔街集体冒冷汗的中国人,竟然是一个几个月前还被嘲笑“掉队”的90后。
他叫杨植麟。
7月16日,杨植麟创办的月之暗面突然扔出Kimi K3。没有铺天盖地预热,也没有开几十场发布会,直接把模型往桌上一拍:2.8万亿参数,原生多模态,100万token上下文,还要开放模型权重。
硅谷一开始以为,这又是一款中国公司用“参数大”制造噱头的模型。毕竟过去两年,见过太多把参数吹上天、一跑分就露馅的“大力出奇迹”选手。华尔街那帮分析师,甚至懒得调整财报模型,只当是又一轮国产大模型的常规刷榜。
但三天之后,风向变了。
起因是开源社区有人拿Kimi K3跑了一轮“硬核”测试——不是那种精心调过提示词的刷分题,而是丢进去一份满是公式、图表和手写批注的百页技术文档,让它直接提取关键数据并重绘逻辑框架。
结果不仅准确率高得离谱,更让海外开发者倒吸凉气的是推理成本:处理同样体量的任务,Kimi K3的消耗只有Claude 3.7的十分之一出头。
硅谷技术论坛开始有人翻出杨植麟的履历——清华学霸,卡内基梅隆博士,Transformer作者之一,曾参与XLNet和Transformer-XL的核心研发。换句话说,这位被国内媒体一度贴上“掉队”标签的90后,十年前就在啃Transformer底层架构,如今不过是在自己最熟悉的战场上打了一场翻身仗。
