一个模型把家底全掏出来给你抄,是什么体验。Kimi K3今天直接摊牌:权重公开、技术报告全放、连训练用的三项底层Infra技术一起开源。这不是发模型,这是把后厨和前厅的装修图纸都贴墙上了。
先看硬参数:2.8万亿参数的混合专家模型,上下文窗口100万token,原生就能看懂图片。参数规模是上一代K2.5的三倍,但真正值得聊的不是堆料,他们在算力不宽裕的前提下,靠KDA注意力机制、注意力残差和MoonEP这一套组合拳,把规模化效率硬生生提了2.5倍。什么意思?就是单位算力产出的智能,相当于原来的两倍半。
说人话:别人靠加显卡砸出来的效果,他们靠改底层数学做到了。
技术报告里还有一个容易被忽视的点:视觉编码器MoonViT-V2是纯用next-token prediction从零练出来的,没走对比预训练那条老路。这意味着视觉理解的训练逻辑跟语言模型彻底打通了,优化更稳,思路也更干净。
最狠的是他们把MoonEP、FlashKDA、AgentEnv三项训练基础设施全部开源。这几样东西是撑住K3训练效率和稳定性的骨架,现在任何人都可以拿去训自己的下一代模型。
开源权重能降低获取智能的门槛,但开源训练基建,是把造门槛的工具也发了。这才是真正的开放。

