原定 8 月问世的豆包 2.2 突然跳票了。
以“大力出奇迹”和极速迭代著称的字节跳动,这次破天荒地选择了主动踩刹车。
宁可牺牲发布节奏,也要把多余的时间砸进训练池里,重点修补三大核心能力:Coding、工具调用、Agent。
这释放出一个再清晰不过的信号——在 C 端流量大获全胜之后,字节在模型真正的高阶智商上感到了深深的焦虑。
回看今年 6 月发布的 Seed 2.1,虽然当时已经把 Coding 挂在嘴边,但开发者给出的反馈极其真实:差强人意,远未打响口碑。
字节内部显然看得很明白,如果拿不出让硬核程序员点赞的真功夫,光靠聊天框里的温柔体贴,根本无法筑起大模型的商业壁垒。
内部给 Seed 定下的年底铁律相当硬核:必须做到第一梯队,效果要硬啃下 GLM-5.2 和 Kimi-K3 这两座大山,让开发者真正买账。
为了给这个硬指标让路,Seed 团队在 8 月经历了一场近乎拆骨重造的组织架构大地震。
以往按文本、语音、代码、视觉等模态划清界限的学术派分工被一刀切开,重组为四大功能导向的新集群:Pretrain Data(预训练数据)、Horizon RL(地平线强化学习)、Product Posttrain-Work(工作场景后训练)以及 Product Posttrain-Chat(对话场景后训练)。
这场重组的逻辑非常犀利:按模态划分是搞研究的旧思路,按交付场景拆解才是做产品的硬道理。Horizon RL 团队被直接赋予了死磕 Coding 后训练的重任;而 Work 团队则专攻工具调用、GUI 操作和长任务执行。
这标志着字节的研发逻辑彻底发生转向——别管你是看图像还是听语音,只要进了打工人的电脑,你首先得学会如何操控界面、调用 API,像个熟练工一样把复杂任务一条条执行到底。
在招聘市场上,字节的急迫感更是化为了扑面而来的抢人攻势。Code Agent、通用 Agent 以及 RL 算法工程师的岗位挂满了官网。最让人直呼真实的,是一份 Multi-Agent Harness(多 Agent 框架)岗位,直接要求候选人深入拆解 Claude Code 和 Codex 等主流方案,搭建能够长时间运行的多 Agent 强化学习环境。这简直是把“偷师顶尖 Agent 架构、用 RL 大力出奇迹”的战术意图公开放到了招聘启事里。
当大模型上半场的流量红利见顶,字节已经在用最硬核的方式调头:重构组织、搭建强化学习演练场、死磕长链条任务执行。
在这个赛道里,能让人持续付费的,永远不是说得有多漂亮,而是做出来有多管用。字节宁可晚发布也要死磕 Coding,因为大家都心知肚明:搞不定代码和 Agent 的大模型,哪怕流量再大,终究不过是一个会讲笑话的精致聊天框。
