Dwarkesh Patel 的最新播客采访了三位顶尖 AI 研究员,分别是 Zyphra 首席技术官 Beren Millidge,Thinking Machines 首席科学家 John Schulman,Baseten 的模型训练负责人 Charlie O’Neill。
他们聊到了近期沸沸扬扬的国内厂商蒸馏问题,John Schulman 认为如果仅凭监督学习做蒸馏,Prompt 分布至关重要。即便你拿到了模型的完整访问权,包括 CoT(思维链)在内的所有内部信息,蒸馏也绝非易事。
要把所有核心能力完整复制下来极其困难,因为你必须源源不断地给模型提供输入,而且这些输入必须是高度贴近真实业务场景、覆盖面极广的 Prompt 分布。
这就解释了为什么中转站的数据比大家想的都有价值。
如果一个国内用户 / 企业愿意花钱去使用中转站,说明他的真实工作对前沿模型有刚需(没有人是烧 Token 去玩吧?至少要追求某些回报)。而这些用户形成的数据能提供近乎完美的真实 Prompt 分布。
Beren Millidge 认为,如果去拆解一线前沿流程,或是细看中国 AI 团队在论文里披露的技术路线就会发现,他们通常先获取一批由人工编写与前述 Router 数据结合而成的种子 Prompt。
接着,他们再借助手头的现有模型或其他顶尖模型,以这些种子为支点,自动化合成出覆盖面极为广阔的数据集。
无论是收集 Prompt 分布,还是搭建训练环境,背后都可以实现高度的自动化。而随着基础模型越发强大,人类需要介入灌输的信息先验正在急剧减少。
这也可以侧面说明,如果手上有个能持续承接真实用户流量的产品,对当下模型的训练也非常有帮助 —— 甚至也许真实世界的实际部署就比环境更重要。
根据上述推导,Charlie O’Neill 预测认为美国前沿实验室即便在 RL 环境上还有优势,这种优势现在恐怕也所剩无几了。
为了便于理解,再补充个 John Schulman 在播客内的解释:
“衡量训练环境,其实可以拉出两个不同的维度:一个是难度,另一个是真实度。”
“单纯把环境难度做上去相对容易,无非是堆砌更复杂的任务,或者逼模型展现更精巧的解题能力。这本质上是在 benchmaxxing 分布上下功夫,毕竟主流基准评测大多偏爱这种极难、类似解谜、但判定结果极易验证的任务。”
“但另一个维度是真实度。比如在真实的 Coding Agent 场景下,模型需要与人类多轮拉扯、反复交互,同时还要兼顾多个目标。要让模型在这种复杂现实中同样游刃有余,难度完全不可同日而语。”
“首创模型行为的前沿实验室,必须在这两个方向上同时推进。要想获得理想的模型表现,就必须在真实度维度上下苦功,依靠细致的评分标准或人工反馈来构建奖励函数。”
“但如果只是照搬表面做简单蒸馏,最终充其量只能在刷榜任务上追平教师模型。要是缺乏足够多能在复杂现实场景中锻炼能力的训练环境,学生模型就根本掌握不了这些能力。”
“现在很可能存在这样一种现象:顶尖大模型能更从容地从狭隘刁钻的特定任务,泛化到真实的复杂任务里。”
“如果在蒸馏阶段,你手里掌握着一套极其贴合实战的真实 Prompt 分布,确实能把大模型复刻得八九不离十,但如果你手里只有那些便于验证的刷题任务,结果就是模型在各大跑分榜单上表现亮眼,可一旦放到更广阔的现实分布中,立刻原形毕露。”