众力资讯网

The Base Model Is Dead。

The Base Model Is Dead,这是我刚看完的一期分享,来自美国开源模型创业公司 Arcee AI 的预训练负责人 Varun Singh。标题有点唬人,但这哥们的观点非常扎实。

他认为,过去 Base Model 的任务,是尽可能吸收人类已有的知识。

GPT-3 那个时代,预训练的逻辑很简单,就是抓取大量互联网文本、Wikipedia、书籍,把尽可能多的人类知识压缩进模型参数里。

在 GPT-3 的训练数据里,来自网页和 Wikipedia 的数据大概占到了 85%。

那个时候大家的默认逻辑就是,模型到底有多强,很大程度上取决于预训练做得好不好。

后训练更多是在这个基础上做最后的行为调整,比如让模型更会聊天、更会遵循指令。RL 在当时的作用也比较有限。

但是 O1 之后,整个行业都发现了 RL 的重要性。

大家开始发现,只要 RL 做得足够好,模型在预训练结束之后,能力还可以继续明显提升。于是就不断加后训练的投入。

我记得之前罗福莉在一个访谈里提过,他们在预训练和后训练上的算力投入已经大致接近。

这也就是说,模型在预训练结束之后并没有定型。后训练已经不只是把模型调得更好用,它开始真正影响模型的最终能力。

Base Model 的角色也因此发生了变化。它越来越像是在给后面的 RL 准备一些原子能力,也就是 Atomic Skills。

举个例子,如果希望通过 RL 训练出一个非常强的 Coding Agent,那 Base Model 在预训练结束的时候,不一定已经能够独立完成十个小时的软件工程任务。

但它最好已经掌握了 Python、代码结构、API、函数调用、Git、文件系统这些基础能力。

这些就是 Atomic Skills。

进入更复杂的任务和环境之后,再通过 RL 学习怎么把这些基础能力组合起来,这样就可以涌现出复杂 Agent 任务的能力。

所以,如果 Base Model 的目标变了,预训练的数据自然也会变。