众力资讯网

#用AI训练AI# 说真的,"用AI训练AI"这五个字,圈外人听着像科幻,圈内人早干两年了。翻译成工程语言就一句:人类的数据快用完了,只能让模型自己造数据喂自己。 先算笔账,你就懂为啥非走这条路不可。以前训大模型靠人类标注,雇人一条条打标签——贵,还慢。专业领域的专家按小时算钱,模型要喂的数 ​

用AI训练AI

说真的,"用AI训练AI"这五个字,圈外人听着像科幻,圈内人早干两年了。翻译成工程语言就一句:人类的数据快用完了,只能让模型自己造数据喂自己。

先算笔账,你就懂为啥非走这条路不可。以前训大模型靠人类标注,雇人一条条打标签——贵,还慢。专业领域的专家按小时算钱,模型要喂的数据量,人类标到死都标不完。更绝的是有些领域人类根本标不动,量子物理、密码学代码,能标的人比大熊猫还少。换 AI 当老师:大模型出题、解题、留下推理过程,另一个 AI 当批改老师打分,好的留下当教材,循环。成本从"雇人"变成"烧 token",数量直接拉满。

这套东西有个学名叫数据飞轮。最狠的例子是 DeepMind 的 AlphaProof:训练时自己证明了上百万条数学定理,每条证明都变成下一条的垫脚石。OpenAI 的 o 系列也是这么练的——自己生成推理、自己验证,RL 循环滚起来。听着是不是挺美?AI 自己卷自己,越卷越强。

问题就在这儿:自己教自己,容易近亲繁殖。行话叫模型崩溃(model collapse)——模型拿自己生成的数据当教材,多样性越抄越窄,抄到后面整个模型练成一滩浆糊;偏见、幻觉,也一代代遗传放大。所以现在各家都学乖了:合成数据占个六成七成,但一定留两到三成真人数据当"锚",再加一道人类抽检,别让这飞轮彻底失控。

说句细思极恐的:以前人类是 AI 的老师,教它啥它学啥;现在人类退成质检员了,只在流水线末尾抽几件看看合不合格。数据飞轮转起来之后,AI 进步的速度,人类已经追不上了——你连它自己给自己编的教材,都未必看得懂。

用AI训练AIAI大模型热点科普