大模型微调与对齐的底层原理
藏在AI圈里很少对外明说的内幕:刚跑完预训练的大模型,哪怕参数再大、纸面能力吹得再厉害,也绝对不敢直接放给普通用户用。
为啥?
这东西啃完了全网几乎所有公开数据,上知天文下知地理,逻辑推理能力拉满,但它根本没被教过怎么跟人好好打交道。
动不动就东拉西扯、答非所问,蹦出点违规有害内容都是常事,你让它干啥它完全听不懂,只会自顾自顺着文本往下接,活脱脱一个没经过社会规训的熊孩子。
所以要把它改成工业界能用的靠谱工具,两道工序绕不开:微调、对齐。
很多外行人都把这俩混为一谈,其实两个步骤的目标完全不一样——说穿了,一个教它干活,一个教它守规矩。
先说说微调。
工程师会提前准备好一堆高质量的人工标注指令数据集,全是用户真实会提的问题,后面跟着提前定好的标准答案。
把这些成对的指令和答案喂给已经训练好的底座大模型,让它对照着样本小范围修正自己的参数。
这个过程根本不会动它之前预训练学到的所有知识和底层逻辑,只会调整它输出内容的话术和格式,让它慢慢学会读懂人类的简单指令。
说白了,微调就是给大模型报了个技能培训班,教它怎么准确接收到你的需求,输出你想要的内容,解决“该怎么说、怎么把活干对”的问题。
很多人只看到微调表面的操作,不知道它背后藏着两个核心底层原理。
第一个叫局部权重扰动原理。
预训练阶段已经把大模型99%的底层网络参数都固化好了,微调根本不会打散这些已经成型的知识和逻辑,只对输出层和浅层网络做小幅度的参数更新。
用几乎可以忽略的极小参数改动,就把模型的输出倾向掰到适配人类指令的方向,既让它会干活,又完全不破坏它之前攒下的所有本事。
第二个叫指令特征映射原理。
微调本质上就是给模型强行绑定“用户提问→标准输出”的对应关系,让它彻底分清什么是随便续写文本,什么是人类给它下的任务指令。
这也是为什么现在你跟大模型说话,它能秒懂你的需求,不会自顾自瞎扯的根本原因。
等微调把技能点都给它点满了,接下来就要走对齐流程,给它立规矩了。
对齐靠的是人类反馈打分机制:人给模型输出的所有结果挨个打分,优质合规的给高分,偏激违规的直接打低分。
系统根据打分高低搭出奖励机制,一遍遍淘汰那些爱闯祸、敢输出违规内容的应答逻辑,慢慢把模型的说话习惯掰到符合人类价值观的方向。
说白了,对齐就是教大模型听人话、说人话,教它怎么当一个守规矩的“靠谱人”。
对齐流程背后也有两个很少有人提的核心底层逻辑。
第一个是人类偏好奖励塑形原理,也就是大家常听的RLHF的核心。
原生大模型根本没有什么对错、善恶的概念,也不知道人类喜欢什么、讨厌什么。
对齐就是靠外部的奖励函数给它立好评价标准:回答得合规又好用就给正向奖励,敢瞎编乱造输出违规内容就直接惩罚。
反复迭代多轮之后,模型自己就会主动往能拿高分的方向输出,慢慢养成符合人类审美和安全底线的应答习惯。
第二个是认知边界约束原理,这也是对齐最容易被忽略的核心作用。
原生的预训练大模型根本不知道自己的能力边界在哪,遇到不懂的问题张嘴就瞎编,各种幻觉内容满天飞。
对齐相当于直接给它装了一层认知防火墙,遇到未知问题、敏感问题,直接叫停它瞎编的行为,从根源上减少幻觉输出。
最后给大家捋得明明白白:
微调调的是大模型的任务响应逻辑,教它会干活。
对齐调的是大模型的行为偏好和安全边界,教它不闯祸。
这俩步骤半毛钱都不会提升大模型本身的知识储量和推理上限,根本不会给它“涨智商”,只是把原生大模型的野生能力,改成人类能完全掌控的形态。
没有微调,大模型就是个啥活都不会干的书呆子。
没有对齐,大模型就是个随时要出大问题的定时炸弹。
话说回来,你觉得现在做大模型对齐,最难的地方到底是什么?评论区咱们聊聊。
