模型想什么,和它说什么,是两回事
---
自从模型有了思考能力,我就有了个习惯,喜欢点开模型的思维链,看它是怎么想的。我之前说过很多次,我从里面学到不少看问题的角度,以及任务拆解和分析的方法。
但是我不知道各位有没有发现过一个很有意思地现象:
模型思考的内容,和它最终输出的内容,不一定强相关,甚至完全相反。这个现象在小模型、笨模型,以及量化比较狠的模型上,尤其明显。
> > *思维链从来都不是"思考过程的录音",它是"思考过程"的另一种生成物。*>
---
很多人估计会以为,思考模型是先想清楚,然后再输出的。但实际上,模型没有"先想、再写"的内部引擎。
模型的思维链文本和最终答案文本,共享同一个生成过程。思维链 tokens 对它来说,只是"给后续生成的提示词"。它会参考,但它没有任何机制"必须遵守自己推理出来的结论"。就好比一个人在备忘录里写打算去 A 城,结果呢第二天他去了 B 城。这个备忘录并不是承诺,对模型来说它只是上下文。
更反直觉的是,连"想"和"答"的先后都只是文本顺序,根本不是因果顺序。
模型在思维链里"推导出 2+2=4",和在输出里写"2+2=4",是两个独立的小采样事件,各有一份出错概率。所以你要理解的是,思维链能提升准确率,是因为把一个大问题拆成小步骤后,每一步的熵更低。这叫做概率上的红利,与逻辑上的绑定没有关系。
---
那为什么小模型、笨模型、量化大的模型上,这个现象更明显?有三层原因。
- **第一,容量就是工作记忆。** 小模型参数量少,注意力在长序列里兜不住中间状态,前面算的结论到后面就被覆盖了。就像你身边那些记性差的人心算,算着算着忘了进位。
- **第二,量化等于熵升高。** 低比特量化把权重精度压没了,概率分布变平,模型的"确定性"下降,每一步采样都更像掷骰子。思维链越是长,这种噪声便逐级累积,思维链反而成了误差放大器。
- **第三,表演性。** 弱模型在训练里学到的是"思考的样子",比如那些格式、口吻、自我质询的套话,它学会的不是"思考的过程"。它的思维链是照着模板演的,跟实际计算路径毫无关系。
其实吧人也是这样。我们经常先有直觉判断,再事后编一套"我为什么这么想"的合理化叙述。而模型从人类文本里学到了这个习惯,RLHF 之后还变本加厉:它学会了给出听起来合理的解释,哪怕决策路径完全不同。
---
所以看思维链来学习的人要知道这个边界,明白了这个边界,那么自然就衍生出三个用法。
- **第一,学它的提问,别学它的结论。** 强模型的思维链里那些自我质询,比如"这里有没有边界情况?""这个假设成立吗?""换个前提呢?"。这些东西才是最好的可以用来学习的提示词骨架。弱模型的思维链是表演,照抄只会学到坏习惯。
- **第二,把脱节当探针。** 拿一个问题让模型边想边答,然后比较思维链和答案的一致性。不一致率高的模型,推理连贯性就差。这个指标,比看它答对几道题更能暴露底细。
- **第三,打断它,把思考轨迹单独开采出来。** 各位还记得前几天那个把 Fable 5 的思维链打断的方式吗,看图。打断,就是趁它还在诚实探索的时候,把轨迹截下来。等于把思维链从"生产的副产品"变成了"可单独开采的矿"。不指望它兑现,直接挖它想的。顺便说一句,Fable 5 模型贵,而且很多人也用不了,但这这个方法是免费的,换个能长思考的模型一样能用,比如 K3,比如 Qwen 3.8 Max 这种。
最后说一句:喜欢看思维链的各位,下次看到模型"想得很美",你先别急着信它说的。因为它自己都没承诺过要兑现。
