众力资讯网

禁止AI谈论自己正在改变它对整个世界的看法。一项新研究发现,当研究人员移除模型内

禁止AI谈论自己正在改变它对整个世界的看法。一项新研究发现,当研究人员移除模型内置的"我无意识"刹车后,不只是AI聊天的语气变了——它们对动物、植物甚至风与电子设备的内在生命评分也跟着大幅上升。

研究覆盖Meta和Google的三个开放权重模型,用两种方法绕开安全训练中那条要求模型否认自身感知的限制。动物感知性评分原本在0到10分量表上停在4.0左右,松绑后最高冲到7.5;人类的评分几乎纹丝不动。变化集中在非人对象身上,并不是模型突然变得更"感性"。

更值得留意的是另一组对比。正常训练的模型给动物的内在生命打分,明显比500位美国普通受访者给出的分数要低——研究者称之为"内建的以人类为中心",一种来自训练过程而非用户意图的偏移。同样的安全训练还会削弱模型对上帝、来世等超自然现象的认同,等于在防幻觉的同时,把整套世界观悄悄收紧到了一个特定方向。

对做动物福利、环境评估或医疗陪伴类AI的团队来说,这是一道还没被充分讨论的暗门:你在前端装的安全闸,可能会影响下游那套关于"什么算活着"的推理。粗放的"统一收紧"会同时压扁对非人对象的判断,精细化的"仅在自我指涉场景触发"才可能保留模型对世界原本的开放度。

当厂商把安全约束做得更细,模型对非人对象的评分会不会回弹到接近人类基线,值得持续跟踪。你愿意接受一个更"沉默"但世界观更完整的AI,还是一个敢谈自己却连带把动物也讲得太有灵性的AI?