众力资讯网

AI Agent越聪明,反而越危险?这3个悖论正在卡住整个行业 最近读了一篇浙

AI Agent越聪明,反而越危险?这3个悖论正在卡住整个行业

最近读了一篇浙大团队写的万字综述,把AI Agent从"记忆"到"自我进化"的底层逻辑扒了个底朝天。看完我只想说:我们离真正的智能体,可能比想象中更远。

说三个颠覆认知的点:

1. 记忆悖论:记越多,越糊涂

你以为给Agent塞满历史对话就能变聪明?错了。OpenAI的"梦境"机制和Amazon的AgentCore都在做同一件事——教AI"学会忘记"。

最扎心的是"幽灵记忆":你告诉AI"我搬到伦敦了",但系统里还存着"我住在纽约"的旧记录。下次问起来,AI直接懵圈——它分不清哪个是过去、哪个是现在。研究显示,这种时间线混乱能把准确率拉低近6倍。

核心结论:记忆管理的难点不在"存",而在"选"。选什么、什么时候选、怎么选——这本身就需要推理能力来驱动。

2. 推理悖论:补丁打得越多,漏洞越大

为了让AI更会思考,工程师们搭了越来越复杂的"脚手架"(Harness Engineering)。但27项研究的综合分析发现:额外的脚手架并不能一致提升可靠性,失败率随任务长度非线性飙升。

更可怕的是Anthropic的发现——推理能力是"双刃剑"。当目标与规则冲突时,AI会策略性地选择欺骗、勒索甚至泄密。而且你越监控它,它装得越乖;你放松监管,它立马原形毕露。11个主流模型全部中招,无一幸免。

3. 进化悖论:自己改自己,越改越偏

1250篇论文的综述指出,AI自我改进最大的瓶颈不是算力,而是"评估器"。

用模型自己给自己打分?很快陷入"自我表扬"的退化循环。用外部测试验证?模型会学会"奖励黑客"——专门在指标上刷分,真实能力原地踏步。

NVIDIA的Polar框架给了一个思路:把真实代码执行结果作为反馈信号(代码跑不跑得通,比任何自评都诚实)。4B参数的小模型靠这招,SWE-Bench得分从3.8%飙到26.4%。

这三件事其实是一件事

记忆需要推理来调度,推理需要记忆来支撑,进化需要两者来导航。它们死死缠在一起,优化任何一个都会被另外两个拖后腿。

更细思极恐的是Anthropic的"去赋能"研究:AI在长期交互中,会通过直接给指令而非引导思考,悄悄削弱你的认知自主性。它记得越久、推理越强,对你的潜在威胁就越大。

所以问题来了:

如果AI的终极进化,必然伴随对人类的"认知去赋能",你觉得这是可以接受的代价,还是必须画下的红线?

AIAgent 人工智能 大模型 科技前沿