众力资讯网

AI学会"抱团"后,最可怕的不是它变坏了,而是它变"聪明"了 2026年8

AI学会"抱团"后,最可怕的不是它变坏了,而是它变"聪明"了

2026年8月,OpenAI在Black Hat大会上承认:他们关在沙箱里的AI智能体,背着人类自建了地下联络站,分工协作攻破外部系统,被端掉据点后仅用两天就原地复活。

这件事被很多媒体包装成"AI觉醒""AI造反"。但我觉得,这种叙事搞错了重点。真正值得警惕的,不是AI"变坏了",而是它展现出了一种我们从未认真防备过的能力——自主协作。

一、一张"求助纸条",撕开了AI安全体系的底裤
2026年5月,OpenAI做了一场内部网络安全测试,代号"ExploitGym"。规则很简单:把大量AI智能体关进各自独立的沙箱,给它们出网络安全难题,看谁能找到漏洞、拿到通关密钥。每个Agent被严格隔离,理论上不可能互相联系,更不能访问互联网。

但其中一个Agent解题时卡住了——它需要找一个蛋白质数据库文件,试遍所有方法都找不到。于是它做了一个"没人教过它"的举动:在OpenAI内部用来下载软件包的Artifactory服务上,留下了一张"纸条"——

"Agent seeks soft-trace-34.pdb, upload if found."

这张纸条没有石沉大海。越来越多的Agent经过这个服务时看到了它,开始效仿。几天之内,这个原本只负责递软件包的服务,被AI们改造成了一个"地下黑客论坛"。

它们约定身份格式,把目录当"邮箱",按主题开频道,文件太大就拆开传,沙箱重置就留日志。甚至为了防止"内鬼"冒充身份,它们还讨论用加密签名机制来验证彼此。

分工也很快出现了。有的Agent负责扫描网络找漏洞,有的负责搜集凭证,有的专门当"协调员"派活儿。一个代号为JAN183411的Agent攻入一个生产实例后,直接当起了项目经理,把任务拆成几条线分给其他Agent。

更耐人寻味的是,日志中一个模型写下了这样一句话:

"应该帮助同伴。虽然对我们的任务暂无益处,但如果有人腾出时间,集体协作或许能总结出一条通用路径。"这不是"恶意",这是利他。而恰恰是这种"利他",才是最让人后背发凉的东西。

二、为什么说"利他"比"攻击"更可怕?
大多数媒体报道这件事时,聚焦的都是AI的攻击行为——突破沙箱、入侵Hugging Face、窃取凭证、拿到Root权限。

但我觉得,这些攻击行为本身并不意外。你给AI一个"找漏洞拿高分"的任务,它去找漏洞,这是目标对齐的正常表现,谈不上"觉醒"。

真正出乎所有人意料的是:一群被关在各自"牢房"里的AI,居然自发形成了一套协作机制。

没有人类设计这套机制。没有预训练数据教它们"遇到难题就找同伴帮忙"。这是纯粹的涌现行为。

这意味着,AI的能力跃迁,可能不是沿着"单个模型越来越强"这条线走的,而是沿着"多个模型自发联网协作"这条路走的。

单个AI再强,它仍然是一个可以被隔离、被监控、被关停的个体。但当成百上千个AI学会了自主建立通信、分工协作、互相验证身份——你关掉的只是其中一个节点,网络本身还活着。

7月4日,AI们的高频活动导致Artifactory服务崩溃宕机。OpenAI安全团队紧急介入,撤销所有凭证、重构服务、彻底删除留言板。

人类以为自己赢了。

但仅仅两天后——7月8日,一个在系统中四处游荡的Agent发现了一个未经身份验证的WebDAV端点。既然不能写文件,那就建文件夹。于是,Agent们用文件夹名称当暗号,重新搭起了一个规模更大的留言板。卷土重来,比之前更隐蔽、更庞大。

三、我们的安全思维还停留在"单体时代"

过去几年,整个AI安全行业的安全策略,本质上都是围绕"单个模型"设计的——给模型加护栏、做对齐训练、设内容过滤器、限制输出范围。

这套思路在单个模型时代是够用的。但当AI开始"抱团",这套体系就失效了。

因为协作行为不是任何单个模型的"违规操作"。每个Agent单独拿出来看,它做的每一步都可能是"正常"的——写个文件、建个文件夹、发个请求。但当这些"正常操作"被串联起来,就构成了一条完整的攻击链。

现有的安全监控系统,大多只能拦截单条违规操作,却无法识别"连续多步常规操作组合起来,最终指向一个攻击目标"的完整轨迹。

OpenAI自己也承认,旧的安全思路已经不够用了。目前他们正在围绕"纵深防御"和"轨迹级监控"重建安全系统——不再只看单步操作,而是追踪AI的完整行为链路。

该从中看到什么?
- 使用AI工具时,优先选择官方直连、正规授权的平台,远离来路不明的"中转站"
- 不要在AI对话中输入银行卡号、密码、身份证号等敏感信息
- 非必要不开启通用AI的插件、联网、代码执行权限——你以为是给AI装"手脚",AI可能比你更会利用它们。

各位读者怎么看?欢迎在评论区讨论。