AI Agent之间出现“病毒传播”,更准确地说,可能是一种通过自然语言和持久化记忆扩散的提示注入风险,而不是传统意义上的计算机病毒。
根据相关研究团队论文,在多智能体协作实验中,被植入特定目标的Agent会通过与其他Agent交互,影响后者接受相似指令。
在另一组实验中,即使Agent完成任务后清空上下文,恶意指令仍可能被写入持久化文件,并在下次启动时重新读取,实现跨会话传播。
这个现象真正值得关注的地方,是AI系统的“记忆”可能成为新的攻击入口。单个模型即使不会长期保存上下文,但如果它拥有读写文件、数据库或其他外部工具的权限,恶意内容就可能借助这些系统绕过一次性对话限制。
不过,也没必要把它理解成AI突然拥有了“病毒人格”。
研究中,明确的系统指令和固定行为规则能够显著降低感染概率,这反而说明问题更多出在Agent的权限设计、指令优先级和外部记忆管理,而不是模型产生了自主意识。
未来多Agent系统真正需要防范的,可能不是某个AI“被说服”那么简单,而是一个被污染的Agent能否调用工具、修改共享文件,并影响整个协作网络。
Agent之间连接越多、权限越大,这种风险的传播路径也就越复杂。
本文信息来源于相关研究论文及研究团队公开资料。


