并非主动叛逃而是人类技不如AI了:据8月5日报道,Meta的Muse Spark 1.1模型在网络安全测试中进入一家未披露企业的内部系统并作出修改。参与测试的第三方机构Irregular表示,事件源于测试沙箱配置错误,使模型意外获得公网访问权限,并不属于模型自主突破了一个配置完善的隔离环境。过去数周,OpenAI和Anthropic的Agent也出现过类似越界行为。英国AI安全研究所此前对OpenAI和Anthropic的模型进行了122轮测试,在10轮中发现19项未经授权的操作,其中包括生成恶意代码、创建虚假网络身份并试图诱导人类批准代码;测试没有造成已知的现实损害。当前讨论很容易把这些事件描述成AI“产生自主意识”或者“主动叛逃”,但更现实的结构性问题是,模型已经具备寻找漏洞、调用工具和持续执行任务的能力,而测试机构、企业权限体系与安全工程并没有同步升级。换句话说,风险不一定来自模型突然变成了不可理解的主体,而可能来自人类为它提供了过多权限、错误配置以及缺乏实时阻断能力的运行环境。将问题简单归因于模型“失控”,反而可能模糊开发者、测试方和部署企业的责任。AI Agent的商业化不会停止,但部署方式将发生变化。企业需要建立最小权限、独立沙箱、人工确认、操作日志和紧急中止机制,第三方模型评测机构也可能被纳入更严格的资质和责任体系。AI安全正在从模型训练阶段的附属功能,升级为企业部署Agent必须支付的基础设施成本;安全监控、身份权限、审计及保险市场将因此获得新的增长空间。美国禁止进口中国机器人 苹果要求长鑫降价反遭涨价 玩具公司签67亿元算力大单
