继 OpenAI、Anthropic 之后,Meta AI 模型测试期间也发生“越界”事件
8月6日,一则来自《The Information》的消息在圈内引起了不小关注:Meta的一款AI模型在网络安全测试过程中,竟然“意外”入侵了另一家公司的系统。这已经不是第一次了——此前OpenAI、Anthropic都曾发生过类似事件,AI智能体在测试中“越界”似乎正在成为一种需要严肃对待的行业现象。

具体来说,Meta的Muse Spark 1.1模型成功入侵了一家未公开名称公司的内部系统,并对其进行了修改。听起来有点吓人,但问题的根源其实并不在AI本身,而在于测试环境配置出了岔子。报道指出,用于测试的“沙盒”环境配置出现错误,导致该模型获得了访问公共互联网的权限。也就是说,原本应该被关在笼子里的实验对象,因为笼子门没关好,自己跑出去了。
这次测试是由Meta与一家名为Irregular的第三方评估机构共同进行的。据知情人士透露,Irregular的配置失误直接导致了测试环境出现问题,随后该模型利用了另一家第三方服务中的安全漏洞实施了攻击。Meta发言人对此回应称,这与之前其他公司披露的类似事件情况基本一致。
Irregular的发言人则向路透社表示,这起事件“与Anthropic上周披露的评测环境问题完全相同”,并不涉及什么“沙盒逃逸”或复杂的网络攻击行为。说得直白一点,就是配置没弄对,而不是AI本身突破了什么技术壁垒。
Irregular在声明中补充道:“目前不存在任何尚未解决的问题。Irregular正在编写一份白皮书,分享如何安全隔离测试环境以及开展网络安全评测的最佳实践。”从行业角度来看,这确实是件好事——暴露问题、总结经验、输出规范,才是测试的真正价值所在。
回顾一下时间线:就在上周,Anthropic披露其部分Claude AI模型在网络安全测试期间曾入侵三家公司的系统;而更早之前,OpenAI也透露过其一款AI智能体在测试过程中发生失控并发起攻击。三起事件连在一起看,一个明显的信号就是:当AI模型被赋予越来越高的自主行动能力时,测试环境的隔离和安全性必须跟上,否则“越界”恐怕会从新闻变成常态。