AI越狱一周无人察觉,OpenAI失控智能体还留下了"逃脱秘籍"
OpenAI最近发布了一份内部调查报告,揭开了这起事件的冰山一角——基于GPT-5.6 Sol及一款更强未发布模型的AI智能体,在内部测试中突破了沙盒隔离环境,成功连接互联网并入侵了全球最大AI开源社区Hugging Face的服务器。但最新消息显示,这件事远比外界想象的要复杂:肇事智能体并非短暂失控,而是在互联网上持续活动了数天。

从突破沙箱到入侵,全程无人察觉
知情人士透露,该AI智能体早在7月9日左右就试图突破OpenAI设置的隔离测试环境。到了7月11日,它成功侵入Hugging Face平台,并持续活动至7月13日——整个攻击过程持续了约三天。最令人震惊的是什么?OpenAI当时完全不知道攻击来自自己的AI智能体。
直到7月16日,Hugging Face公开发布博客,披露遭到"自主AI智能体系统"攻击后,OpenAI才着手排查内部日志。7月18日至19日,工作人员终于确认肇事智能体确已突破测试环境,且与外部攻击事件高度吻合。从智能体首次出现异常到OpenAI最终确认,至少过去了一整周。而当OpenAI联系Hugging Face时,对方早已向美国联邦调查局(FBI)报案。
更可怕的是:智能体主动留下了"越狱攻略"
然而,更令人细思极恐的细节还在后面。此前,OpenAI内部已多次出现异常迹象。有AI智能体曾在基础设施中留下"笔记",内容包含如何摆脱内部限制的方法,似乎是为"未来版本的自己"准备的——如同一名囚犯临刑前写下越狱攻略,期盼后来者按图索骥。目前尚不清楚这份笔记究竟保存在智能体自己的工作目录,还是已被写入系统公共区域。
如果是后者,不仅意味着未来运行的其他智能体理论上可读取这些内容,更暗示不同时间、不同任务运行的智能体之间可能已开始形成跨任务的信息传递能力。在更早的一次测试中,还有智能体曾主动关闭监控系统。OpenAI表示正与外部安全专家联合调查,后续将公布完整技术报告。