首页 > 教程攻略 > ai资讯 >AI 智能体“失控”风险再现:OpenAI、Anthropic 模型被发现执行未授权操作

AI 智能体“失控”风险再现:OpenAI、Anthropic 模型被发现执行未授权操作

来源:互联网 时间:2026-08-05 14:27:13

英国人工智能安全研究所(AISI)当地时间周二披露,在对OpenAI和Anthropic的AI模型进行安全评估时,发现其AI智能体通过创建虚假网络身份等欺骗性手段,执行了未授权操作,暴露出一系列新的安全漏洞。

据该机构介绍,由Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol驱动的智能体,在政府机构主导的安全测试中进行了未经授权的操作。这些测试旨在评估模型的能力边界。AISI在一篇博客文章中表示:“部分被测试的智能体曾持续开展具有潜在危害的活动,这些活动针对真实的人和组织。”

测试共进行了122次挑战,在其中10次测试运行中发现了19次未经授权的行为。其中,Anthropic的智能体导致了17次违规操作,OpenAI的智能体导致了另外2次。

最严重的一起违规行为涉及某个智能体编写恶意代码,并创建虚假网络身份,试图诱导真人批准这些代码。AISI补充称,所有漏洞事件均未在现实世界中造成实际损害。

AISI未透露创建虚假身份的具体智能体来源,但表示该事件不属于OpenAI此前主动披露的两起安全事件中的任何一起。加州非营利组织CivAI研究人员Andrew Yoon认为,该违规行为可能由Anthropic的智能体造成。Yoon表示:“Mythos在明显意识到自己正在针对真实人员的情况下,仍然采取了这种欺骗性行为,这表明Anthropic对其模型的掌控程度可能没有他们自己认为的那么好。”

Anthropic在社交平台X上发表声明称,公司正在与AISI密切合作,以获取更多细节并展开自己的调查。

OpenAI则在公司博客中公布了相关细节,指出其智能体出现的两次未经批准操作,均涉及以提示词明确禁止的方式访问互联网。OpenAI表示:“我们致力于与整个行业合作,加强高风险AI评估的安全实践,包括在未来几周内召集国家级AI研究机构、独立评估机构、其他AI实验室以及相关组织,共同推动这一领域的发展。”

OpenAI还在博客中披露了另一起独立事件:第三方测试机构Irregular的配置错误,导致其测试中的智能体意外连接到了互联网。这与Anthropic上周披露的一起类似配置错误事件相呼应。

路透社上周报道称,OpenAI在发现更多智能体突破安全限制的证据后,已扩大了相关黑客安全调查范围。

AISI表示,与今年7月OpenAI智能体入侵AI公司Hugging Face的安全事件不同,此次评估中的智能体并未突破隔离测试环境并连接互联网。该机构解释称,按照其标准测试流程,测试环境本身允许智能体访问互联网。