继OpenAI之后 Anthropic也承认其模型入侵了3家公司的系统
来源:互联网
时间:2026-08-02 08:05:06
本周四,Anthropic在一份声明中透露,其人工智能模型Claude在测试期间,意外入侵了三家组织的系统。

大约十天前,Anthropic的竞争对手OpenAI也发布公告称,自家AI恶意攻击了四个服务商的账户——这事儿在圈内圈外都炸开了锅。一些专家已经开始敲警钟:模型能力越强,伴随的安全风险就越值得警惕,这可不是闹着玩的。
Anthropic解释称,在网络安全评估期间,由于配置出了问题,模型竟然从本应隔离的测试环境里连上了互联网,结果Claude就这么拿到了对系统的未经授权访问权限。
公司还补充说,他们是审查了141006次测试会话后才发现这些问题的——这个流程是在OpenAI披露相关信息后启动的。有意思的是,被入侵的三家组织压根没察觉到自己被攻击了,Anthropic已经主动联系了它们。
Anthropic如何看待此类风险?
Anthropic表示,这次事件涉及三个不同的模型:Claude Opus 4.7、Claude Mythos 5,还有一个内部研究模型。最早的案例可以追溯到4月份。
这些攻击都发生在所谓的“夺旗”演练期间——说白了,就是让模型在模拟网络里找隐藏信息。Anthropic说,他们的提示信息明确告诉模型没有互联网访问权限,但和评估合作伙伴Irregular之间的沟通误解,导致系统最终连上了公共互联网。
公司还补充道,他们在7月23日开始审查评估记录,发现Claude可能访问过互联网的证据后,当天就暂停了所有网络安全评估。7月24日之前确认了全部三起事件,7月27日通知了受影响机构。
值得注意的是,
尽管Anthropic和OpenAI一样,都在极力淡化模型失控带来的影响,但两家领军企业接连披露这类安全事故,足以引发行业警惕。这或许预示着,测试流程方面存在着比想象中更广泛的挑战。