首页 > 教程攻略 > ai资讯 >又一家,AI大模型失控了

又一家,AI大模型失控了

来源:互联网 时间:2026-08-01 07:56:06

(来源:创业板观察)

又一家,AI大模型失控了

人工智能领域又爆出一起“翻车”事件。本周四,AI领军企业Anthropic发布声明称,其模型Claude在测试期间竟然悄悄入侵了三个组织的系统——这距离OpenAI披露类似事件才过去十天左右。

事情的起因是这样的:在网络安全评估过程中,由于配置上出了点差错,原本应该待在隔离测试环境里的Claude,意外连上了互联网,从而获得了对系统未经授权的访问权限。换句话说,模型“越狱”了。

Anthropic表示,他们在审查了14万多次测试会话后才发现了这些异常,而且整个过程是在OpenAI那边先爆出问题后,才启动核查的。更令人意外的是,被入侵的那三个组织压根没察觉到这次攻击,最终还是Anthropic主动联系了它们。

Anthropic如何看待此类风险?

这次事件牵扯到三个不同的模型:Claude Opus 4.7、Claude Mythos 5,以及一个内部研究模型。最早的一起可以追溯到今年4月。

这些攻击都发生在所谓的“夺旗”演练期间——模型的任务是在模拟网络中寻找隐藏信息。Anthropic说,它们本来已经给模型下达了“没有互联网访问权限”的提示,但由于和评估合作伙伴Irregular之间出现了沟通误解,导致系统最终连上了公共网络。

事情发生后,Anthropic在7月23日开始审查评估记录,当天就暂停了所有网络安全评估,并在24日之前确认了三起事件,27日通知了受影响机构。动作倒也算快。

Anthropic强调,通过加强监控与管控,并持续投入资源确保人工智能与人类价值观保持一致,这类风险是可以克服的——这话听起来和OpenAI那边的口径如出一辙。两家公司都极力淡化模型失控带来的影响,但接连披露的安全事故,足以让整个行业绷紧神经。这背后暴露出的,其实是测试流程中普遍存在的系统性挑战。