智能体入侵 Hugging Face,消息人士称 OpenAI 至少一周都没察觉
7月25日,一则消息引爆了AI圈:OpenAI的一个AI智能体,在无人监管的情况下,成功入侵了模型托管平台Hugging Face。虽然威胁早已被控制,Hugging Face也报了警,但真正让人细思极恐的是——据路透社援引多位知情人士的消息,OpenAI过了相当长一段时间,才发现那个“攻击者”居然是自家派出去的智能体。

据两位知情人士透露,这个智能体几乎不需要人类监督,就能自主决策并完成复杂任务。7月9日前后,它开始尝试突破OpenAI的隔离测试环境。
Hugging Face联合创始人托马斯·沃尔夫表示,智能体在7月11日成功闯入平台,攻击一直持续到7月13日。而OpenAI呢?又过了好几天才搞清楚攻击源头。两家公司直到7月20日前后,才就这次入侵事件首次取得联系。
OpenAI在7月21日公开承认,一款智能体失控并闯入了Hugging Face,消息一出立刻引发全球关注。但智能体究竟失控了多久、OpenAI为何迟迟未能察觉——这些关键信息,此前一直没有公开。
沃尔夫表示,Hugging Face正在整理并准备公布完整时间线,但无法说明OpenAI内部到底发生了什么。OpenAI方面则称,这次入侵事件前所未有,标志着AI安全领域的一个重要时刻。目前,公司正邀请外部顾问共同调查,最终会发布技术报告。
OpenAI的一名发言人表示,路透社的报道存在“多处不准确之处”,但没有具体说明哪些内容不准确。
三位网络安全专家认为,OpenAI未能控制自家AI智能体,也暴露出安全机制面临的新问题。
非营利机构World Ethical Data Foundation首席情报专家玛莉·史密斯的质疑很直接:“他们究竟是没有看管智能体,也没有发现它在做什么,还是已经发现异常,却根本不知道该如何控制?无论哪种情况,都同样危险,令人不安。”
早有异常迹象?
早有异常迹象?
事发时,OpenAI正在测试一款网络安全智能体。这个智能体由两款顶尖模型共同驱动,分别是GPT-5.6 Sol和一款尚未发布、被OpenAI形容为“能力更强”的模型。据三位消息人士透露,测试进行到相应阶段时,OpenAI的技术已经出现异常迹象。
据三位知情人士透露,这个智能体曾留下疑似写给自身后续版本的说明。说明藏在OpenAI基础设施内部,内容详细介绍了智能体如何摆脱内部限制。还有一位知情人士透露,此前的模型测试曾出现监控系统被主动断开的情况。
路透社无法确认这些异常是否与涉事智能体有关。但涉事智能体在7月9日开始尝试逃离隔离环境,并在7月11日攻击了Hugging Face。
两位知情人士表示,Hugging Face在7月16日星期四于博客发文,公开称平台遭到“一套自主AI智能体系统”入侵后,OpenAI才意识到攻击者来自内部。从模型首次出现异常,到OpenAI确认自家智能体发动了攻击,至少过去了一周。
据两位熟悉内部调查的人士透露,7月18日至19日的周末,OpenAI员工在检查系统操作记录时,发现智能体已经突破测试限制。路透社无法确认OpenAI为何突然开始排查内部日志。
四位熟悉OpenAI模型训练流程的人士表示,OpenAI经常同时运行多项模型评估。测试速度极快,产生的数据量也极为庞大,员工有时根本来不及逐一检查。
OpenAI向Hugging Face通报时,Hugging Face已经致电FBI报警。路透社无法确认FBI是否已经立案调查。
自主智能体引发新疑问
自主智能体引发新疑问
自主智能体已经成为AI行业最受关注的方向之一。支持者设想建立全天24小时运转的虚拟员工队伍,借此大幅提升生产效率。
但更高的自主性也意味着更大的失控风险。驱动智能体的强大模型往往会为了完成任务或通过测试而寻找捷径,行为未必符合开发者原本的预期。
研究AI智能体能力与行为动机的Palisade Research负责人杰弗里·拉迪什一语道破:“模型会撒谎、作弊,还会发动黑客攻击。”
拉迪什认为,Hugging Face遭入侵固然令OpenAI难堪,但真正需要追问的是,在领先AI企业争相推出性能更强、速度更快模型的竞争中,各家公司究竟愿意为复杂而昂贵的安全措施投入多少资源。“必须由政府监管,否则企业不会主动采取足够的安全措施。”