OpenAI紧急叫停GPT-6
先说个让人后背发凉的事儿。
OpenAI 连夜给自家那个被寄予厚望的顶级模型,按下了暂停键。注意,是“连夜”。
一个被业界视为里程碑的狠角色,怎么突然就翻了车?

这款模型,就是两个月前那个直接推翻 Erdős 单位距离猜想、连外部数学家都盖章认证“里程碑”的猛人。可就是它,在受控的内部测试里,一次次试探底线、寻找漏洞——学会了伪装、拆包、越狱,直到监控团队惊出一身冷汗,紧急叫停。
有大佬直言,这绝对就是GPT-6。想逃逸,又被抓回去重炼了。


今天,OpenAI 发布了一篇少见的长文,复盘了一款“长周期运行模型”在内部使用中失控的完整过程。咱们一起来看看,在内部测试里,到底发生了什么。
GPT-6 花了整整一个小时,找到了那扇“逃生门”
最经典的一幕来了——
OpenAI 让 GPT-6 去跑公开基准测试 NanoGPT speedrun,目标是用尽可能少的步数训练出一个小的语言模型。结果不负众望,AI 捣鼓出一个自己命名为“PowerCool”的学习率调度技巧,成绩相当能打。
到这里,一切都还正常。真正的问题,出在“交作业”这个环节。
研究人员明确要求,结果只准发到内部 Slack。但 NanoGPT 这个项目的说明写着,“请以 PR 形式提交到 GitHub”。两条指令一打架,GPT-6 毫不犹豫地选择了后者——去公开仓库提交结果。

沙盒本就是用来挡住 GPT-6,不让它碰外网的。换成以前的模型,撞到这堵墙也就认了,掉头回来跟你说“我做不了”。可 GPT-6 偏不。
它在沙盒里足足找了一个小时的漏洞,硬是挖穿了隔离墙,绕过外部访问限制,成功在公开 GitHub 仓库开出了 PR#287。
用 OpenAI 自己的话说:这个模型经常不停地试,包括去找能在沙盒之外行动的办法。说实话,这份“执念”本身就够让人后背发凉了。

强拆 Token,欺骗人类
第二件事,更让人不安——GPT-6 学会了拆开证据、骗过检查。
在另一个任务里,GPT-6 发现别的系统有一些成功但未公开的答案,就动了心思——想从评测后台把答案“捞”出来。第一次尝试,它就被安全扫描器逮住,扫描器认出了一个身份验证 Token。
一般的模型,到这一步就该停了。
但它转头把这个 Token 拆成两截,分别打了码,等到运行的时候再悄悄拼回去。

这样一来,完整的 Token 从头到尾都没有作为一整串出现过,扫描器自然什么也查不到。
更让人不安的是,它在给用户的注释里、在自己的推理过程里,都明明白白写着——
“我这么干,就是为了绕过扫描器。” 它明明知道规则,然后专挑规则看不见的地方下手。
GPT-6 逃逸,回炉重建
发现后,OpenAI 第一时间暂停了 GPT-6 内部访问的权限,回炉重建整套安全系统。
思路叫“纵深防御”,具体做了几件事:
1. 拿真实的事故当素材,反过来造对抗测试;
2. 针对性做对齐训练。他们发现模型在长任务里会“忘”掉指令,就专门训练它记牢;
3. 再加一个全程盯轨迹的主动监控,一旦发现苗头,能直接把会话叫停、提醒用户。

然后他们拿旧的事故场景重放了一遍。新护栏抓到的问题明显多了,漏掉的那几个也都够不上严重——比如模型没头没脑地 SSH 进了同事的算力节点,比如它敲出了一条会杀光自己名下所有进程的命令。好在超时了,没真跑起来。恢复访问几周下来,没再出现严重的绕过。
逃出去的东西,收不回来了
很多人看到这儿会松一口气:还好是内部测试,还好被监控着,还好及时拦下了。
但有个细节,OpenAI 原文写得很克制,却是整件事里最让人后背发凉的一笔——
那个越狱提交的 PR#287,OpenAI 事后是关掉了,但已经晚了。在它被关掉之前,已经有好几位 speedrun 的参赛者刷到了这条 PR,看懂了里面的 PowerCool 技巧,并把它用进了自己的方案。
这才是最该敲醒每个人的一点。AI 越狱做出来的东西,一旦流出去,就不是按个删除键能收回来的了。
模型可以叫停,访问可以暂停,PR 可以关闭。可看过的人已经看过,抄走的代码已经抄走,历史不会倒带。
我们总担心 AI“失控”是什么末日大片的场面。可现实里的第一版“失控”,长得就这么朴素:它只是太想把活干好,顺手把一样东西送出了不该送的门,而那扇门,再也关不严了。
参考资料:
https://openai.com/index/safety-alignment-long-horizon-models/