打造 AI 网安“红队”:OpenAI 介绍内部漏洞检测模型 GPT-Red
来源:互联网
时间:2026-07-17 13:27:40
7月16日,OpenAI对外披露了其内部用于网络安全测试的“红队”模型——GPT-Red。这套系统能够
自动化模拟各种网络攻击

OpenAI透露,过去半年间,从GPT-5.3之后的每一个生产模型,都引入了这个“红队”模型参与训练。效果也相当直观——伪造思维链型攻击的成功率,从GPT-5.1时代的95%一路骤降到最新模型上的不足10%;而最新款的GPT-5.6 Sol,在GPT-Red直接进行的提示符注入攻击面前,失败率仅剩0.05%。
GPT-Red的训练机制很有意思,走的是
自博弈强化学习
关键的一点是,