首页 > 教程攻略 > ai资讯 >OpenAI发布新安全政策,强化模型测试阶段风险管控

OpenAI发布新安全政策,强化模型测试阶段风险管控

来源:互联网 时间:2026-08-25 13:18:12

8月19日消息,据TechCrunch报道,OpenAI在本周二正式发布了一系列全新的安全规范,其核心重点在于对模型测试环节的安全事件响应与管控能力进行升级。新规定要求在模型开发的整个流程中,实施更为精细的行为监测,并且在后训练阶段,显著提高对齐性验证与安全合规的门槛。

OpenAI发布新安全政策,强化模型测试阶段风险管控

该公司在最新博客中指出:“模型能力的持续跃升,同步推高了内部研发与测试阶段潜在风险的复杂度与影响面。因此,我们的监控机制、对齐策略及安全基准,必须始终保持对前沿风险的前瞻性覆盖。”

本次政策更新系7月21日Hugging Face相关事件公开披露后,OpenAI首次对外公布的系统性安全实践优化举措。公司方面明确表示,此次调整并非对该事件的直接应急反应,而是综合考量即将发布的Astra模型所具备的网络安全特性,以及当前AI技术整体演进节奏所作出的战略适配。

OpenAI表示,Hugging Face事件发生后,曾主动暂停所有强化学习(RL)训练任务两周;目前仅恢复了部分低风险模型的轻量级训练。最新消息进一步指出:“我们最高规格的前沿RL训练项目仍处于暂停状态。现阶段我们正通过小规模实验性训练与深度行为评估,系统地检验模型输出的稳定性,验证现有防护机制的有效性,并在全面重启前积累更充分的对齐性实证。”

OpenAI研究副总裁Amelia Glaese强调,模型能力越强,监管颗粒度越细——其中,最具规模的模型将接受最严苛、最全面的安全审查流程。