速递 | OpenAI o1草莓模型发布,这次真的更像人类了!
来源:互联网
时间:2026-08-27 14:24:12
先说几个核心判断:OpenAI这次发布的o1系列模型,确实带来了不小的震动。官方的技术博客写得言简意赅,但背后释放的信号很明确——AI的推理能力,正在向“类人思维”迈出一大步。这次推出的模型(代号“草莓”?),本质上不再是那种“张嘴就答”的模式,而是学会了在给出答案前,先好好“想一想”。

OpenAI在其官网正式发布了o1系列模型的介绍。这一系列模型专为解决复杂问题而生,其核心训练思路是:在回应之前,花更多时间进行思考,模仿人类的思维过程。通过训练,它们学会了完善自身的推理链,尝试不同的策略,甚至能够识别并纠正自己的错误。从结果来看,在科学、编程和数学这类高逻辑需求的任务上,性能的提升是飞跃性的。
那么,它具体厉害在哪里?我们来拆解几个关键点:
- :不再是“输入-输出”的简单映射,而是开启了“内部思考”的流程。它会反复推演、尝试不同路径,并主动识别出逻辑上的死胡同。
工作原理
- :在物理、化学、生物等领域的挑战性基准测试中,其表现已经可以媲美博士生。一个更直观的数据是,在国际数学奥林匹克(IMO)的资格赛中,GPT-4o的正确解答率是13%,而o1模型的得分飙到了83%。编程方面,它在Codeforces竞赛中达到了第89百分位,这意味着它比大多数人类参赛者都强。
性能表现
- :这是一个容易被忽略但极其重要的亮点。OpenAI引入了一套新的安全训练方法,利用模型自身的推理能力来遵循安全和对齐指南。在“越狱”测试中,o1-preview模型的得分是84分(满分100),而GPT-4o仅有22分。这意味着它更难被恶意提示词诱导,对Pro提示词的“免疫力”强了许多。
安全性进化
- :一句话,如果你是科研工作者、程序员、数学家,或者在日常工作中需要处理复杂逻辑和数据分析,那么o1模型会是你全新的得力助手。
目标用户
- :为了兼顾效率和成本,OpenAI还同步发布了o1-mini。这是一个更小、更快、更便宜的推理模型,尤其在编程任务上表现出极高性价比,对开发者来说是个好消息。
轻量级选手——o1-mini
- :ChatGPT Plus和Team用户即刻起就能在模型选择器中手动选择o1-preview和o1-mini。初始阶段,o1-preview的每周消息限制是30条,o1-mini是50条。API用户也可以开始用于原型设计。企业版和教育版用户则要等到下周。
如何访问
具体性能提升:哪里更强?
根据官方公布的信息,o1系列的性能提升具体体现在以下几个维度:
- :能够处理复杂的科学问题和数据分析,在基准测试中表现出色。
科学领域
- :无论是代码生成还是复杂逻辑的调试,能力都有显著提升。在Codeforces竞赛中达到第89百分位,就是最好的证明。
编程领域
- :从IMO资格赛13%到83%的跨越,说明了它在解决高难度数学问题上的巨大飞跃。
数学领域
- :这正是o1系列设计的初衷——通过“慢思考”和推理,完成需要深入分析和逻辑链的任务。
复杂问题解决
- :在遵循安全规则和对抗恶意攻击方面,通过新的训练方法,实现了质的提升。
安全对齐
- :官方给出了几个非常具体的例子,比如医疗研究中的细胞序列数据注释,物理学家生成量子光学所需的复杂数学公式,以及开发者构建和执行多步骤工作流。这些都是过去模型难以胜任的。
特定应用
图片来源:OpenAI
编程与数学:质变是如何发生的?
在编程和数学这两个硬核领域,o1的改进不仅仅是分数的提升,而是能力的跃迁。
编程能力方面:
- 从能写出代码,到能写出的复杂代码。它能理解复杂的编程范式,精准生成和调试逻辑。
正确且高效
- 在Codeforces这种竞技性编程平台上,它已经进入了顶尖选手的行列(89百分位)。
数学问题解决方面:
- 23%到83%的解题率提升,背后是推理能力的全面升级。它不仅能解代数、几何,还能处理更复杂的微积分问题。
- 这意味着在科研和工程计算领域,它可以成为一个真正意义上的“数学助手”。
推理和策略方面:
- 核心在于“深入思考”的机制。它不再是蒙答案,而是像解题思路一样,尝试不同策略,最终找到最优解。
- 一个关键的突破是“自我纠错”。通过训练,模型学会识别自己逻辑链条中的错误,并加以修正,这对于提高准确率至关重要。
安全性和对齐方面:
- 84分对22分的越狱测试得分,说明它具备了更强的判断力。当用户试图引导其说出不合规内容时,它能通过推理识别出意图,并遵循安全指南。
图片来源:OpenAI
如何使用?
目前,ChatGPT Plus和Team用户已经可以在ChatGPT中手动切换到o1-preview和o1-mini。需要注意的是,早期阶段使用额度有限,o1-preview每周30条,o1-mini每周50条。可以预期,OpenAI很快就会提高这个限制,并实现自动切换最佳模型的机制。
总的来说,o1模型的推出,标志着我们从一个“快速回答”的AI时代,迈入了一个“深度思考”的AI时代。它在科学、编程、数学和安全领域带来的质变,让人对未来充满期待。这只是一个开始,接下来就看它在实际应用中能落地出多大的价值了。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名