首页 > 教程攻略 > ai资讯 >草莓的真面目终揭开,OpenAI o1 全方位解析!

草莓的真面目终揭开,OpenAI o1 全方位解析!

来源:互联网 时间:2026-08-27 14:29:14

北京时间凌晨一点左右,OpenAI o1 横空出世——就是之前传闻已久的“草莓”模型。消息来得突然,特工们第一时间被推送,直接不困了。不就是发了两个模型、十几个演示视频、43 页论文嘛,起来肝就完了。没睡的特工,出列!拉群开整!

o1 的核心特点是:在给出回复前会用更多时间进行思考,模仿人类解决复杂问题的思考方式,而且

思考越久,推理任务的表现就越好

。这一机制是 o1 向无限推理模型迈出的重要一步,同时也把 AI 在复杂推理任务上的能力提升到了全新高度。所以 OpenAI 将计数器重置为 1,把这个新系列命名为“OpenAI o1”。不同于之前的各种期货,这次直接上线,毫不拖拉。

简介与评估

简单来说,OpenAI o1 系列模型在复杂推理上的性能提升,

与传统 LLM 预训练式的提升路径完全不同

——它

通过强化学习的方式,让模型不断完善思考过程

,包括对不同策略进行尝试、认识到错误等。正是这一新训练模式,让 o1 模型拥有了博士级别的推理能力。而且从报告来看,

这一模式存在 Scale up 的可能性

下面具体来看,o1 在这一新训练模式下展现出的惊人性能。观察下图可以发现,o1 在各类机器学习基准测试中远胜 GPT-4o(注:pass@1 指一次通过):

在 GPQA Diamond* 上,o1 甚至成为第一个能击败人类专家的模型。虽然不能直接说 o1 能力超过人类专家,但足以证明它“博士级”的推理思考能力。GPQA Diamond:一个困难的智力基准,测试化学、物理和生物学方面的专业知识。实线条显示一次通过的准确率,阴影区域显示 64 个样本的平均性能。

文科类评估中,o1 相比 4o 提升不算太大,但逻辑推理方面,o1 远胜 4o。值得关注的是,为了展示 o1 的逻辑推理能力,OpenAI 选择了 AIME 作为测试——这是美国数学竞赛中仅次于奥林匹克数学竞赛的项目,难度极大、非常灵活。o1 在这一基准上的表现:在 1 样本提示下,平均拿下 74%;而在 64 个样本的共识中达到 83%;最夸张的是,使用 1000 样本可直达 93%,足以进入美国前 500 名。

至于

编程能力

,OpenAI 以 o1 为基础,经过不断训练改进后的模型,最终在模拟 Codeforces 编程竞赛中得分 1807,超过 93% 的人类选手,而 GPT-4o 仅得到 808 分。

人类偏好评估

方面,除复杂推理外,o1-preview 相比 4o 也占据主要优势。不过

在推理要求不高的场景下,人们还是更倾向于 4o 模型

安全方面

,总体相比 4o 保持改进或相当。

CoT(思维链)

除了推理能力的提升,思维链的嵌入让 o1 相比 4o 产生了能力的飞跃。o1 在尝试解决问题时,会先进行一系列思维链推导——

其中包括识别并纠正错误、问题拆解与规划、不同策略的尝试

。这不就是我们人类解决复杂问题的过程吗?

官方给出了 Code、Math、Science 等场景下的真实案例,并展示了 CoT 的完整过程。其中数学方面的 case 特别值得关注,因为

以往的大语言模型在数学回答中总是存在大量论断、过程不严谨,在不调用外部计算器的情况下,计算也经常出错

原理

在 OpenAI 官网上有一张图,简单解释如下:

  • 用户输入问题后,o1 相比之前 GPT 系列模型多使用一个叫做“

    推理标记

    ”的东西。可以理解为

    它学会了像人一样选择在什么时候进行思考,并输出当前的想法

    ,但这些“推理标记”中的思考内容并不会展示出来。这也是为什么有体验者提到模型等待时间比较久——因为思考过程并不会显式地展示。
  • 在新一轮对话中(用户第二次输入),上一轮“思考”的内容全部被删除,开始全新的“思考”。
  • 依此类推,当对话达到 128k Tokens 的上限时,模型会给出一个“删减版”答案,避免我们白等却碰到上下文上限。

这个做法让人联想到

当年它的名字还叫 Q*

,而 Star 的由来源自 StaR 系列论文。其中《Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking》的方法与 OpenAI 在 o1 中的做法有很多相似之处。Life can only be understood backward, but it must be lived forward - Søren Kierkegaard(Quiet-STaR 在论文摘要中引用了这句话,挺有意境)

官方演示视频

OpenAI 直接发布了十几个演示视频,特工们和小伙伴们都惊呆了。以下是一些精选案例:

1. 数 strawberry 中 r 的个数。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633604531008700419"></iframe>

2. 制作在 HTML 上可以玩的贪吃蛇小游戏。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633602608675422209"></iframe>

3. 将存在错误不通顺的韩语正确翻译为英文。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633599874576252929"></iframe>

4. 破解逻辑谜题。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633598766608678915"></iframe>

5. 做数学题。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633596812046483456"></iframe>

总结(o1 很强,但不要尬吹)

从 OpenAI 的文章来看,无论用户反馈还是实际测评,

o1 更多是弥补先前大模型缺失的推理能力

,而非全方位碾压所有模型——术业有专攻,选择适合的才是最好的。

OpenAI 只做了简单的 self-play,思维模式仍然难以琢磨,很难说 o1 是好的思维模式

(引用自 MetaGPT 作者吴承霖)。按照评分,o1-preview 的幻觉频率低于 GPT-4o,o1-mini 的幻觉频率低于 GPT-4o-mini。但

也有一些反馈表明 o1-preview 和 o1-mini 似乎比 GPT-4o 和 GPT-4o-mini 更容易产生幻觉

。全面理解幻觉现象还很远,特别是在评估未涉及的领域(如化学)。According to these evaluations, o1-preview hallucinates less frequently than GPT-4o, and o1-mini hallucinates less frequently than GPT-4o-mini. However, we ha ve received anecdotal feedback that o1-preview and o1-mini tend to hallucinate more than GPT-4o and GPT-4o-mini. More work is needed to understand hallucinations holistically, particularly in domains not covered by our evaluations (e.g., chemistry). Additionally, red teamers ha ve noted that o1-preview is more convincing in certain domains than GPT-4o given that it generates more detailed answers. This potentially increases the risk of people trusting and relying more on hallucinated generation.

o1 作为 Agent 的底层 LLM,效果略逊于之前的模型。

经过一定调整后能力可以与当前 Claude-3.5-Sonnet 持平,达到最高水准。

除了能力本身,特工们也对 OpenAI 的路径做了些探索和思考,简单聊聊:

1️⃣ OpenAI 大道至简

。行业通用路径是通过 Agentic Workflow,在基座模型基础上用显式的符号逻辑完成 CoT。但 OpenAI 这一次把所有能力都隐式地训练到模型中,最大程度利用自回归模型的特点完成了端到端的 CoT。某种意义上,OpenAI 通过模型层的巨大提升,把许多依赖复杂工程框架的工作简化成只需要一个 API。

2️⃣ OpenAI 在背后做了大量工作

。虽然最终没有对外交付工程框架,但 OpenAI 内部一定有非常完整的数据管线,大通量地形成高质量和低错误率的 CoT 数据。最终效果是:用一个复杂的工程框架训练出一个不依赖工程框架即可有好效果的模型。可以预见,o1 之后,构建数据管线将成为每个模型和应用公司的必备工作。

3️⃣ 通用的提升领域能力的方法即将出现

。自 AlphaGo 开始,用机器超越人的速度就在大幅加快。但无论是下围棋还是打游戏,强化学习都被认为不可扩展。OpenAI 没有披露 o1 的训练细节,但很快我们就能总结出泛化性强的模型能力提升之路。可以预见,只要给出明确的任务主题(不管是写代码、角色扮演还是做设计),都能快速完成 SOTA 的迭代。

4️⃣ o1 很强,但目前和大部分人无关

。人们总是高估眼下的新进展。客观来说,o1 的科研价值(展现和证明可能性)远大于当下的使用价值。也许我们会更受益于借助 OpenAI o1 开发的新软件、研发的新药物、研发的新机械结构,而不是 o1 本身。也许当我们回顾人类的科技进化史时,会发现 o1 是一次巨大的拐点——因为它提供了更行之有效的做出好模型、让特定领域的智能可以无限扩展的最优范式。

最后,有细心的网友发现 Contributor 名单中有个名为 Jie Tang 的大佬,以为是清华智谱的唐杰老师。特工们 Think step by step 并调用 Web Search 求证后,

发现只是撞名的乌龙而已