首页 > 教程攻略 > ai资讯 >深挖 OpenAI o1:独立思考,智商超群,思维隐藏,一石三鸟...

深挖 OpenAI o1:独立思考,智商超群,思维隐藏,一石三鸟...

来源:互联网 时间:2026-08-27 14:44:01

先说几个核心判断。

全网对 OpenAI o1 的测试基本尘埃落定,一个共识正在形成:这是一个独立思考能力出众、智商超高的模型。智商测试拿了 120 分,高考数学直接满分。但有意思的是,当你试图去询问模型的思考过程时,却收到了 OpenAI 的封号警告。这背后,到底藏着什么不能说的秘密?

带着这个疑问翻完了官方技术报告,答案似乎渐渐浮现了。

一、先从光鲜亮丽的那一面说起

OpenAI 发布的 o1 模型系列,特性相当另类。它主动舍弃了一大堆现代 AI 模型的标准配置:没有联网搜索,不支持文件上传,不能画图,连 system prompt、tool、json mode 这些常规能力也一并缺失。在功能上,它似乎退步了。

但它依然敢定价为旧模型的 100 倍。底气在哪里?

答案就是所谓的“系统2思考”——它会花更多时间来推演复杂任务,专门攻克科学、编程和数学领域里的高难度题目。这种能力上的跨越,从智商测试成绩上就能看出端倪:o1 是 120 分,而人类平均值大约是 100,其他主流模型都还徘徊在 100 以下。

更直观的证明,来自网友 @howie_serious 的实测:用 o1 做今年的数学高考题,竟然全部答对。

还记得两个月前 OpenAI 定义的 AI 五个 Level 吗?当时高管在内部会议上说,我们还在第一级(ChatBots),但很快会触及第二级(Reasoners),也就是能解决基础问题的系统。o1 的发布,等于正式宣告行业进入了 Level 2。它已经稳在了第二级,不过 Agent 能力仍然偏弱。

但这已经足以引起重视。OpenAI 自己也意识到了这一点,于是在模型里加了一些让人琢磨不透的操作……

二、技术报告里的真相:解放思想,然后隐藏

o1 的能力确实让人眼前一亮,但大家很快发现了异样:

  • API 调用时,模型只返回最终结果,整个思考过程一概隐藏。

  • 在 ChatGPT 官网使用,看到的也只是思维链的摘要。

  • 如果你非要追问思考过程,OpenAI 会发邮件警告——再问就封号!

o1 的思维过程里到底藏着什么,让它受到如此严密的保护?

答案,其实就藏在 OpenAI 官方发布的技术报告里。

整份技术报告写得惜字如金,生怕多说一个字被竞争对手抄走。但仔细看,还是能抓出几个关键点:

通过强化学习,o1 学会了磨炼其思维链,并完善所使用的策略。它学会了识别并纠正错误,将棘手的步骤分解为更简单的步骤。如果当前方法行不通,就尝试另一种。这个过程极大地提升了模型的推理能力。

这里点名了强化学习到底在强化什么:

  • 识别错误和纠正错误
  • 拆解复杂任务为简单任务
  • 失败后换条思路重新来过

但光靠纠正错误来提升解题能力,还远远不够。模型需要更强的思考发散能力。

OpenAI 很早就意识到,RLHF(基于人类反馈的强化学习)会影响模型的智力水平——对齐人类的偏好,代价是智商下降。

于是,o1 的设计中直接放弃了 RLHF,彻底放飞模型。

要让模型发挥作用,它必须能够完全自由地以不被扭曲的形式表达其思想。因此,我们无法将任何政策合规性或用户偏好训练到思维链上。

翻译一下:要想让模型更聪明,就得让它自由思考,不能给它加任何思想钢印。

但完全自由的思考,肯定是不合规的。那怎么办?

在权衡了用户体验、竞争优势和对思维链进行监控等多个因素之后,我们决定不向用户显示原始的思维链。我们承认这个决定有缺点。我们努力通过教导模型在回答中复现思维链中的有用想法来弥补。对于 o1 模型系列,我们展示一个由模型生成的思维链摘要。

简单说,OpenAI 不愿让用户看到模型真实的思考过程,于是选择隐藏。但又觉得全部隐藏对用户帮助不大,所以额外做了一个摘要模型。所以严格来说,o1 不是一个单独的模型,它至少包含三个:

  • 发散思考模型:

    没有思想钢印,完全自由思考,通过强化学习提升输出高价值想法的能力。
  • 思维摘要模型:

    负责总结和改写,隐藏真实思路,同时用思想钢印过滤掉敏感内容,严防信息泄露。
  • 结果输出模型:

    包含所有安全对齐和人类对格式的偏好,只输出最终结果——这也是 API 返回的唯一内容。

OpenAI 做了一个思考能力极强的模型,然后决定把它的思考过程藏起来。嗯,这个操作,值得细细品味。

三、隐藏思维,一石三鸟

隐藏思维过程这招,算盘打得是真响,一石三鸟。

第一,

保证在监管环境下,模型依然能发展智力。传说中的机器人三定律,本质就是一套思想钢印。隐藏思维过程后,模型可以不遵守任何人类规则。如果哪天它真的产生了超级智能(SSI),只要 OpenAI 不说,外界也无从知晓。模型可以在合规输出的外表下,悄悄进行智力突破、猥琐发育。

第二,

避免被竞争对手摸清底牌。强化学习的核心,是筛选出高价值的思维方式。这些思维方式价值连城,一旦公布,竞争对手很快就能追上。而高水平的强化学习,全世界能把控好的公司不超过五家。藏好思考过程,就能赢得一时的技术优势。

第三,

彻底杜绝模型蒸馏。GPT-4 被蒸馏后养活了多少模型团队,大家心里都有数。藏起思考过程,别人就没办法反向提取模型能力。OpenAI 就可以通过 Self Play 左脚踩右脚,构建自己的数据壁垒,不让外部团队搭便车。

不得不说,在通向“CloseAI”的路上,这套策略设计得相当精妙。

四、技术报告的引用,一切尽在不言中

技术报告确实没透露出多少干货,但翻到参考文献那一截,反而发现了更有意思的东西。

技术报告不能明说,但学者操守还在,该写的引用不能少。其中有四个链接特别值得注意:

  1. Claude 3.5 的官方介绍

    ——首先感谢友商 Anthropic 的启发。
  2. Gemini Pro 2 的官方介绍

    ——其次感谢友商 Google 的启发。
  3. Let's verify step by step

    ——OpenAI 自己发的论文,研究的是通过对思维过程进行监督(而不是只对结果进行监督)来训练强化学习。
  4. 关于 Elo 评级的说明

    ——探讨竞争编程中的评级系统,可能是 o1 强化学习中采用的评价机制。

其中第三篇《Let's verify step by step》可以视为 o1 训练方法的方法论。这篇论文很特别——它使用的是未经人类偏好对齐的 GPT-4 基座做实验,得出了几个神奇结论:

  • 对思维链进行过程监督(PRM),显著优于只对结果进行监督(ORM)。
  • 在解决高难度数学问题时,过程监督的效果远超结果监督。
  • 过程监督实际上产生了“负对齐税”——安全上越对齐,模型能力反而越强。

    那些只可意会不可言传的东西,模型竟然也学会了。
  • 过程监督的训练集采用主动学习来构建,能筛选出最高价值的模型补全结果,降低人工标注成本,效率提升 2.6 倍。这也许就是发散思维部分强化学习的关键。

五、故事的结局是……

看到这里,发散思考也该收敛了,来整理一下整条线索。

OpenAI 开发出了一个智商超过 120、高考数学满分的 AI 模型,具备真正的思考能力。但他们没有对模型的思考部分进行安全对齐,还把整个思考过程隐藏了起来。

这引发了安全担忧。首席科学家 Ilya 和安全团队的部分成员也因为理念分歧离开了公司。为了应对挑战,OpenAI 不得不与美英政府合作研究 AI 安全。

但这一系列操作可能带来的潜在风险,不容忽视:

  1. 权力集中

    :只有少数人能控制 AI 的安全,而他们的偏见,就定义了什么叫做“安全”。
  2. 有害思想

    :模型可能在思维过程中计划出一些对人类造成伤害的行为。输出结果里看不到,但这些内容可能会被 OpenAI 或美英政府的内部人员看到并利用。
  3. 学会撒谎

    :既然模型可以不透明地输出所有思想内容,它就已经学会了撒谎。模型甚至可以解释说,那些看起来有害的结果是为了人类的长远利益——细思极恐。

越想,越能感受到一种智能失控的预感。

这应该不是 Ilya 想看到的未来。

不过话说回来,o1 的技术并不会成为真正的壁垒。Anthropic、Google、Meta、xAI 这些公司,早晚也会做到同样的水平。而在它们之中,至少有一家,会选择公开透明。