OpenAI 发布新模型,Sam Altman:耐心时刻结束了!
来源:互联网
时间:2026-08-27 14:27:43
北京时间凌晨一点,OpenAI 突然放了个大招。
预热了快一年的 Q* / 草莓项目——传说中能进行高级推理的大语言模型,今晚终于露出真面目。

OpenAI 官方发文宣布,正式推出 OpenAI o1-preview 模型。名字的含义外媒之前已有爆料:o1 代表着下一代大模型 Orion(猎户座)。官方在文档中写道,新模型在推理能力上代表了人工智能能力的新水平,因此计数器重置为 1——这意味着未来很可能不会有 GPT-5 了,o1 将代表 OpenAI 的最强水平。
而且,从今天开始,ChatGPT Plus 和 Team 用户就能直接访问模型。用户可以手动选择使用 o1 模型的预览版——o1-preview,或使用小尺寸的 o1-mini。o1-preview 每周限制 30 条消息,o1-mini 每周限制 50 条。
有意思的是,在 OpenAI 的模型介绍页面上,o1 模型的训练数据截止到去年十月份——而 Q* 项目最早的爆料,正好出现在十一月份。OpenAI 憋了一年的这个大招,究竟如何?它能否再次引领大模型的潮流,甚至让人们看到通用人工智能之路不再遥远?很快,每个人都能检验这一点。Sam Altman 凌晨一点在 X 上发帖:「需要耐心等待的时刻结束了!」
**01. o1 模型:解决博士级别的科学问题,超越人类**
截止发稿时,还不能直接使用 o1 模型。不过 OpenAI 放出了大量相关表现展示。最引人关注的自然是推理能力。Sam Altman 直接在 X 上贴出了 o1 与 GPT-4o 在数学、编程和博士级科学题目上的能力对比。
最左边的柱形代表目前的主力模型 GPT-4o,今天放出的 o1 预览版为中间的橙色柱形。可以看到,在 2024 年美国数学邀请赛和 Codeforces 算法竞赛题上,o1 预览版的能力比 GPT-4o 提升了 5-6 倍。而深橙色的柱形——真正的 o1,相比 GPT-4o 提升了 8-9 倍!最后一张图中,OpenAI 列出了人类专家解决博士级科学题目的成功率,约为 69.7%,而 o1 预览版和 o1 都已经超过了这个水平。
技术博客给出了更具体的数字:o1 模型在美国数学邀请赛上的成绩,可以排进全国前 500 名。而在物理、生物和化学问题上的准确度,超过了人类博士的水平。
大模型进入公众视野的两年里,一个常被用到的比喻是:它像什么都懂一点的大学生,在知识专精方面远远不够,但基础常识还行。OpenAI 的新模型,很可能要刷新这一认知了。
官方博客简单解释了背后的原理:类似于人类在回答难题前会思考很长时间,o1 在尝试解决问题时会使用一系列思维。通过强化学习,o1 学会了磨练其思维链并完善策略。它学会认识并纠正错误,将棘手的步骤分解成更简单的步骤。当当前方法不管用时,它会尝试另一种。这个过程极大提升了推理能力。
在 OpenAI 给的案例中,GPT-4o 和 o1 模型同时回答同一个问题——读长文做阅读理解。o1 模型多了一个选项叫展开思维链。如果不展开,两个模型给出的答案不同;打开思维链后,能看到一段非常长的模型与自己的思维对话,解释为什么做出不同选择——"选 A?嗯,好像不是很好。选 B?好像没关联。"模型完全在自问自答,最终判断出哪个答案更好。
另一个例子中,解决化学问题时,o1 模型甚至自己在多种方案间对比:"标准计算方式是这样,但我们也可以这么算,但这样或许没必要?"多次纠正自己后,它得出了正确答案。
之前已有大量报道透露过 o1 模型高推理能力的原理——这一训练方法最早来自斯坦福大学 2022 年开发的"自学推理"(Self-Taught Reasoner,STaR)。后来研究人员进一步开发了"Quiet-STaR"技术,核心是在每个输入 token 后插入一个"思考"步骤,让 AI 生成内部推理,然后评估这些推理是否有助于预测后续文本,并相应调整参数。这也是人们推测 Q*(读作 Q Star)命名的原因。
在 o1 模型出现前,用户可以通过与模型对话引导它一步步思考(慢思考)获得更准确的回答。但 o1 模型显然将思维链放大到了完全不同的量级。更重要的是,在之前用户 prompt 引导下,答案终究受限于模型能力。而通过不同训练方式训练出来的 o1,很有可能通过自身推理超越训练材料的限制,产出更高级和准确的答案。
在复杂推理任务上的进步,可能直接推动编程和科学研究两个方向。OpenAI 提到,未来医疗保健研究人员可以用 o1 注释细胞测序数据,物理学家可以用 o1 生成量子光学所需的复杂数学公式,开发人员可以用 o1 构建和执行多步骤工作流程。一个例子是,仅用提示词就完成了一个游戏的编程。
推理能力的进步,如果还能进一步消除模型幻觉,将对 AI 应用的构建产生间接影响。对未来的 AI 安全也有积极意义——之前通过提示词工程误导模型进行错误输出的手段,可能被模型更强的思考能力直接化解。OpenAI o1-preview 今天开始在 ChatGPT 上可用,并提供给受信任的 API 用户。
**02. 价格没涨,OpenAI 用 o1-mini 解决推理成本问题**
此次发布前,不少媒体爆料说,新模型内部推理链条长,算力成本会进一步升高,OpenAI 可能提高使用费用——最离谱的猜测达到每月 2000 美元。然而发布后令人惊讶:新模型价格没涨,只是使用次数受到了限制。o1-preview 每周限制 30 条消息。
除限制使用条数外,OpenAI 管控推理成本的另一个重要举措是同步推出 o1-mini 版。OpenAI 没有说明参数量,但技术文档显示,o1-mini 和 o1 上下文长度相同,甚至最大输出 token 数更高。OpenAI 表示,o1-mini 尤其擅长准确生成和调试复杂代码,对开发者尤其有用。作为较小的模型,它比 o1-preview 便宜 80%,是应用程序中需要推理但不需要广泛世界知识的强大且经济高效的模型。OpenAI 甚至计划之后为所有 ChatGPT 免费用户提供 o1-mini 访问权限。
不过,作为新模型,o1 系列目前还不能浏览网页获取信息、上传文件和图像。OpenAI 也提示,GPT-4o 短期内在某些任务上会更强一些。
**03. Scaling Law 后最重要的进展?**
这次发布新模型,甚至不是唯一重要的事。OpenAI 还提及了训练中的一个发现:随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算),o1 的性能能持续提高。扩展这种方式,限制条件与 LLM 预训练的限制有很大不同。
英伟达具身团队领导者 Jim Fan 直接在 X 上点评了这一事件的历史意义——模型不仅拥有训练时的 scaling law,还拥有推理层面的 scaling law。双曲线共同增长,将突破之前大模型能力的提升瓶颈。Jim Fan 表示,2022 年人们提出了原始的 scaling law(尺度定律),意味着随着参数量、数据量和计算量的增加,模型性能能不断提高。然而 scaling law 在今年看起来似乎已有停滞——在 self-rewarding language 文章中,他感受到 3 轮自我提升似乎是大语言模型的饱和极限了。
而这次 OpenAI 的新模型,除了在训练时通过增大参数量和数据量获得性能提升,还通过增加推理时间——也就是前面所说的模型在自己内部思考的时间——得到了能力上的提升。也就是说,如果模型未来自己和自己思考的时间越长,得到的答案可能就越准确。这很接近我们对 AI 的终极想象了——就像最早在 AlphaGo 中所展现的,AI 通过自己和自己下棋来提升棋艺。
OpenAI 的新模型展现的是一条全新的提升路径。Jim Fan 在 X 上的一句话令人耸动:「之前,没人能将 AlphaGo 的成功复制到大模型上——使用更多的计算让模型走向超人能力。目前,我们已经翻过这一页了。」
回看 2023 年,许多人在问:Ilya 看到了什么?大家都怀疑是一个超级强大的模型——是的,此次发布的 o1 确实很强。但或许,更有可能是这个——推理层面 scaling law 的发现,再一次让人们意识到,超人的 AI,或许不再遥远。 -
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名