草莓的真面目终揭开,OpenAI o1 全方位解析!
北京时间凌晨一点左右,OpenAI o1 横空出世——就是之前传闻已久的“草莓”模型。消息来得突然,特工们第一时间被推送,直接不困了。不就是发了两个模型、十几个演示视频、43 页论文嘛,起来肝就完了。没睡的特工,出列!拉群开整!
o1 的核心特点是:在给出回复前会用更多时间进行思考,模仿人类解决复杂问题的思考方式,而且
思考越久,推理任务的表现就越好
简介与评估
简单来说,OpenAI o1 系列模型在复杂推理上的性能提升,
与传统 LLM 预训练式的提升路径完全不同
通过强化学习的方式,让模型不断完善思考过程
这一模式存在 Scale up 的可能性
下面具体来看,o1 在这一新训练模式下展现出的惊人性能。观察下图可以发现,o1 在各类机器学习基准测试中远胜 GPT-4o(注:pass@1 指一次通过):
在 GPQA Diamond* 上,o1 甚至成为第一个能击败人类专家的模型。虽然不能直接说 o1 能力超过人类专家,但足以证明它“博士级”的推理思考能力。GPQA Diamond:一个困难的智力基准,测试化学、物理和生物学方面的专业知识。实线条显示一次通过的准确率,阴影区域显示 64 个样本的平均性能。
文科类评估中,o1 相比 4o 提升不算太大,但逻辑推理方面,o1 远胜 4o。值得关注的是,为了展示 o1 的逻辑推理能力,OpenAI 选择了 AIME 作为测试——这是美国数学竞赛中仅次于奥林匹克数学竞赛的项目,难度极大、非常灵活。o1 在这一基准上的表现:在 1 样本提示下,平均拿下 74%;而在 64 个样本的共识中达到 83%;最夸张的是,使用 1000 样本可直达 93%,足以进入美国前 500 名。
至于
编程能力
在
人类偏好评估
在推理要求不高的场景下,人们还是更倾向于 4o 模型
安全方面
CoT(思维链)
除了推理能力的提升,思维链的嵌入让 o1 相比 4o 产生了能力的飞跃。o1 在尝试解决问题时,会先进行一系列思维链推导——
其中包括识别并纠正错误、问题拆解与规划、不同策略的尝试
官方给出了 Code、Math、Science 等场景下的真实案例,并展示了 CoT 的完整过程。其中数学方面的 case 特别值得关注,因为
以往的大语言模型在数学回答中总是存在大量论断、过程不严谨,在不调用外部计算器的情况下,计算也经常出错
原理
在 OpenAI 官网上有一张图,简单解释如下:
- 用户输入问题后,o1 相比之前 GPT 系列模型多使用一个叫做“”的东西。可以理解为
推理标记
,但这些“推理标记”中的思考内容并不会展示出来。这也是为什么有体验者提到模型等待时间比较久——因为思考过程并不会显式地展示。它学会了像人一样选择在什么时候进行思考,并输出当前的想法
- 在新一轮对话中(用户第二次输入),上一轮“思考”的内容全部被删除,开始全新的“思考”。
- 依此类推,当对话达到 128k Tokens 的上限时,模型会给出一个“删减版”答案,避免我们白等却碰到上下文上限。
这个做法让人联想到
当年它的名字还叫 Q*
官方演示视频
OpenAI 直接发布了十几个演示视频,特工们和小伙伴们都惊呆了。以下是一些精选案例:
1. 数 strawberry 中 r 的个数。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633604531008700419"></iframe>2. 制作在 HTML 上可以玩的贪吃蛇小游戏。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633602608675422209"></iframe>3. 将存在错误不通顺的韩语正确翻译为英文。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633599874576252929"></iframe>4. 破解逻辑谜题。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633598766608678915"></iframe>5. 做数学题。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3633596812046483456"></iframe>总结(o1 很强,但不要尬吹)
从 OpenAI 的文章来看,无论用户反馈还是实际测评,
o1 更多是弥补先前大模型缺失的推理能力
OpenAI 只做了简单的 self-play,思维模式仍然难以琢磨,很难说 o1 是好的思维模式
也有一些反馈表明 o1-preview 和 o1-mini 似乎比 GPT-4o 和 GPT-4o-mini 更容易产生幻觉
o1 作为 Agent 的底层 LLM,效果略逊于之前的模型。
除了能力本身,特工们也对 OpenAI 的路径做了些探索和思考,简单聊聊:
1️⃣ OpenAI 大道至简
2️⃣ OpenAI 在背后做了大量工作
3️⃣ 通用的提升领域能力的方法即将出现
4️⃣ o1 很强,但目前和大部分人无关
最后,有细心的网友发现 Contributor 名单中有个名为 Jie Tang 的大佬,以为是清华智谱的唐杰老师。特工们 Think step by step 并调用 Web Search 求证后,
发现只是撞名的乌龙而已
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名