「草莓」实测:可能只是工程 Trick,且有扣费陷阱!
长话短说
中国时间 9 月 13 日凌晨,OpenAI 正式发布了 o1 系列模型——o1-preview 和 o1-mini,官方确认就是此前传得沸沸扬扬的「草莓」模型。从公布的数据来看,
o1 在 STEM(理工科)领域做了特别优化,回答之前会经历一段思考过程
Plus 和 Team 用户现在就能在 ChatGPT 里访问
T5 级别的开发者可以用 API
需要强调的是,
这个模型目前还是个半成品,离完整工程化还有距离
而且,
这里有个坑——你可能会被百倍计费
另外,
模型标称有 32k/64k 的最大输出,但真实输出远没那么多
基于 GPT-4o 的 agent,而且做得并不好

上图是进行结构化输出时的 400 报错。
效果与特性
先确认一下,o1 就是官方认定的「草莓」。

奥特曼本人对此也很满意。


在测试结果中,o1 在绝大多数重推理任务中显著优于 GPT-4o。整体来看,o1 的表现碾压了 4o,尤其在 MMLU 的多数子类别中优势明显。
根据官方报告,许多需要推理的测试里,o1 已经达到了人类专家的水平。像 MATH 和 GSM8K 这类测试,近期模型分数都太高了,已经分不出高下。因此官方选择了更具挑战性的 AIME(美国数学邀请赛)——这是一项专为全美顶尖高中数学学生设计的考试。
在 2024 年 AIME 中,GPT-4o 的平均成绩只有 12%(1.8/15),而 o1 平均得分高达 74%(11.1/15)。只用单次回答时,64 个样本的平均正确率达到 83%(12.5/15)。如果使用学习算法对 1000 个样本进行优化排序,o1 的得分进一步提高到 93%(13.9/15)。这个成绩足以进入全国前 500 名,甚至超过了美国数学奥林匹克的入围线。
价格与限制
目前 o1 系列模型可以通过 ChatGPT 网页版或 API 访问:
o1-preview
- 128k 上下文
- 32k 最大输出
- 旨在解决各领域复杂问题的推理模型
- 训练数据截止于 23 年 10 月
o1-mini
- 128k 上下文
- 64k 最大输出
- 更快速、更经济的推理模型,特别擅长编程、数学和科学
- 训练数据截止于 23 年 10 月
ChatGPT 网页版目前仅 Plus 和 Team 用户可用,Enterprise 和 Edu 用户还需等一周:
- o1-preview:30 条/周
- o1-mini:50 条/周
API 调用方面,Tire5(支付金额超过 1000 美金)的用户已经可以用:
- o1-preview:20 RPM,30,000,000 TPM
- o1-mini:20 RPM,150,000,000 TPM
需要注意
经测试,o1 模型不支持以下功能,调用会报错:
- system 字段:400 报错
- tools 字段:400 报错
- 图片输入:400 报错
- json_object 输出:500 报错
- structured 输出:400 报错
- logprobs 输出:403 报错
- stream 输出:400 报错
- 其他:temperature、top_p 和 n 被固定为 1;presence_penalty 和 frequency_penalty 固定为 0
进行结构化输出时,400 报错(见上图)。
更需要注意
文档说 o1 可以输出 64k,但实测远非如此。比如 prompt 为「写一部『黑神话悟空』的同人小说,不少于 2 万字」,返回的内容只有 1000+ 字。
「谨防电信反诈」
实现原理
简单来说,o1 系列模型在回答过程中会经历多次内部对话,根据对话评估再进行后续生成。它先思考,然后总结输出。
这个思考可能不止一步,最长的思考步骤可达 128k。具体流程如下:先思考,再总结输出。
但需要注意:API 调用时并不会返回中间的思考过程。比如同样的问题「安徽牛肉板面,为什么是石家庄特产?」,API 的返回里隐藏了推理过程。下图显示此处产生了 896 tokens 的推理(ID 等信息已隐去)。
换个例子,问题简短的「你好」,返回如下:输出 471 tokens,其中 448 tokens 是推理,只有 23 个是真实输出。
同样的问题用 4o 问:输出只有 9 tokens。
要知道,o1 模型的价格是 4o-0806 的 6 倍。再加上推理的额外消耗,以及 o1 的 token 计算可能比 4o 更多,API 开支可能会炸!
以「你好」为例,4o-0806 的费用是 ($10*9 + $2.5*8) * 10^-6 = 110 * 10^-6 美元;而 o1 模型费用是 ($60*471 + $15*10) * 10^-6 = 28410 * 10^-6 美元。
完成相同的任务,o1 比 4o 贵了足足 258 倍!
对于非极端问题且 prompt 较短的情况,比如「安徽牛肉板面,为什么是石家庄特产?」,4o-0806 的开销为 2192.5 * 10^-6 美元,而 o1 的开销为 86835 * 10^-6 美元。
在这个案例中,o1 比 4o 贵了 40 倍!
可以合理推断:在日常使用中,o1 的开销通常会比 4o 贵上百倍。
一些判断
首先,保持一个观点:
这次的「草莓」,与其说是模型优化,不如说是工程优化
去掉 CoT 行为后,可以发现 o1 和 4o 的行为、语言风格高度相似。甚至可以猜测:
这次的「草莓」o1 有可能是 gpt-4o 经过微调或对齐后的 agent
同时,这个 agent 做得并不好,甚至不能算是及格。用 o1-mini 进行「完整输出千字文」时,无论是语言识别、意图识别还是指令遵循,都非常不尽如人意。即便换用更强的 o1-preview,结果也不理想(选中文字是错的),输出也不全。
(此处有两张截图,展示 o1-mini 和 o1-preview 的失败输出)
综上
这个版本的草莓,
远低于预期,甚至不如民间的工程化实现
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名