OpenAI o1 代码能力实战篇
今天 OpenAI 终于发了新模型,大家都很兴奋。奥特曼说它推理很厉害,写代码也很厉害,官方还演示了一段用 HTML 和 CSS 写 Transformer 原理的视频。刚好这里有一个之前搭好的 UI 生成工具,于是连夜就让 OpenAI 的新模型来挑战一下现在的前端代码擂主:克劳德。用实战来看看它到底能不能挑战成功。之前在这个工具环境中测试下来,Claude 遥遥领先,而 OpenAI 在前端代码能力上,跟 DeepSeek 可以说是不相上下。

参赛选手:
OpenAI - o1-mini,OpenAI - 01-preview,claude-3-5-sonnet-20240620。
参赛规则:
- 统一走中转 API,保证公平公正。
- 相同的工程环境,都是 React,给的是相同的组件库。
- 每一局每位选手最多有 3 次机会,一次成功则得分最高。
- 如果失败,则会把报错信息反馈给模型继续修改,相应的分数也会有折扣。
题目:
结论有点出人意料,先看看效果再说。
第 1 局
题目:
- 速度:从输入到输出,Claude 平均在 20 秒左右,而 preview 平均需要 1 到 2 分钟。
- 效果:主观来看,Claude 略胜一筹,至少对 React 库更熟悉,对代码版本的了解也更多。
- 美感:指定了 Shadcn 这个 UI 库,所以出来的风格都差不多。这里只放了部分效果,但 Claude 仍然略胜一筹。
Claude
o1-mini
o1-preview
耗时:76s
思考:59s
备注:为了让大家更了解它思考了什么,这里截取一部分思考内容。后面就不放了,有兴趣可以去飞书看。
content: > 正在思考
填写指令
构建个人博客首页
制定代码规范
创建主页
整理思路和资源
引入必要组件
展示新功能
更新代码要求
设计博客主页
深入了解 Ja vaScript
理解代码结构
搭建博客页面
探讨技术发展
构建主页框架
介绍新技术
第 2 局
题目:
Claude
o1-mini:
o1-preview:
耗时:85s
第 3 局
题目:
Claude:
o1-mini:
o1-preview:
耗时:25s
第 4 局
题目:
Claude
o1-mini
o1-preview:
耗时:38s 思考:15s
第 5 局
题目:
Claude
o1-mini
o1-preview
耗时:121s思考:63s
第 6 局
题目:
Claude
o1-mini:
- 第 1 次:失败,Token 超了
模型返回内容:> 正在思考
思考 6 秒
- 第 2 次:失败,代码错误
- 第 3 次:成功
o1-preview
耗时:145思考:41
第 7 局
题目:
Claude
o1-mini
o1-preview
耗时:38思考:14
第 8 局
题目:
Claude
o1-mini
- 第 1 次:失败,原因:库引用出错
- 第 2 次
o1-preview
耗时:72s思考:41s
第 9 局
题目:
Claude
o1-mini:
- 第 1 次:失败,原因:库引用出错
- 第 2 次:成功
o1-preview
- 第 1 次:失败,没有思考,直出代码,报错了
- 第 2 次:成功,思考了
耗时:82s思考:57
第 10 局
题目:
Claude
- 第 1 次:失败,token超了(4096)
o1-mini:
- 第 1 次:失败,原因:库引用出错
模型返回内容:> 正在思考
生成React JSX文件我正在创建一个高保真度的React JSX文件,使用Tailwind CSS和指定的UI组件进行数据可视化。这将支持多个图表类型、实时数据更新和自定义仪表板功能。实时数据更新将通过占位符来模拟。整理界面布局我正绘制布局,包含侧边栏、头部和主页内容区,用多个图表和控制组件模拟仪表板的外观。...
思考 几秒
- 第 2 次:失败,原因:Charts 库引用出错(用的 shadcn)
- 第 3 次:失败,原因:Charts 库引用出错(用的 shadcn)
o1-preview
- 第 1 次:失败,原因:库引用出错
- 第 2 次:失败,原因:看下面自查
- 第 3 次:成功,思考了64s
结论
前端这块,OpenAI思考完的效果都没有追上Claude。
速度
- Claude 平均耗时大约 20 秒完成任务。
- OpenAI 的 o1-mini 和 o1-preview 模型通常需要 1 到 2 分钟来生成代码,速度明显慢于 Claude。
准确率(一次成功)
- Claude:9/10 场比赛一次成功,表现稳定且高效。
- OpenAI 的两个模型,尤其是 o1-preview,虽然不断尝试调整代码逻辑,但一次成功的次数明显少于 Claude。
代码熟练度与效果
- Claude 对 React 及其库的熟悉度更高,特别是在处理复杂组件和动态页面布局方面表现出色。OpenAI 的模型虽然可以通过思考与调整来生成代码,但过程显得重复冗余,尤其在需要快速生成代码时效率偏低。
- 在美感和功能性上,由于指定使用相同的 UI 库(Shadcn),生成的界面在风格上差别不大,但 Claude 凭借对布局和响应式设计的更好把控,依然略胜一筹。
一点观察
在观察 o1 的思考过程时发现,OpenAI o1 似乎只是把 Planning 揉进了接口调用里。说得直白点,就是用户的 query 发出后,用工程方式去不断调用自己的模型(比如 4o),然后不断纠正——AutoGPT 的即视感。回头看看第一局设计博客页面时 o1 思考的具体内容,为了直观,把 title 单独拎出来看:深红色的是匪夷所思的思考内容,粉色的是重复累赘的思考内容。是不是很熟悉?重复、累赘、多消耗点 tokens。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名