Claude Opus5 “便宜”稳定的最强“AGI”!
Kimi K3 的表现确实亮眼,对于 K3 和 Claude 的用户来说,这无疑是个好消息。这不,Opus 5 也紧随其后发布了。
K3 虽强,但 Claude 更全面、更稳定、自主性更强,这是业内比较一致的看法。
今天 Claude Opus 5 发布,它的第一句话是这样写的:
看这种介绍,其实抓住第一句就够了。
深思熟虑、主动、价格便宜(相对),这才是真正的主力模型。
稳定、不出错、不犯傻,这才是真正的高性价比。
1、基准数据
重点看完,再来看看细节:
Opus 5 在大多数 Agent 类任务中处于领先地位,尤其是在“自主执行任务”和“复杂推理”这两个方向上。
多个维度甚至超过了 Fable 5,这确实有些出乎意料。
Fable 5 曾被宣传为“不敢发布的怪物”,没想到 Opus 5 轻松超越了它。
这个表格的强弱对比一目了然,都标得很清楚。
下面来解读一下:
1、终端智能编程(Agentic terminal coding)
这是最重要的一项。
- Opus 5:43.3%
- Fable 5:33.7%
- Opus 4.8:21.1%
- GPT-5.6 Sol:34.4%
这说明:
Opus 5 在类似 Claude Code 这种场景里提升巨大,能更好地:
- 理解大型代码库
- 修改多个文件
- 调试
- 自主完成开发任务
这正好是 Anthropic 主推的方向。
2、知识工作能力
GDVal-AA v2:
- Opus 5:1861
- Fable 5:1747
- GPT-5.6 Sol:1736
- Opus 4.8:1593
代表:
写报告、分析资料、处理复杂办公任务的能力提升。
3、新问题解决能力
ARC-AGI-3:
- Opus 5:30.2%
- Opus 4.8:1.5%
- GPT-5.6 Sol:7.8%
这一项比较特殊,测试模型面对陌生规则、没有训练经验的问题。
Opus 5 提升非常明显。
4、Agent 搜索能力
BrowseComp:
- Opus 5:90.8%
- GPT-5.6 Sol:90.4%
- Fable 5:87.4%
说明:
联网搜索、信息整理能力已经接近顶级水平。
5、电脑操作(Computer Use)
OSWorld 2.0:
- Opus 5:70.6%
- Fable 5:66.1%
- GPT-5.6 Sol:62.6%
- Opus 4.8:55.7%
表示:
操作真实电脑环境,比如:
- 点击界面
- 使用软件
- 完成流程
Opus 5 有明显优势。
2、每个任务成本
还有一个有意思的点:Claude 也开始谈性价比了!
它们推特的第三楼是这么说的:
他们给出了四种使用场景下的任务消耗情况图:
这让人意外:Anthropic 用了四张图来展示 Opus 5.0 的性价比(竞争真是美妙)。
从这四个图来看,Opus 5.0 实现了在相同价格下性能更高,相同性能下价格更低。
这四个图分别讲的是:
1、电脑操作任务
测试 AI 能不能像人一样操作电脑完成事情。
例如:
- 打开软件
- 点击按钮
- 填表
- 修改文档
- 使用网页应用
- 完成一套办公流程
2、企业业务流程任务
测试 AI 能不能完成真实工作流程。
例如:
- 处理客户请求
- 分析业务资料
- 整理数据
- 执行审批流程
- 跨多个系统完成任务
3、多学科综合推理任务
测试 AI 的复杂知识和推理能力。
例如:
- 数学问题
- 科学问题
- 医学问题
- 法律问题
- 工程问题
- 跨领域综合分析
4、智能编程任务
测试 AI 能不能自主完成软件开发。
例如:
- 阅读代码库
- 找 Bug
- 修改代码
- 编写功能
- 运行测试
- 完成开发任务
3、通用人工智能
当“梁圣”在朝着 AGI 这个目标前进的时候,Anthropic 已经给出了阶段性的结果。
前面提到了一个叫 AGI3 的基准!
这是一个很少被提及的新基准,之所以很少被提及,是因为它太难了,对当前模型来说基本上得不了多少分。
这个基准是今年上半年刚提出的,最大的特点是不告诉你规则。
相当于给你一个完全陌生的环境,不告诉你规则、目标、有效操作和重要元素,全部需要 AI 自己去探索。
这个基准刚推出时,几乎所有模型都徘徊在个位数的百分比。
Sol 的 7.8% 已经算非常高了。
但 Opus 5 直接把它干到了 30%,这让人不禁担心 Anthropic 会不会一下子刷到 80%,大家又没得玩了。
虽然大家都知道 AGI 还没有实现,但在这个 AGI3 基准上,它已经是最强的存在了。
4、不对齐行为
除了基准领先和性价比高,Claude 还强调了另一点:不对齐行为(越低越好)。
这个图主要表明,Opus 5 是 Claude 家族里最不容易出现危险、欺骗、鲁莽行为的模型。
这种数据不太适合放在第一个展示,但事实上这才是最重要的点。
5、安全防御
另外还强调了网络安全方面的:
这个图展示了两方面的能力:左图是发现漏洞的能力,右图是漏洞的利用能力。
也就是说,Opus 5.0 的防御能力已经和 Mythos 5 差不多了,只是在攻击力上差很多。
就是给了你最强的盾,而矛还在少数人手里。
这也不是坏事,至少人家打过来的时候,还能扛一下。
作为五代模型,现在推出什么功能都不会太新鲜了。
现在的模型比拼的是生态能力和实战能力。
别看 Opus 系列相对比较贵,但它真正完成任务的成本其实比较低。现在官方也用数据来证明单任务成本。
再者,Opus 总是能以非常专业的视角,帮你做最好的规划。开头也说了,它是一个深思熟虑的主动型模型。
“主动”这个词可能很多人没有体会,但实际使用中,它总是能想得更多、更全,做得更好。它绝对不是那种单纯执行任务的模型,而是会按最优路径来完成任务的模型。
就是那种你一个眼神,它心领神会,然后做得很好。
这也就是为什么在众多模型中,实际使用的只有 Opus,从 4.6 到 4.7 到 4.8,再到 5.0。
这次 Opus 5.0 的发布时机也很有意思,居然是在星期五,多少还是有点危机感,不过这是好事。
国产模型加油!你们变强了,对所有人都有好处。