首页 > 教程攻略 > ai资讯 >Claude Opus 5 发布:性能翻倍价格不变,逼近 Fable 5

Claude Opus 5 发布:性能翻倍价格不变,逼近 Fable 5

来源:互联网 时间:2026-07-25 13:16:48

7月24日,Anthropic正式发布了Claude Opus 5。这次官方的定位很有意思——不追求成为体系内最强的模型,而是更看重“日常高频调用的能力密度”,用他们自己的话说,是“以一半的价格接近Claude Fable 5的前沿智能”。发布当天,Opus 5就在Anthropic全平台上线了,同时成为Claude Max的默认模型,也是Claude Pro订阅用户能用到的最强模型。

从层级结构来看,Opus 5处在Anthropic现有产品线中段偏上的位置。往上走,是Mythos层级的Claude Fable 5和访问受限的Claude Mythos 5;往下看,是主打性价比的Sonnet 5和轻量场景的Haiku 4.5。Opus 5接替了Opus 4.8,成为这一层级的旗舰,API模型ID是claude-opus-5。官方没有公开参数规模和上下文窗口,信息密度控制得相当克制。

技术表现方面,Anthropic自己公布了一组基准数据。在编码与知识工作评测Frontier-Bench和GDPval-AA上,Opus 5又刷了一轮新高,Frontier-Bench v0.1上的表现是Opus 4.8的两倍以上,单任务成本反而更低。在CursorBench 3.2的最高effort档位下,Opus 5的得分和Fable 5的峰值成绩相差不到0.5%,但单任务成本只有后者的一半左右。ARC-AGI 3这个考察陌生问题求解能力的基准上,官方说它的得分是次优模型的三倍。更值得关注的是计算机操作基准OSWorld 2.0,Opus 5以约三分之一的成本就超过了Fable 5的最佳成绩。科研方向的提升也被单独拎了出来——在Anthropic全部生命科学评测中,Opus 5都优于Opus 4.8,其中从光谱数据推断分子结构这类有机化学任务,内部基准高出10.2个百分点,蛋白质序列变异的功能预测任务高出7.7个百分点。当然,这些数据都是厂商自测结果,目前还没有第三方独立复现。

把镜头拉远一点,这些能力提升其实指向几个非常具体的场景。软件工程团队可以拿它做跨文件的大规模重构和疑难缺陷的根因定位——官方案例里,模型在一个开源包管理器的真实缺陷上,直接找出了社区补丁遗漏的边界情况。Agent开发者则可以把它当作长链路自主任务的底层模型,在缺乏现成验证条件时,让模型自己搭建测试手段。企业自动化团队可以用它端到端跑通业务流程,Zapier在AutomationBench上的反馈是,模型完整执行了一套客户流失预防流程,包括标记风险账户、通知责任人、为留存团队生成摘要。专业知识工作者——法律、金融、科研方向——也能借助它在数值推理、表格处理、文书批注上的改进,处理精度敏感的任务。

这次升级中最受关注的一点,是模型自我校验与迭代能力的增强。Anthropic给的典型例子是一项Frontier-Bench任务:模型被要求根据一张机械零件图纸编写代码,把它重建为3D FreeCAD模型,但刻意被剥夺了直接查看图纸的能力。Opus 5的应对方式是自行编写一套计算机视觉管线,从原始像素中提取几何信息,然后完成整个零件的重建,而且可以重复成功。在相同条件下,其他参与对比的模型经过五次尝试全部失败。多家早期客户的反馈也集中在效率而非峰值能力上。法律AI公司Harvey说,Opus 5在较低推理档位就能达到Opus 4.8最高推理档的质量,平均token消耗降低约26%。应用开发平台Lovable则强调,这个模型在内部评测中“运行间波动明显更小”,对他们来说,这种稳定性比分数本身更重要。

安全与对齐是这次发布的另一条主线。Anthropic表示,在部署前的自动化行为审计中,Opus 5的整体失准行为得分是2.3,在它近期模型里是最低的,欺骗性行为比例也最低,最不容易被诱导到滥用场景。安全能力方面,官方说Opus 5没有针对网络安全任务做专门训练,但随着通用能力提升,它的漏洞发现能力已经接近Mythos 5,不过在把漏洞转化为可用攻击手段这个环节上,还明显落后。相应的安全策略是:允许模型在源代码中发现漏洞,但阻断二进制漏洞扫描、渗透测试和漏洞利用生成。官方预计分类器的触发频率大约是Fable 5的15%,在Claude.ai、Claude Code和Claude Cowork中,被标记的请求会默认回退到Opus 4.8。

可用性和定价方面,Claude Opus 5的API价格是每百万输入token 5美元、每百万输出token 25美元,和Opus 4.8完全一致,大约是Fable 5的一半。模型还提供约2.5倍默认速度的Fast模式,在Claude Platform上按基础价格的两倍计费,在Claude Code中通过用量额度使用。和之前的Opus模型一样,Opus 5在通用访问下不设数据保留要求。与模型同步发布的还有两项Beta功能:Claude Platform支持在会话中途变更可用工具而不让prompt缓存失效;API侧新增自动回退能力,被安全分类器标记的请求可以自动路由到其他模型,而不是直接被阻断。

整体来看,Claude Opus 5的发布折射出模型竞争重心的一次位移。当各家旗舰在绝对能力上的差距逐步收窄,单位成本下能完成多少有效工作,正在取代基准峰值成为更受关注的指标。Anthropic这次没有宣称推出了最聪明的模型——那个位置仍然属于Fable 5——而是选择在价格不变的前提下把性能推上去,并反复强调token效率与运行稳定性。对高频调用的开发团队和企业用户来说,这类改进的实际价值可能高于榜单排名的变化。不过必须说的是,公告里的对比数据目前全部来自厂商自测与早期客户反馈,真实表现还有待更广泛的实际使用和第三方评测来检验。