Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%
来源:互联网
时间:2026-07-25 19:02:11
7月25日,第三方评测机构Artificial Analysis放出了Claude Opus 5的成绩单。在综合9项测试的智能指数中,它拿下了61分,仅以1分之差领先Fable 5的60分。紧随其后的是GPT-5.6 Sol的59分,以及Kimi K3的57分。
值得关注的是,Opus 5在成本控制上表现相当抢眼——每项任务平均成本为2.03美元,比Fable 5的2.75美元低了整整26%。这还没完,它在GDPval-AA v2和AA-Briefcase两项知识工作评测中直接登顶,搭配Claude Code后还并列拿下了编程Agent指数的第一。Terminal-Bench v2.1的得分是89%,基本追平了GPT-5.6 Sol。
说到灵活性,Opus 5内置了5档推理强度,从low到max,输出Token的差距大约有8倍,GDPval-AA v2的成绩也相差了407 Elo。这意味着什么?你可以用更多的Token去换取更强的性能,也可以主动压低成本——完全看需求来调。
不过,短板也很明显。Opus 5在事实知识这块仍然落后于Fable 5。在AA-Omniscience测试中,它的幻觉率飙到了50%,比Opus 4.8高了14个百分点。另外,低推理档位的性价比也还是略逊于GPT-5.6系列。简单说,有亮点,但别指望它样样完美。