首页 > 教程攻略 > ai资讯 >AI大模型周榜:代码榜榜首易主,claude-opus-4-7-thinking登顶

AI大模型周榜:代码榜榜首易主,claude-opus-4-7-thinking登顶

来源:互联网 时间:2026-07-14 12:37:05

7月13日,Arena平台发布了最新一周的AI大模型排行榜,覆盖2026年7月6日至7月12日的数据。这期榜单的核心看点,是代码榜榜首发生了易主——claude-opus-4-7-thinking从第二蹿升到第一,把原来的冠军claude-fable-5挤到了第五。综合榜这边,头把交椅依然被claude-fable-5牢牢攥着,Anthropic的模型几乎包揽了前五名。国产模型整体处在中上游梯队,排名波动不大,相对稳定。

AI大模型周榜:代码榜榜首易主,claude-opus-4-7-thinking登顶

综合榜

综合榜的格局这周基本没怎么动。claude-fable-5继续稳坐第一,ELO分数1505,比上周微降4分。第二到第五名依次是claude-opus-4-6-thinking、claude-opus-4-7-thinking、claude-opus-4-6、claude-opus-4-7,清一色都是Anthropic的模型,分数差距都在30分以内,在统计误差范围内基本可以视为并列。头部模型里,唯一一个掉出前五的是muse-spark-1.1,从第五滑到第六,变动幅度也不大。

国产模型方面,只有三款进入了前30名,整体排名保持稳定:

  • qwen3.7-max-preview表现最好,排在第17名,ELO 1475分,排名没变;
  • glm-5.1排在第25名,ELO 1472分,下滑了3名;
  • ernie-5.1排在第30名,ELO 1468分,排名不变。

代码榜

代码榜本周最大的变化就是榜首易主。原来的第二名claude-opus-4-7-thinking冲上第一,ELO分数1553;原冠军claude-fable-5则大幅下滑了4个名次,掉到第五,ELO分数从1563降到1546,跌幅达17分。第二到第四名分别是claude-opus-4-6-thinking、claude-opus-4-7、claude-opus-4-6,头部前五名依然被Anthropic的模型包揽,分数差距在10分以内,基本属于同一水平线。

值得关注的是,grok-4.5排名上升了5位,到了第14名,是榜单里涨幅最大的模型之一。

国产模型共有五款上榜,具体排名和分数如下:

  • qwen3.7-max-preview排名最高,第12名,ELO 1526分,比上周下降了2位;
  • glm-5.1排在第18名,ELO 1521分;
  • mimo-v2.5-pro排在第23名,ELO 1518分,下降了6位;
  • kimi-k2.6排在第25名,ELO 1514分,上升了3位;
  • ernie-5.1排在第26名,ELO 1514分,也上升了3位;
  • glm-5.2排在第27名,ELO 1513分,下降了6位。

数学榜

数学榜这边,claude-fable-5从第二名升到了第一,ELO分数大幅提升了31分,达到1548。原来的冠军claude-opus-4-6-thinking则退到第二,分数保持在1518没动。国产模型里,ernie-5.1排名上升了2位,到了第14名;qwen3.7-max-preview下降了一位,排在第11名。整体分数差距都在误差范围内,算不上剧烈波动。

高难度指令榜

高难度指令榜的头部也发生了换位。claude-opus-4-6-thinking从第二升到第一,claude-fable-5从第一降到第二,二者分数都是1532,在误差范围内可以视为并列。排名变动幅度都在3位以内,整体格局也比较稳定。国产模型这里,qwen3.7-max-preview排在第19位,分数微涨1分;glm-5.1排在第21位;glm-5.2排在第30位,分数没变。

多轮对话榜

多轮对话榜里,claude-fable-5从榜首跌到了第四,排名下降了3位。claude-opus-4-7则上升了1位,登顶榜首。头部格局有小幅变动,但最抢眼的还是muse-spark-1.1,从第13位直接跳到第8位,涨幅最明显。国产模型qwen3.7-max-preview排在第22位,分数微涨1分。

把整期榜单看下来,结论很清晰:Anthropic旗下的模型仍然霸占了绝大部分头部位置,综合、代码等多个榜单里前几名几乎被它们包圆,美国厂商的整体优势依然明显。国产模型整体稳定在中上游区间,qwen3.7-max-preview在多个榜单中保持领先位置,kimi-k2.6和ernie-5.1在代码榜上实现了排名上升。下期榜单值得关注的是,有没有新入围的模型能制造惊喜,以及国产模型能否进一步冲击头部位置。