新榜单出炉,单周处理量破8万亿Token:Agnes公布大模型最新成绩单
先说几个关键判断。AI的竞争,现在已经不在表层对话了,而是全面转向了生产力比拼。这个趋势,各大厂商看得比谁都清楚,所以一边忙着迭代自家大模型,一边集中火力冲向了用户付费意愿更强、商业化落地更稳的赛道——比如多智能体协同,还有AI编程。
现在正是抢AI应用生态布局的关键窗口期。赛道里的企业,普遍以分层基础模型为核心,再配上自研的专属开发工具,一套组合拳打下来,既能满足普通用户的日常需求,也能覆盖专业生产场景,把AI落地的门槛压得越来越低。
就在这个节点,Agnes AI正式官宣了文本大模型与AI编程产品矩阵的最新升级,具体包括
Agnes-2.5 Flash正式上线、旗舰文本模型Agnes-2.5 Pro Alpha即将开放体验,以及AgnesCode功能优化升级
Agnes 2.5 Flash

Agnes 2.5 Pro Alpha即将上线
AgnesCode
这一整套产品矩阵的全方位升级,背后是Agnes对AI应用形态进入新一轮升级周期的精准判断。现在用户普遍把大模型深度对接内部业务系统,内嵌到全流程工作链路里,实现全天候高频调用,直接推动批量Token消耗量指数级攀升。在这个背景下,模型竞争早就不是单点性能的比拼了,而是进入了综合实力的全方位角逐。
一、两大模型+AI工作台全升级,Pro Alpha模型上榜Artificial Analysis
一、两大模型+AI工作台全升级,Pro Alpha模型上榜Artificial Analysis
榜单分数,是体现模型水平最直观的证明。
Agnes AI这次更新的Agnes 2.5 Pro Alpha,在多个公开评测榜单中都展现出了很强的综合能力。
先看榜单成绩。在Artificial Analysis的Intelligence Index中,Agnes 2.5 Pro Alpha
得分39
第9

这个指数由9项评测构成,覆盖Agent任务、代码执行、科学推理、知识可靠性和长上下文理解等能力,其中Agent和Coding相关评测合计占了较高权重,更注重模型在真实任务中的综合表现。
另外,Agnes 2.5 Pro Alpha在真实Linux终端智能体基准测试Terminal-Bench v2.1中得分是
67%
这个榜单的含金量在于,全程在隔离Docker沙箱环境运行,固定保留了89项真实工程任务,修复了28项环境配置、指令匹配、资源配额的底层问题,所以这个分数反映的是模型在模拟终端环境中完成工程任务的真实能力。

除了Agnes 2.5 Pro Alpha,Agnes AI还升级了Agnes 2.5 Flash,并配套优化了其AI工作台AgnesCode的使用体验。这两款模型定位很清晰,一个承接普通用户日常需求,一个服务专业开发者的复杂需求。
具体看看Agnes AI这次升级的
AgnesCode平台
在用户体验方面,平台完成了
首字生成时延(TTFT)优化
除了桌面端升级,AgnesCode还将于7月28日
上线CLI功能

从模型的全栈能力迭代,到分层定价策略、免费体验,再到AI工作台升级,Agnes AI这套组合拳,确实打通了从技术研发、用户沉淀到商业落地的完整链路。
二、一手实测编程难题,直出复杂项目管理平台
二、一手实测编程难题,直出复杂项目管理平台
我们提前体验了一波Agnes 2.5 Flash和Agnes 2.5 Pro Alpha。
先说
Agnes 2.5 Flash
日常编程、Agent和高频开发任务
和Agnes AI此前的定价策略一脉相承,该模型全面上线后
不限期免费开放
我们用Agnes-2.5 Flash做了一轮测试,输入提示词:搭建一个macOS桌面界面,自带文件管理、浏览器、笔记这类常用基础功能。

可以看看效果。模型生成的界面整体视觉非常贴合原生macOS系统的经典UI风格,顶部菜单栏、桌面常驻图标、底部Dock栏等元素齐全,同时配齐了文件管理器、浏览器、备忘录、日历、相机、音乐、黑屏终端、系统设置这些刚需程序,点击日历还能查看到对应的提醒事项,交互观感很贴近真实系统。
另一道题是让模型生成“一个完整响应式科幻风格个人博客网站”。
整个网站的视觉风格很统一,主标题设计了白色和紫色渐变的字体,科幻感十足。页面布局自上而下是主标题、文章列表、博主个人介绍,文章卡片使用半透明深色背景,主次分明。
接下来是
Agnes 2.5 Pro Alpha
它是全新旗舰文本模型Agnes-2.5 Pro的体验先行版本,支持
100万Token超长上下文窗口
复杂问题理解与推理、长链路任务执行、大型项目协作、复杂代码分析及工程开发
Agnes 2.5 Pro Alpha也是Agnes AI首款付费模型,当前API价格是每百万输入Token 0.45美元(约合软妹币3.05元)、每百万输出Token 0.90美元(约合软妹币6.09元)。用户可以通过Agnes充值后调用API服务;同时,为了降低专业用户的体验门槛,模型上线后,用户登录AgnesCode可以
领取免费积分,体验Pro Alpha模型能力
我们给Agnes 2.5 Pro Alpha出了一个进阶难题:要求它“设计并实现一个企业级多租户SaaS项目管理平台”。
先看登录页,它完整设计了账号、密码、租户标识(Tenant Slug)输入框,精准对应多租户体系的登录鉴权逻辑。

再看后台界面,它采用了左侧导航栏、右侧内容区的企业后台布局,完全匹配项目管理平台的功能结构。组件化拆分、表单、筛选、卡片布局都是成熟企业前端的写法,静态页面的还原质量相当合格。

Agnes-2.5 Pro Alpha作为先行体验版本,已经在复杂平台构建方面展现出应用价值。再加上Flash版本承接用户日常的高频业务调用,一普惠一旗舰的组合升级,正好适配了当下AI应用的规模化落地趋势。
三、周token处理量超8万亿,调用数据印证模型商业化进展
三、周token处理量超8万亿,调用数据印证模型商业化进展
评判一款全模态大模型的技术成熟度,纸面参数和各类权威评测榜单虽然有一定参考价值,但真实线上Token消耗结构才是更硬核的落地检验标准。
依托真实线上业务沉淀的数据,能直观反映用户真实使用偏好与模型实用价值。根据Agnes AI披露的最新数据,其全模态模型的单周Token处理量已经达到
8.16万亿
5.1万亿
3.06万亿

这份Token配比数据释放出的信号很清晰:Agnes全模态模型的
整体调用规模持续走高
多模态占比稳步提升
这也和当下AI产业趋势高度相关。如今头部模型比拼的核心落点,已经转向技术能力能否匹配用户真实需求、收获市场认可,并最终转化为真实调用流量。
根据全球AI模型聚合平台OpenRouter的最新大模型周调用榜单,小米MiMo-V2.5以10.2T tokens位列第一,DeepSeek V4 Flash以6.01T tokens位列第二。对比这两家行业头部玩家的数据,Agnes已经达到8.16万亿的周处理量级,其商业化规模已经跻身全球前列。

模型体验比拼白热化的背后,行业竞争重心也在向下游推理基建转移。SGLang作为支撑万亿级Token流转的核心开源框架,已经成为各大技术团队打磨硬核工程能力的关键。
Agnes团队也在积极参与SGLang开源社区建设,目前已经提交了4项代码贡献,其中3项已正式合并,另有1项已通过维护者审核,正在完成后续测试与合并流程。
结语:模型全方位升级落地,核心是对齐产业真实诉求
结语:模型全方位升级落地,核心是对齐产业真实诉求
头部大模型的能力比拼,已经从文本模型的单一竞赛,转向图像、视频与文本协同运转的一体化全模态体系建设。与此同时,全模态能力只有经过海量线上调用检验、份额稳步提升,才算完成从实验室算法原型向稳定可用产品能力的迭代闭环。
Agnes从模型、调用量到工具的全方位升级,也证明了其模型的感知、理解、生成一体化能力,已经真正匹配了产业的实际需求。