首页 > 教程攻略 > ai资讯 >对话PPIO姚欣:Token工厂的第一客户不再是人,而是Agent

对话PPIO姚欣:Token工厂的第一客户不再是人,而是Agent

来源:互联网 时间:2026-07-21 07:51:07

2026年初,一款名为“OpenClaw”的开源AI智能体突然爆火,让无数开发者和极客第一次真切感受到“AI能自己干活”的震撼——自主规划、多步推理、工具调用,这些能力不再是实验室里的概念。紧接着,各种定制化个人智能体如雨后春笋般涌现,全球AI智能体市场从2024年的51亿美元一路狂奔,预计2030年将冲到471亿美元。但注意,Agent每执行一次多步推理、每完成一次长程任务,背后都需要数以万计的Token来支撑。Token这个智能时代的度量单位,它的生产、优化和调度,一下子被推到了聚光灯下。人们开始追问:Token从哪来?怎么让Token更稳定、更优质?

在最近的一次深度对话中,PPIO联合创始人兼CEO姚欣把今年的变化概括为两个关键词:

“Token会更智能”

“从人用Token到Agent用Token”

。当Token的客户不再是人类,而是Agent时,云服务商需要的不再只是CPU、硬盘和带宽,而是面向Agent工作负载的“Token工厂”——一种更低延迟、更高吞吐、更懂Agent的运行方式。正是在这个行业拐点上,PPIO在WAIC 2026大会上正式发布了全新的

Agentic Cloud

定位,以及

智能模型网关

新品,致力于打造

面向Agent时代的智能Token工厂

。围绕这一定位,PPIO Agentic Cloud构建了两层原生产品体系:智能模型网关与Agent Harness层。

对话PPIO姚欣:Token工厂的第一客户不再是人,而是Agent

01

.

智能Token工厂的两大关键词:让Agent既省钱又变聪明

根据灼识咨询的数据,推理成本虽然每年以

10倍以上

的速度下降,但Agent任务的复杂度也在同步攀升。单次Agent任务消耗的Token数量,从早期的数百个增长到如今的

数万甚至数十万

,综合算下来,成本压力不降反升。另一方面,

单一模型无法覆盖Agent的多样化需求

——Agent既要深度推理,又要快速响应,还要处理多模态信息,而市面上的MaaS平台大多绑定自家模型生态,无法灵活适配。更关键的是,Agent对延迟和稳定性的要求远高于传统AI应用:一次工具调用失败,整个任务链条可能瞬间崩断。

针对这一难点,PPIO在本次WAIC上给出的核心解法是发布

智能模型网关

。姚欣透露,这款新品的核心逻辑是“在提升智能上限的同时,帮用户大幅省钱”。具体来看,首先是

“混合模型”(MoM,Mixture of Models)

机制。在处理高价值、高风险或结果不确定的关键Agent步骤时,网关会触发多模型融合,将问题同时分发给多个擅长此道的专家模型,通过交叉验证生成最终答案。这种“专家会诊”模式可以极大避免因模型“偏科”导致的任务失败和返工。其次是

“智能调度”

成本优化

。网关会根据任务类型进行智能路由:简单问答用轻量模型,复杂推理用强模型,并通过压缩冗余上下文、复用计算结果、设置预算护栏和失败回退机制,确保用最经济的成本完成同样质量的任务。

这种工程化手段带来的效果立竿见影。根据DRACO深度研究基准测试,PPIO通过融合Mimo-V2.5-Pro、Kimi-K2.7和GLM-5.2进行混合推理,可将性能提升至

接近Claude Fable 5

的水平,而成本大幅下降。据综合测算,PPIO智能模型网关能将智能水平

提升20%

,同时将成本

降低50%到60%

。姚欣形象地总结道:“智能模型网关不卖最贵的‘超级模型’,也不卖最便宜的‘乞丐模型’。我们是把模型的智商稳定在头部梯队,同时把价格打到了中低梯队。”此外,PPIO自研的推理加速引擎针对Agent高频工具调用、长上下文推理等场景深度优化,推理性能提升可达10倍。搭配Prompt Cache技术,Token成本最高能省80%。这一技术实力也已获得权威认可——今年,PPIO入选中国信通院首批“企业级Token服务性能攀登基线”,在通用场景下跑出了

TPS≥55个/秒、TTFT≤0.9秒、调用成功率≥99.9%

的硬指标。

02

.

Agent沙箱上线一年增长123倍,Harness为Agent装上手脚和记忆

传统云服务的控制台、API、数据库、计费模式……一切都是围绕“人如何使用云”来构建的。但Agent的工作方式完全不同:它们的任务是毫秒级启动、秒级执行、完成后即刻销毁,整个生命周期可能只有两三分钟。行业正在形成一个新的共识:

Agentic AI Infra的核心不再仅仅是GPU,而是Runtime(运行时)

。Agent需要的是一个理解Agent工作方式的专属运行环境——低延迟启动、隔离安全、自带记忆、天然工具接口。PPIO Agent沙箱正是由此而生的。

PPIO Agent沙箱基于microVM技术,可以实现

毫秒级冷启动(<200ms)

,满足Agent实时响应需求;每个Agent任务均可运行在

独立虚拟机环境

,实现系统级安全隔离,防止跨任务数据泄露与资源竞争;支持上万个沙箱同时创建,每个请求获得独立执行环境;Auto Pause/Resume机制让任务空闲时自动暂停、恢复时秒级唤起,成本较同类产品最高

降低90%以上

。自去年WAIC发布以来,Agent沙箱经历了爆炸式增长。姚欣在采访中提到:“去年我们在WAIC上发布了Agent Sandbox,是国内首发,今年再看Sandbox的增量,增速非常夸张。”这款国内首款兼容E2B接口的Agent沙箱,让开发者无需修改现有代码即可迁移,上线不到一年业务规模

增长超123倍

沙箱解决了“在哪跑”的问题,但生产级Agent还需要“怎么编排、怎么操作、怎么记住”。PPIO正面向长程任务持续演进Harness能力。PPIO Agent Harness

内置Browser Use

让Agent驱动浏览器搜索信息、填写表单、抓取数据;

Computer Use

让Agent操控桌面环境完成GUI自动化;

Code Interpreter

让Agent在沙箱内执行代码做数据分析和文件处理;

MCP Server

通过标准协议接入飞书、数据库、第三方API等外部服务。工具调用叠加多智能体编排、记忆管理等一套工具组合,覆盖Agent从信息获取到执行操作的完整链路。姚欣的观点很清晰:

“当Agent成为Token工厂的第一客户,云平台就不能再用给人类用的工具去服务程序化的Agent。”

基于Harness层,平台预置了

PPClaw、PPHermes

等多款开箱即用的智能体模板,开发者通过控制台一键操作即可完成云端部署,最快10分钟即可上线运行。部署后的Agent支持7×24小时持续托管与定时任务调度,不使用时可一键暂停计费,恢复时秒级唤醒,成本完全可控、可预测。同时,PPIO还提供

面向Agent的AI原生接口

,支持MCP标准协议,Agent可通过自然语言直接调用GPU算力、沙箱环境、模型API、存储网络等全量基础设施能力。平台兼容LangChain、CrewAI、AutoGen等主流Agent框架,现有代码零改造即可接入部署,最大程度降低迁移成本。姚欣认为,在Agent时代,开发范式发生了转变:“从基于程序开发,变成基于Agent开发。以后企业搭建的是数字员工团队。这种模式未来很可能成为替代SaaS的新趋势。”

03

.

PPIO:从“基础设施”到“Agentic Cloud”的进化

智能Token工厂不是凭空出现的。PPIO日均万亿级Token消耗量的背后,是提前数年布局的

分布式算力网络和高密度计算节点

。正如姚欣在采访中所说:“PPIO跟同行的发展路径不一样,我们从八年前就开始打造分布式云的底座。到了2023年之后,这变成了我们做分布式推理的基础;2024年我们又推出了推理加速平台PPInfer;到了2025年,Token工厂服务集成了从底层算力调度到上层推理加速的全栈能力。”

PPIO的爆发式增长数据印证了这一逻辑。2026年6月,PPIO日均Tokens调用量

超1.2万亿

,在中国独立AI云计算服务商中

排名第一

,较2025年同期增长

超8倍

。按2025年及2026年第一季度平均每日Token消耗量计,PPIO同样位居独立AI云计算服务商

榜首

。PPIO的AI云收入自2025年起

增长逾十倍

,公司营收从2023年3.584亿元增至2025年

7.703亿元

。全球注册开发者

超67万名

。客户覆盖泛互联网、社交媒体、电商、教育、汽车、电信、信息科技、智能制造等八大行业,其中包括大部分中国前十大互联网公司及多家“独角兽”初创公司。

还有一个关键数据值得关注:PPIO平均GPU利用率2025年一直

高于75%

,远超行业平均40%到50%。姚欣在采访中揭示了背后的逻辑:“推理是跟着用户的使用习惯走的,大部分人在白天工作用AI,流量高峰就在白天,凌晨是低谷,这就导致很多GPU集群的平均利用率只有40%到50%。而PPIO利用东西半球的时差互补,能在全球24小时内把GPU利用率拉到70%到80%。”PPIO将此增长归因于全球调度网络的

“削峰填谷”能力

。PPIO在欧洲、北美洲、南美洲、东南亚等关键区域部署分布式多集群,覆盖全球6大洲。其利用跨地区时区差异和多样化客户群的交错需求概况,将全球闲置算力动态分配至任何特定时刻的需求高点,确保GPU资源有效部署而非在非高峰时段闲置。这种调度能力直接降低了单位Token的实际成本,成为PPIO“前店后厂”模式得以盈利的底层保障。

04

.

结语:智能Token工厂,Agent时代的基础设施

姚欣在采访中说了一句话,描述了PPIO的愿景:“今天的智能上限不仅存在于模型内部,在模型之外,像Agent工程、模型融合这些方向,同样能大幅提升智能水平。”这意味着,通往AGI的道路不止一条。当行业在卷模型参数、卷训练数据时,PPIO选择在另一条路上深耕:让Token更便宜、让Agent跑得更稳、让云真正服务于AI。

Agent的规模化部署才刚刚开始。从单Agent执行简单任务,到多Agent协同完成复杂工作流,再到数字员工与人类员工的无缝协作……每一次跃升都会对Token的供给能力提出更高要求。智能Token工厂的意义,不只为适配当下需求,更为智能体经济的爆发提前布局底层基建。