首页 > 教程攻略 > 热点新闻 >万亿参数大模型推理速度突破千tokens每秒,行业迎来新里程碑

万亿参数大模型推理速度突破千tokens每秒,行业迎来新里程碑

来源:互联网 时间:2026-08-02 20:16:17

近日,一项关于大规模语言模型推理速度的突破性进展引发了行业关注。一家科技公司宣布,其最新发布的模型优化模式,在万亿参数级别上实现了每秒输出超过一千个tokens的惊人速度,这标志着大模型在实际应用中的响应效率迈上了一个新台阶。

万亿参数大模型推理速度突破千tokens每秒,行业迎来新里程碑

据悉,此次推出的UltraSpeed模式,旨在通过技术优化显著提升模型的推理性能。官方信息显示,该模式下的API服务定价为标准版本的

三倍

,但承诺提供

约十倍

的输出速度提升。这种以更高成本换取极致性能的模式,主要面向对实时性有极高要求的专业场景和开发者。

限时开放与试用规则

由于高速推理所需的计算资源供给有限,该服务目前采取申请制并限时开放。开放体验窗口期为2026年6月9日至6月23日。通过审核的用户将获得限时免费的对话体验机会。为了在资源受限条件下保障服务质量和公平性,平台设定了明确的试用规则:每个账号每日最多成功发起10次会话请求;单次会话的持续时长上限为30分钟;如果会话处于空闲状态超过5分钟,系统将自动释放占用的计算资源。

对行业应用的潜在影响

此次在万亿参数模型上实现千tokens每秒的输出速度,被视为大模型商业化落地进程中的一个重要技术里程碑。更高的推理速度意味着模型能够更流畅地处理复杂、连续的对话,或在代码生成、内容创作等需要大量连续输出的任务中显著减少等待时间,提升用户体验。这或将推动AI应用在更多对实时反馈要求严格的领域,如智能客服、实时翻译、交互式娱乐等,展开更深层次的探索与实践。