小米发布AI模型极速版,文本生成速度突破每秒1000个token
来源:互联网
时间:2026-08-04 21:14:39
对于AI开发者而言,模型推理速度一直是影响应用落地和用户体验的关键瓶颈。近日,一项技术突破将文本生成速度推向了新的高度,这将对AI应用生态产生哪些直接影响?

小米联合TileRT正式推出了MiMo-V2.5-Pro-UltraSpeed版本,实现了行业里程碑式的突破。该版本基于万亿参数大模型,在单台标准8卡通用GPU节点上,
首次将文本生成速度提升至1000 tokens/s,峰值甚至可达1200 tokens/s
限时API服务与试用规则
为了推动技术应用,该版本同步上线了限时API服务。其定价为原版MiMo-V2.5-Pro的3倍,但生成速度提升了约10倍,性价比优势显著。由于高速推理资源有限,服务采用申请制限时开放,试用周期为北京时间6月9日至6月23日23:59。平台将优先审核有实际业务需求的企业与专业开发者。
普通用户则可通过专属网页免费体验对话功能,但设有资源公平分配机制:单账号每日排队上限为10次,单次会话最长30分钟,若闲置超过5分钟将自动断开连接。
支撑性能飞跃的三大核心技术
此次性能的飞跃并非单一优化,而是依托模型与系统的深度协同设计,其核心包含三大技术创新。
首先是
FP4量化技术
其次是DFlash区块并行推测解码技术。它摒弃了传统的串行解码模式,单次可预测一整段文本区块。在代码生成、数理推理等特定场景下,平均单轮可确认6-7个token,从而大幅提升了解码效率。
最后是依靠TileRT推理系统重构了GPU执行架构。该系统采用持久化内核与异构流水线设计,消除了算子切换带来的延迟,使得硬件算力能够持续满负荷运转,最大化硬件性能。
极速推理将重塑哪些应用场景
极速推理能力的突破,正在重塑AI的应用边界。超高速度使得模型能够进行并行推演和自主纠错,从而提升逻辑推理的质量与可靠性。在编程领域,它大幅缓解了代码生成时的等待卡顿,有望释放编程智能体的生产力。
更重要的是,