小米大模型推理速度突破每秒千词元,官方详解技术实现与性能对比
来源:互联网
时间:2026-08-02 20:11:14
近日,小米正式上线了一项名为Xiaomi MiMo-V2.5-Pro-UltraSpeed的新模式,其核心亮点在于实现了全球首个在通用GPU上突破每秒1000词元的万亿参数模型推理速度。这一速度指标对于普通用户而言可能较为抽象,小米官方随后发布科普文章,详细解释了其含义与技术实现路径。

在大型语言模型中,词元是基本的计量单位,类似于日常生活中的“斤”或“两”。每秒1000词元,即1000 TPS,意味着模型每秒能够生成1000个词元。粗略换算,这大约相当于每秒生成750个英文单词或上千个汉字。为了更直观地理解这一速度,官方将其与常见场景进行了对比。
性能对比:远超常规与顶尖水平
普通大模型的输出速度通常在每秒50到130个词元之间,这个速度接近人类正常朗读的语速。而国内一些顶尖大模型的输出速度可以达到每秒400个词元左右,这已经类似于快速播报新闻的语速。小米此次推出的UltraSpeed模式,将输出速度提升至
每秒1000个词元
核心技术:量化、解码与推理系统协同
实现如此高速的推理,背后是多项关键技术的协同作用。首先,小米采用了FP4量化技术。这项技术并非对整个模型进行均匀压缩,而是
只对精度最不敏感的MoE专家模块进行压缩
其次,DFlash投机解码技术也起到了关键作用。该技术让小模型并行“抢答”一整块词元,然后交由大模型进行无损验证。如果小模型“猜对”了,结果就被采纳;如果“猜错”,则会被打回重来。最终输出的结果与原模型完全一致,但验证方式从“逐字确认”转变为“整块确认”,从而大幅提升了整体生成效率。
此外,TileRT推理系统通过常驻内核和异构流水线设计,尽可能消除了微秒级运算中计算步骤之间的启动、等待、数据搬运等空隙。这套系统在不改变最终计算结果的前提下,充分压榨了硬件潜力,确保了推理过程的高效流畅。