国产 GPU 也能跑万亿大模型:海光 DCU 适配 Kimi K3,896 专家并行不卡顿
来源:互联网
时间:2026-07-29 16:18:11
国产算力终于跑通了一个里程碑——万亿参数级别的大模型,不再是海外旗舰芯片的专属领地。
海光信息正式宣布,Kimi K3 已在海光 DCU 平台上完成全栈适配与性能验证。换句话说,开发者拿到的算力,现在可以直接上手部署,不需要再为模型迁移伤脑筋。
具体来说,海光 DCU 从底层的算子优化到推理引擎,做了一整套适配工作,Kimi K3 的模型代码无需任何改动就能直接跑起来。迁移成本几乎压到零,兼容性相当从容。
针对 K3 的 KDA 注意力和 896 个专家组成的 MoE 架构,海光做了算子级的定制打磨。在百万级上下文的重载场景下,896 个专家同时并行,推理依然高效稳定,卡顿问题被有效控制——这才是真正的硬核能力。

落到具体场景上,K3 在海光 DCU 上能支撑起长程智能体工程、视觉闭环创作,甚至自主芯片设计这类前沿玩法。国产算力用户终于有机会亲手跑通万亿级的开源模型,不再只是“看看”的壁纸。
值得关注的是,月之暗面在发布 K3 之前,就已经联合海光与中科曙光完成了完整的兼容性调优。曙光基于海光 DCU 硬件栈,打通了 Kimi MoE 架构的分布式训练与多卡并行推理链路;海光 DCU 则靠底层硬件与软件栈的协同优化,在曙光8000集群上让长文本推理稳稳运行。整个链条,可以说是一气呵成。
官方实测数据也给出了一个硬指标:国产卡的性能折损控制在12%以内,这已经达到了商用部署的门槛。当万亿模型与国产 GPU 之间的那道墙被推开一道缝,智能时代的算力版图,正在悄悄挪动。