首页 > 教程攻略 > ai资讯 >一文读懂Kimi K3 预训练|3T模型,不再是魔法

一文读懂Kimi K3 预训练|3T模型,不再是魔法

来源:互联网 时间:2026-08-03 08:00:58

Kimi发布K3模型:总参数量2.78万亿,激活参数约1042亿,支持100万Token上下文

7月,中国大模型领域接连出现两款总参数超过2万亿的模型。Kimi率先发布K3,总参数量2.78万亿,每个Token激活约1042亿参数,拥有896个路由专家,支持最长100万Token上下文。随后,阿里预览了总参数量2.4万亿的Qwen3.8-Max。两个2T以上模型在短时间内先后出现,表明训练3T级模型已有具体、可复用的方法。

Kimi公布的K3技术报告详细披露了训练一个3T级模型的关键技术路径。K3是MoE(混合专家)模型,每读入一个Token不调用全部2.78T参数,而是激活约16个专家,约计104.2B参数。2.78T参数按BF16保存一份权重需要约5.56TB,理论上只需70多张80GB GPU即可存放,上千张GPU即可训练。

核心技术:KDA注意力机制解决算得动

K3将上下文从128K扩展到1M,网络层数从61层加深到93层。如果93层全部沿用MLA(多查询注意力),序列长度增加约八倍后计算量无法承受。K3采用Kimi Linear架构,核心是KDA(Kimi Delta Attention)注意力机制。KDA将全注意力中存储所有历史信息的NxN矩阵压缩成固定大小的状态向量,计算量从O(N²)降到O(N),内存恒定。KDA在注意力头中引入通道级细粒度门控,允许不同状态通道以不同速度衰减,并采用增量纠错规则(Delta Rule)提高记忆准确性。K3使用3:1混合结构:连续三层KDA后插入一层MLA,共69层KDA和24层MLA,模型末尾用MLA收尾。MLA负责定期重新查看全部历史Token,弥补线性注意力难以精确找回原文细节的问题。

通信优化:LatentMoE与Quantile Balancing解决传得了

K3每Token激活专家从8个增加到16个,专家并行成为通信主要难题。K3采用NVIDIA提出的LatentMoE技术,将需要分给专家的参数压缩一倍:Token从7168维压缩到3584维潜在空间,路由专家只处理半宽表示,结果汇总后再投影回7168维。经过压缩后,K3每层16个专家×3584维=57,344,与K2的8个专家×7168维=57,344完全一致,通信量未随专家数量增加而增加。

针对专家负载不均衡问题,K3提出Quantile Balancing(分位数负载均衡)方法。它查看当前全局Batch中的路由分数分布,计算每个专家应设置的录取线,一次性整体调节,使长期负载靠近目标水平,避免辅助损失干扰模型主目标。

系统层优化:MoonEP与负载感知调度器解决算得满

K3在系统层面实现MoonEP,在Quantile Balancing的路由形成之后,读取当前Micro-batch的真实分配情况,发现某些GPU上专家过热时,在其他GPU上临时复制这些专家,将部分Token分流给副本,保证每个专家并行设备收到完全相同数量的Token。MoonEP使用零额外复制通信,数据直接落到目标位置。

K3还增加Workload-aware Scheduler(负载感知的专家计算调度器),在计算开始前读取各专家收到的Token数,根据硬件成本模型调整任务安排,缩短计算单元空等时间。此外,K3为KDA编写了FlashKDA专用Kernel,将大部分可并行的准备工作从依赖链中拆出,只把最后的记忆交接留在顺序流程中,提高GPU利用率。

训练效率:AttnRes与稳定性配方实现学得快

K3报告称,新架构、数据和训练配方共同带来约2.5倍整体Scaling Efficiency(规模扩展效率)。即达到同样验证Loss,K3家族所需总计算量约为K2路线的0.4倍。其中,KDA-MLA混合结构带来约1.16倍计算最优效率,AttnRes带来约1.25倍Scaling Efficiency。

AttnRes(Attention Residuals)是K3采用的层间注意力残差机制,解决深层网络中残差连接使历史信号不断累积、新层变化微弱的问题。AttnRes允许当前层根据当前状态生成查询,通过注意力计算从历史层中直接选择需要的表示,而非仅靠固定加法。K3将93层组织成约8个Block,每个Block约12层,既保留深度检索能力,又控制计算量。

K3还引入多项稳定性措施:专家汇总后加入RMSNorm,用SiTU-GLU替换SwiGLU(平滑双曲正切上限压住极端值),KDA设置衰减下限(单步保留率最低约0.67%),以及按注意力头分别执行Muon更新(Per-Head Muon)。这些措施确保训练数周过程中不会因极端激活导致昂贵损失。

业务背景与市场影响

Kimi没有披露K3主预训练使用的GPU数量、型号、训练Token总量和GPU小时,但资源区间应与DeepSeek相似。K3的出现表明,中国实验室在有限算力条件下,通过架构创新和工程优化,同样有能力训练3T级前沿模型。K3的技术路径与DeepSeek-V3、V4存在大量重叠:MoE扩大总参数并控制激活成本,线性/稀疏注意力降低长上下文成本,低精度训练减少显存通信压力,以及专家负载均衡、通信计算重叠和专用Kernel提高GPU利用率。

后续安排与限制

Kimi已发布K3技术报告,但模型正式上线时间和API开放计划尚未公布。K3技术报告中提到的量化训练、推理优化和大规模部署方案仍有待验证。模型目前处于技术报告阶段,产品化进度将取决于后续工程和生态建设。

本文信息基于原始资料记录时的状态,模型版本、产品功能、价格、企业合作和政策可能继续变化,实际情况以相关主体最新公开信息为准。

相关下载