Kimi K3正式开源:2.8万亿参数MoE模型开放权重,全球AI产业格局生变
来源:互联网
时间:2026-07-28 13:48:06
凌晨两点,技术圈突然炸开了锅——月之暗面在深夜扔出了Kimi K3模型权重和完整技术报告,顺带还开源了三项核心基础设施技术。这是Kimi有史以来最强的一版模型,也是中国AI开源社区至今规模最大的一次技术开放。
月之暗面在公告里说得挺直白:他们坚信开放权重模型的价值——降低智能获取的门槛,推动创新,而且让用户对数据拥有更大的控制权、隐私保护和所有权。按照Kimi K3许可证的条款,任何人都可以下载并部署这个模型,不管是内部研发还是嵌入到面向终端用户的产品里,全都可以自由使用。模型权重已经在Hugging Face上线,技术报告和全部源代码也已经在GitHub公开。
Kimi K3一开源,全球资本市场立刻给出了反应。华尔街分析师直接动手算了一笔账:OpenAI与Anthropic的合计估值预期因此蒸发约3140亿美元,英伟达单日市值也缩水了1111亿美元。彭博社的评价很直接——“正在搅动全球科技市场”。
开源模型首度站上世界前沿
Kimi K3是一个拥有2.8万亿参数的混合专家(MoE)模型,参数规模大约是此前Kimi K2.5的3倍。它具备原生视觉理解能力,支持100万token的上下文窗口。在Artificial Analysis智能指数上,Kimi K3综合得分位列全球第三,仅次于Claude Fable 5和GPT-5.6 Sol;在Frontend Code Arena编程榜单上,它以1679分登顶,成为首个在该榜单超越所有闭源模型的开源模型。特斯拉CEO马斯克在相关评测下留言说“令人印象深刻”。 月之暗面特别强调了一点:规模化并不是简单的参数堆叠。在算力条件并不宽裕的情况下,团队凭借一系列架构创新实现了规模化效率提升2.5倍——也就是说,单位算力产出的智能相当于原先的2.5倍。支撑这一效率突破的核心技术包括Kimi Delta Attention(KDA)、Attention Residuals以及MoonEP等。技术报告披露训练核心细节
同步发布的技术报告详尽披露了Kimi K3的训练方法,主要包含四大技术板块:
**KDA + AttnRes**:以3:1比例混合KDA与Gated MLA,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动。
**Stable LatentMoE**:每个token从896个路由专家中激活16个,通过SiTU-GLU与Quantile Balancing在极高稀疏度下保持训练稳定。
**MoonViT-V2**:视觉编码器从零开始使用next-token prediction训练,无需对比预训练,在达到SigLIP初始化基线效果的同时获得更稳定的优化过程。
**后训练与评估**:在通用推理、通用Agent和编程Agent三大领域进行大规模任务合成,配备百万token上下文的强化学习基建,并在近20个内部评测集上完成完整评估。