打败Fable 5!Kimi K3冲上第一,杨植麟导师很骄傲
智东西7月17日报道,Kimi终于放出了大招——正式发布了他们迄今为止能力最强、也是全球首个开源的3万亿参数级别模型Kimi K3。这个模型的参数量达到了2.8万亿,原生支持视觉理解,并且拥有100万token的上下文窗口。算下来,这确实是一个里程碑式的产品。
Kimi K3一上线,立刻就成了大模型圈的顶流。不少网友把它称作“中国的Fable 5时刻”。就连Kimi创始人兼CEO杨植麟的博士生导师、CMU的机器学习泰斗Russ Salakhutdinov,也专门发帖盛赞新版Kimi给开源社区带来了重大突破。

不仅如此,云平台Vercel的创始人、Next.js的作者Guillermo Rauch,公布了一个专业网页工程AI评测结果,Kimi K3的综合表现位列第一。他发帖说,这是首次有开源模型在这个权威榜单上超越全部海外闭源模型;代码任务成功率达到92%,开发效率甚至优于同梯队中的Claude Fable 5。

测评博主aditya实测后,觉得Kimi K3就像中国开源了Claude Fable 5类型的模型。他用Kimi K3生成了一款枪战游戏,并表示从未见过AI仅凭一个提示就能生成如此惊喜的界面。

另一位AI头部测评博主Taelin也体验了Kimi K3。他认为在某些题目上,Kimi K3的表现确实超过了Claude Fable 5,但有些题目表现却很差,而且花费的时间是Claude Fable 5的10倍。不过,他坦言,用Claude Sonnet 5的价格就能买到接近Claude Fable 5的开源模型,这个事实确实改变了他的看法。

从技术博客来看,Kimi K3的长程Agent式执行能力大幅提升。这个模型可以把编程、视觉理解、工具调用和知识工作串成一个完整流程。以官方展示的ASIC行业42年研究网站为例,Kimi K3通过120多轮迭代,完成了2800多次网页搜索与抓取、1100多次终端数据提取,处理了87份季度报告和99份原始PDF,最终生成了一份包含定制图表、动画示意图和交互式可视化叙事的研究报告。这已经不是简单的问答,而是完整的工作流交付了。

在基准测试方面,Kimi K3在大模型评测竞技场Arena.AI的前端代码测试中,超越了Claude Fable 5;在第三方独立测评机构Vals AI中,综合测试得分为74.7,位列第2,超越了GPT-5.6,仅次于Claude Fable 5。

Kimi K3上线前,在海外曾以“Kivine”为代号,被不少网友注意到。开源生态基金会Super Gemma的创始人Jun Song评价称,从生成的结果来看,“Kimi明显比Opus强”,并且认为Kimi K3已经达到了Opus 5的水平。

在架构和基础设施上,Kimi K3通过KDA、AttnRes等架构升级,以及更高稀疏性的MoE设计,提高了长序列信息处理和模型扩展效率。相比Kimi K2,整体扩展效率提升了约2.5倍。
价格方面,Kimi维持了分级计费模式,但相比Kimi K2.6,价格有明显上涨。具体来看,Kimi K3每百万token的输入价格为20元(缓存未命中),较Kimi K2.6的6.5元上涨了约207.69%;缓存命中情况下的输入价格为2元,较之前的1.1元也有所提升;而输出价格则从27元上调至100元,涨幅约270.37%。在窗口容量上,Kimi K3提供了1,048,576 token的上下文窗口支持。

不过,相比顶级闭源模型,Kimi K3仍然保持着较低的价格。以Claude Fable 5为例,其API输入和输出价格分别为每百万token 10美元(约合软妹币67.78元)和50美元(约合软妹币338.88元),明显高于Kimi K3。
Kimi K3现已上线kimi.com、最新版Kimi应用、Kimi API和Kimi Code编程助手,所有用户可以在免费额度内体验,额度用完后需付费使用。Kimi称,Kimi K3的完整模型权重将于7月27日前发布。智东西也在Kimi K3 Max模式下进行了多模态创意的实测。由于Kimi K3受到广泛关注,使用人数不断增多,智东西在进行第2个实测时被告知暂时无法使用,可见热度之高。

01. 实测对标Claude Fable 5,Kimi K3展示多模态创意理解
01. 实测对标Claude Fable 5,Kimi K3展示多模态创意理解
智东西在Kimi K3 Max模式下测试了该模型的多模态与代码生成能力。我们对Kimi K3下达的任务是要求其制作一个3D横版的格斗游戏。
提示词:制作一个单文件HTML的3D横版格斗游戏,场景为被霸天虎入侵的破败城市地图,敌人为类人型赛博坦机器人,包含武器后坐力效果,采用低多边形风格并带有卡通美学。游戏开始时,玩家位于街道上,周围有建筑废墟;游戏中应包含可被击倒的细节物品,如汽车、树木、石块/瓦砾和自动售货机。玩家可以选择5种擎天柱阵营角色进行游戏,并与5种霸天虎变种敌人战斗,这些敌人会不断生成,游戏为无限时间的沙盒模式。


从实测结果来看,Kimi K3仅用一次就完成了该游戏的创建,并且没有出现错误。在游戏逻辑与元素还原上,Kimi K3相较于之前的Kimi K2.6(下图)都有较强的提升,主要表现在对提示词的理解没有像Kimi K2.6那样出现让玩家上下移动的情况。其次,在画面的精细程度上,生成的人物更加接近提示词要求,废墟等环境都有出现。此外,在没有提示的情况下,该游戏还为玩家提供了射击和击打2种攻击模式。

AI领域记者Chetaslua对Kimi K3和GPT-5.6 Sol在3D内容生成方面进行了对比。他称,两款模型的差异不仅体现在输出效果上,也体现在任务完成方式上。即便最终产出较为接近,二者采用的实现路径仍存在明显差异,他认为Kimi K3在创意生成方面表现更突出。

海外网友之前用Kimi K3生成了一个“达芬奇工坊”(Officina di Leonardo)模拟器,主题是达芬奇设计的扑翼机(Ornithopter)。Kimi K3不仅复现了文艺复兴工坊的视觉风格,还理解了达芬奇扑翼机的历史背景和工程细节,将材料、结构与空气动力学知识融入生成结果。这说明该模型具备跨领域知识整合能力。

测评博主aditya在3D游戏生成任务中,将Kimi K3与GPT-5.6-Sol、Claude Fable 5、Grok 4.5同台比拼,发现它们的性能不相上下,但Kimi K3单次调用成本仅0.71美元(约合软妹币4.81元),远低于GPT、Claude;更突出的是它能解决其他模型察觉不到的隐性问题。他认为,开源大模型赶超顶尖闭源产品的速度,远超行业预期。


开发者LASCHUK也实测对比了Kimi K3与Claude Fable 5,提示词都是复刻苹果官网、无额外辅助。两款模型都能完成页面开发,但Kimi K3单次花费仅0.44美元(约合软妹币2.98元),成本只有Claude Fable 5 0.94美元(约合软妹币6.37元)的一半;按百万token计价,Claude Fable 5定价远高于市面绝大多数模型,Kimi K3定价仅其三分之一。LASCHUK由此质疑高价闭源模型的溢价价值。

02. 从代码开发到知识创作,Kimi K3展现复杂任务执行能力
02. 从代码开发到知识创作,Kimi K3展现复杂任务执行能力
在编程领域,Kimi K3不仅能够理解大型代码库、调用终端工具,持续完成长时间的软件开发任务,还能参与GPU内核优化、编译器开发、芯片设计等高复杂度工程工作,并结合视觉理解能力完成游戏开发、前端设计等多模态编程任务。
首先,Kimi K3具备构建完整工程系统的能力。Kimi展示了该模型从零开始构建GPU编程系统的案例。它开发了类似Triton的编译器MiniTriton,该编译器可以将开发者编写的程序转换为GPU能够执行的代码,并完成优化和运行,在部分场景下性能达到甚至超过现有工具。

其次,Kimi K3还融合了3D推理、编程与视觉能力。它能将概念、图像和视频转化为完全可玩的交互体验。比如,Kimi K3生成的3D动画游戏场景,里面是下雨天的森林,还包含湖泊,雨滴和马匹以及人物等元素。

Kimi K3还能设计芯片。Kimi称,在连续48小时的自主Agent运行中,Kimi K3基于开源EDA工具和Nangate 45nm工艺库,独立完成了芯片的构建、优化与验证。

此外,Kimi K3还能将科学文献中的方法转化为可执行代码,完成从论文理解、代码实现到实验分析的完整科研计算流程。

在知识生成领域,Kimi K3能够自主搜集和分析大量资料,整合文献、数据与工具,完成产业研究、科研分析、报告生成和可视化创作等任务。
下图是Kimi K3生成的一份咨询风格的行业报告,这份报告包含交互式可视化图表。图表中包括时间线、漏斗、甘特图等。

这是Kimi K3对GWTC-5引力波的分析报告,它使用20多个并发subagents分析了391个引力波事件,生成了7张科学可视化图、2张表格,并综合了10多篇论文的文献内容。

此外,Kimi K3还可以将技术概念转化为动画图示和转场。在这个案例中,Kimi K3制作了一支介绍自己架构的「3Blue1Brown」风格动态图形讲解视频。

Kimi K3还能自己剪辑视频。Kimi官方展示了该模型依托56段原始素材自主生成品牌宣传视频,独立完成素材筛选、画面动作匹配剪辑、卡点、音频以及多轮迭代修改工作,较人工快上数天。

值得注意的是,Kimi K3还进一步增强了模型交互的可视化和持续管理能力。基于Kimi K3,Kimi Work推出了“小组件”和“看板”功能。其中,小组件支持在对话中生成可交互内容,并连接本地数据或外部插件实现动态更新;看板则能够集中管理多个小组件,形成围绕项目、主题或目标的长期工作空间。

03. 多维评测验证,编程、Agent与视觉能力全面提升
03. 多维评测验证,编程、Agent与视觉能力全面提升
在官方公布的评测结果中,Kimi K3在编程、Agent任务和视觉理解等多个方向展现出较强能力。
在编程能力方面,Kimi K3在超长时序持续开发SWE Marathon、软件逆向Program Bench、终端运维Terminal Bench 2.1等测试中表现突出。其中,SWE Marathon、Program Bench均取得第一,Terminal Bench 2.1达到88.3分,与GPT-5.6 Sol接近;在高难度软件工程任务FrontierSWE中,Kimi K3以81.2分位列第二,仅次于Claude Fable 5。

在Agent和知识工作场景中,Kimi K3同样展现出较强的任务执行能力。在网页深度调研BrowseComp、办公自动化Automation Bench、Excel财务建模SpreadsheetBench 2等测试中取得领先,其中BrowseComp达到91.2分,Automation Bench和SpreadsheetBench 2均排名第一。不过,在综合白领任务GDPval-AA v2、APEX-Agents等更贴近真实办公流程的评测中,Kimi K3仍弱于Claude Fable 5等顶级闭源模型。

在视觉能力方面,Kimi K3在图表理解CharXiv、文档分析OmniDocBench等任务中表现较强,其中OmniDocBench达到91.1分,超过参与对比的多款模型;但在部分视觉推理任务中,Kimi K3仍存在差距,例如零样本视觉工具任务Zerobench低于Claude Fable 5。

Kimi内部也测试了Kimi K3的工程能力。在GPU内核优化测试中,Kimi K3需自主完成代码分析、内核重写和性能验证,覆盖AttnRes、KDA、MLA等GPU计算任务。结果显示,在最高推理强度下,Kimi K3表现接近Claude Fable 5(含回退机制),并超过Claude Opus 4.8、GPT-5.6 Sol和GPT-5.5。

在知识工作方面,Kimi内部Internal Knowledge Work Bench测试显示,在统一开启最高深度思考模式后,Kimi K3在通用推理、深度文档分析和金融专项三类任务中的表现均超过GPT-5.5和Claude Opus 4.8。

04. 两大架构升级支撑3T级模型,推理成本仍可控
04. 两大架构升级支撑3T级模型,推理成本仍可控
据官方博客介绍,从去年7月到现在,中间有9个月,Kimi模型始终保持着开源模型的规模上限,参数量一直在1万亿以上,而今天推出的Kimi K3是首个参数量达到2.8万亿的开源模型。

Kimi K3的构建主要基于2项架构更新:Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)。更新之后的架构可让信息在更长序列和更深模型中流动得更顺畅。同时,Kimi K3进一步扩大了Mixture of Experts(MoE)的稀疏度:结合Stable LatentMoE框架后,该模型可以在896个专家中高效激活16个。

Kimi称,再加上训练方法和数据配方的优化,这些结构性改进让Kimi K3相比Kimi K2的整体扩展效率提升约2.5倍,能更有效地把算力转化为能力。
在训练与部署上,该模型从SFT阶段开始采用量化感知训练,使用MXFP4权重和MXFP8激活,并通过平衡专家并行训练提升吞吐。针对长上下文推理,Kimi团队还向vLLM社区贡献了KDA相关实现,使Kimi K3在2.8万亿参数和百万token上下文条件下仍能控制推理成本。
在安全性和可靠性方面,Kimi称目前Kimi K3仍存在一些使用限制。一是由于Kimi K3是在保留思维历史的模式下训练的,如果Agent框架没有正确返回完整历史内容,或用户在会话中从其他模型切换到K3,生成质量可能变得不稳定。二是Kimi K3针对长期复杂任务进行了强化训练,在用户意图不明确时可能表现得过于主动,因此官方建议在系统提示词或AGENTS.md中设置更明确的行为边界。
Kimi也承认,Kimi K3虽然具备较强竞争力,但用户体验相比Claude Fable 5、GPT 5.6 Sol等顶级闭源模型仍存在差距。
05. 结语:Kimi K3拉开超大开源模型序幕,搞定复杂工作完整交付
05. 结语:Kimi K3拉开超大开源模型序幕,搞定复杂工作完整交付
Kimi K3的发布,进一步推动开源模型向超大规模迈进。但相比参数规模的提升,Kimi K3更值得关注的是其在长程任务执行上的探索。从长时间代码开发、GPU工程优化,到产业研究、科研分析和多模态创作,Kimi K3展示了大模型从内容生成向复杂任务执行和完整工作流交付的延伸。
不过,随着模型规模持续扩大,如何进一步提升推理效率、降低使用成本,并缩小与顶级闭源模型在实际体验上的差距,仍是开源模型后续发展需要解决的问题。
-
- 网名带郑和霍字的网名女有哪些
- 角色扮演 | 1
- 网名