Kimi K3开源了,本地部署,先准备好3000万
写大模型本地部署相关的文章,可能这是一个阶段性的告别了。用 Qwen3.6-27B 作为收官之作,也算是某种巧合——比英伟达还会玩,本地部署速度翻了 2.5 倍。不过,真正让行业震动的,是 Kimi 兑现了承诺:K3 权重如约开源,2.8T 参数,全球最大开放权重模型,没有之一。权重文件来到惊人的 1.56 TB。
先说结论:
- K3 权重是 MXFP4 精度,实测 1.56TB(96 个 safetensors 分片),单台 8 卡 H200(1128GB 显存)连权重都装不下,
单节点直接出局
- 最低两台 8×H200 起步,算上网络,,这只是入场券
约 730 万—800 万元
- 官方明确建议 64 卡以上超节点部署,8 台 8×H200 的话,
约 2900 万—3000 万元
- 再考虑 1M 上下文、并发和高可用,这就是一个
几千万级别的 AI 基础设施项目
K3 有多强
K3 整体能力仍然落后于 Claude Fable 5 和 GPT-5.6 Sol 这两个最强闭源模型,但在开源阵营里是断档领先。Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2。Agent 能力:BrowseComp 91.2 分全场第一,JobBench、SpreadsheetBench、AutomationBench 都排在开源第一梯队。
这已经是让闭源模型胆战的实力了。
值得一提的是,Kimi 现在的订阅价格也追平 Claude 和 GPT 了。Kimi 套餐价格分别是 49 元、99 元、199 元、699 元每月;ChatGPT 定价分别是 8 美元、20 美元、100 美元(Pro 5x)、200 美元(Pro 20x)。感觉 Kimi 是照着闭源旗舰模型定价直接乘汇率来的。缺点也很明显:消耗速度太快,即便 199 的套餐,也很难撑得住。
模型尺寸
2.8T 参数的大模型,模型文件只有 1.56TB,这是因为 K3 从 SFT 阶段就开始做量化感知训练(QAT),权重原生就是 MXFP4、激活 MXFP8。MXFP4 是 4 bit 权重加块级缩放因子,折算下来每参数约 4.25 bit,也就是约 0.53 字节,估算一下:
2.8T 参数 × 0.53 字节 ≈ 1.5TB
注意,这个 1.56TB 已经是“压缩后”的状态了,别指望像 GLM-5.2 那样“换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化。
前文提到过本地部署 GLM-5.2 的成本:743B 的 GLM-5.2 原版模型私有化部署,
350 万元只是入场券
占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留。参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:
1.56TB × 1.18 ≈ 1.84TB
好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现。
坏消息是,这个显存需求,单机时代结束了。
多机推理做张量并行和专家并行,卡数按 2 的幂次方规划最省心(16、32、64),这也是主流推理框架分片的舒适区。
方案一:两台 16 卡,约 730 万—800 万元(入场券)
16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档。多机就绕不开高速网络,200G 起步的 RDMA 交换机、光模块、线缆:
| 项目 | 预算 |
|---|---|
| 两台 8×H200 服务器 | 约 700 万元 |
| 高速网络及线缆 | 约 30 万—100 万元 |
| 合计 | 约 730 万—800 万元 |
方案二:四台 32 卡,约 1450 万—1550 万元(舒适档)
4512GB 显存,权重之外还有约 3TB 余量,长上下文和像样的并发才开始成为可能。
方案三:八台 64 卡,约 2900 万—3000 万元(官方推荐姿势)
官方技术博客原话:推理效率受益于更大的高带宽通信域,
建议在 64 卡以上的超节点配置上部署 K3
| 项目 | 预算 |
|---|---|
| 八台 8×H200 服务器 | 约 2800 万元 |
| 高速网络及线缆 | 约 100 万—200 万元 |
| 合计 | 约 2900 万—3000 万元 |
到这个规模,机房也要跟着升级:单台整机功耗约 10.2kW,八台就是 80kW+,高密机柜、PDU、供电改造、散热全都要动,不过相比整机采购这都是小钱了。
最后
前面提到长鑫科技,刚刷到一个视频讲长鑫与合肥的故事,有点感触。多说两句:当年内存被三星、海力士、美光三家攥在手里,说涨价就涨价,说断供就断供,国内厂商连上牌桌的资格都没有。合肥掏出真金白银陪长鑫蹲了快十年冷板凳,从流片失败到良率爬坡,没人看好,直到今天——内存涨价周期里,长鑫成了那个别人绕不开的名字。
这个剧本,正在大模型行业重演。看看现在用 Claude 的姿势有多拧巴:一边被 Anthropic 封号,一边在群里骂它霸道,骂完转头又找渠道求着续上——被人拿捏成这样,气不气?气,但没办法,谁让人家模型确实强。
长鑫的故事讲的没什么玄妙的道理,被卡脖子的行业,出路只有一条:自己造出来,而且造得足够好。GLM-5.2、Kimi K3 们正在走这条路,差距还有,但方向已经很清楚了:闭源模型的每一次封号、每一次涨价、每一次区域限制,都是在给国产开源模型送用户。
内存我们熬了十年,大模型不用等那么久。到那天,封号就封吧,随便封。