首页 > 教程攻略 > ai资讯 >Kimi K3开源了,本地部署,先准备好3000万

Kimi K3开源了,本地部署,先准备好3000万

来源:互联网 时间:2026-07-28 13:39:20

写大模型本地部署相关的文章,可能这是一个阶段性的告别了。用 Qwen3.6-27B 作为收官之作,也算是某种巧合——比英伟达还会玩,本地部署速度翻了 2.5 倍。不过,真正让行业震动的,是 Kimi 兑现了承诺:K3 权重如约开源,2.8T 参数,全球最大开放权重模型,没有之一。权重文件来到惊人的 1.56 TB。

先说结论:

  • K3 权重是 MXFP4 精度,实测 1.56TB(96 个 safetensors 分片),单台 8 卡 H200(1128GB 显存)连权重都装不下,

    单节点直接出局

  • 最低两台 8×H200 起步,算上网络,

    约 730 万—800 万元

    ,这只是入场券
  • 官方明确建议 64 卡以上超节点部署,8 台 8×H200 的话,

    约 2900 万—3000 万元

  • 再考虑 1M 上下文、并发和高可用,这就是一个

    几千万级别的 AI 基础设施项目

K3 有多强

K3 整体能力仍然落后于 Claude Fable 5 和 GPT-5.6 Sol 这两个最强闭源模型,但在开源阵营里是断档领先。Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2。Agent 能力:BrowseComp 91.2 分全场第一,JobBench、SpreadsheetBench、AutomationBench 都排在开源第一梯队。

这已经是让闭源模型胆战的实力了。

值得一提的是,Kimi 现在的订阅价格也追平 Claude 和 GPT 了。Kimi 套餐价格分别是 49 元、99 元、199 元、699 元每月;ChatGPT 定价分别是 8 美元、20 美元、100 美元(Pro 5x)、200 美元(Pro 20x)。感觉 Kimi 是照着闭源旗舰模型定价直接乘汇率来的。缺点也很明显:消耗速度太快,即便 199 的套餐,也很难撑得住。

模型尺寸

2.8T 参数的大模型,模型文件只有 1.56TB,这是因为 K3 从 SFT 阶段就开始做量化感知训练(QAT),权重原生就是 MXFP4、激活 MXFP8。MXFP4 是 4 bit 权重加块级缩放因子,折算下来每参数约 4.25 bit,也就是约 0.53 字节,估算一下:

2.8T 参数 × 0.53 字节 ≈ 1.5TB

注意,这个 1.56TB 已经是“压缩后”的状态了,别指望像 GLM-5.2 那样“换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化。

前文提到过本地部署 GLM-5.2 的成本:743B 的 GLM-5.2 原版模型私有化部署,

350 万元只是入场券

。那 2.8T 的 K3 本地部署要花多少钱呢?

占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留。参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:

1.56TB × 1.18 ≈ 1.84TB

好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现。

坏消息是,这个显存需求,单机时代结束了。

一台完整的 8×H200 SXM 服务器,今年内存硬盘大涨价,350 万元起步。看看长鑫科技这涨幅,这市值,未来内存依然是金子……

多机推理做张量并行和专家并行,卡数按 2 的幂次方规划最省心(16、32、64),这也是主流推理框架分片的舒适区。

Kimi K3 本地部署三档方案对比

方案一:两台 16 卡,约 730 万—800 万元(入场券)

16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档。多机就绕不开高速网络,200G 起步的 RDMA 交换机、光模块、线缆:

项目预算
两台 8×H200 服务器约 700 万元
高速网络及线缆约 30 万—100 万元
合计

约 730 万—800 万元

方案二:四台 32 卡,约 1450 万—1550 万元(舒适档)

4512GB 显存,权重之外还有约 3TB 余量,长上下文和像样的并发才开始成为可能。

方案三:八台 64 卡,约 2900 万—3000 万元(官方推荐姿势)

官方技术博客原话:推理效率受益于更大的高带宽通信域,

建议在 64 卡以上的超节点配置上部署 K3

项目预算
八台 8×H200 服务器约 2800 万元
高速网络及线缆约 100 万—200 万元
合计

约 2900 万—3000 万元

到这个规模,机房也要跟着升级:单台整机功耗约 10.2kW,八台就是 80kW+,高密机柜、PDU、供电改造、散热全都要动,不过相比整机采购这都是小钱了。

最后

前面提到长鑫科技,刚刷到一个视频讲长鑫与合肥的故事,有点感触。多说两句:当年内存被三星、海力士、美光三家攥在手里,说涨价就涨价,说断供就断供,国内厂商连上牌桌的资格都没有。合肥掏出真金白银陪长鑫蹲了快十年冷板凳,从流片失败到良率爬坡,没人看好,直到今天——内存涨价周期里,长鑫成了那个别人绕不开的名字。

这个剧本,正在大模型行业重演。看看现在用 Claude 的姿势有多拧巴:一边被 Anthropic 封号,一边在群里骂它霸道,骂完转头又找渠道求着续上——被人拿捏成这样,气不气?气,但没办法,谁让人家模型确实强。

长鑫的故事讲的没什么玄妙的道理,被卡脖子的行业,出路只有一条:自己造出来,而且造得足够好。GLM-5.2、Kimi K3 们正在走这条路,差距还有,但方向已经很清楚了:闭源模型的每一次封号、每一次涨价、每一次区域限制,都是在给国产开源模型送用户。

内存我们熬了十年,大模型不用等那么久。到那天,封号就封吧,随便封。

相关下载