首页 > 教程攻略 > ai资讯 >Kimi,“等芯来”

Kimi,“等芯来”

来源:互联网 时间:2026-07-24 14:32:49

Kimi K3的发布,让大洋彼岸的科技圈陷入了一场集体反思。一个核心问题反复被提起:为什么杨植麟在卡内基梅隆拿到博士学位后,没有选择留在美国创业?

答案或许就藏在K3本身。作为年度最强开源模型,Kimi K3的参数量达到3T级别,在各大基准测试中表现亮眼,部分榜单甚至压过了Fable 5这类美国实验室的前沿模型。更关键的是,它是在算力受限的条件下,通过算法、工程优化和参数扩展,硬生生打破了“Scaling Law撞墙”的论调。这当然引发了一些硅谷巨头的焦虑与恐慌。

OpenAI战略负责人迪恩·W·鲍尔直言:“开源模型会阻碍人工智能领域的进一步资本支出。”

这话背后的逻辑不难理解:大家都在探索AGI。你跑通这条路需要10块钱,而别人用1块钱就做到了。那么,你得解释清楚那多出来的9块钱到底花在了哪里,是否合理。对于年度资本开支高达7000亿美元的硅谷巨头来说,如果答案是“不合理”,那整个产业将面临一轮史无前例的泡沫破裂。

不过,Kimi在“搅局”之后,立刻迎来了自己的第一个硬仗:算力短缺。

01、一封充满算力焦虑的信

7月19日晚间,Kimi发出通知信,暂停新用户接入。这扇门,暂时关上了。

信的内容很直白:热度太高,需求远超预期,存量算力已经逼近极限。为了保障现有用户体验,只能暂停C端新用户订阅,直到新算力到位,再逐步开放名额。

“暂停”增量用户接入,与过去常见的“Token Plan”限售,虽然都是算力紧缺的产物,但性质完全不同。过去算力不够,至少还能通过限售的方式开个口子,保留后续通过API转化重度用户的可能。而直接“暂停”,意味着算力供给上已经没有任何腾挪余地,可见Kimi眼下的算力紧张到了什么程度。

“它自己的算力都没法批量获取,现在这么多用户想用都开不了付费账户,这直接影响商业变&现和用户口碑。”一位资深科技投资人如此评价。

长期关注中国科技产业的上海财经大学教授胡延平则认为,问题的根源在于算力准备不足,而非投资回报率(ROI)没转正。“因为算力约束,接不住这泼天的用户流量,当前比ROI转正更重要的,是先把用户接住。”他强调,如果只盯着“算力/token”看,可能会出现用户token消耗越多、亏损越大的情况。只有从“算力成本效率/token”的角度分析,才能看清算力约束的真实含义。

“类似Kimi这种情况,除了需要更合理的资费和更多的算力卡,更关键的是要有能效比、量效比更高的算力卡和算力集群。”一位接近Kimi的知情人士透露,暂停新会员订阅后,公司上下最重要的事就是找算力。

“我们已经在非常努力地通过模型性能优化和算力供给来解决问题。”Kimi企业业务负责人黄震昕在日前的一次沟通会上说。

就在Kimi四处寻找算力之际,智谱将建设1GW纯国产算力的消息传出,引发了从业者的密集讨论。核心问题在于:智谱从哪里能获得如此天量规模的算力?

以刚刚在2026世界人工智能大会(WAIC)亮相的华&为昇腾Atlas 950超节点为例,仅按64卡机柜、100KW功耗上限来换算,不考虑交换设备,1GW就相当于10000个Atlas 950机柜,也就是640000张NPU。假设单卡价格为20万元,那么整个1GW的订单,仅算力部分就将超过1200亿元。即便考虑国产卡的价格差异,按平均单价10万元算,1GW纯国产算力,也是一笔超过600亿元的算力大单。如果消息属实,对国产算力产业链来说,无疑是一个巨大利好。

02、先找路,再找钱

“从目前披露的信息来看,K3暂未呈现出范式级的全新架构。”期智研究院研究员李彪告诉腾讯科技。

他指出,KDA和AttnRes此前已有论文发表,本次更值得关注的是将这些模块与极稀疏MoE、低精度训练和大规模并行系统进行整合,并扩展到2.8万亿参数。不过,由于K3完整技术报告尚未发布,目前仍难以评估其全部技术增量。

有分析文章指出,KDA让序列计算更便宜,AttnRes让深度信息流更智能,Stable LatentMoE让参数容量更庞大——三者共同构成了Kimi K3的架构骨架。算得更省、流得更顺、装得更多,共同成就了2.8万亿参数的Kimi K3,以及它在开源生态和整个大模型领域的影响力。

“Kimi K3再次说明,size still matters。”李彪强调说。他认为,模型规模仍是提升前沿能力的重要变量,但规模能否有效转化为能力,取决于架构、数据配比、优化方法和基础设施的共同配合。“对于2.8万亿参数的极稀疏MoE模型,当前更显性的工程约束来自功耗、通信开销、专家负载均衡和集群可靠性。从它能够支撑这一规模训练来看,Kimi应该在底层Infra上做了不错的优化。”

另一位学术研究员也认同训练过程中Infra和工程能力的重要性,“大家的思路都大差不差,归根结底变成了软件工程的比拼。”

前述科技投资人则感叹,中国公司又一次在较短时间内,把开源模型推到了接近全球闭源旗舰模型的水平。“这非常厉害。它给我的冲击是,Scaling Law还在继续;而且,当前最前沿的模型训练配方,中国公司也能快速掌握。”

把研究员和投资人的观点综合起来,可以归结为:Kimi通过Infra和工程的手段,找到了一条持续Scaling Law的路。这不仅是Kimi自己的路,也是中国开源模型生态的路。

也正因如此,Kimi K3亮相后不久,2.4万亿参数的Qwen 3.8预览版也宣布上线了。

当可靠的Scaling Law路径被验证之后,剩下的问题就是:钱从哪来?

过去半年,Kimi在一级市场一直是“当红炸子鸡”,融资传闻不断。根据外媒披露的数据,Kimi计划8月启动上市前最后一轮融资谈判,目标估值为500亿美元,这相当于DeepSeek上一轮融资完成后的估值。同期,Kimi也在拆除VIE架构,加速赴港上市流程,冲击继智谱、MiniMax之后在港股上市的“大模型第三股”。

时间倒回到2025年12月31日,彼时杨植麟发内部信确认完成5亿美元的C轮融资。“当前现金持有量超过100亿元。相比于二级市场,我们判断还可以从一级市场募集更大量资金,事实上,我们B/C轮融资金额就超过绝大部分IPO募资及上市公司的定向增发。所以我们短期不着急上市。”杨植麟在内部信中说。

资料显示,Kimi的C轮完成后,投后估值43亿美元。对比外媒报道的最新Pre-IPO轮500亿美元估值,半年涨幅接近12倍。

半年前,杨植麟的判断是“可以从一级市场拿到更多钱”,这个判断后来被验证了。但100亿元的现金,在7个月后、在Kimi K3被迫暂停新用户接入之后来看,显然不够用了。

03、中国芯片的第二场战争

“Kimi K3目前证明的是技术能力达到了前沿,但还没有完全证明推理经济性、产品体验和商业模式同样成立。”前述科技投资人如是说。

根据Artifacial Analysis的“智能指数”评测,Kimi K3在全部9项测试中总共产生了约1.3亿个输出Token,高吞吐量导致跑完整套评测的总账单高达2709.75美元。相比之下,同类参评模型的中位数仅为6300万个。拆分成单一任务,Kimi K3的平均花费为0.94美元,GPT-5.6 Sol为1.04美元,Claude Opus 4.8为1.8美元。

单看定价,Kimi K3的token已经不便宜了。而Kimi方面的解释是:中国开源模型不应该被贴上性价比标签,SOTA模型应该有自己的定价权。

不过,对于用户而言,追逐性价比就是追逐更高的经济性。放在Kimi K3身上,如果Token输出量能压缩一半,成本自然也就压缩一半。这与胡延平教授提出的“量效比”高度一致。他说,如果不考虑量效比,长期竞争会出现问题,“某些时间点会出现token不经济”。

胡延平以英伟达为例,强调在H200上,token的ROI可能是亏的,但升级到B300,可能分分秒秒都是“印钞机”。这其实给国产算力提出了一个新要求:既要保证国产模型的算力供给,也要在硬件层面释放token的经济性。

SemiAnalysis今年5月的报告显示,在MiniMax-M2.5的8K/1K负载下,B200 NVFP4凭借硬件与内核优化,在高吞吐交互下(单用户速度提升至110 tok/s/user),每百万token为0.09美元。作为对比,H100 FP8在统一条件下,每百万token为0.74美元,性能价比提升了超过8倍。

高交互负载下,B200 NVFP4 较 H100 FP8 运行Minimax 2.5成本对比

关于国产算力的进化,今年的世界人工智能大会(WAIC)出现了一些积极信号。最典型的例子是,2025年的华&为CloudMatrix 384到2026年的Atlas 950,两代超节点实现了显著进化:单柜从32卡升级到64卡,计算密度翻倍;计算柜也从12个增加到16个。机柜内部采用高密度铜缆电互联,机柜间则采用全光互联,从支持千亿参数模型的训练,扩展到万亿参数模型的低精度训练和混合推理。

这种变化,不亲自去现场看、不做对比,很难直观感受到其中的差异。

在《2026,中国芯片为国产模型“托底”》一文中,提到了国产算力进化背后的一些故事。其中最具代表性的是,国产算力从业者都表现出不同程度的喜悦。原因有几个:公司上市,让很大一部分员工获得了股权激励;同时,市场开始为中国芯片重新定价,这种财富效应正在逐步放大。

如果说上市是中国芯片要打的第一场战争,那么,接住国产大模型的需求、为其token成本托底,将成为真正意义上的第二场关键战役。

相关下载