首页 > 教程攻略 > ai资讯 >国产大模型,贵到用不起

国产大模型,贵到用不起

来源:互联网 时间:2026-07-30 14:05:14

最近这一个月,硅谷AI界可谓大招频出,GPT-5.6、Fable 5、Grok-4.5接连问世,搞得国内开发者圈子里一阵沸腾,各种测评、讨论铺天盖地。虽然这个月也有Kimi-K3这样的新锐国产模型亮相,但实事求是地说,国产大模型在核心开发者群体中,始终处在一个“叫好不叫座”的尴尬位置。

先看一组数据:OpenRouter 6月22日至28日的数据显示,中国模型周调用量达到20.39万亿Token,美国模型为4.25万亿,前者已经连续九周领先。但与此同时,国内AI六小龙的营收表现却不太乐观——智谱2025年营收7.24亿元,亏损却超过30亿元;MiniMax营收7900万美元(约5.7亿元);月之暗面等其余四家尚未披露完整年营收。即便是头部企业,收入也还停留在数亿元量级。

反观Anthropic,其ARR已经达到约600亿—700亿美元,主要靠B2B API和AI Coding场景驱动。两相对比,一个问题就变得格外尖锐:为什么号称“便宜”“调用量大”的国产模型,至今仍然叫好不叫座,在高价值的AI Coding场景上,始终难以与国外顶尖模型正面抗衡?

最近和几位一线开发者深入聊了聊,发现了一个挺反直觉的事实:

国产大模型,某种程度上其实非常“贵”。

正是这种“贵”,让某些性能上有突破的国产模型,很难真正展现自己的闪光点。

01 “低价”的幻觉

提起国产大模型,很多人想到的是DeepSeek、Kimi、智谱这些名字,而与之关联最紧密的标签之一,就是“低价”“便宜”。如果只看Token单价,国产模型确实比GPT-5.6、Fable 5等顶尖模型有优势——拿GLM-5.2和DeepSeek V4举例:GLM-5.2每百万Token输入/输出为1.4/4.4美元,DeepSeek-V4-Pro为0.435/0.87美元;而GPT-5.6 Sol是5/30美元,Claude Fable 5是10/50美元。看上去差距明显。

但问题在于,这种“低价”印象,其实是一种圈外人长久的误区。

尤其在高强度的编程场景下,国产大模型的单价不但没有优势,反而比有套餐的GPT、Claude贵出好几倍。

李光(化名)是AI领域的科研工作者,每天要在AI Coding场景下消耗几十亿Token。如果他用GLM-5.2,成本会非常恐怖。他当天消耗的Token接近40亿——换算一下,用GLM-5.2大致需要:(8639万普通输入×1.4美元 + 33.80亿缓存输入×0.26美元 + 1906万输出及推理×4.4美元)≈ 1084美元,按1美元兑7.2元估算,约合软妹币7800元。

而李光之所以能放开手脚烧Token,是因为他开了GPT的CodeX套餐。这个套餐并非真正不限量,而是把CodeX纳入ChatGPT订阅:Plus是20美元/月,Pro从100美元/月起,额度约为Plus的5倍或20倍,触顶后可以购买Credits继续使用。同样,Anthropic的Claude Code也有类似套餐:Claude Pro 20美元/月,Max 5x和Max 20x分别为100、200美元/月,网页端与Claude Code共享额度,触顶后可按API价格续用。在这样的套餐兜底下,巨大的Token成本反而被抹平了。

对于国内开发者来说,高强度AI Coding场景下每天消耗几十亿、上百亿Token是常态。另一位重度开发者小刘,在CodeX上实际一周花费300元软妹币,这还是在没有公司报销的情况下。但即便如此,这个成本仍然比国产模型“便宜”得多——因为同样300元,根本买不来GLM-5.2同等数量的Token。

国内开发者的普遍感受是:GPT的CodeX套餐,是目前能买到的最便宜的Token,比智谱、Kimi便宜好几倍。这听起来反直觉,但事实就是如此——在高强度Coding场景下,国产模型的性价比完全无法与之对比。需要说明的是,CodeX并非真正意义上不限量,按最高档200美元算,一周大概有20亿额度。但部分开发者通过“中转站”等手段,能以更低价格买到更多Token,于是出现了300块买120亿Token的现象。

那么,国产模型有没有推出过类似套餐?答案是有的,但如果细究起来,这些套餐在限额方面,和CodeX相比存在很大限制。

02 国产定价之痛

国产大模型在定价方面的现状,可以用一句话形容:

“你以为你进的是自助餐的场子,最后发现商家还是按斤计费。”

举例来说,Kimi Code分为49、99、199、699元四档,额度按周刷新;GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt,每周约400、2000、8000次,而且GLM-5.2高峰期要按3倍扣额。再看阿里的Qoder,根据一位做B端客户运维的朋友介绍:“Qoder曾经是国内最好用的AI IDE,可惜它自己的新定价把优势搞没了。”Qoder CN个人Pro、Pro+分别为59、169元/月,含2000、6000 Credits;Teams与VPC版分别为99、199元/席位·月,均含3000 Credits,后者50席起售。“今年他们合并灵码调了定价后,就我知道的,至少二三十家放弃续费了。”按他的测试,Qoder企业版199的套餐,按他的用法3天就没了,如果按重度开发者的用法,估计一天就没了。

同样让国内用户感到五味杂陈的,还有GLM-5.2的套餐。按照开发者小薇的说法:“GLM-5.2的套餐约等于没有,就算有套餐高峰期仍然限流,而且存在‘背刺’用户的现象。”之前GLM-5.2的套餐比演唱会门票还难抢,每天早上十点钟准时刷新,能不能买到全凭手速。2026年1月,智谱发公告说因为算力紧张,把每日可销售量直接砍到原来的20%,每天早上10点放一点额度,几分钟就售罄。

说到底,国产模型在套餐、价格上的“吝啬”,本质上是算力不足造成的窘迫。

根据2025年中国信通院、工信部数据,中国现存数据中心449个,美国是5427个;总算力方面,中国为1053 EFLOPS,美国为2400。但关键在于,美国的2400 EFLOPS里高端GPU占比极高,而中国的算力中大量是华&为昇腾、寒武纪等国产芯片,单卡性能与H100仍有代差。为应对愈发高涨的算力需求,2026年3月开始,智谱、阿里云、腾讯云、百度在Token价格上集体涨价,涨幅从5%到460%不等。

说白了,国产模型的“低价”“价格战”早已成为过去式。不是国产模型不想搞Buffet,是因为算过账:以现在的算力成本和亏损状态,搞包月等于拿固定月费去赌用户不会刷爆。而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法,这样的商业模式很快会被击穿成本线。而OpenAI和Anthropic的编程套餐,卖的是高净值企业客户——Cursor、GitHub Copilot这种大客户一年能给Anthropic贡献14亿美元收入。在高算力加持下,这套商业模式本质是用“固定月费”换“长期锁客”,客户质量高,ARPU也相对较高,摊得平成本。

相比之下,国内虽然有阿里这样的云巨头,但阿里云FY2026调整后EBITA Margin只有7.5%,云智能集团虽然收入增长快,但利润并不丰厚。而且传统云厂商敢卖“不限量云服务器”,是因为用户不是24小时满负载——一台ECS实际CPU利用率可能只有10%,云厂商可以把一台物理机超卖给十个人。但大模型推理不一样:来一个Token,就要实打实烧一次GPU算力。用户如果24小时不间断刷,云厂商的HBM显存、GPU核心、电费全是刚性支出,没有任何超卖空间。

03 模型的“黄金三角”

除了价格因素,对国内开发者来说,选择CodeX、Claude Code的原因,无疑是其强大的编程性能。但国产模型在性能方面,也并非像某些刻板印象中那样不堪。与多个开发者交流后,一个比较普遍的观点是:国产大模型,尤其是GLM-5.2等最新模型,已经可以承接一些辅助性、次要的任务,例如做测试和修改bug。

但在较为复杂的、长时间的异步任务上,国产模型与GPT、Claude等顶尖模型之间,仍有较大差距。

开发者小张今年3月用过一次国产模型编程,用GLM、Qwen和GPT对比同样的任务,只有GPT跑完了,并且符合页面要求——那是一个多级、多列内容比对和结果生成的项目。另一位开发者小薇则表示,根据她的体验,Kimi 2.7和豆包2.1 Pro性能尚可,但总的来说还是要弱一档(属于第二梯队),不过总体上也超过Claude Sonnet 4.6了。

目前,开发者群体中的普遍共识是:GLM-5.2是第一个达到Opus级别的国产模型。

它在执行真实的、复杂的、长时间的异步任务中是可用的,占了一席之地。

尽管在很多维度(例如世界知识)上,它与真正的Opus模型仍有较大差距,但这不妨碍它成为国产模型的新高度。但现实是,这些刚刚崭露头角的少数“尖子生”,却被与性能无关的其他因素拖累了——比如缓存效率不高、高峰期仍然限流,让开发者的实际体验很糟糕。

这就引出了当下模型对比中的另一个维度:稳定性。在一线开发者和程序员的体验中,模型的选择早已不是简单的性能对比,而是

性能—价格—稳定性的“黄金三角”。

在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。

近期,Kimi发布了最新的旗舰模型K3——一款拥有2.8万亿参数、原生多模态和100万Token上下文、开放权重的模型,主攻长程编程、知识工作与深度推理。在众多测评中,它在Artificial Analysis上的智力指数是57分,位列全球第三;Arena前端编程榜以1679分登顶,甚至有传言称其性能已经能比肩Claude Fable 5。然而,在耀眼的分数与排名背后,开发者最关心的仍然是一个词:性价比。K3发布后,很多开发者表示,Kimi现在仍然很贵,与CodeX相比没有性价比,而且额度不够用。单看API价格,K3每百万Token缓存/输入/输出分别为2/20/100元;GPT-5.6 Sol为0.5/5/30美元,K3虽低于Sol,却明显高于GPT-5.6 Luna的0.1/1/6美元。更关键的是,在使用K3的过程中,开发者还出现了API断连,甚至断了一上午的情况。

就目前来看,国内开发者不是不愿意为国产模型付费,而是国产模型因算力紧、成本高,目前开不起CodeX这样具有性价比的套餐,只能开看似自助餐、实则限量的“大众点评套餐”(类似智谱的Coding Plan)。而套餐体验不稳定、性价比模糊,导致用户使用后难以留存。这本质上,是在目前算力底座成本高的情况下,用户的理性选择。

以上这些,并非要长他人志气、灭自己威风,只是想提示一种风险:目前国产模型在追赶GPT、Claude的路途中,非常喜欢强调性能,但国产大模型从研发到应用,需要攀登的远不止性能这一座高山。我们需要的是等待——等到国产算力基座大规模量产,在技术、价格、稳定性方面形成合力,那时我们的产品才能真正撑起用户的期待。