算力成生死线,巨头疯抢“超节点”
刚刚结束的WAIC(世界人工智能大会)上,风头最劲的居然不是大模型,而是“超节点”。它直接占据了展馆的C位,成了全场焦点。
所谓“超节点”(Super Node),说白了,就是把多个计算节点(比如AI加速卡、NPU、GPU)通过高速互联协议,在物理上拧成一股绳,让它看起来、用起来就像一台超级计算机。
背后推手不难理解:AI大模型的算力需求正急剧膨胀,从单机八卡直接跳到了万卡、十万卡级别。在算力普遍吃紧的当下,头部云厂商、大模型公司、政企客户不约而同地把规模算力采购当作标配,这也直接推动了超节点的规模化商用。
资本市场的反应也很直接。7月1日到22日,据《中国企业家》统计,紫光股份股价累计上涨58%,市值冲到1300亿元;浪潮信息涨了41%,市值接近1400亿元。超节点俨然成了“造富机器”。
产能也在快速爬坡。5月,一位服务器厂商高管透露,从2026年下半年到2027年,超节点会持续快速上量。“一旦GPU、存储这些核心部件供应更充足,你会看到更陡峭的上量曲线。”他直言,现在跟互联网公司谈的,已经是2027年、2028年的供货合同了。
“互联网客户第一句话就是:你有10万片的供应,我们再谈。没有?那就不浪费时间了。”

摄影:闫俊文
《中国企业家》了解到,新华三正在杭州建设新的AI超级工厂,主攻AI整机柜,规模达3.5万立方米,能容纳200到300个测试点位,每个点位功率可达240到300千瓦。WAIC上,他们展示了UniPoD S80000超节点,覆盖从32卡到1024卡的全系列产品,训练性能提升70%,推理性能提升3倍。
华 为也亮出了家底:其“A384超节点”已累计商用超过750套。最新的“昇腾950超节点”以1024张NPU真机状态亮相,具备量产交付能力。
一些AI芯片创业公司也主动投身这场浪潮。今年1月,从商汤大芯片部门独立出来的“曦望”,推出了GPU芯片S3,并发布了超节点解决方案。算力芯片公司奕行智能则发布了首个RISC-V AI算力超节点——单机柜支持64到128颗芯片全互联,单芯互联带宽达3.2T。该产品已落地在合作伙伴联合打造的“全球首套全栈RISC-V万卡超节点AI Token工厂”,一期预计今年8月建成。今年4月,奕行智能完成了15亿元B轮融资。
某算力公司高管算了一笔账:
超节点价格比传统服务器贵50%,利润也比单卡高。但性能能提升10倍,“客户算得过来这笔账”。
芯和半导体副总裁仓巍则观察到,产业链两端都在发力:芯片厂商自下而上,从芯片架构、封装、互联向上延伸,最终触达超节点系统层;整机厂商则自上而下,从系统需求倒推,向下定义互联规格、芯片接口乃至封装形态。两个方向如何在系统中间层汇合,考验的是厂商的跨层级协同能力——这正成为竞争焦点。
01
“十万卡”已经不够用了
“十万卡”已经不够用了
今年,几家头部模型公司都推出了更先进的模型,但不约而同地,他们都被“卡”在了算力上,无法卖出更多Token套餐。2月,智谱发布GLM-5大模型;7月,月之暗面发布了高达2.8万亿参数的Kimi K3大模型。但他们都不得不靠提价、限购来抑制需求。
九章云极创始人方磊指出:
对大模型公司而言,行业普遍呈现1美元收入对应约0.8美元算力成本的局面。但当下,1美元收入也对应着X倍的市值或估值——算力规模仍是大模型公司最重要的增长手段。
智谱已经等不及了。
7月21日,智谱宣布收购国产AI异构算力软件公司中科加禾,并落地建成1GW级国产AI算力数据中心——此举推动智谱股价单日大涨近37%。
“十万卡已经不算什么了,马斯克、黄仁勋要建百万卡集群,中国厂商还得往前冲。”一位中兴通讯的超节点员工这样感叹。他提到Kimi K3,“未来模型的参数会越来越大,意味着需要更强大的算力基础设施来支撑训练。”
另有半导体人士透露,
Kimi K3的部署建议是使用64张以上加速卡组成的超节点——这标志着大模型对超节点规模算力已经设定了门槛。
“模型参数规模的竞赛没有停止迹象。今天是2.8万亿,明年可能是5万亿、10万亿。每一次模型规模的跃升,都会把算力需求的基准线往上推一个台阶。这是超节点需求持续增长的底层逻辑,不是短期现象。”这位人士说。
摩尔线程创始人张建中在WAIC演讲中强调:模型能不能达到Frontier Model的水平,它的Benchmark、精度、能力,完全取决于模型工厂的基础设施能力。

摩尔线程创始人张建中 来源:受访者
“你不知道下一个要训练的模型是什么。大语言模型发布后,能不能尽快扩展到多模态?未来还要训练各种与人类工业生产、生活相关的模型,包括物理、科学研究、数学,甚至世界模型。”张建中说。摩尔线程已经拿出了自己的“MTT C256超节点”,并为此搭建了模型训练工厂和Token生产工厂。
各家逐鹿下,超节点的算力密度和规模不断提升,变成了一场以数字为中心的比拼游戏。
华 为最新的“昇腾950超节点”标准版为1024张卡,单柜64卡,由16个柜台组成,最大可拓展至8192卡。中兴通讯7月发布的“OEX超节点”,单柜可容纳128张GPU,集群可扩展至万卡规模。中科曙光也在7月发布了首个全国产十万卡AI的“曙光8000(登峰)”超节点,并接入了国家超算互联网。

摄影:闫俊文
蜂拥上新背后,各家技术路线不尽相同。华 为“昇腾950超节点”的特点是从芯片、互联协议到散热,全栈自研。
这种路线的优势是各层之间可以深度协同优化,整体系统效率远高于各层独立堆砌,但对研发体量的要求也极高。
中兴通讯联合壁仞科技、沐曦股份、燧原科技等多家合作伙伴打造的超节点,走的则是另一条路——
开放生态、多芯协同,不押注单一芯片,让客户在不同算力芯片之间灵活组合。
阿里平头哥“真武M890”与“磐久AL128”,百度旗下的昆仑芯“天池超节点”,以及沐曦、清微智能、摩尔线程等企业也都带来了各自的算力系统。
这些厂商大多从云厂商或特定垂直场景出发,更强调推理效率和性价比,不追求纯粹的算力规模。
仓巍的判断是:“现在判断最终格局还为时尚早。”真正拉开差距的地方,不在算力数字,而在系统工程的完整性——从芯片、互联,到软件栈、运维工具,能否用一套完整的产品和系统能力交付给客户,而不是单点优势,这才是竞争最终的判断标准。
“各家路线针对的客户群体和应用场景本来就不重叠,可能最终形成的是多元格局,而非赢者通吃。”
02
账面看,超节点不是最优解?
账面看,超节点不是最优解?
但问题来了:超节点性能强大,价格也相当惊人。
据《中国企业家》了解,超节点产品投入可能在数百万元到几千万元之间。不论是训练还是推理,关键是Token的吞吐效率要“跑满”,这也是厂商选择自购还是租赁的核心考量——并不是GPU数量越多越好,硬件越高级越好,关键是符合市场需求,能算清ROI。
这也让动辄千万元的超节点产品,注定是少数科技大厂和头部创业公司的游戏,难以成为中小公司、创业公司的选项。

摄影:闫俊文
例如,阿里云除了推出性能更强大的“磐久AL128”超节点整机之外,也主打“灵骏真武M890超节点”。该产品以标准化超节点形态,向客户交付具备高速互联能力、开箱即用的64卡高性能算力单元。
九章云极目前拥有3万P的智算规模,未来几年计划建设10万P的智算集群工厂,达到10万亿Token/日的流转承载力。方磊这样描述建设算力中心的方式——类似于高速公路和换电站。“某种程度上,我们更像一个AI基础设施和算力资产运营平台。”
此外,中兴通讯、华 为、新华三等员工也都提到了超节点的运维成本,比如电力架构、异构算力的算子融合等。
过去,半导体竞争更多围绕单颗芯片的性能展开,而AI时代,真正决定竞争力的已经是整套系统的高效协同。相关人士表示:把很多芯片连接起来并不难,难的是让它们像一个整体一样工作,这涉及高速互联网络、液冷、电力供应等诸多挑战。
解决超节点里的能源和电力问题,远比大多数人想象的要复杂。超节点表面上是“耗电多”,深层考验的是整个供电链路的协同设计。
散热同样如此。机柜内的热分布不只是“装几台风扇”那么简单,而是要和芯片功耗分布、封装热阻、液冷板流量设计相互耦合。例如,华 为展出的风冷超节点,就解决了传统风冷机房向高密度智算升级的难题,无需进行高昂的液冷改造,即可部署超节点技术。
在互联方面,随着集群规模增大,纯铜缆互联在带宽和距离上已触及天花板,对光互联的需求越来越迫切。但光互联也带来了电、光、热三个物理场的全新设计挑战——光模块对温度极敏感,和高功耗AI芯片封装在一起,热耦合问题更加棘手。
这也让超节点系统工程师成为科技大厂的招聘热门。比如字节跳动正在招收“系统分析师”,其职责是深入分析字节跳动大规模AI集群的性能瓶颈和需求,做AI基础设施(服务器/互联/超节点)的架构设计和优化。
03
GPU成了最不重要的一环
GPU成了最不重要的一环
有一个趋势越来越明显:在超节点的系统工程里,曾经作为核心的GPU,重要性正在下降。大公司更着眼于CPU、存储、网络交换卡的系统优化层面。
最直观的变化就是GPU和CPU的数量比例。
《中国企业家》观察到:2025年,在超节点架构里,GPU:CPU的比值是8:1甚至4:1。但到了2026年,一些厂商预言:未来CPU与GPU的比变成1:2甚至1:1都有可能。
背后的原因很简单:多智能体系统更需要CPU的调度和内存。

摄影:闫俊文
一位华 为鲲鹏高管在近期的演讲中谈到:
Agent多轮推理时,更多记忆系统工作在CPU中展开,最后才交给GPU去推理,任务的负载已经更多扩散到了内存、CPU等环节。“NPU变成了CPU的模板,由CPU来安排NPU做什么。”
某服务器厂商高管也提到,Agentic有很多活是要交给CPU干的。所以智算机房以后不仅仅是智算服务器、智算整机柜,可能将演变为以CPU为中心的通算整机柜。
在各大类型的超节点中,CPU的比例不断上升,超节点机柜正在从“GPU中心”走向“GPU+CPU+存储协同”。
不过,目前CPU、HBM(高带宽内存)、先进封装等关键资源同样紧张。CPU需求增长比产业预期更快,短期供给难以迅速跟上,行业也同步出现了CPU涨价、交付周期拉长的供需失衡现象。
7月6日,英特尔宣布上调旗下多款消费级与服务器级CPU的建议零售指导价。其中,面向服务器端的旗舰级至强6980P单颗售价上调1495美元,涨价金额近乎等同于一台中端消费处理器的原价。
存储也是超节点供应链中的关键一环。智能体需要依赖长期记忆、知识库、上下文缓存(KV Cache)以及海量数据的高速读写,未来存储的价值将更多体现在容量、带宽和低时延能力,而不仅仅是成本上。
供应链的价格波动正指挥着超节点的狂飙节拍——尽管这是一个价值数千亿元的大生意,但可以为其买单的客户太过集中,超节点玩家们将面临的,仍将是更加残酷的性能与价格搏杀。