2026年下半年,算力竞赛为何突然转向超节点?
“
中国大型互联网企业会在下半年大量部署超节点方案。
即便此前没有采用超节点的DeepSeek,最近也明确要入场,正在议价。一位云计算大厂人士告诉数智前线,这个信号很关键,有风向标意义。
这一热潮在2026世界人工智能大会上表现得尤为突出。华&为展出了由20个机柜组成的1024卡超节点真机,中科曙光则展示了沸腾着冷却液的640卡超节点,百度天池、阿里云灵骏真武M890、浪潮信息元脑以及沐曦曦景S600,都被放在了各自展台最显眼的位置。
超节点到底是什么?简单来说,它通过高速互联技术,把大量GPU或加速卡从“多台服务器”深度整合成逻辑上像一台“超级计算机”的系统。这解决了传统集群跨机器通信的带宽和延迟瓶颈,大幅提升GPU利用率,最终带来单位Token成本的下降。华&为资深人士的观点很明确:“
超节点已成为目前AI Infra建设的一个主流趋势。
一年前,超节点还是少数厂商展示系统能力的旗舰产品;一年后,它正在成为主流算力企业必须参与的军备赛。百度昆仑芯人士说,国产超节点从去年推出,目前已发展到可批量落地的阶段。“
到今年底,每家算力企业基本上都具备交付能力。
谁在造超节点
谁在造超节点
超节点不是新概念了。2024年,英伟达发布GB200 NVL72,将72颗Blackwell GPU纳入一个高速互联域,从此把这个架构带入业界视野。但最初的需求并不算旺。到了2025年,随着大模型参数暴涨,超节点才真正成为热点。国内厂商早在2024年前后就开始技术预研,最早一批产品在2025年上市,华&为、百度智能云、浪潮信息、新华三、中兴等纷纷跟进。超节点赛道,开始涌入多个玩家。
不过,各家争夺的焦点并不一样,目前形成了三条不同的路线:
一派不断扩大单个超节点的规模,一派更强调部署效率和经济性,还有一派试图用新的芯片和互联架构重新定义超节点
观察下来,
华&为、中科曙光和百度,在走向“大节点”
华&为
750多套,证明了商业规模部署的能力

中科曙光
百度智能云

另一批厂商并不认同“越大越好”
阿里云

浪潮信息、沐曦
还有一些厂商试图跳出英伟达GPU或华&为加速卡的路线,走了第三条路
清微智能
东方算芯
此外,摩尔线程也计划年底伴随新一代GPU推出相关产品。寒武纪目前虽然没有超节点,但业界判断下一代芯片也将推出超节点。至此,国内主要算力芯片和服务器企业,几乎都已进入这一赛道。
为什么是今年
为什么是今年
超节点为什么会在今年爆发?业内认为有三大原因。
第一,模型训练和推理需求足够大
训练端
推理端
第二,账算得过来
昆仑芯人士介绍,传统模式下10台机器的算力相加不等于10,“只能等于6”,超节点通过高速互联把损耗降到最低,让更多算力发挥效能。如果用超节点做PD分离推理,系统比普通同卡数机器能提升30%到50%的性能。
第三,批量交付节点到了

不过,超节点更适合训练还是推理
华&为人士认为,训练和推理都有价值,万亿参数大模型训练需要巨大内存池,Agent推理需要海量上下文并发,超节点必须配备大内存卡。摩尔线程认为,超节点要面向1万亿到5万亿参数大模型训练,以及高速推理的tokens工厂场景。而沐曦人士分析,“经过严密论证,超节点在推理的Decode阶段,也就是逐Token生成答案时,价值更为突出。”清微智能陈逸伦则判断,“目前超节点在训练侧跑微调较多,拿它做推理性能更好。”
分歧与共识
分歧与共识
爆火之下,超节点技术路线存在诸多分歧,目前还没有标准答案,取决于各企业的技术商业判断。
第一个分歧是规模之争:超节点应该做多大?64卡/128卡,还是更大规模?
一部分业界人士是“小节点派”。“在我个人认知里,64卡就够了。TP并行、EP并行的最大规模可能就是64卡,剩下的通过PP和DP并行、Scale-out去连起来。没必要把单个节点的Scale-up做到足够大,因为任何通信都有延迟,TP和EP对延迟极度敏感,即便千卡互联中间几个微秒的延迟,GPU其实都在等。”一位人士分析,“对时延和稳定性都要有考虑,这是一个工程上的平衡,并不是Scale-up越大越好。”另一位人士持相同立场,“64到128卡是最经济的形态,再大就浪费了。”
另一些企业则是“大节点派”。华&为最新超节点扩展至1024卡,中科曙光640卡,百度天池、新华三均推进至512卡。他们的逻辑是:进入Agent时代后,万亿参数、百万Token上下文和海量并发推理之下,64卡和128卡小节点的统一内存池太小。“64卡更像基础机柜单元,适合中小规模模型微调、离线推理;万亿大模型的完整训练、大规模多智能体并发,必须依靠更大规模超节点。”
第二个分歧是CUDA兼容之争
一位大厂人士分析,自研生态虽然迁移成本高,但可控性和长期演进空间更大。他坦言,
也许两三年后,CUDA兼容就没有那么重要了
一位华&为人士介绍,华&为是国内最先支持mxfP8和fp4精度的厂商,mxfP8的可变量比fp8更好。“
有人说昇腾从CANN走向了CUDA,其实并不完全正确。
此外还有其他的分歧,比如连接中的铜缆与光纤之争,液冷中的风冷和液冷,特别是浸没式液冷。这些新旧技术转换中,因技术瓶颈、故障率与运维成本产生的矛盾和挑战,让业界有不同的技术商业选择。
一个共识是软硬架构协同
浪潮信息董事长彭震最近介绍,过去基础设施主要沿摩尔定律演进,最新的进展是软硬件联合创新——一端提出新算法,另一端用新介质、硬件和网络去适配,收益显著。他看到美国企业也在开展类似的探索。
在沐曦杨建博士看来,这条赛道“未来二三十年都停不下来”。今年,他已经看到一些企业开始用AI参与设计,道路、房屋、机械等设计本质上都属于知识生产,AI的影响早已超出coding,正在渗透到各行各业。一位大型企业管理者希望,到2027年底实现“白天开会写规范,下班前交给大模型,第二天看结果”,人负责定义和发现问题,大模型负责求解。目前,AI知识创造的进程,“很多企业还没开始,因为总经理和董事长还没作出对数字员工的定岗决定。”资深人士观察,这正是AI要渗透的市场。
算力越便宜,行业扩张就越快,“整个链条就再也停不下来了”。美国的算力大约是中国的9倍。超节点,正成为这条产业链向下延伸的重要算力底座。随着更多厂商具备整机交付能力,真正激烈的竞争已经开始。
“现在比拼的是能否批量交付、稳定运行,并真正降低每Token成本。”一位大厂人士说。供应链是其中更大的挑战,“无论国产还是海外供应都存在不足。锁定供应链,未来发展才更有确定性。”