超万卡GPU集群关键技术深度分析
大模型正从千亿参数的自然语言模型向万亿参数的多模态模型演进,这个趋势大家都有目共睹。随之而来的,是超万卡集群对底层计算能力的迫切需求——全面提升,刻不容缓。这不仅仅是堆硬件,更是一场从芯片、互联到架构的系统性升级,最终目标是支持更大规模的训练和推理任务。
1. 集群高能效计算技术
面对万亿参数的多模态模型,单靠堆砌显卡已经行不通了。我们需要从四个维度进行系统性突破:单芯片能力的精进、超节点计算能力的跃升、基于DPU的多计算能力融合,以及对极致能效比的追求。
1.1 单芯片能力
单芯片能力是万丈高楼平地起的基础,它包括了GPU自身的计算性能和显存访问性能两个核心部分。
在计算性能方面,设计更先进的GPU处理器是根本。在功耗允许的范围内,我们需要研发拥有更多并行处理核心、更高运行频率的单GPU。其次,通过优化高速缓存设计来减少内存访问延迟,也是提升运行效率的关键。再者,浮点数表示格式的优化,比如从FP16向FP8演进,通过引入新的存储方式和精度控制,可以在保证模型精度的前提下,大幅提升计算性能。最后,针对特定计算任务,可以在芯片上集成定制化的硬件加速逻辑单元。这种基于DSA的并行计算设计,对特定业务领域的计算速度提升非常显著。
在显存访问性能方面,挑战同样巨大。为了让万亿模型的数据布设在数万张GPU显存上,显存必须具备高带宽、大容量的特性。这要求我们采用基于2.5D/3D堆叠的HBM技术,它能有效缩短数据传输距离,降低访存延迟,并提升GPU计算单元与显存间的互联效率。通过这些技术,超万卡集群才能为智算中心提供强大的单卡算力,并为未来的大模型奠定坚实的硬件基础。
1.2 超节点计算能力
针对万亿模型,特别是处理超长序列和应用MoE架构时,巨量参数和庞大数据样本的计算效率是核心瓶颈。这直接引发了All2All通信模式下GPU卡间海量的通信需求。因此,超万卡集群的改进策略需要集中在几个关键领域。
首先是推进“超节点”形态的服务器。
其次是引入面向Scale up的Switch芯片。

如图2所示,通过引入节点内的Switch芯片,GPU卡间的点对点带宽得到了增强,这有效地提升了节点内的网络传输效率,满足了大模型日益增长的互联与带宽需求。可以说,这是为大模型并行计算提供强大硬件支持的关键一步。
最后是优化GPU卡间互联协议。
1.3 多计算能力融合
在超万卡集群中,智算中心内部的数据交换需求呈指数级增长。如果还堆砌CPU资源来处理网络数据,只会又低效又昂贵。因此,计算架构必须转变:将原本运行在CPU、GPU中的数据处理任务,卸载到具有层级化可编程、低时延、统一管控特性的DPU上执行。
这带来的好处是,既能大幅扩展节点间的算力连接能力,又能释放被占用的CPU、GPU算力,降低协作成本,让集群发挥出更大的效能。具体来说,可以对智算中心进行软硬一体重构,打造计算、存储、网络、安全、管控五大引擎,并定义标准化的DPU片上驱动内核。
- 负责卸载加速I/O设备的数据路径与控制路径,面向节点提供标准化的virtio-net、virtio-blk后端接口,屏蔽厂商专用驱动。
计算引擎
- 在DPU上实现存储后端接口,可基于TCP/IP或RDMA网络功能连接各类存储集群,将节点的全类型存储任务卸载至DPU。
存储引擎
- 将虚拟交换机卸载至DPU,采用标准流表和卸载接口,全线速释放硬件性能。同时集成RDMA功能,降低多机多卡间端到端通信时延,构建节点间数据交换的高速通道。
网络引擎
- 通过信任根机制和标准加密协议,为系统和多租户网络提供安全防护。
安全引擎
- 屏蔽裸金属、虚拟机、容器等算力单元的形态差异,实现DPU资源统一管理和全链路管控运维。
管控引擎
中国移动正是基于这一蓝图,于2020年开始打造具有自主知识产权的磐石DPU,并在2024年将其FPGA架构全面升级为ASIC架构。将磐石DPU这样的芯片融入现有智算中心,将算力集群从CPU+GPU双平台支撑,扩展至CPU+GPU+DPU三平台支撑,这有效打破了节点间的算力孤岛,突破了现有技术架构下的集群规模极限,让超万卡集群真正成为可能。
1.4 极致算力能效比
在制程工艺相对固定的条件下,芯片的高性能往往伴随着高功耗,散热问题日益严峻。面对高性能计算芯片功率密度急剧上升的现状,我们需要从制冷系统和GPU芯片两方面双管齐下。
在制冷系统方面,单机8卡GPU服务器的功耗早已数倍于通用服务器。为了增加计算密度、节省空间,超万卡集群建议采用成熟的冷板式液冷机柜。一个液冷机柜可容纳多台液冷GPU训练服务器,空间利用率远超传统风冷机柜。
在GPU芯片方面,提升能效比需要多领域协同。在芯片工艺上,采用7nm或更先进的制造工艺是降低晶体管功耗、提升集成度的必要手段。在架构设计上,需要创新优化片上总线、流水线结构、电压/频率策略以及时钟门控技术,以实现不同工作状态下的最优能耗效率。在软件层面,启用更精细的监控和分析,实时跟踪GPU运行数据,并不断优化算法和工作负载分配,才能真正实现均衡、高效的算力利用。通过这些设计与优化,不仅能提升用户的计算体验、降低成本,也为智算中心的可持续发展提供了可行的绿色方案。
2. 高性能融合存储技术
要实现存储空间的高效利用和数据的高效流动,并支持集群的大规模扩展,超万卡集群必须采用多协议融合和自动分级存储技术。这是提升智算数据处理效率,支撑千亿乃至万亿大模型训练的关键。
2.1 多协议融合
超万卡集群的融合存储底座,需要承载AI全流程业务的数据处理。这意味着它必须兼容NFS、S3、并行客户端POSIX等多种协议,并支持各协议语义无损,达到与原生协议一样的生态兼容性。在不同阶段要实现数据零拷贝和格式零转换,确保前一阶段的输出可以无缝作为后一阶段的输入。这种“零等待”的效果,能显著提升大模型训练的效率。
2.2 集群高吞吐性能
为了满足大模型对存储高吞吐性能的需求,基于全局文件系统技术,可以支持超过3000个节点的扩展规模,为大模型训练提供百PB级全闪存储大集群能力。从闪存密度、数据面网络、并行客户端到对等通信机制,多个维度的系统性提升,能实现存储集群10TB/S级的聚合吞吐带宽和亿级IOPS。一个直观的效果是,智能算力利用率能提升20%以上,而大模型checkpoint的恢复时长可以从分钟级缩短至秒级。同时,对于高价值的智算存储数据,还能提供强一致性访问和高达99.9999%的可靠性。
2.3 高效分级管理
超万卡集群的数据量是巨大的,其中大部分是温冷数据。所以,我们需要统筹考虑性能和成本,规划普通性能和高性能两类存储集群。普通性能集群使用混闪存储介质,具备低成本和大容量优势,负责温冷数据的存储;高性能集群则使用全闪介质,为大模型训练提供高吞吐,专门存放热数据。为了让智算应用高效地管理和访问数据,这两类存储集群对外应当呈现统一命名空间,并提供基于策略的数据自动分级流动能力。这样一来,冷热数据可以按照策略自动流转,避免了人工频繁介入,提升了存储系统整体的运行效率。
3. 大规模机间高可靠网络技术
超万卡集群的网络可以划分为参数面、数据面、业务面和管理面。业务面和管理面通常采用传统的TCP方式部署。但参数面网络用于计算节点间的参数交换,对高带宽、无损能力要求极高;数据面网络用于计算节点访问存储节点,同样有高带宽无损的诉求。其中,参数面网络的要求最为苛刻,主要体现在四个方面:大规模、零丢包、高吞吐、高可靠。
目前业界成熟的参数面主要是InfiniBand (IB) 和 RoCE 两种技术。面向未来,为了满足AI大模型的大规模组网和高性能节点通信需求,业界也在探索新的技术,比如由中国移动主导的全调度以太网(GSE)方案和Linux Foundation成立的超以太网联盟(UEC)。它们的核心思路都是革新以太网现有通信栈,突破传统性能瓶颈。
3.1 大规模组网
根据不同的AI服务器规模,参数面网络推荐采用Spine-Leaf两层组网或胖树(Fat-Tree)组网。在Spine-Leaf两层组网中,每8台Leaf交换机和下挂的AI服务器组成一个group,以group为单位扩展。在group内部,采用多轨方案将AI服务器连接至Leaf交换机,所有网口按顺序分别上连到不同的Leaf。Spine和Leaf之间采用Full-mesh全连接,上下行收敛比为1:1。胖树组网则在此基础上增加了Core层,以pod为单位进行扩展,同样采用Full-mesh连接和1:1的收敛比。
3.2 零丢包无损网络
分布式高性能应用的特点是“多打一”的Incast流量模型,这很容易造成交换机内部队列缓存的瞬时突发拥塞甚至丢包,损害分布式应用的性能。AI场景通常采用RoCEv2协议与DCQCN拥塞控制机制配合实现零丢包。DCQCN要求交换机对拥塞报文进行ECN标记。但传统手工配置静态ECN门限的方式,无法适配所有业务流量模型:水线配置低了,吞吐上不去;配置高了,又可能频繁触发PFC,影响其他业务。因此,建议部署动态ECN技术,通过AI算法根据实际流量模型计算出最优水线,在保证吞吐的同时维持低时延,达到最佳平衡。值得注意的是,无论是静态还是动态ECN,本质上都是被动拥塞控制。因此,中国移动提出了GSE技术,通过全局动态的主动授权机制,从根源上消除拥塞,突破RoCEv2的性能瓶颈。
3.3 高吞吐网络
AI场景的流量特征是流数少、单流带宽大。传统的ECMP基于5元组逐流HASH,在流数少时极易出现HASH不均。建议使用端口级负载均衡或算网协同负载均衡技术来替代。端口级负载均衡部署在Leaf交换机上,以源/目的端口作为均衡因子,消除哈希的不确定性。算网协同负载均衡则更进一步,AI调度平台会将任务信息通知给网络控制器,网络控制器结合全局拓扑,计算最优路径并动态配置到网络设备上,实现全网负载均衡,使网络吞吐可以稳定在95%以上。
3.4 高可靠网络
网络作为业务流量的调度中枢,其稳定性决定着整个集群的运行效率。在典型的CLOS组网中,交换机间有多条路径。一条链路故障时,传统做法是通过路由收敛将流量切换到备用链路。但这个时间通常在秒级。然而在AI场景中,每次通信时间在毫秒级,秒级时间里已经完成了多轮通信。DPFR(数据面快速恢复)技术可以在此场景下做到毫秒级收敛。它通过故障快速感知、本地/远程快收敛等技术,让关键应用对故障几乎无感,业务性能在链路故障时无明显下降。
4. 高容错高效能平台技术
智算平台是智算中心的大脑和指挥中枢,它对底层的计算、存储、网络等IaaS资源进行云化管控,并向上提供资源纳管、任务调度、拓扑感知、全链路监控等核心服务。随着模型规模和数据量的激增,单集群规模达到万级,但平台性能往往不能线性增长,反而会有损耗。因此,我们必须借助高效的算力调度平台,结合算法、框架的优化,才能将算力平台的效能发挥到极致。业界通常以断点续训、并行计算优化和智能运维为切入点来构建高容错、高效能的平台。
4.1 断点续训高容错能力
大模型训练面临的最大困难,不是性能不够,而是如何确保训练任务不中断。硬件、软件、网络故障都可能随时出现。这种频繁中断带来的进度损失,对于耗时又耗资源的训练任务来说是难以承受的。当前业界的容错方案主要依赖于训练过程中周期性保存checkpoint,故障发生后从中断点之前的checkpoint重新启动训练。
典型的断点续训流程包括:基于平台运维监控能力检测故障、人工介入排查、隔离故障、重新调度容器、初始化通信、加载中断前的checkpoint信息、最后重新编译算子库。在这个过程中,checkpoint的密集程度、保存和恢复的性能至关重要。当模型参数达到百亿甚至千亿时,checkpoint的开销通常在几分钟到十几分钟之间,这会导致训练任务暂停,用户难以进行频繁操作。但如果拉长保存周期,一旦发生中断,损失就更大了。
为了解决这个问题,关键在于降低checkpoint流程的开销。业界通常采用checkpoint多级存储的方式,利用更高I/O性能的内存介质构建存储系统,大幅缩短训练暂停时间。同时,结合业务需求将checkpoint异步写入持久化存储,不干扰正常训练。当故障导致训练重启时,新启动的进程可以直接读取内存中的checkpoint数据,省去了读取网络存储的I/O开销。断点续训基于多级checkpoint、软硬件协同优化以及全栈系统级容错,能实现训练任务分钟级恢复,并且在商业化层面,为模型开发者提供了保障训练任务长期稳定运行的关键特性。
4.2 分布式并行计算优化
在超万卡集群中,分布式并行训练框架是标准配置。它将训练任务划分为多个子任务在多台计算机上并行执行。但超万卡集群节点多、资源类型不统一、数据量大、网络环境复杂,带来了两大挑战。
挑战一:大规模下的高效率训练。
分布式并行框架在进行模型训练时,每个步骤都关系到运行效率。因此,超万卡集群的框架需要针对整个流程进行优化,并支持更多类型的模型加速技术。
- 支持数据并行、模型并行、流水线并行的一种或多种组合。
3D并行策略:
- 根据模型结构、参数量、硬件资源拓扑和网络带宽,自动生成最优的3D并行参数组合。
自动并行方案生成:
- 构建高效算子库,预设算子融合库,设计子图替换规则,在编译阶段自动触发优化。
自动计算图优化:
- 采用数据并行处理、分布式加速缓存等技术,解决数据预处理和加载阶段GPU空闲的问题,提升利用率。
数据流水线优化:
- 综合运用代码优化、梯度累计、存储格式优化、半精度训练等方法,降低显存消耗,提高训练的稳定性与可扩展性。
显存优化:
4.3 超万卡集群智能管控
随着集群规模的扩大,运维管控与集群应用之间的矛盾日益凸显。当AI加速卡从千级增长到万级时,故障范围扩大10倍以上,并迅速扩散到算网存多域全栈。要改变这一困境,必须引入新的运维理念——以全链路可视化监控、故障快速定位和运维侧快速修复为原则,建设新的智能运维系统。
这个系统需要具备算、网、存协同管理的端到端能力,包括计算、网络、存储、光模块等设备的全生命周期管理,最终目标是让大模型“训得快、训得稳、训得好”。新系统从底层建设开始,就应具备统一的容器化平台与公共技术底座。南向采集统一化,对被管单元进行资源、性能、告警、日志等信息的统一采集。系统核心应包含以下能力:
- 支持展示与训练作业相关的资源视图,包括参数面交换机、智算服务器、AI加速卡和链路,提供路径拓扑的可视化运维。
作业路径可视:
- 包括集群环境检查和作业运行前检查,规避软硬件问题,提高作业成功率。
环境健康检查:
- 对失败作业进行智能诊断,基于日志、告警等进行时空关联分析,实现多种典型故障的实时诊断。
故障诊断:
- 提供集群的基础信息配置、修改和元数据管理能力。
集群资源管理:
- 实现对集群内全量设备的静态数据录入、采集和检索管理。
设备管理:
- 基于多维度数据,提供软硬件、作业的性能分析、告警和日志检索。
监控分析:
- 实时呈现集群资源使用、运行状况和训练任务执行情况,让运维人员对全局状态一目了然。
监控大盘:
5. 新型智算中心机房设计
面向高密度、高能耗的智能算力发展,部署超万卡集群的新型智算中心,需要在确保设备安全、稳定、可靠运行的前提下,具备高效制冷、弹性扩展、敏捷部署、绿色低碳等特征,并实现智能化运维。
- 芯片TDP不断攀升,风冷已经无力应对。液冷技术因其高效的散热能力和对更高功率处理器的支持而成为必然选择。扩大解耦型冷板液冷或单相浸没液冷的应用范围,并推动交换机等网络设备应用液冷,可在解决高密服务器散热问题的同时,降低整体能耗。
高效制冷:
- 智算中心负载率波动大,需要弹性供电。采用大容量、模块化高效UPS形成电力资源池,并以每列机架为颗粒度预留高密和普通密度机架互弹的条件,同时采用末端小母线供电方案,提升供电灵活性。
弹性供电:
- 智算业务需求常是短时爆发的,这就要求智算中心能敏捷部署。采用一体化电源系统、预制集成泵站、集装箱或模块化智算中心等预制模块化建造技术,可以大幅缩短交付周期。
敏捷部署:
- 新型智算中心应积极应用绿色能源。结合园区特点部署分布式光伏、风电,实现清洁能源的就地生产与消纳。同时,通过电力交易、绿证交易等模式采购可再生能源,并规模化应用氢燃料电池。
绿色能源应用:
- 借助大数据、AI和数字孪生技术,构建智能运维管理体系。运用AI算法预测设备故障、优化能源使用、调度资源,将运维从“被动响应”转向“主动预测”。
智能化运维管理:
6. 未来展望
随着数据规模、集群能力的持续扩大,对新型智算底座的升级提出了更高要求。面向未来,我们需要在超节点、跨集群训练、软件框架等领域实现技术突破,并持续探索存算一体、光子芯片等先进技术,为下一次信息变革奠定基础。
- 大模型的进一步发展,让单纯依靠Scale out已无法满足需求。算力形态将向超节点架构演进,通过内部高速总线互联AI芯片,一台超节点即可实现万亿参数训练和实时推理。为此,中国移动提出了全向智感互联系统(OISA),旨在为GPU间南向通信提供百卡级别的高速互联方案。
引入超节点,拓展Scale up能力:
- 组网规模向十万卡级演进,受限于机房空间和供电,必然会出现同园区跨楼宇或小局点短距互联的需求。但网络传输距离的拉长会增加时延和对无损缓冲的要求,需要通过工程和科学上的研究来验证和优化。
大规模逻辑集群,突破距离限制:
- 需要在软硬件、算法、网络等多方面持续创新,提升自动化能力、跨平台支持和大规模模型训练效率,降低用户开发门槛。
软件框架技术,提升自动化与效率:
- 大模型的发展给传统冯诺伊曼架构带来了功耗、内存和通讯三大挑战。未来需要从存算一体、光子芯片等领域探索新的设计和应用范式,为智算产业与AI生态的结合开辟新的道路。
潜在换道超车技术,突破摩尔极限:
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名