首页 > 教程攻略 > ai资讯 >构建10万张H100的大模型训练集群!

构建10万张H100的大模型训练集群!

来源:互联网 时间:2026-08-12 17:21:52

自从GPT-4发布以来,总有人觉得AI的能力好像就卡在那儿不动了。这话说得有点道理,但根本原因很简单:没人能持续给单一模型投入越来越大的计算量。看看现在发布的这些模型,算力水平基本都围着GPT-4打转(训练计算量大约2e25 FLOP)。谷歌的Gemini Ultra、Nvidia Nemotron 340B、Meta的LLAMA 3,它们分配到的FLOPS跟GPT-4不相上下,甚至更高,但因为架构设计差了点意思,始终没能真正突破GPT-4的效果。

OpenAI手里其实拿到了更多的算力,但他们把这些资源主要用在了做更小、训练得更“狠”、推理成本更低的模型上,比如GPT-4 Turbo和GPT-4o。他们也自己承认,直到最近才开始着手训练下一代的大模型。

AI的下一个明确方向,就是用海量的视频、图像、音频和文本,训练一个拥有数万亿参数的多模态Transformer。这件事还没人真正干成过,但抢头名的竞赛已经打得热火朝天了。

包括OpenAI/Microsoft、xAI、Meta在内的几家大型AI实验室,都在拼命搭建超过10万张GPU的集群。光这些训练集群本身的服务器资本支出就超过40亿美元,而且它们还严重受限于数据中心容量和供电——因为GPU要放在一起才能实现高速芯片间互联。一个10万GPU的集群,需要超过150MW的数据中心容量,一年耗电1.59太瓦时,按标准电价0.078美元/千瓦时算,光电费就要1239万美元。

今天我们来深入聊聊大规模AI训练集群以及围绕它的基础设施。造这样的集群可不是砸钱就能搞定的。因为各种组件(尤其是网络)故障率很高,想实现高利用率可太难了。我们还会讨论电力挑战、可靠性、检查点、网络拓扑选项、并行方案、机架布局,以及整个系统的物料清单。一年多以前,我们报道过Nvidia的InfiniBand问题,这导致一些公司转而选择Spectrum-X以太网。我们也会重点说说Spectrum-X的主要缺陷——正是这些缺陷让超大规模计算公司最终倒向了Broadcom的Tomahawk 5。

为了直观理解一个10万GPU集群能提供多少算力,咱们对比一下:OpenAI训练GPT-4时用了大概2万个A100,跑了90到100天,训练BF16 FLOPS约2.15e25 FLOP(2150万ExaFLOP),那个集群的峰值吞吐量只有6.28 BF16 ExaFLOP/秒。而在10万个H100集群上,这个数字会飙到198/99 FP8/FP16 ExaFLOP/秒,跟2万个A100的集群比,峰值理论AI训练FLOP提升了31.5倍。

在H100上,AI实验室训练数万亿参数的模型时,FP8模型FLOP利用率(MFU)能到35%,FP16 MFU能到40%。MFU衡量的是在考虑各种开销(电源限制、通信不稳、重新计算、落后者、低效内核等)之后,峰值潜在FLOPS的有效吞吐量。一个10万H100的集群,用FP8算的话,四天就能训完一个GPT-4。如果跑100天,你可以实现约6e26(6亿ExaFLOP)的有效FP8模型FLOP。当然,硬件的可靠性差会显著拉低MFU。

能源挑战

一个10万H100集群的关键IT功耗大约是150MW。虽然单张GPU功耗700W,但在每台H100服务器内部,CPU、网卡、电源等每张GPU还需要额外约575W。除了H100服务器,AI集群还需要一堆存储服务器、网络交换机、CPU节点、光模块等,这些加起来还要在IT功耗上再加10%。150MW是什么概念?美国最大的国家实验室超级计算机El Capitan,IT功耗才30MW。政府超算跟行业一比,简直小巫见大巫。

数据中心在电力上有个大难题:目前没有哪一栋建筑能轻松部署新的150MW电力。大家说“10万GPU集群”的时候,通常指的是在同一个园区内,而不是同一栋楼里。电力需求如此迫切,以至于xAI把田纳西州孟菲斯的一个旧工厂改造成了数据中心,因为实在没别的选择。

这些集群用光模块做网络连接,光模块的成本跟传输距离成正比。长距离的“单模”DR和FR光模块能可靠传输500米到2公里,但价格可能是只能传50米左右的“多模”SR和AOC光模块的2.5倍。而园区级的“相干”800G光模块能传2公里以上,价格更是贵出10倍多。

小型H100集群通常只用多模光模块在400G速率下通过一两层交换机把各GPU连起来。大型GPU集群就需要加更多层交换,光器件的成本会变得极其昂贵。这类集群的网络拓扑会因首选供应商、当前和未来的工作负载以及资本支出差异很大。

每栋建筑通常包含一个或多个计算“岛屿”,它们之间用便宜的铜缆或多模光模块连接。然后跨“岛屿”的互联就要用长距离光模块。下图展示了4个计算“岛屿”,岛内带宽很高,但岛间带宽较低。

不同客户选择不同的网络拓扑,考虑的因素包括数据传输基础设施、成本、可维护性、电力、当前和未来的工作负载等。所以有的客户选基于Broadcom Tomahawk 5的交换机,有的坚持用InfiniBand,还有的选NVIDIA Spectrum-X。下面我们来深入聊聊各自的原因。

并行方案回顾

要理解网络设计、拓扑、可靠性问题和检查点策略,我们先快速回顾一下万亿参数训练中常用的三种并行性:数据并行、张量并行、流水线并行。我们对并行性有更全面的解释(包括专家并行性)。

数据并行是最简单的形式:每个GPU都持有完整的模型权重,每个GPU(rank)接收不同的数据子集。它的通信需求最小,因为只需要在GPU间汇总梯度(all-reduce)。但数据并行只在每个GPU有足够内存存放整个模型权重、激活和优化器状态时才有效。像GPT-4这种1.8万亿参数的模型,仅模型权重和优化器状态在训练时就需要高达10.8TB的内存。

为了克服内存限制,就要用张量并行。在张量并行中,每一层的工作和模型权重分布在多个GPU上,通常沿着隐藏维度拆分。中间结果需要在自注意力、前馈网络和层归一化中多次进行设备间的all-reduce。这需要高带宽,尤其是低延迟。实际上,域内的每个GPU在每一层上都和其他GPU协同工作,就像它们是一个巨大的GPU一样。张量并行通过张量并行度减少了每个GPU使用的总内存。比如现在常把8个张量并行度放在NVLink上,这样每个GPU的内存使用就减少8倍。

为了进一步解决每个GPU内存不够装模型权重和优化器状态的问题,使用流水线并行。流水线并行中,每个GPU只负责一部分层,只对该层进行计算,然后把输出传给下一个GPU。这种技术通过流水线并行度来减少所需内存。流水线并行也有大量通信量,但没张量并行那么重。

为了最大化模型FLOP利用率(MFU),公司通常把三种并行方式组合起来形成3D并行。张量并行用在H100服务器内的GPU之间,同一个岛屿内的节点之间用流水线并行。因为数据并行通信量最低,岛屿之间速度较慢,所以岛屿之间就用数据并行。

像FSDP这样的整体技术,在小GPU尺寸的极大模型中很常见,但它行不通——它跟流水线并行不兼容。

网络设计考量

网络设计要配合并行方案。如果每个GPU都用胖树拓扑以最大带宽连到所有其他GPU,成本会高到离谱,因为需要4层交换。每增加一层网络,光器件成本就飙升。

所以,没人给大型GPU集群部署完整的胖树架构。取而代之的是,他们搞出一些计算“岛屿”,岛内是完整胖树,岛间带宽较小。实现方法很多,但大多数公司选择在顶层网络做“超额订阅”。比如Meta上一代GPU集群架构(高达32000个),总共8个岛屿,岛内是全胖带宽,然后在顶部再加一层交换,超额订阅7:1。岛间网络比岛内网络慢7倍。

GPU部署涉及多个网络:前端、后端和扩展(NVLink)。有时候你会让不同的并行方案跑在不同的网络上。NVLink网络可能是唯一一个速度够快能支撑张量并行带宽要求的网络。后端网络通常能轻松处理其他并行类型,但如果做了超额订阅,通常就只适合数据并行。

还有的人甚至不在顶层做超额订阅。他们干脆把通信从后端网络转移到前端网络进行岛间通信。

混合InfiniBand和前端网络架构

有一家大公司就是用多个InfiniBand岛屿,再加上前端以太网来做训练。原因很简单:前端网络成本低得多,而且可以利用现有的数据中心园区网络做建筑间和区域间的路由。

但不幸的是,随着MoE这种稀疏技术的应用,模型尺寸增长更快,前端网络要处理的通信量也在涨。这个权衡必须仔细优化,否则最后两个网络的成本可能一样——因为前端网络带宽最终会大到跟后端网络差不多。

需要注意的是,谷歌专门用前端网络做其多TPU pod的训练。他们的“计算织物”叫ICI,最大只能扩展到8960个芯片,用昂贵的800G光器件和光路交换机连接每64个TPU的水冷机架。所以谷歌必须让TPU前端网络比大多数GPU前端网络更强,来弥补这个不足。

当训练中用到前端网络时,岛间必须进行网络拓扑感知的全局all-reduce。首先,每个pod或岛屿在pod内部的InfiniBand或ICI网络上执行本地reduce-scatter,让每个GPU/TPU得到梯度的一个子部分的总和。然后,用前端以太网在每个主机等级之间执行跨pod all-reduce,最后每个pod再执行pod级all-gather。

前端网络还负责加载数据。随着多模态图像和视频训练数据的转变,前端网络需求会指数级增长。这时候前端网络带宽就要在加载大视频文件和执行all-reduce之间争夺资源。如果有不规则的存储网络流量,落后者问题会更严重,导致所有all-reduce变慢,模型训练无法可预测。

另一种选择是使用4级InfiniBand网络,超额订阅7:1,有4个pod,每个pod有24576个H100,采用非阻塞的3级系统。相比使用前端网络,这种方式对未来带宽增长有更大的灵活性——因为在建筑A的交换机上加光器件连接到建筑B的交换机,远比在集群里每个机箱上做完整的前端网卡升级(比如从100G升到200G)容易。

这会产生更稳定的网络模式:前端网络专注加载数据和检查点,后端网络专注GPU到GPU的通信。这也有助于解决落后者问题。但代价是,4级InfiniBand网络需要大量额外的交换机和光器件,非常昂贵。

轨道优化 vs 机架中部设计

为了提高可维护性,并增加铜网络(<3米)和多模网络(<50米)的使用,一些客户放弃了NVIDIA推荐的轨道优化设计,转而选择机架中部设计。

轨道优化是一种技术:让每台H100服务器连接到8个不同的叶交换机(而不是全部连到同一个机架中部交换机),这样每个GPU只需1个交换机跳转就能跟更远的GPU通信。这在真实环境中能提升所有集合操作的性能。All-to-all集合通信在混合专家(MoE)专家并行中大量使用。

轨道优化设计的缺点是,你必须连接到不同距离的不同叶交换机,而不是让一个靠近服务器中所有8个GPU的机架中部交换机。当交换机能放在同一个机架里时,可以用被动直连电缆(DAC)和有源电缆(AEC),但轨道优化设计中,交换机不一定在同一个机架,必须用光器件。而且叶到脊的距离可能超过50米,逼得用单模光器件。

采用非轨道优化设计,你可以用便宜的直连铜缆替换连接GPU到叶交换机的98304个光器件,让GPU织物的25-33%是铜的。从下面的机架图可以看到,不再是每个GPU到叶交换机的连接向上走到电缆托盘、再横向9个机架到专用的轨道优化叶交换机架,而是把叶交换机放在机架中部,这样每个GPU就能用DAC铜缆。

DAC铜缆运行温度更低、功耗更少,比光器件便宜得多。而且由于温度低、功耗少,更可靠,这减少了被称为“闪烁”(网络链接间歇性掉线)和故障的问题——这是所有高速互连中使用光器件的主要痛点。使用DAC铜缆的Quantum-2 IB脊交换机功耗747瓦特,而用多模光器件时功耗会飙升到1500瓦特。

另外,对数据中心技术人员来说,轨道优化设计的初始布线非常耗时,因为每个链接的末端最远有50米,不在同一个机架上。而机架中部设计中,叶交换机就在机架中部,就像连到叶交换机上的所有GPU都在同一个机架里。在机架中部设计里,你甚至可以在工厂做集成测试,因为计算节点和叶交换机都在同一个机架内。

可靠性和恢复

可靠性是这些大型集群最重要的运营问题之一,因为当前前沿训练技术都是同步的。最常见的可靠性问题包括GPU HBM ECC错误、GPU驱动程序卡住、光器件故障、NIC过热等。节点不断下线或出现错误。

为了保持低故障恢复时间并继续训练,数据中心必须在现场准备热备用节点和冷备用组件。发生故障时,与其停下整个训练,不如更换一个已经打开的工作备用节点继续训练。这些服务器很多停机时间仅仅是重启节点并解决出现的问题。

但简单的重启不能解决所有问题,很多情况下需要数据中心技术人员亲自到场诊断和更换设备。最好的情况下,技术人员几个小时能修好一个坏的GPU服务器,但很多时候可能要几天才能把一个坏节点重新接入训练运行。坏掉的节点和备用热节点都是GPU,虽然理论上有FLOPS可用,但并没在积极训练模型。

当模型训练时,需要频繁地把模型检查点存到CPU内存或NAND SSD上,以防出现HBM ECC等错误。发生错误后,必须从慢速存储层重新加载模型和优化器的权重,然后重启训练。也可以用Oobleck这样的容错训练技术,提供用户级应用驱动的办法处理GPU和网络故障。

不幸的是,频繁的检查点和容错训练技术会损害系统的整体MFU。集群需要不断暂停,把当前权重保存到持久性内存或CPU内存。而且从检查点重新加载时,通常每100次迭代才存一次,这意味着你最多会损失99个有用工作步骤。在一个10万GPU集群上,如果每次迭代要2秒,那么在第99次迭代时发生故障,你会损失高达229个GPU天的工作量。

另一种故障恢复方法是让备用节点只通过后端织物上的RDMA从其他GPU复制权重。后端GPU织物大约400Gbps,每个GPU有80GB HBM,复制权重大约要1.6秒。通过这种方法,你最多只损失1个步骤(因为更多GPU的HBM会有最新权重的副本),也就是2.3个GPU天的计算量,加上另外1.85个GPU天用于从其他GPU HBM复制权重。

大多数领先的AI实验室已经实现了这种方法,但很多小公司还在用从检查点重启的笨重、缓慢、低效的办法,因为简单。通过内存重建恢复故障可以为大型训练提升好几个百分点的MFU。

最常见的问题之一是InfiniBand/RoCE链路故障。即使每个NIC到叶交换机链路的平均故障间隔是5年,但由于光器件数量庞大,一个全新的、正常工作的集群上第一次作业故障只需要26.28分钟。如果没有内存重建恢复,那么10万GPU集群中花在重启训练上的时间会比推进模型的时间还多。

因为每个GPU直接连到ConnectX-7 NIC(通过PCIe开关),网络架构层面没有容错,所以故障必须在用户训练代码里处理,直接增加了代码库的复杂性。这是NVIDIA和AMD当前GPU网络织物的主要挑战之一:即使一个NIC坏了,那个GPU就没有其他路径可以与其他GPU通信。由于当前LLM在节点内使用张量并行,哪怕一个NIC、一个收发器或一个GPU坏了,整个服务器就算下线了。

正在有大量工作在做网络可重新配置,让节点不那么脆弱。这项工作至关重要,因为现状意味着整个GB200 NVL72会因为一个GPU故障或一个光器件故障而下线。一个价值数百万美元的72 GPU机架下线,比一个价值几十万美元的8 GPU服务器灾难得多。

Nvidia已经注意到这个主要问题,增加了专用的可靠性、可用性和可维护性(RAS)引擎。我们认为RAS引擎会分析芯片级数据,如温度、恢复的ECC重试次数、时钟速度、电压,预测芯片可能的故障时间并警告数据中心技术人员。这样他们就能做主动维护,比如用更高风扇速度来保持可靠性,在后续维护窗口把服务器拉出来做进一步物理检查。另外,在开始训练之前,每个芯片的RAS引擎会执行全面自检,比如运行已知结果的矩阵乘法,检测静默数据损坏(SDC)。

Cedar-7

一些客户如Microsoft/OpenAI在做另一种成本优化:每个服务器用Cedar Fever-7网络模块,而不是8个PCIe外形的ConnectX-7网卡。使用Cedar Fever模块的一个主要好处是,只需要4个OSFP笼子而不是8个,这样计算节点端也能用双端口2x400G光器件(而不仅仅是交换端)。连接到叶交换机的光器件数量从每个H100节点8个减少到4个。这样连接GPU到叶交换机的总计算节点端光器件从98304个减少到49152个。

GPU到叶交换机的链接减半,也有助于改善首次作业故障的估计时间。我们估计每个双端口2x400G链接的故障平均时间约4年(单端口400G链接为5年),这样首次作业故障的估计时间提升到42.05分钟,比没有Cedar-7模块的26.28分钟好很多。

Spectrum-X NVIDIA

目前有一个10万H100集群正在部署,预计今年底投入运营,它用的是NVIDIA Spectrum-X以太网。

去年我们报道过Spectrum-X在大型网络中相比InfiniBand的多项优势。除了性能和可靠性优势,Spectrum-X还有巨大的成本优势。Spectrum-X以太网的优势在于每个SN5600交换机有128个400G端口,而InfiniBand NDR Quantum-2交换机只有64个400G端口。注意,Broadcom的Tomahawk 5交换机ASIC也支持128个400G端口,这让当前一代InfiniBand处于明显劣势。

一个完全互连的10万集群可以做到3级而不是4级。4级变3级意味着需要1.33倍的光器件。因为Quantum-2交换机更低的基数,一个10万集群上完全互连的GPU最大数量限制为65536个H100。下一代InfiniBand交换机叫Quantum-X800,有144个800G端口,从数字“144”可以看出,这是为NVL72和NVL36系统设计的,预计不会在B200或B100集群中大量使用。用Spectrum-X可以省掉4级的开销,但不幸的是你仍然需要买Nvidia LinkX产品线的高价光器件,因为其他光器件可能不工作或未经Nvidia验证。

Spectrum-X相对于其他供应商的主要优势是它得到了NVIDIA库(如NCCL)的一流支持,而且黄仁勋会把你们推到新产品分配队列的前面。相比Tomahawk 5芯片,你需要大量内部工程努力来优化你的网络与NCCL以实现最大吞吐量。

使用以太网而不是InfiniBand作为GPU织物有一个不幸的劣势:以太网目前不支持SHARP的网络内归约。网络内归约让网络交换机运行计算来执行各GPU的求和。SHARP的理论网络带宽增加2倍,因为它把每个GPU必须做的发送和写入次数减半。

Spectrum-X的另一个劣势是,第一代400G Spectrum-X用Bluefield3而不是ConnectX-7作为权宜之计。未来几代我们预计ConnectX-8会与800G Spectrum-X很好配合。Bluefield-3和ConnectX-7的价差大约300美元ASP(超大规模批量),另外Bluefield-3比ConnectX-7多耗50瓦特。因此每个节点多耗400W,降低了整体训练服务器的“每焦耳智能”。

Broadcom Tomahawk 5

为了避免支付巨额的Nvidia税,很多客户正在部署基于Broadcom Tomahawk 5的交换机。每个基于Tomahawk 5的交换机与Spectrum-X SN5600有相同的128个400G端口,如果你的公司有好的网络工程师,可以实现类似性能。此外,你可以从任何供应商买任何通用光器件和铜缆来混合匹配。

大多数客户直接跟用Broadcom交换机ASIC的原始设计制造商(ODM)如Celestica合作,以及跟像Innolight和Eoptolink这样的光器件公司合作。根据交换机成本和通用光器件成本,Tomahawk 5比Nvidia InfiniBand便宜得多,也比Nvidia Spectrum-X便宜。

但不幸的是,你需要有足够的工程能力来修补和优化Tomahawk 5上的NCCL通信集合。开箱即用,NCCL只对Nvidia Spectrum-X和Nvidia InfiniBand做了优化。好消息是,如果你有40亿美元来建10万GPU集群,那肯定有足够的工程能力来修补NCCL并编写优化程序。软件当然难搞,Nvidia总是走在前沿,但我们预计每个超大规模计算公司都会进行这类优化,并逐渐从InfiniBand转移。

下面我们讨论4种不同10万GPU集群网络设计的物料清单,包括交换机和光器件成本,展示不同设计的优劣,以及一个针对减少光器件优化的GPU集群物理平面图。