死磕10万卡GPU算力集群,腾讯星脉网络2.0有什么秘密武器?
大数据产业创新服务媒体

——聚焦数据 · 改变商业
我们正在经历一场计算体系的核心变革。过去,数据中心的主角是CPU集群,如今,随着人工智能,尤其是大模型的爆发,GPU算力集群已经站上了舞台中央。GPU凭借其强大的并行计算能力,成为大规模AI模型训练的绝对主力。但问题也随之而来:当集群规模扩张到万卡、甚至十万卡级别时,传统的网络通信架构就显得有些“喘不过气”了。高频的数据交换、海量的参数同步,让网络成为整个训练流程中那个最容易被忽视的“堵点”。这种背景下,计算集群的网络通信必须来一场彻底的变革,才能充分释放GPU集群的潜力。
腾讯最近推出的星脉网络,正是针对这一痛点。7月1日,他们宣布了星脉网络的全新升级。这套软硬协同的高性能网络体系,通过全面升级的自研网络设备、通信协议、通信库和运营系统,为解决AI大模型训练中的通信瓶颈,提供了一个值得关注的新方案。
AI大模型训练:网络已成为关键的“堵点”
近年来,AI大模型的规模膨胀速度令人咋舌。OpenAI的GPT-3拥有1750亿参数,而更先进的GPT-4已经突破了万亿参数大关。参数规模的飞速增长,让模型能捕捉到更多的语义和上下文,能力自然水涨船高。但随之而来的,是计算、存储和网络通信需求的急剧膨胀——传统的计算和网络架构,真的有点招架不住了。
不仅仅是参数变多,模型的架构本身也在进化。从传统的密集模型(Dense Model)到如今大受欢迎的混合专家模型(MoE),架构设计的目标非常明确:在提升训练效率和推理能力的同时,精打细算地利用计算资源。Dense模型无论处理什么任务,都要动用全部参数,效率不高;而MoE模型则像一个“智能调度中心”,只会激活与当前任务最相关的“专家”模块进行计算,这就大大降低了计算复杂度,也减少了资源浪费。
这种参数规模和架构演变的双重压力,对训练提出了更高的要求。要训练这些庞然大物,必须构建强大的GPU集群,分布式计算是唯一的选择。但是,分布式计算也带来了新的麻烦——节点之间的通信开销和同步问题。如何高效地管理和协调成百上千个GPU节点,就成了提升整体计算性能的关键。
集群训练中产生的庞大通信需求,正让通信开销和性能瓶颈成为最大的“拦路虎”。
通信开销是分布式计算里绕不开的成本。节点在等待数据同步的时候,GPU只能闲着,无法进行计算,这就直接拉低了整个集群的算力利用效率。所以,AI大模型训练对网络系统提出了全新的要求:更高的传输速率、更大的组网规模、更聪明的通信协议,以及更高的可用性和稳定性。
腾讯星脉网络2.0:专为10万级GPU的网络通信而生
前面分析了大模型训练对网络通信的全新需求和面临的挑战。腾讯推出的星脉网络2.0,正是直面这些挑战而来。它的核心目标很明确:通过高性能的自研网络设备、通信协议、通信库和运营系统,打造一个高效、稳定的计算环境,从而支撑起万亿级参数规模的AI大模型训练。
那么,和星脉网络1.0相比,这次升级版到底带来了哪些变化?具体来看,星脉网络2.0实现了四大关键组件的全面升级:自研网络设备、自研通信协议TiTa、集合通信库TCCL,以及全栈网络运营系统。
自研网络设备:让赛道更宽、车速更快
网络设备的性能直接决定了数据传输的速度和效率。面对万亿级参数模型的高频数据交换,传统的“赛道”显然不够用了。必须对交换机、光模块和网卡进行全面升级,才能满足更高的传输速率和更大的组网规模。
在硬件上,星脉网络2.0的升级幅度相当大。交换机的容量从25.6T直接翻倍到了51.2T,简单说,就是数据通行的“主干道”变宽了一倍。光模块的速率也从200G升级到了400G,相当于把“车道”上的限速大幅提高。此外,CNIC网卡作为公有云业内首款专为AI训练设计的网卡,整卡带宽高达400Gbps,每台服务器能实现3.2T的整体通信带宽。这一套“组合拳”打下来,不仅提升了通信效率,还显著减少了网络拥塞。
自研通信协议TiTa:从“事后堵车”到“主动疏导”
在AI大模型训练中,通信协议的效率和稳定性至关重要。传统的被动拥塞控制算法,有点像交通指挥员看到路口堵死了才去疏导,效率自然不高。它依赖交换机上的ECN标记,检测到拥塞后再通知各节点降速,属于“事后补救”。
腾讯自研的TiTa协议则完全不同,它采用主动拥塞控制算法。通过端侧网卡主动感知网络状态,并在拥塞发生前就智能地调整数据包发送速率——这就像给每辆车装上了“智能导航”,能提前预判路况,绕开拥堵路段。相比传统算法,TiTa可以更有效地避免网络拥堵,减少数据包丢失,提升网络吞吐量,并优化数据包发送速率,最终降低整个通信过程中的延迟和拥堵。
集合通信库TCCL:让GPU之间的数据“无缝对接”
在AI大模型训练中,不同节点之间的数据交换又频繁又复杂。集合通信库TCCL正是解决这个问题的关键。它采用NVLINK+NET异构并行通信技术,实现了GPU间数据的高效传输。具体来说,每个GPU网卡都构建了独立的网络通道,数据可以并行传输,这相当于增加了传输的“车道数”,间接提升了链路的总带宽。
更聪明的是,TCCL内部集成了Auto-Tune Network Expert自适应算法。这个算法能根据不同的机型、网络规模、模型算法和数据包大小等因素,动态调整网络参数,确保在各种场景下都能跑出最优性能。这样做的结果,就是资源利用率大幅提高,资源浪费被有效减少。
灵境仿真平台:将故障定位时间从天级缩短到分钟级
一个高效稳定的运营系统,是保证AI大模型训练持续进行的基础。腾讯的灵境仿真平台在这方面扮演了“诊断专家”的角色。它能收集训练过程中的日志和GPU相关信息,通过仿真模拟来还原训练任务,从而快速定位训练中的卡顿和性能抖动问题。这个功能听起来很厉害,实际效果更惊人:它将问题定位时间从传统的“天”级,直接缩短到了“分钟”级。
此外,整个全栈网络运营系统在星脉网络2.0中得到了全面升级,提供了360度无死角的立体监控。这意味着能更快地发现和定位网络问题,并快速修复故障,保证训练任务不中断。这种全方位的监控和快速修复能力,极大地提升了训练的稳定性和高可用性。
星脉网络2.0的这四个关键组件并不是孤立的,而是相互协同,形成一个整体。
网络技术变革的拐点:进化才刚刚开始
展望未来,AI大模型很可能进一步突破参数规模的限制,向着更大、更复杂的方向发展。未来我们看到的模型,可能会包含数十万亿甚至百万亿参数,这意味着模型的表达能力和泛化能力会达到一个全新的高度。
当前网络技术虽然已经进步不少,但未来仍需持续创新。在提高传输速率、扩展网络规模和优化通信协议这些方面,我们还有很长的路要走。比如,未来的高性能网络会致力于实现数十Tbps甚至更高的传输速率。同时,扩展网络规模也是一个核心方向——能否支持更多计算节点组成的大规模集群,将成为能否应对超大规模AI模型训练的关键。
在大规模计算集群的发展趋势中,“超节点”是一个值得关注的技术方向。在分布式计算和网络架构里,超节点一般指的是那些具备卓越计算能力、能够高效协调数据和任务的高性能节点。随着AI技术的迅猛发展,特别是在2020年之后,超节点在大规模AI模型训练中的作用日益凸显。当年OpenAI的GPT-3问世时,就利用了超节点技术来优化资源分配和数据流动。英伟达在2021年推出的DGX SuperPOD集群也采用了超节点架构,通过将成百上千个GPU节点整合在一起,提供了前所未有的计算能力和网络带宽。
腾讯也一直在关注并布局超节点技术。据悉,在计划推出的星脉网络3.0中,就将融入最新的超节点技术。超节点在大规模AI模型训练中的作用,远不止提供计算能力那么简单。它还通过智能调度和资源管理,显著提升训练效率和性能,从而有效减少通信延迟和传输瓶颈。有了超节点,计算节点之间的协同会更加顺畅,数据传输也更高效,模型训练的速度自然就快了起来。
通过持续的技术创新,未来的网络技术在通信效率和成本优化方面,会更加注重智能化和自适应性。通过进一步优化通信协议、引入智能调度算法,能更高效地管理数据传输,减少网络拥堵和延迟。同时,采用低功耗、高性能的网络设备,将在降低通信成本的同时,提升整体网络性能。
高性能网络推动AI大模型训练,对于整个技术升级和产业应用落地都意义重大。持续优化网络性能和通信效率,能显著提升AI模型的训练速度和效果,加速技术创新和应用推广。可以说,高性能网络技术不仅是AI大模型训练的基础保障,更是未来智能社会建设的重要支撑。以腾讯的大模型技术产品体系为例,星脉网络正是腾讯混元和元宝背后的高性能网络基础。正是因为星脉网络解除了大模型训练和推理的网络瓶颈,腾讯整个大模型产业大厦才有了一个牢固的根基。
可以预见,在企业对高效能算力和高性能网络需求的驱动下,相关技术将进入一个快速发展期。未来几年,全球高性能网络的市场规模会显著增长,并带动整个网络产业链的发展。通过不断推进技术进步和产业合作,AI大模型训练和高性能网络技术必将迎来一个更加光明的未来。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名