首页 > 教程攻略 > ai资讯 >Meta AI网络演化

Meta AI网络演化

来源:互联网 时间:2026-08-22 14:21:14

这张来自Meta分享的图片,可以说非常直观地展示了他们在AI基础设施这条路上的演进历程。

摘要里提到,这次分享的核心是Meta在构建AI应用网络时遇到的各种"坑",尤其是AI应用百花齐放,对底层基础设施的需求更是千变万化。他们给出的解法思路,可以归纳为几个关键点:打造灵活的基础设施、搭建大型GPU集群,以及把前端和后端网络放在一起做联合优化。当然,在整个过程中,反复强调测试和基准的重要性,这确实是硬道理。

Meta的AI基础设施到底是怎么一步步走到今天的?可以梳理出几个清晰的脉络:

首先是训练模式的演变。最早是靠CPU硬扛,后来发现GPU才是AI计算的天选之子,果断转向GPU加速。

然后是分布式系统的构建。模型越来越大,单机根本玩不转,必须搞分布式训练系统来支撑。

网络架构方面,Meta押注了RoCE(RDMA over Converged Ethernet),这套方案在数据传输效率上很能打,特别适合AI训练这种数据密集型的活儿。

在拓扑结构上,他们采用了经典的CLOS架构,通过leaf交换机和spine交换机的分层设计来搞定网络扩容和性能问题。

当然,规模上去了,硬件层面的挑战也随之而来。路由、传输、硬件本身的可靠性,都成了需要一一攻克的难题。

Meta的AI应用场景确实丰富,覆盖了ranking、推荐系统,以及当下最火热的生成式AI。

挑战一:设计灵活的基础设施

第一个核心挑战,是设计一套能适应不同AI模型和用例的基础设施。无论是排名推荐、内容理解,还是语音转文本,这些场景对算力和网络的要求简直是天差地别。

举个例子就能看明白:

  • 生成式AI模型通常跑在数千甚至上万个Nvidia A100 GPU组成的集群上,计算规模已经达到了zettaFLOPS级别——也就是每秒10的21次方次浮点运算。
  • 为了满足这种级别的需求,Meta的目标是构建一个每秒能进行20 exaFLOPs(10的18次方次浮点运算)的集群,这样才能快速完成大型模型的训练。
  • 和早期模型相比,现在的目标已经变成在一天甚至几小时内,完成像LLaMA(一个拥有650亿参数的模型)这样规模模型的训练。而过去,类似的任务可能需要数天甚至数周。

下图是一张ranking、推荐和生成式AI模型的差异雷达图,能很清楚地看到生成式AI和另外两个场景在训练和推理阶段有多不同。而大模型推理本身,又因为其特殊性,可以细分为prefill和decoding两个阶段,这两个阶段在计算、内存、网络资源方面的需求差异也非常大。

Meta AI网络演化

排名和推荐场景的训练系统,采用的是flat fabric(扁平化)架构,可以同时处理多个任务。这个架构下,主要是一个运行着ethernet/RoCE的、包含4000个GPU的集群在干活。

大模型训练系统则不一样,它们通常每天要训练数百甚至数千个基础模型,一次只跑几个大型任务,这些任务会直接把整个集群占满,每天执行的运算量是以ZettaFLOPS来计算的。

(在截止分享时间前,也就是23年底前)Meta正在规划和部署的是一个支持3.2万个GPU的InfiniBand和RoCE混合集群,专门用于大型语言模型的训练。而在此之前,他们构建的是1.6万个GPU的InfiniBand集群。

值得一提的是,Meta对"开放"这件事一直态度鲜明。从开放系统、网络-存储架构、机架设计到模型开源,他们都在积极推进。

挑战二:生产过程中的规划、建设、测试、部署

第二个核心挑战,来自于生产环境中的实际落地。规划、建设、测试、部署,每一个环节都比想象中复杂和繁琐得多。这里面涉及到不同类型的问题、不同产品线的组件、产品的迭代开发,而所有这些,都只是整体解决方案中的一小部分。

下图展示的是Meta训练后端集群的一部分,里面有rank RoCE、LLM RoCE以及Infiniband等不同的网络;有A100到H100再到后续GB200的GPU迭代;还有不同类型的交换机和NIC。

同时,在构建布线系统时,比如从100G升级到200G,或从200G升级到400G,像Wedge 40、Wedge 100或Wedge 400这类产品生命周期其实挺长的,所以它们的服务和迭代周期也很长。但在AI领域,需求变化快,迭代周期短,这对基础设施来说是一个巨大的挑战。

除了GPU,Meta也在自研ASIC芯片,多条腿走路,增加技术自主性。

以上讨论的,其实主要是后端网络训练部分。与之对应的,还有承载着所有计算、存储等任务的前端网络。这两套系统必须协同工作,才能提供高质量的服务。

下面这部分,是关于生产实践环境中的测试和benchmarking方案。这些方案能帮助开发研究者对系统性能有更清晰的认识,也方便后续做针对性的优化。

在做系统整体优化和升级的过程中,Meta也会对软硬件的性能做全面的重新评估,然后选择最优的方案。毕竟,在AI这个赛道上,细节往往决定了最终效果的差异。