解读llama3
来源:互联网
时间:2026-08-01 14:27:24
今天Meta正式发布了Llama 3,圈子里一下就热闹起来了。作为一个长期关注AI系统的人,有几个核心判断值得先拿出来聊聊:
Llama 3的发布,
——模型架构没怎么动,但数据量和数据质量的提升,直接带来了肉眼可见的效果飞跃。把数据工程的重要性又推上了一个台阶
数据越多,算力需求就越大。开源大模型玩家的门槛这次又被抬高了,
。说实话,看着这个算力消耗,不焦虑是不可能的。万卡H100级别已经成了标配
在集群系统层面,Meta
,而万卡级系统的容错和故障恢复,已经成了绕不开的关键问题。同时在走RoCE和InfiniBand两条路
有意思的是,Llama 3的算法改动实在太小了——长序列、多模态这些大家都在追的能力它都没上。官方说8B和80B只是个开始,模型还没训练完,后续会补上这些能力。是不是Meta感受到了什么压力,急着先发一版?
1. Llama 3与Llama 2的模型结构(计算)区别
先说结论:
Llama 3和Llama 2的模型架构完全一致
Llama 3-8B与Llama 2-7B的具体差别
对比Huggingface模型中的config.json,一切都很清楚:模型类都是`LlamaForCausalLM`,结构不变。具体的差异在于:
① vocab_size:32000 → 128256。
1504MB
② max_position_embeddings:4096 → 8192。
③ num_key_value_heads:32 → 8。
减少
1536MB
④ intermediate_size:11008 → 14336。
增大
2496MB
综合以上几个调整,模型总体增大了2464M,这也是7B变成8B的直接原因。不过说到底,
计算模式没有任何本质改变
PS:
2. 效果提升主要是数据工程
① 数据量:
15T token
7倍多
4倍多
1千万人工标注
② 数据质量:
一系列数据过滤pipeline
文本分类器来预测数据质量
③ 数据混合比例的探索:
混合不同来源的数据
3. 模型训练的基础设施
3.1 集群细节
Meta这次构建了
两个定制的24K GPU集群
在16K个GPU上进行训练时,每个GPU超过400 TFLOPS的计算利用率
40%
关于这两个集群,Meta在另一篇AI基础设施博客中做了详细介绍。两个集群的
核心区别
Cluster 1:采用RoCE方案
Cluster 2:采用InfiniBand方案
400 Gbps端点互联
之所以同时跑两套方案,目的是
评估不同类型互连对大规模训练的适用性和可扩展性
Meta在同时走RoCE和InfiniBand两条线
其实在Llama 2的技术报告中,Meta就已经用过类似的配置——一个RoCE、一个InfiniBand,相同的互联带宽,两个A100集群。原文提到:“RoCE(一种更便宜、更商业化的互连网络)在2000个GPU的规模下几乎可以像昂贵的InfiniBand一样扩展,这让预训练变得更加大众化。”
核心问题还是IB太贵了
3.2 容错和故障恢复
这次Meta特别强调了一个点:为了最大限度地延长GPU的正常运行时间,他们开发了
先进的新训练堆栈
硬件可靠性和无声数据损坏检测机制
减少了检查点和回滚的开销
95%以上
三倍
万卡级别的集群训练,容错已经成了无法回避的问题。这一点在Grok、Google Gemini等技术报告中都有强调,尤其是Google Gemini的报告中专门提到了大规模系统中一个棘手的现象——
SDC(Silent Data Corruption)
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名