最大405B:Llama-3.1 发布,第一时间详解
来源:互联网
时间:2026-08-18 14:46:28
## 在这篇文章发出时
## Meta 发布了 Llama 3.1
「赛博禅心」第一时间带来详细报道

这次发布,来得比很多人预想中更快。
北京时间2024年7月23日23点,Meta正式发布了其最新的开源模型——Llama 3.1,包含8B、70B和405B三个尺寸,最大上下文提升到了128k。其中,405B是目前Meta最强大的模型,从评分上看,它已经超过了GPT-4 0125,和Claude 3.5打成了平手。
说到这里,还有个有趣的插曲:昨天下午,405B的Llama疑似在Hugging Face被偷跑,Twitter上瞬间炸锅——虽然那个链接很快404了,但热心群众已经把它转成了磁力链接,大概800G的样子。
往前翻一翻,三个月前Meta才开源了Llama 3的8B和70B模型。这才过了多久,就又来了一波大的。
---
## 第一部分:这次发布
那就先来看看这次发布的几个要点。
### Llama 3.1——老模型,新升级
此前推出的8B和70B两个版本,这次全面升级为Llama 3.1,上下文长度从原来的范围直接拉到了128K,推理能力也有了明显增强。
### 405B超大杯
这是全新发布的版本,表现相当聪明。和当下最强的GPT-4、Claude 3.5放在一起比较,差距已经非常微妙,可以说旗鼓相当。
### 全面提升
更多的对比测试结果,大家在官方公布的数据中都能看到,这里不再逐一列举。
---
## 数据训练
训练的数据量是惊人的——Llama 3使用了超过15万亿token的公开数据,动用了超过1.6万个H100 GPU。
**训练思路**
Meta选择了标准的仅解码器Transformer架构,而非混合专家模型,核心考量是最大化训练稳定性。训练过程中采用了迭代式的后训练程序,每一轮都结合了监督微调(SFT)和直接偏好优化(DPO)。
**微调细节**
在后训练环节,Llama经过了多轮对齐才最终生成可用的聊天模型。每一轮都包含监督微调、拒绝抽样和直接偏好优化这么三步。有意思的是,绝大部分SFT示例用的是合成数据——通过多次迭代生成质量越来越高的合成数据,覆盖了模型所需的所有能力。
---
## 第二部分:扎克伯格的致辞
伴随这次发布,扎克伯格也发了一篇致辞,标题叫「Open Source AI Is the Path Forward」——开源人工智能是未来的发展方向。这篇内容与不久前国内某大佬的“开源模型是智商税”论调形成了有趣的对照。
以下是他致辞的核心内容:
### 开源人工智能是未来的发展方向
在高性能计算的早期,当时的主要科技公司都大力投资于开发自己的闭源Unix版本。当时很难想象其他任何方法能够开发出如此先进的软件。然而最终,开源Linux变得流行起来——最初是因为它允许开发人员随意修改其代码并且更加经济实惠,随着时间的推移,因为它变得更加先进、更加安全,并且拥有比任何闭源Unix更多功能的更广泛生态系统的支持。如今,Linux是云计算和运行大多数移动设备的操作系统的行业标准基础——我们都因此受益于更优质的产品。
我相信人工智能会以类似的方式发展。如今,有几家科技公司正在开发领先的封闭模型。但开源很快在缩小差距。去年,Llama 2只能与边缘之后的旧一代模型相提并论。而今年,Llama 3在一些领域具有竞争力,甚至在某些方面领先于最先进的模型。从明年开始,我们预计未来的Llama模型将成为行业中最先进的。但即使在那之前,Llama已经在开放性、可修改性和成本效益方面处于领先地位。
今天,我们正在迈出迈向开源人工智能成为行业标准的下一步。我们发布了Llama 3.1 405B,这是第一个前沿级别的开源人工智能模型,以及新的和改进的Llama 3.1 70B和8B模型。除了相对于封闭模型具有显著更好的成本/性能之外,405B模型是开源的事实将使其成为微调和提炼较小模型的最佳选择。
除了发布这些模型外,我们还与一系列公司合作,以发展更广泛的生态系统。亚马逊、Databricks和Nvidia正在推出一整套服务,以支持开发人员微调和提炼自己的模型。像Groq这样的创新者已为所有新模型构建了低延迟、低成本的推理服务。这些模型将在包括AWS、Azure、Google、Oracle等在内的所有主要云上提供。像Scale.AI、戴尔、德勤等公司已准备好帮助企业采用Llama并使用自己的数据训练定制模型。随着社区的壮大和更多公司开发新服务,我们可以共同将Llama打造成行业标准,并将人工智能的好处带给每个人。
Meta致力于开源人工智能。我将概述为什么我相信开源是最适合您的开发堆栈,为什么开源Llama对Meta有好处,以及为什么开源人工智能对世界有益,因此是一个长期存在的平台。
#### 开源人工智能之于开发者的益处
当我与世界各地的开发人员、首席执行官和政府官员交谈时,通常会听到一些共同的主题:
我们需要训练、微调和提炼我们自己的模型。每个组织都有不同的需求,最好使用不同尺寸的模型来满足这些需求,这些模型是通过特定数据进行训练或微调的。设备上的任务和分类任务需要小型模型,而更复杂的任务则需要更大的模型。现在,您可以使用最先进的Llama模型,继续使用您自己的数据对其进行训练,然后将其提炼为您理想尺寸的模型——而无需我们或其他人看到您的数据。
我们需要掌控自己的命运,不要被困在封闭的供应商中。许多组织不愿意依赖他们无法运行和控制的模型。他们不希望封闭的模型提供商能够改变他们的模型,修改使用条款,甚至完全停止为他们提供服务。他们也不想被锁定在一个拥有模型独家权利的单一云中。开源使得有兼容工具链的广泛公司生态系统成为可能,您可以轻松地在它们之间移动。
我们需要保护我们的数据。许多组织处理敏感数据,需要保护并且不能将其发送到云API上的封闭模型。其他组织简单地不信任封闭模型提供商处理他们的数据。开源通过使您能够在任何地方运行模型来解决这些问题。众所周知,开源软件往往更安全,因为它的开发更加透明。
我们需要一个高效且价格实惠的模型来运行。开发者可以在他们自己的基础设施上运行Llama 3.1 405B上的推理,成本大约是使用像GPT-4o这样的封闭模型的50%,适用于用户界面和离线推理任务。
我们希望投资于那些将成为长期标准的生态系统。许多人认为开源发展速度比封闭模型快,他们希望在能够为他们提供最大长期优势的架构上构建自己的系统。
#### 为什么开源人工智能对Meta有益
Meta的商业模式是致力于为人们打造最佳体验和服务。为了实现这一目标,我们必须确保始终能够获得最先进的技术,避免陷入竞争对手的封闭生态系统,他们可能会限制我们的构建。
我的一次重要经历是在我们的服务受到苹果平台限制时建设。在他们对开发者征税的方式、他们施加的武断规则以及阻止我们推出的所有产品创新之间,很明显,如果我们能够构建我们产品的最佳版本且竞争对手无法限制我们的构建,Meta和许多其他公司将能够为人们构建更好的服务。从哲学层面上说,这是我坚信在AI和AR/VR开放生态系统中构建下一代计算的重要原因之一。
人们经常问我是否担心通过开源Llama而失去技术优势,但我认为这样做忽略了更重要的一些方面:
首先,为了确保我们能够获得最好的技术,并且不会长期被锁定在封闭生态系统中,Llama需要发展成一个完整的工具、效率改进、硅优化和其他集成的生态系统。如果我们是唯一使用Llama的公司,这个生态系统就不会发展起来,我们也不会比封闭的Unix变体好到哪里去。
其次,我预计人工智能的发展将继续保持竞争激烈,这意味着在某一特定时间点开源任何模型并不会给予比下一个最佳模型更大的优势。Llama要成为行业标准,关键在于一代又一代地保持竞争力、高效性和开放性。
第三,Meta和封闭模型提供商之间的一个关键区别是,出售AI模型的访问权限并不是我们的商业模式。这意味着公开发布Llama并不会损害我们的收入、可持续性或研究投资能力,就像对封闭提供商那样。(这也是几家封闭提供商一直在游说政府反对开源的原因之一。)
最后,Meta拥有悠久的开源项目和成功历史。通过与Open Compute Project共享我们的服务器、网络和数据中心设计,并让供应链标准化我们的设计,我们节省了数十亿美元。我们通过开源领先工具如PyTorch、React等受益于生态系统的创新。长期坚持这种方法对我们一直有效。
#### 开源人工智能之于世界的益处
我相信开源对于积极的人工智能未来是必要的。人工智能拥有比任何其他现代技术更大的潜力,可以提高人类的生产力、创造力和生活质量,加速经济增长,同时在医学和科学研究领域推动进展。开源将确保全球更多人能够分享人工智能的好处和机会,避免权力过度集中在少数公司手中,同时可以更均衡、更安全地在社会各个领域推广这项技术。
目前存在关于开源AI模型安全性的辩论,我认为开源AI将比其他选择更安全。我认为各国政府会得出结论,支持开源符合他们的利益,因为这将使世界更加繁荣和安全。
我对安全的理解框架是,我们需要保护免受两类伤害:无意和有意。无意伤害是指当人工智能系统可能造成伤害,即使运行它的人并非有意这样做。例如,现代人工智能模型可能无意中给出错误的健康建议。或者,在更具未来感的场景中,一些人担心模型可能无意中自我复制或过度优化目标,对人类造成损害。有意伤害是指恶意使用人工智能模型的坏人以造成伤害。
值得注意的是,大多数人对人工智能的担忧主要集中在无意造成的伤害上——从AI系统对将使用它们的数十亿人的影响到人类大部分真正灾难性的科幻场景。在这方面,开源应该更安全,因为这些系统更加透明,可以被广泛审查。从历史上看,出于这个原因,开源软件更安全。同样,使用带有Llama Guard等安全系统的Llama可能比封闭模型更安全、更可靠。因此,大多数关于开源AI安全的讨论都集中在有意造成的伤害上。
我们的安全流程包括严格测试和红队评估,以评估我们的模型是否有造成实质性危害的能力,目标是在发布之前减轻风险。由于这些模型是开放的,任何人都可以自行测试。我们必须记住,这些模型是通过已经在互联网上的信息进行训练的,因此在考虑危害时的起点应该是模型是否能比可以从谷歌或其他搜索结果中快速获取的信息带来更多危害。
在思考有意图的伤害时,有助于区分个人或小规模行为者可能采取的行动,与拥有庞大资源的国家等大规模行为者可能采取的行动。
在未来的某个时候,个别不良分子可能会利用人工智能模型的智能,从互联网上可获得的信息中制造全新的危害。在这一点上,权力的平衡对人工智能安全至关重要。我认为生活在一个人工智能广泛部署的世界会更好,这样更大的行动者可以制约较小的不良分子的权力。这就是我们在社交网络上管理安全的方式——我们更强大的人工智能系统识别并阻止那些经常使用较小规模人工智能系统的不那么复杂的行动者的威胁。更广泛地说,大型机构大规模部署人工智能将促进社会的安全和稳定。只要每个人都能访问相似世代的模型——这正是开源所倡导的——那么拥有更多计算资源的政府和机构就能够用更少的计算资源来审查不良行为者。
美国和民主国家应该如何应对像中国这样拥有大量资源的国家的威胁是下一个问题。美国的优势在于分散和开放的创新。有人认为我们必须关闭我们的模式,以防止中国获得对它们的访问,但我认为这不会奏效,只会给美国及其盟友带来不利。我们的对手擅长间谍活动,窃取适合放在一个拇指驱动器上的模式相对容易,而大多数科技公司远未以使这更加困难的方式运作。似乎最有可能的情况是,只有封闭模型的世界会导致少数几家大公司以及我们的地缘整治对手能够访问领先的模型,而初创公司、大学和小型企业则错失机会。此外,将美国的创新限制在封闭开发中会增加我们根本无法领先的可能性。相反,我认为我们最好的策略是建立一个强大的开放生态系统,并让我们领先的公司与我们的政府和盟友密切合作,确保他们能够最好地利用最新进展,并在长期内取得可持续的先发优势。
在考虑未来的机遇时,请记住,今天大多数领先的科技公司和科学研究都是建立在开源软件的基础上的。如果我们共同投资于开源人工智能,下一代公司和研究将使用开源人工智能。这包括刚刚起步的初创公司,以及那些可能没有资源从头开始开发自己最先进人工智能的大学和国家的人。
开源人工智能代表着世界最好的机会,利用这项技术创造最大的经济机会和安全保障。
#### 让我们一起建设这个项目
在过去的Llama模型中,Meta为我们自己开发了它们,然后发布,但并没有过多关注构建更广泛的生态系统。这次发布我们采取了不同的方式。我们正在内部建立团队,以使尽可能多的开发人员和合作伙伴使用Llama,并积极建立合作关系,以便生态系统中更多公司也能为其客户提供独特功能。
我相信Llama 3.1版本将成为行业的一个转折点,大多数开发人员将开始主要使用开源,我期待这种方法从这里开始不断增长。希望您能加入我们,一起努力将人工智能的好处带给世界上的每个人。
---
## 第三部分:其他
随之发布的还有一份详细的技术文档:**The Llama 3 Herd of Models**,一共92页,非常详尽。
(注:打赏阅读者可在后台回复特定关键词获取文档下载方式) -
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名