首页 > 教程攻略 > ai资讯 >大模型重磅!Llama3发布!

大模型重磅!Llama3发布!

来源:互联网 时间:2026-08-01 14:03:27

今天,Meta正式发布了下一代开源大型语言模型——Llama 3。如果你关注过大模型领域,应该知道Llama系列一直是开源社区的中坚力量,这次的新版本可以说是一次跨越式的升级。8B和70B参数的两个模型(预训练版和指令微调版)已经上线,并且将在AWS、Databricks、Google Cloud、Hugging Face、Kaggle、IBM WatsonX、Microsoft Azure、NVIDIA NIM和Snowflake等主流平台上提供。硬件支持方面,AMD、AWS、Dell、Intel、NVIDIA和高通也都加入了生态。

这次发布不仅仅是模型本身,Meta还做了一系列配套工作:新的可信与安全工具,比如Llama Guard 2、Code Shield和CyberSec Eval 2,以及一份详细的研究论文将在后续放出。基于Llama 3技术构建的Meta AI,也已经成为业界领先的AI助手之一——它能帮用户学习、工作、创作内容,甚至连接社交。用一句话总结:开源大模型的标杆,这次被重新定义了。

Llama 3 的目标

Meta的目标很明确:打造一个能与当今最好的专有模型媲美的开放模型。为此,他们听取了开发者的大量反馈,重点提升模型的实用性,同时继续在负责任地使用和部署LLM方面保持行业领导地位。采取开源精神,尽早且频繁地发布——让社区在模型仍在完善过程中就能获得访问权。这次发布的文本模型只是Llama 3系列的开端,后续还会加入多语言、多模态、更长上下文支持,并持续提升推理和编码等核心能力。

最先进的性能

新发布的8B和70B参数模型,相比Llama 2是一次巨大飞跃,在同类规模上树立了新的行业标准。预训练和后训练的技术改进,使得这两个指令微调模型成为目前8B和70B规模上最好的选择。具体来说,后训练流程大幅降低了错误拒绝率,提升了一致性,响应多样性也更丰富。在推理、代码生成和指令遵循等能力上,提升显著,模型变得更“可控制”了。

评估细节请参考官方说明,不同设置和参数下结果可能略有差异。

开发团队在标准基准测试之外,还专门设计了一套高质量的人类评估集,包含1800个提示,覆盖12个关键用例:寻求建议、头脑风暴、分类、封闭式问答、编码、创意写作、提取、角色扮演、开放式问答、推理、改写和总结。为了确保评估的公平性,即使是Meta自己的建模团队也无法访问这个数据集。下图展示了人类评估的汇总结果,与Claude Sonnet、Mistral Medium和GPT-3.5的对比一目了然。

人类注释者的偏好排名显示,70B指令模型在真实场景中的表现非常出色,与同类规模的竞品相比有明显优势。预训练模型的表现也同样亮眼。

评估细节请参见官方文档。

要打造出这样的语言模型,Meta在创新、扩展和优化上下了大功夫。他们的设计哲学贯穿四个关键要素:模型架构、预训练数据、扩展预训练和指令微调。

模型架构

与设计哲学一致,Llama 3选择了相对标准的仅解码器Transformer架构,但相比Llama 2做了几项关键改进。分词器升级到了128K令牌,编码效率更高,直接提升了模型性能。8B和70B版本都采用了分组查询注意力(GQA),推理效率显著提升。训练序列长度设定为8192个令牌,并使用掩码确保自注意力不会跨越文档边界。

训练数据

数据质量是大模型成败的关键。Llama 3在超过15T令牌的数据上进行了预训练,全部来自公开可用的来源。这个规模是Llama 2的七倍,其中代码数据更是翻了四倍。为了给未来的多语言能力做铺垫,超过5%的训练数据由30多种语言的高质量非英语数据组成——当然,目前这些语言的性能还无法与英语持平。

为了确保数据质量,Meta开发了一整套数据过滤管道:包括启发式过滤器、NSFW过滤器、语义去重方法和文本分类器。有意思的是,他们发现Llama 2本身在识别高质量数据方面表现惊人,于是干脆用Llama 2为Llama 3的数据质量分类器生成训练数据。在最终数据混合上,他们进行了大量实验,确保模型在琐事、STEM、编码、历史知识等各领域都有良好表现。

扩展预训练

为了充分利用海量训练数据,Meta在扩展预训练上投入了巨大精力。他们建立了一套详细的扩展法则,用于预测下游基准性能,从而选择最优的数据混合和训练计算分配。这套法则甚至可以在实际训练开始前,就预测出最大模型在关键任务(比如HumanEval上的代码生成)上的表现。

一个有趣的发现是:对于8B参数模型,按照Chinchilla最优训练量约200B令牌计算,但实际训练到比这多两个数量级的15T令牌时,模型性能仍在继续对数线性提高。更大的模型可以用更少的计算量匹配较小模型的性能,但在推理效率上通常还是小模型更有优势。

训练最大的Llama 3模型时,Meta结合了数据并行、模型并行和流水线并行三种方式。最有效的实现在16000颗GPU同时训练时,单GPU计算利用率超过400 TFLOPS。他们在两个定制的24000颗GPU集群上进行了训练,并开发了自动化错误检测、处理和维护的高级训练栈,使得整体有效训练时间超过95%。与Llama 2相比,训练效率提升了约三倍。

指令微调

为了充分释放预训练模型在聊天场景的潜力,Meta对指令微调方法进行了创新。后训练流程结合了监督式微调(SFT)、拒绝采样、近端策略优化(PPO)和直接策略优化(DPO)。SFT使用的提示和PPO/DPO使用的偏好排名数据,对模型对齐效果影响巨大。最大的质量提升恰恰来自于对这些数据的精心策划,以及人类注释者多轮质量保证。

一个值得注意的细节:通过PPO和DPO学习偏好排名,显著提升了Llama 3在推理和编码任务上的表现。很多时候,模型知道如何产生正确的推理轨迹,但并不知道如何“选择”它——偏好排名训练恰好解决了这个问题,教会模型如何做出正确选择。

使用 Llama 3 构建

Meta的愿景是让开发者能够自由定制Llama 3,同时轻松采用最佳实践。这次版本提供了新的可信与安全工具:更新的Llama Guard 2、CyberSec Eval 2组件,以及全新的Code Shield——一个用于过滤LLM生成的不安全代码的推理时护栏。

特别值得一提的是,Meta与torchtune合作开发了Llama 3。torchtune是一个新的PyTorch原生库,用于轻松编写、微调和实验大语言模型。它支持内存高效、可黑客的训练配方,并且与Hugging Face、Weights & Biases、EleutherAI等流行平台集成,甚至支持Executorch在移动和边缘设备上运行推理。从提示工程到使用LangChain与Llama 3集成,Meta提供了一套完整的入门指南,覆盖从下载到大规模部署的全链路。

系统级的责任方法

有趣的是,Meta将Llama 3定位为“更广泛系统的一部分”,把开发者放在驾驶座的位置。模型本身只是基础组件,开发者根据自身最终目标设计系统。指令微调在安全性上扮演了重要角色,内部和外部团队都进行了红队安全测试——利用人类专家和自动化方法生成对抗性提示,评估化学、生物、网络安全等风险领域。Llama Guard 2使用了MLCommons分类法,CyberSecEval 2增加了代码解释器滥用倾向、攻击性网络安全能力以及对提示注入攻击的易感性评估。Code Shield则提供了对不安全代码建议的风险缓解和代码解释器滥用预防。

Meta还更新了负责任使用指南(RUG),建议开发者根据应用场景检查和过滤所有输入输出,同时鼓励使用云服务商的内容审核API等工具。

大规模部署 Llama 3

Llama 3将很快在所有主要平台上可用——云提供商、模型API提供商等,真正实现“无处不在”。基准测试显示,新分词器相比Llama 2令牌效率提升了最多15%。得益于GQA的加入,尽管8B模型比Llama 2 7B多出10亿参数,推理效率却基本持平。你可以查看Llama Recipes仓库,里面包含了从微调到部署再到模型评估的所有开源代码。

Llama 3 的未来

8B和70B版本只是Llama 3系列的开端。接下来还有更多惊喜:超过400B参数的最大模型仍在训练中,虽然还未发布,但团队对其发展趋势信心满满。在接下来的几个月里,Meta将陆续发布具有多模态能力、多语言对话、更长上下文窗口和更强整体性能的新模型。训练完成后,还会放出详细的研究论文。

从早期检查点的趋势来看,400B+模型在多个基准上的表现已经令人期待——当然,这些数据还不是正式发布版本。

评估细节请参见官方说明。

Meta一直坚信,开放带来更好、更安全的产品,更快的创新和更健康的市场。这次以社区为先的Llama 3发布,只是长期开放AI生态战略的一部分。从今天开始,这些模型已经在领先的云、托管和硬件平台上可用,未来还会有更多。