首页 > 教程攻略 > ai资讯 >值得一看的大模型最新综述:兼看多语种大模型微调数据集Aya

值得一看的大模型最新综述:兼看多语种大模型微调数据集Aya

来源:互联网 时间:2026-07-30 13:07:08
今天是2024年2月14日,星期三,农历初五,开市大吉,祝大家新年快乐。 值得一看的大模型最新综述:兼看多语种大模型微调数据集Aya 短暂歇息之后,我们来看看近期一些有趣的工作。一个是新发布的大模型综述《Large Language Models: A Survey》,里面的图表相当漂亮,读下来会有不少收获。另一个是多语种微调数据集Aya(《Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning》),这类资源对于提升大模型的多语言能力,有直接的收益。 ## 一、值得一看的新大模型综述,细节可多研究 这篇综述《Large Language Models: A Survey》(链接:https://arxiv.org/abs/2402.06196)在模块设计上逻辑性不错,里面的图很漂亮,值得仔细翻阅。 **关于大模型的能力项分类** 目前,很大一部分研究都在探索大模型的能力边界。大模型所具备的能力,可以细分为几个维度:基础能力(Basic),包括世界知识理解、通用理解能力、多语种能力以及代码能力;涌现能力(Emerging),包括指令遵循、推理能力、少样本上下文学习;此外还有增强后的能力(Augmented),涉及用户交互、自我迭代优化,以及工具调用。 **关于当前主流大模型的分类** 从不同角度切入,大模型的分类方式已经非常多样。例如,按架构可分为Encoder-Only、Decoder-Only、Encoder-Decoder,按参数量级可分为小型、中型、大型,按权限则有私有与公有之分。下表中,我们可以看到GPT家族(GPT-3、CODEX、WebGPT等)、LLaMA家族(LLaMA 1、LLaMA 2等)、PaLM家族(PaLM-2、Med-PaLM 2等),每个模型所对应的训练tokens数量、数据集规模及参数量,都一目了然。 **关于大规模参数量对fewshot的影响** GPT-3的出现,明确揭示了一个趋势:模型规模越大,对上下文信息的利用效率就越高。在一项要求模型从单词中移除随机符号的简单任务中,无论是否附带自然语言的任务描述,大模型都展现出了显著的上下文学习能力。 **关于人类反馈学习RLHF的实现流程** 人类反馈学习(RLHF)是ChatGPT能力强大的底层逻辑之一。经典的SFT-RM-PPO三阶段流程,依然是最值得回顾的实现路径。值得一提的是,最新进展已经从PPO逐步演化到了DPO。DPO直接优化人类偏好,同时避免了复杂的强化学习过程。传统方法是先拟合一个奖励模型,再用RL策略去最大化该奖励;而DPO则通过一个简单的分类目标,直接优化出最符合人类偏好的策略,无需显式的奖励函数或RL。 **关于当前代表性的大模型框架演变时间线** 从2017年的BERT到2023年的Mixtral,大模型的演化速度惊人,可以画出一条完整的时间线,回顾这一路的技术跃迁。 **关于大模型研发过程中的不同部件** 大模型的研发是一条很长的流水线,每个环节都值得深入。具体包括数据清洗、分词策略、位置编码、模型架构、预训练、微调与指令微调、人类偏好对齐、解码策略、成本优化、模型压缩与适配等。每一处细节,都是可以深挖的技术点。 **关于当前大模型不同的位置编码** 位置编码在长文本建模中尤为关键。目前主流方案包括绝对位置编码、相对位置编码、旋转位置编码(RoPE)以及相对位置偏置等。 **关于大模型预训练数据的处理** 在宏数据精炼(Macrodata Refinement)的后续阶段,仅CommonCrawl这一个来源,就有近90%的原始文件被剔除。整个流程经历了去重、去噪等多个严格步骤。 **关于当前大模型评估数据集** 如何客观评估大模型性能,是一个核心难题。目前已有大量针对不同能力项的评测基准:测试代码能力的HumanEval、MBPP,测试数学能力的GSM8K、MATH等。对应这些基准的评估指标计算方式、官方评测代码及排行榜,都值得持续关注。 **关于大模型的应用及增强范式** 大模型如何落地,是当前最受关注的话题。这其中既涉及模型自身的局限性(典型如幻觉问题,以及由此衍生的一系列评估指标),也涉及提示工程(Prompt Engineering,包括思维链、思维树、自一致性、自动提示工程等)。另一方面,检索增强生成(RAG)通过外部知识为大模型赋能,其关键要素包括检索器、工具链(如LangChain, LlamaIndex)以及问答环节的提示设计。此外,Agent机制让模型能通过调用外部工具完成任务,知识图谱也在这一过程中扮演着重要角色。 **关于大模型Agent的论述** 举个例子,HuggingGPT是一个典型的Agent框架,它利用大模型调用HuggingFace上的API,完成特定场景下的任务。一个标准的Agent架构,通常包括外部知识模块、AI Agent核心、工具调用策略、策略制定器及动作执行器。 **关于大模型结构的趋势** Switch Transformer的Encoder block,也就是当前MoE(混合专家模型)的常见架构。关于这一点,可以参考我们之前写过的文章。 **关于模型量化加速与蒸馏** 如何在低资源环境下训练和部署大模型,是一个很有趣的课题。早期有LoRA,而现在的模型自蒸馏技术也受到广泛关注。通过将单个模型(甚至多个模型)的知识蒸馏到更小的模型上,可以获得尺寸更小、甚至能在边缘设备上运行的模型。典型过程如下图所示。 ## 二、值得一看的多语种大模型微调数据集Aya 开源微调数据集的重要性不言而喻,特别是对于多语种场景。最近这篇《Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning》(https://arxiv.org/abs/2402.06619)很值得一读。 **已有的多语种微调数据集** 下表中对比了不同的指令微调数据集。对勾代表允许商业使用的许可,≈代表限制性许可,错号则代表无法获得许可证。 **Aya微调数据集** 图1展示了Aya数据集、Aya系列模型以及Aya评估套件的整体框架。这些数据集由65种语言的流利使用者撰写,经过人工编辑,形成了一大批原创的提示-回答对。右侧部分显示,Aya数据集由44个单语和多语模板指令数据集,加上19个翻译数据集组成,横跨114种语言,涵盖文本分类、自然语言生成、问答三大主要任务。图中蓝色椭圆内的数值,代表该数据集中涉及的语言数量。 ## 总结 本文主要介绍了最新的大模型综述,以及一个高质量的多语种微调数据集。无论是其中的实现流程,还是每个模块的进一步延伸,都值得反复研读,会有不小的收获。