HCIE-AI:大模型微调和安全治理
1.概述
先来一张全景图,把大模型微调的整体脉络梳理清楚。下面这张图概括了从预训练到微调再到推理的完整链条,重点关注的是“微调”这一环节在整个流程中的位置和作用。

紧接着这张图进一步拆解了微调内部的分类:全参微调、低参微调、基于人类反馈的强化学习(RLHF)等不同路线,以及它们各自适用的场景。

2. 目标
微调到底要解决什么问题?这张图给出了三个核心目标:让模型学会特定任务、对齐人类偏好、以及提升在垂直领域的表现。简单说,就是让通用模型变成“专才”。

3. 预训练和微调对比
预训练和微调的关系就像“通识教育”和“专业进修”。预训练阶段模型学习海量通用知识,而微调阶段则针对具体场景做定向优化。下面这张对比图清晰地展示了两者的异同——从数据规模、计算资源到输出效果,差异一目了然。

4. 微调与提示工程、RAG对比
说到微调,就绕不开另外两个常见方案:提示工程(Prompt Engineering)和检索增强生成(RAG)。它们各自有什么优劣势?这张图把ICL(上下文学习)、提示工程、RAG和微调做了横向对比——从成本、效果、可控性等维度一一拆解。

提示工程的核心在于设计输入格式,引导模型输出期望结果,但这依赖模型本身的能力,并且对复杂任务效果有限。

接下来这张图展示了RAG的工作流程:先检索外部知识库,再结合检索结果生成回答。好处是知识实时更新且可解释性强,但缺点是延迟较高。

再来看看微调与RAG在具体场景下的效果差异——微调更适合风格、格式的定向改造,而RAG更适合事实性问答。

最后这张图总结了选择策略的决策树:根据数据量、任务类型、算力预算等因素,判断该用提示工程、RAG还是微调。

5. 如何让一个英文好,中文不好的模型提高中文能力?
一个现实问题:很多模型英文能力出色,但中文表现不尽人意。怎么解决?这张图给出了几种思路——增量预训练、多语言混合微调、以及针对中文数据做定向优化。核心在于让模型在已有的语言知识基础上,通过少量高质量中文数据“激活”对中文的理解。

6. 大模型参数敏感性
微调时参数怎么调?哪些参数最敏感?这张图揭示了学习率、批大小、训练步数等超参数对模型收敛效果的敏感度。有趣的是,不同规模的模型对同一参数的敏感度完全不同,这给调参工作增加了很多不确定性。

7. LLM微调数据集构建
数据集是微调的基石,构建方式分为手动和自动两种。
7.1 手动构建
手动构建要求逐条设计输入输出对,质量可控但成本极高。下面这几张图展示了手动构建的典型流程:先确定任务定义,再写种子样本,然后人工审核迭代。





7.2 自动构建
自动构建则利用更强的模型(如GPT-4)生成数据,再经过过滤和清洗得到训练集。这张图展示了自动构建的流水线:从种子数据出发,通过大模型生成多样性样本,最后人工抽检质量。

8. 微调分类
微调按照更新参数的范围可以分为全参微调(Full Fine-Tuning)和低参微调(PEFT)。下面这张图从参数量、内存占用、训练速度、效果等多个维度做了对比。简单说:全参微调上限高但资源消耗大,低参微调高效但可能损失部分表达能力。

9. 全参微调
全参微调指的是更新模型中所有可训练参数。这张图展示了全参微调在反向传播时的计算图——每一层的权重梯度都会计算并更新。

9.1 推理内存评估
全参微调后的模型推理时,内存消耗主要来自模型权重和中间激活。下面两张图分别给出了不同规模模型(7B、13B、70B)在推理时的内存需求估算,量化精度和序列长度对内存的影响也被标注出来。

9.2 训练内存评估
训练阶段的内存开销更大,因为除了权重和激活,还需要保存优化器状态和梯度。这张图给出了全参微调训练时各项内存占比的详细分解。

10. 低参微调
低参微调(Parameter-Efficient Fine-Tuning,PEFT)的目标是用尽量少的可训练参数达到接近全参微调的效果。下面这张图提纲挈领地列出了主流PEFT方法:Freeze、Prompt Tuning、Prefix-Tuning、P-Tuning、P-Tuning v2、LoRA、QLoRA等。

10.1 Freeze微调
Freeze微调的思路很简单:固定大部分预训练参数,只更新最后几层或部分特定层。两张图分别展示了冻结策略的示意图以及不同冻结程度下的效果对比——冻结太多效果下降,冻结太少又失去低参优势。


10.2 Prompt Tuning
Prompt Tuning不更新模型参数,而是在输入层加入可学习的软提示(soft prompt)向量。这张图清晰展示了软提示如何与输入embedding拼接,然后一起送入模型。

10.3 Prefix-Tuning
Prefix-Tuning更进一步,在每一层transformer的输入前都添加可学习的“前缀”向量。下图给出了在编码器和解码器结构中分别添加前缀的示意图,相比Prompt Tuning,它能影响更深层的表示。

10.4 P-Tuning
P-Tuning类似于Prompt Tuning,但引入了一个轻量网络来生成更好的软提示向量,避免直接随机初始化带来的不稳定。这张图展示了P-Tuning的整体架构。

10.5 P-Tuning v2
P-Tuning v2是P-Tuning的升级版,它把软提示加到每一层(类似Prefix-Tuning),并且支持更长的提示长度。这张图对比了P-Tuning v2与v1在效果上的差异。

10.6 LoRA
LoRA(Low-Rank Adaptation)是目前最流行的PEFT方法之一。它通过低秩矩阵分解来近似权重更新量,只训练两个小矩阵。这张图展示了LoRA在注意力层中插入的低秩适配器结构。

10.7 QLoRA
QLoRA在LoRA基础上引入了4-bit量化,进一步降低显存占用,让大模型微调可以在消费级显卡上运行。下图给出了QLoRA的量化训练流程和内存对比。

11. 微调框架介绍
工欲善其事,必先利其器。当前主流的微调框架有Hugging Face Transformers、DeepSpeed、PEFT库、以及LLaMA-Factory等。下面两张图分别对比了这些框架在支持的方法、分布式训练能力、易用性上的差异,方便根据项目需求选择。


12. LLM安全治理
微调之后,模型可能产生有害输出或泄露隐私,安全治理成为必要环节。这一部分主要涉及基于人类反馈的强化学习(RLHF)及其变体。下面两张图介绍了PPO(Proximal Policy Optimization)和DPO(Direct Preference Optimization)两种对齐方法的基本流程。


PPO介绍
PPO通过奖励模型对生成结果打分,再以强化学习方式优化策略。这张图展示了PPO训练的完整循环:初始策略生成回复,奖励模型给出分数,PPO更新策略。

DPO介绍
DPO则直接利用偏好对数据进行训练,不需要显式的奖励模型,实现更简洁。这张图对比了DPO与PPO在算法复杂度和训练效率上的差异。

13. 总结
本文主要介绍了大模型微调和LLM安全治理的核心内容。从微调的目标、与预训练及其他技术的对比,到数据集构建、不同微调方法的原理与适用场景,再到安全对齐的PPO/DPO方案,基本覆盖了该领域的关键知识点。如果后续有笔试需求,这部分内容大概占12%的权重,值得重点掌握。