首页 > 教程攻略 > ai资讯 >LLM微调新方法DoRA:权重幅度与方向的智能分解,比LoRA更精细、更有效!

LLM微调新方法DoRA:权重幅度与方向的智能分解,比LoRA更精细、更有效!

来源:互联网 时间:2026-08-03 12:42:40

DoRA:权重分解低阶适应,让微调更接近全量微调

大模型微调领域又出现了一个值得关注的新方法——DoRA(Weight-Decomposed Low-Rank Adaptation)。这是NVIDIA最新提出的一种参数高效微调(PEFT)方案,核心思路可以概括为:把预训练权重拆成“幅度”和“方向”两部分,然后分别做微调。听起来好像只是把LoRA换了个玩法?其实不然,它在学习能力和训练稳定性上都有明显提升,而且推理阶段没有额外开销。更妙的是,它天然可以和LoRA搭配使用。

那么,DoRA具体是怎么操作的?我们拆开来看。

DoRA的关键步骤

  1. 权重分解

    :预训练权重矩阵 (W_0) 被分解为幅度向量 (m) 和方向矩阵 (V)。这里的讲究在于,(V) 的每一列都是单位向量,而 (m) 中的每个元素则定义了对应列向量的大小——说白了,就是分别抓住了“有多长”和“往哪走”。
  2. 微调过程

    :微调时,方向矩阵 (V) 保持固定不动,只对幅度向量 (m) 进行直接训练。那方向怎么调?这里就用到LoRA了——通过两个低秩矩阵的乘积来近似方向上的权重变化。
  3. LoRA的应用

    :DoRA把LoRA塞进了方向组件的高效更新中,既维持了参数数量上的节俭,又能对模型做更精细的调整。

DoRA概述,该方法将预训练权重分解为幅度和方向两个组成部分

为什么要这么折腾?动机来自FT与LoRA的差异分析

研究者通过权重分解分析,对比了全量微调(FT)和LoRA的更新模式,发现两者存在显著差异:

  • FT(全量微调)

    :在幅度和方向上表现出更多样化的更新。这也好理解——全量微调自由度大,能适应各种下游任务,学习模式自然更复杂。
  • LoRA(低秩适应)

    :幅度和方向的更新之间存在正相关性,即两者变化往往是成比例的。这种相关性可能限制了LoRA在精细调节模型权重方面的能力——好比只能同步加减速,不能单独调整方向盘。
  • DoRA(权重分解低秩适应)

    :展现出与FT相似的学习模式,能够在幅度和方向上进行更独立的调整。换句话说,DoRA在保持参数效率的同时,更有效地模仿了FT的学习能力。

三种微调方法在不同层级和中间步骤中对查询矩阵的幅度和方向更新。不同的标记代表不同训练步骤的矩阵,不同的颜色代表每一层的矩阵。

实验效果:一致优于LoRA,向FT看齐

实验数据相当有说服力。DoRA在常识推理、视觉指令微调、图像/视频-文本理解等多个下游任务上,均一致优于LoRA。更关键的是,无论是从经验上还是数学上,DoRA都表现出与FT相近的学习行为。

LLaMA 7B/13B在八个常识推理数据集上与各种PEFT方法的准确率比较。DoRA†:DoRA的调整版本,其秩减半。

图像/视频-文本理解:各种PEFT方法结合VL-BART进行多任务准确率评估

视觉指令微调:LLaVA1.5-7B在广泛的七个视觉-语言任务上的评估结果

此外,研究还探讨了DoRA与其他LoRA变体的兼容性,并通过消融实验证明:无论训练样本数量多少、秩如何变化,DoRA的性能始终超越LoRA。

GPT-4为微调后的LLaMA-7B/LLaMA2-7B生成的答案在MT-Bench上计算的平均分数

使用不同数量的Alpaca训练样本微调后的LLaMA2-7B在MT-Bench上的性能表现

更精细的调整粒度:花更少的参数,办更好的事

最后一点很值得注意:DoRA可以通过选择性地更新某些模块的方向组件,用更少的可训练参数实现比LoRA更好的准确性。这意味着在资源受限的场景下,DoRA的性价比可能更高。

未来展望

论文结论部分也坦承,DoRA目前在语言和视觉领域之外(比如音频领域)的通用性还有待探索。另外,研究者们也希望尝试其在Stable Diffusion文本到图像微调等应用中的潜力——可以预见,这个方法还有不少值得挖掘的空间。