LLM微调新方法DoRA:权重幅度与方向的智能分解,比LoRA更精细、更有效!
来源:互联网
时间:2026-08-03 12:42:40
DoRA:权重分解低阶适应,让微调更接近全量微调
大模型微调领域又出现了一个值得关注的新方法——DoRA(Weight-Decomposed Low-Rank Adaptation)。这是NVIDIA最新提出的一种参数高效微调(PEFT)方案,核心思路可以概括为:把预训练权重拆成“幅度”和“方向”两部分,然后分别做微调。听起来好像只是把LoRA换了个玩法?其实不然,它在学习能力和训练稳定性上都有明显提升,而且推理阶段没有额外开销。更妙的是,它天然可以和LoRA搭配使用。
那么,DoRA具体是怎么操作的?我们拆开来看。
DoRA的关键步骤
- :预训练权重矩阵 (W_0) 被分解为幅度向量 (m) 和方向矩阵 (V)。这里的讲究在于,(V) 的每一列都是单位向量,而 (m) 中的每个元素则定义了对应列向量的大小——说白了,就是分别抓住了“有多长”和“往哪走”。
权重分解
- :微调时,方向矩阵 (V) 保持固定不动,只对幅度向量 (m) 进行直接训练。那方向怎么调?这里就用到LoRA了——通过两个低秩矩阵的乘积来近似方向上的权重变化。
微调过程
- :DoRA把LoRA塞进了方向组件的高效更新中,既维持了参数数量上的节俭,又能对模型做更精细的调整。
LoRA的应用

为什么要这么折腾?动机来自FT与LoRA的差异分析
研究者通过权重分解分析,对比了全量微调(FT)和LoRA的更新模式,发现两者存在显著差异:
- :在幅度和方向上表现出更多样化的更新。这也好理解——全量微调自由度大,能适应各种下游任务,学习模式自然更复杂。
FT(全量微调)
- :幅度和方向的更新之间存在正相关性,即两者变化往往是成比例的。这种相关性可能限制了LoRA在精细调节模型权重方面的能力——好比只能同步加减速,不能单独调整方向盘。
LoRA(低秩适应)
- :展现出与FT相似的学习模式,能够在幅度和方向上进行更独立的调整。换句话说,DoRA在保持参数效率的同时,更有效地模仿了FT的学习能力。
DoRA(权重分解低秩适应)

实验效果:一致优于LoRA,向FT看齐
实验数据相当有说服力。DoRA在常识推理、视觉指令微调、图像/视频-文本理解等多个下游任务上,均一致优于LoRA。更关键的是,无论是从经验上还是数学上,DoRA都表现出与FT相近的学习行为。



此外,研究还探讨了DoRA与其他LoRA变体的兼容性,并通过消融实验证明:无论训练样本数量多少、秩如何变化,DoRA的性能始终超越LoRA。


更精细的调整粒度:花更少的参数,办更好的事
最后一点很值得注意:DoRA可以通过选择性地更新某些模块的方向组件,用更少的可训练参数实现比LoRA更好的准确性。这意味着在资源受限的场景下,DoRA的性价比可能更高。
未来展望
论文结论部分也坦承,DoRA目前在语言和视觉领域之外(比如音频领域)的通用性还有待探索。另外,研究者们也希望尝试其在Stable Diffusion文本到图像微调等应用中的潜力——可以预见,这个方法还有不少值得挖掘的空间。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名