首页 > 教程攻略 > ai资讯 >新突破:上海交通大学研究团队用极少参数实现接近全量微调效果

新突破:上海交通大学研究团队用极少参数实现接近全量微调效果

来源:互联网 时间:2026-08-20 14:35:18

大模型参数规模持续膨胀,全量微调的成本高得令人咋舌。针对这一痛点,上海交通大学的研究团队提出了一套全新的高效微调(PEFT)框架——子空间微调,试图将当前五花八门的PEFT方法统一到一个理论之下。简单说,这套思路不直接动整个参数矩阵,而是专注于调整原始参数的子空间,包括重构和扩展两个方向。

新突破:上海交通大学研究团队用极少参数实现接近全量微调效果

那么,子空间微调到底在做什么?研究者从分解理论的角度,厘清了不同PEFT方法操作子空间的数学原理,并给出了一个完整的理论框架来解释这些方法之间的性能差异和内部动态。基于这个框架,他们还提出了两种全新的PEFT方法——仅调整0.02%的参数,就能达到接近全量微调的效果。

图1:子空间调整框架。a, 子空间调整努力确定最优权重 W∗ 在由 ϕ(W) 基所跨越的子空间上的最大投影。这里,ϕ(W) 表示原始冻结权重 W 的子空间变换。b, 子空间重构涉及重新缩放 W 的子空间以近似 W∗ ,或构建从原始派生的新子空间。子空间扩展旨在调整原始权重 W 的子空间,使其接近甚至包含 W∗ 。子空间组合包括子空间的重构和扩展。c, 子空间调整的数值视角。重构涉及修改原始冻结参数,而扩展则涉及添加新的可调参数

子空间调优框架

这套框架的核心思路很直观:与其修改海量参数,不如只动那些对任务性能影响最大的参数子集。这样一来,需要调整的参数量大大减少,计算和存储的压力也随之下降。

具体来说,框架的理论基础是参数敏感性分析。通过分析每个参数对模型输出变化的敏感程度,可以精准识别出哪些是“关键参数”,然后把这些参数划入待优化的子空间。实现时,有多种算法来定义这个子空间,比如基于梯度的方法、基于权重的方法,甚至可以通过先验知识手动划定。

图2:a. 基于重构方法的子空间视图。微调奇异值涉及权重的重新缩放,而微调奇异向量则有效地重构子空间。b. 基于重构方法的数值视图。我们将子空间中的调整直接对应于它们的数值调整。c. 基于重构方法的性能。SSL和SSB在微调不到0.1%预训练模型参数的情况下,能够达到全面微调99%的性能。与x轴平行的水平虚线,标记为FT,代表全面微调的性能。每种方法的平均得分是在三个大型预训练模型(RoBERTa-base、DeBERTaV3-base和RoBERTa-large)上使用GLUE基准测试评估的。误差棒表示五次运行中平均值的标准误差。

新型PEFT方法

基于上述框架,论文提出了两种新型PEFT方法,目标是进一步提升调优效率和效果。

  1. 动态子空间调整

    :这种方法在训练过程中动态调节子空间的定义——根据模型当前的表现,增加或减少子空间中的参数数量。这种灵活性能让模型更好地适应数据分布不均匀的情况。

  2. 优化子空间选择

    :这种方法通过全局优化算法(如遗传算法、模拟退火等)来寻找最优的子空间配置。它会在不同子空间设置下评估模型表现,然后选出能最大化性能的配置。

图3:基于扩展的方法的子空间和数值视图。基于扩展的方法引入一个额外的权重矩阵,然后试图在由这个额外权重和原始权重跨越的子空间内找到最优权重投影。为了实现这一点,额外矩阵构建的子空间的基应尽可能补充原始权重的基。右图列出了一些常见的基于扩展的方法及其对矩阵的操作。

这两种方法已经在多个公共数据集上完成了实验验证。结果显示,它们不仅大幅减少了需要调整的参数数量,而且在多数场景下能够保持甚至提升模型性能。这充分说明了子空间调优框架在实际应用中的可行性和有效性,尤其是在资源受限的环境中,价值尤为突出。