首页 > 教程攻略 > ai资讯 >陈丹琦团队新作:LLM指令微调仅选择5%的数据效果优于全量数据

陈丹琦团队新作:LLM指令微调仅选择5%的数据效果优于全量数据

来源:互联网 时间:2026-08-02 13:21:10

【导读】

来自普林斯顿陈丹琦团队的最新研究,提出了一种数据选择方法。在指令微调数据集里,只需要选出5%的数据进行训练,效果就能超过使用全量数据集。更妙的是,这种方法在不同系列的模型和数据集上都适用。

简介

这篇名为《LESS: Selecting Influential Data for Targeted Instruction Tuning》的论文,出自普林斯顿大学的陈丹琦团队。陈丹琦本人是清华姚班出身,斯坦福博士期间师从Christopher Manning,毕业后成为普林斯顿大学计算机学院助理教授。她在学期间已在ACL、EMNLP、NIPS等自然语言处理与机器学习顶级会议上发表过多篇论文。

陈丹琦团队新作:LLM指令微调仅选择5%的数据效果优于全量数据

论文思想

LESS的核心思路是“优化器感知”——通过这种方式,从海量的指令数据集中,精准地挑选出5%最有价值的数据用于目标指令微调。实验结果显示,在多个下游任务上,用这些精选数据训练出的模型,表现往往比用完整数据集训出来的还要好。更厉害的是,LESS算法选出来的数据还有很强的迁移性:用小模型挑出来的数据,拿去训练更大的模型,效果依然出色,而且在不同系列的模型之间也通用。

方法

整个流程可以分为四步,具体是怎么做到的呢?

1. 准备阶段(Warmup Training)

首先,用LoRA(Low-rank Adaptation)技术对预训练的基础模型(比如LLAMA-2-7B)进行参数高效的微调。这样做的目的是大幅减少可训练参数的数量,从而加速训练过程。然后,在训练集的一个随机子集上进行N个epoch的预热训练,让模型适应特定的数据分布。每完成一个epoch,就保存一次模型检查点。

2. 计算梯度特征(Compute Gradient Features)

对于每一个训练数据点,计算它在预热训练期间产生的梯度。接着,应用随机投影技术(比如Johnson-Lindenstrauss引理)把这些高维的梯度压缩到低维空间,生成低维梯度特征。这些特征会被存储在一个梯度数据存储库中,后续的数据选择过程可以直接拿来用,效率很高。

3. 数据选择(Data Selection)

对于目标任务的验证集(只需要少量示例就行),计算每个子任务的平均梯度特征。然后,通过LESS算法来评估每个训练数据点对验证集的潜在影响——具体做法是计算数据点的梯度特征与验证集特征之间的相似度,并据此打分。最后,根据得分高低,挑选出最高分的那部分训练数据(比如前5%),作为最终的训练集。

4. 目标模型训练(Training Final Model)

用选出来的这个数据子集去训练目标模型。这一步同样可以用LoRA做参数高效微调,也可以做完整微调。训练完成后,在测试集上评估模型性能,验证LESS选出的数据到底能带来多大的提升。

这套流程的根本逻辑,就是利用模型的梯度信息来估算每个数据点对目标任务的影响力,然后选出那些“高影响力”的数据进行针对性训练,从而提升模型在特定任务上的表现。LESS方法的关键在于,它能适配现有的优化器(比如Adam),同时还能有效处理可变长度的指令数据。另外,前面构建的梯度数据存储库可以重复用于不同的目标任务,大大提升了数据选择的效率。

实验结果

实验结果对比了LESS与全量数据集(100%)、随机选择(5%)在不同模型、不同数据集下的表现。

几个关键结论值得关注:

  • LESS在不同模型中都是有效的。在所有模型和评估数据集上,LESS筛选出的数据效果始终明显优于随机选择。
  • 选出的5%高价值数据,其效果通常能超越整个数据集。
  • 用小模型选出的数据,能够有效提升较大、或不同架构模型的性能。
  • 与其他基准方法相比,LESS是唯一一个持续有效、稳定可靠的方法。

总结

这篇论文提出了一种基于优化器感知影响力的数据选择算法——LESS。它构建了一个高效且可重用的低维梯度特征存储库,使得数据选择过程变得非常高效。实验证明了LESS相比全量数据(100%)和随机数据(5%)的优势,同时也展示了用小模型挑选数据来训练大模型的潜力。分析和消融实验表明,LESS选出的数据在可解释性上更胜一筹,不过计算成本也确实不低。