APEER:基于自动提示工程的LLM信息检索增强技术
在信息检索(IR)领域,大型语言模型(LLM)的零样本相关性排序一直是个令人头疼的问题——几乎所有工作都依赖手工编写的提示词。这种依赖不仅耗费大量人力和专业知识,而且过程主观、难以规模化。更棘手的是,现有方法往往无法应对相关性排序中的真正复杂性,比如如何整合查询与长段落对,如何进行全面的相关性评估。这些短板限制了LLM在实际场景中的高效落地。

论文介绍
业内目前的主流解法还是手动写提示词——有效,但既耗时又看个人发挥。手动方案没有可扩展性,结果也高度依赖人的经验。而一些已有的自动提示工程技术,更多是面向语言建模、分类这类相对简单的任务,压根没考虑相关性排序里的独特挑战:查询和段落对的融合、以及排序的全面性要求。说白了,现有方法优化逻辑太简单,根本搞不定这些。
来自罗格斯大学和康涅狄格大学的研究团队,搞出了APEER(Automatic Prompt Engineering Enhances LLM Reranking)。这个思路挺干脆:通过迭代反馈和偏好优化来自动化提示工程,大幅减少人工介入。怎么做的呢?根据性能反馈生成更优的提示,同时让提示朝“偏好示例”对齐。这样一来,既避免了手动工程的主观性,又提升了LLM在检索任务中的效率和准确性。可以视为一个兼顾可扩展性的有效方案。
APEER的运作流程清晰:先生成一个初始提示,然后通过两个核心优化步骤迭代打磨。第一步是反馈优化:采集当前提示的性能表现,生成改进版本。第二步是偏好优化:从正例和反例样本库中学习,进一步迭代提示。训练和验证用了多个数据集——MS MARCO、TREC-DL、BEIR——覆盖不同检索任务和LLM架构,保证了方法的鲁棒性。
实验结果相当亮眼。在相关性排序任务中,APEER驱动下的LLM性能提升显著。拿关键指标nDCG@1、nDCG@5、nDCG@10来说,相比于当前最好的手动提示,APEER实现了大幅提升。例如,在LLaMA3模型上,APEER在八个BEIR数据集上平均提升nDCG@10达到5.29。更值得一提的是,APEER生成的提示在不同任务和LLM架构之间迁移性更好——在GPT-4、LLaMA3、Qwen2等模型上,始终优于基线方法。
总结一下:APEER自动完成了LLM在信息检索中的提示工程,直接解决了人工编写提示这一关键瓶颈。通过迭代反馈与偏好优化,它不仅降低了人工成本,还显著提升了LLM跨数据集和模型架构的性能。这项创新为复杂相关性排序场景下的提示优化,提供了一条可扩展且有效的路径。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名