首页 > 教程攻略 > ai资讯 >LongRAG:长检索单元增强LLM问答能力

LongRAG:长检索单元增强LLM问答能力

来源:互联网 时间:2026-08-13 14:05:16

滑铁卢大学的研究团队最近提出了一种名为LongRAG的新型人工智能框架,核心思路是把长文本检索单元和长上下文大语言模型结合起来,以此来提升检索增强生成(RAG)系统的效率和准确性。这项工作在开放域问答任务上表现出了相当亮眼的潜力。

论文介绍

检索增强生成(RAG)通过从大规模语料库中检索外部知识,帮助大语言模型突破自身参数化知识的局限,从而在开放域问答这类需要精细准确答案的场景中发挥更大作用。传统RAG系统通常使用较短的检索单元,比如100词左右的段落,这就要求检索器从海量数据中筛选信息。这种设计带来的问题很直接:检索器负担过重,而阅读器任务相对简单,导致整体效率低下,同时因为文档截断,语义信息也不完整。换句话说,系统内部检索器和阅读器之间的不平衡,成了性能瓶颈。

业内已有的方法,比如稠密段落检索(DPR),虽然能聚焦于从大型语料库中找到精确的短单元,但通常需要召回大量片段并依赖复杂的重排序流程才能保证精度。这些方法在某种程度上有效,但短单元带来的效率和语义表示问题始终没有真正解决。

针对这些挑战,滑铁卢大学的团队提出了LongRAG框架,它包含一个“长检索器”和一个“长阅读器”。关键创新在于将每个检索单元的长度提升到约4K个token。别小看这个变化——通过扩大检索单元,语料库的单元数量从2200万个锐减到60万个,检索器的工作量大幅降低,检索分数也随之提升。这样一来,检索器不再需要处理碎片化的信息片段,而是可以直接面对更完整的语义块。

具体实现上,LongRAG先把相关文档分组构造成长检索单元,然后长检索器对这些单元进行筛选。之后,检索器过滤出排名靠前的4到8个单元,把它们拼接起来,送入长上下文大语言模型(例如Gemini-1.5-Pro或GPT-4o),由模型生成最终答案。整个流程利用了长上下文模型处理大量文本的能力,确保信息提取的全面性和准确性。

从技术细节看,该方法使用一个编码器将输入问题映射为向量,另一个编码器将检索单元映射为向量,然后计算问题和单元之间的相似度,找出最相关的单元。长检索器搜索这些单元,大幅压缩了语料库规模,同时提升了检索精度。之后检索到的单元被拼接并送入长阅读器,阅读器利用上下文直接给出答案。这一设计让阅读器面对的是更完整的信息集合,系统的整体性能自然就上去了。

实验数据相当有说服力。在Natural Questions(NQ)数据集上,LongRAG实现了62.7%的精确匹配(EM)分数;在HotpotQA数据集上,达到了64.3%的EM分数。这两个结果直接对标最先进的微调RAG模型。更值得注意的是,与传统方法相比,LongRAG将语料库大小缩减了30倍,答案召回率提升了约20个百分点——在NQ上answer recall@1达到71%,在HotpotQA上达到72%。

可以说,LongRAG为解决传统RAG系统的效率低下和不平衡问题提供了颇有价值的思路。通过采用长检索单元并充分借助先进长上下文模型的能力,它在开放域问答任务上同时提升了准确性和效率。这项研究不仅优化了检索性能,也为未来检索增强生成系统的发展打下了一个非常扎实的基础。