卡内基梅隆:什么样的RAG配置是最佳配置
来源:互联网
时间:2026-07-31 13:23:07
先抛出一个核心问题:RAG技术通过给大模型“开卷考”的方式来提升能力,效果确实很显著。但实际用起来,会发现它的表现和配置方式高度绑定——那么问题来了:到底怎么配置RAG才是最优解?为了搞清楚这个问题,我们创新地提出了一个叫RAGGED的框架,专门用来分析和优化RAG系统。
框架
为了判断什么样的RAG设置最合理,我们需要拆开系统来逐项测试。他们把RAG拆成了三大块:检索器(Retriever)、文档(Documents)和阅读器(Reader)。

接着,围绕三个方面调参,探索最佳组合:
- ,比如用哪种检索器(BM25还是ColBERT),用哪类阅读器(LLaMa2还是FlanT5),以及输入长度上限。
RAG组件
- ,记作n。我们对n从1一直测到100,发现关键性的变化基本在n=30之前就能看出来。
检索到的段落数量
- :比如,按“前n个段落是否包含金标准段落”来分片分析。
数据切片
数据集
为了让结论有足够的说服力,测试覆盖了以下三类代表性数据集:
- :选自NQ数据集(Kwiatkowski等,2019),用在最通用的开放域单跳问题上。每个问题都是Google的真实用户搜索,每个示例至少配一个金标准相关段落和一个简短答案。我们用的是KILT版本(Petroni等,2021)。
Natural Questions
- :来自Yang等(2018),专门提供有挑战性的多跳问题。每个问题都涉及至少两个段落的推理才能解答。和NQ用相同的维基百科领域,正好能对比模型在多证据片段上的推理差异。
HotpotQA
- :选取任务11B(Krithara等,2023),代表生物医学领域的特殊问题。评估数据由训练集和金标准丰富集汇编而成,里面还包含列表式和是/否这类复杂题型。
BioASQ
结果
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名