RAGChecker为你的RAG系统提供全方位诊断
来源:互联网
时间:2026-08-24 14:12:07
评估一个RAG系统到底难在哪儿?模块化架构让各组件相互耦合,长文本响应又缺乏统一的评价标尺,再加上现有指标本身就不太靠谱——这几个问题叠加在一起,想全面衡量一个RAG系统的表现,还真不是件容易的事。

亚马逊AWS AI最近开源了
RAGChecker
RAGCHECKER中提出的指标的说明
RAGChecker让开发者和研究者能更深入地诊断自己的RAG系统,具体能提供这些能力:
- :给出整体指标,直接衡量整个RAG流程的效果。
全面评估
- :检索器有检索器的指标,生成器有生成器的指标。哪儿出问题一目了然,改进方向自然就清晰了。
诊断指标
- :核心就是声明级别的蕴含操作,每个细节都不放过。
细粒度评估
- :一个涵盖10个领域、包含4000个问题的RAG基准数据集(即将发布)。
基准数据集
- :还附带一个人工标注的偏好数据集,用来检验RAGChecker的结果跟人类判断到底有多吻合。
元评估
他们在10个领域的公共数据集上,对8个最先进的RAG系统做了全面实验。结果相当亮眼:
RAGCHECKER与人类评估者的相关性显著更强
RAG基准统计信息
图中展示了RAGCheck、TruLens、RAGAS、ARES、CRUD-RAG等框架的指标与人类评估在正确性、完整性和整体评估上的相关性。
RAGChecker的指标不仅能反映现状,还能给出优化建议。研究人员和实践者可以据此调整RAG系统的设置——
比如检索器的数量、块大小、块重叠比例、生成提示
不同RAG系统在10个数据集上的平均评估结果
附录:RAGCHECKER与RAGAS答案相似性预测分数分布对比
更多上下文增强了忠实度诊断示例分析
- 。所以k越大,上下文精确度越低;片段越大,精确度越高。但两者都会提升检索中的声明召回率。
增加k会引入更多可能不相关的上下文,而增大片段大小则提供了相关事实更丰富的周边上下文
- ——当然,Llama3本身已经很忠实了,所以这个趋势不太明显。不过由于噪声增加,上下文利用度通常会下降,相关噪声敏感性反而升高。
生成器在上下文更多时往往更忠实
- ,主要是召回率上来了。建议适度增加这两个参数,既能提升忠实度,又不会让有用信息饱和。在上下文长度有限的情况下,优先选较大的片段大小和较小的k,尤其是面对金融、写作这类较容易的数据集时。比如,片段大小150且k=20的配置,就不如片段大小300且k=10的效果好。
端到端的RAG性能在更多上下文时略好
Top-k选择的诊断
片段大小的诊断
论文原文:https://arxiv.org/pdf/2408.08067 项目地址:https://github.com/amazon-science/RAGChecker
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名