Rageval:评估检索增强生成(RAG)方法的工具
来源:互联网
时间:2026-08-01 13:41:00
项目简介

说到RAG系统的评估,Rageval这个工具值得好好聊聊。它把整个评估拆成了六个子任务:查询重写、文档排名、信息压缩、证据验证、答案生成和结果验证。每个环节都有对应的衡量标准,下面咱们就逐一拆解。
任务和指标的定义
1. 生成任务
生成任务的核心,就是让模型根据检索模块拿到的上下文来回答问题。这里的上下文通常来自压缩器提取的文本片段,或者重新排名器筛选出的相关文档。评估生成任务时,会从两个维度切入:答案的正确性,以及答案的“扎根性”——也就是答案是否真的基于给定的上下文(有时也叫事实一致性)。
(1)答案正确性
- 答案F1正确性 —— 不少顶会论文都用它(如江等人、Yu等人、Xu等人)。
- 答案NLI正确性 —— 论文里也常叫“权利要求召回”(Tianyu等人)。
- 答案EM正确性 —— 就是精确匹配(Ivan Stelmakh等人)。
- 答案Bleu Score —— 机器翻译领域的经典指标(Kishore Papineni等人)。
- 答案Ter Score —— 翻译编辑率(Snover等人)。
- 答案chrF分数 —— 字符n-gram F分数(Popovic等人)。
- 答案Disambig-F1 —— 消歧版F1(Ivan Stelmakh等人,Zhengbao江等人)。
- 答案Rouge正确性 —— 文本摘要常用的ROUGE(Chin-Yew Lin)。
- 答案准确性 —— 就是分类任务里的准确率(Dan Hendrycks等人)。
- 答案LCS比率 —— 最长公共子序列占比(Nashid等人)。
- 答案编辑距离 —— 经典编辑距离(Nashid等人)。
(2)答案扎根性
- 引文精度(Tianyu等人)
- 引文召回(Tianyu等人)
- 上下文拒绝率(也叫拒绝率,Wenhao Yu等人)
2. 重写任务
重写任务就是把用户原始问题重新表述成一组对搜索模块更“友好”的查询。说白了,就是让检索更容易命中关键信息。
3. 搜索任务
搜索任务是从知识库里把相关文档捞出来。评估这个环节,主要看两方面:
(1)上下文充分性
(2)上下文相关性
- 上下文召回 —— 在RAGAS框架里也这么叫。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名