RAG | (支付宝+清华KDD24论文)FoRAG: 基于大语言模型的网络增强型长篇问答系统
网络增强型长篇问答系统,近年来逐步成为自然语言处理与信息检索交叉领域的一个热点。但一个尴尬的现实是:当系统生成一长串回答时,事实错误和逻辑混乱几乎成了“标配”——比如用户问“为什么古代城市会被沙土掩埋”,系统可能答成“所有古代城市都被沙土掩埋”,或者把若干个原因混成一锅粥,让人读完后更糊涂了。这背后折射出的核心问题,正是本文试图攻克的:如何让长篇回答既事实准确、又逻辑清晰?

论文来源:FoRAG: Factuality-optimized Retrieval Augmented Generation for Web-enhanced Long-form Question Answering
地址:https://arxiv.org/html/2406.13779v1
代码:https://huggingface.co/forag
出版:KDD '24
机构:蚂蚁集团、清华大学
1 研究问题
问题的症结并不难理解。长篇回答涉及的信息量和逻辑层次远大于短句检索,而现有系统的几个短板正好扎在这根刺上:
- 事实性错误频发,人工验证成本又高得离谱;
- 生成的回答结构松散,用户很难分清主次因果;
- 传统RLHF(基于人类反馈的强化学习)在长篇生成中,奖励信号稀疏得如同大海捞针;
- 更尴尬的是,业界缺乏一个可靠的中英双语网络增强型长篇问答数据集。
针对这些痛点,蚂蚁与清华的团队提出了FoRAG方法。可以把FoRAG理解成一个“作家+编辑”的协作机制——作家先列大纲,保证逻辑骨架清晰,再动笔填充内容;编辑则从宏观到微观逐句逐词地核实事实,确保每一处信息都有根有据。这种组合既保障了回答的连贯性,又最大限度压缩了事实错误的生存空间。
2 研究方法
2.1 大纲增强生成器
大纲增强生成器是FoRAG的“作家角色”,采用两阶段策略:先列大纲,再扩写。以“为什么恐龙灭绝了”为例,系统首先判断这个问题适合“因果关系”组织模式,然后生成三个主要论点的大纲:小行星撞击理论、火山爆发理论、气候变化理论。第二阶段再基于这个大纲,逐一充实每个论点的细节、证据和逻辑链条。
这样做的好处很明显——就像盖房子要先搭框架,再砌砖瓦。如果一上来就堆砌信息,哪怕每块砖都是好砖,盖出来的房子也容易歪歪扭扭。大纲先行,保证了最终回答的结构感与可读性。
2.2 大纲增强长篇问答数据集
为了让生成器学会“先列大纲再写作”,团队构建了一个专门的训练数据集。他们从两个现成的网络增强型长篇问答数据集(英文WebGLM-QA和中文WebCPM)中保留了问题及相关段落,但用大纲增强生成技术重新生成了答案。每个样本不仅包含问题和答案,还显式给出了答案的大纲。
这个过程好比给一本没有目录的书添加目录,再根据目录重写每一章——既提高了内容的组织性,也为后续模型学习结构化生成提供了宝贵的“教材”。
2.3 双重细粒度RLHF框架
如果说大纲增强保证了“说清楚”,那么双重细粒度RLHF框架就是为了“说准确”。这个框架借鉴了人类审核信息的习惯:既看全局,也抠细节。它包含两个创新点:细粒度自动评估和细粒度奖励建模。
2.3.1 细粒度自动评估
评估分为三个层次:
- 整体评估——给整个答案打一个事实性总分;
- 句子级评估——逐句判断是否事实准确;
- 子主张级评估——把一个句子拆成多个“子主张”,比如“小行星撞击导致恐龙灭绝”拆成“小行星撞击地球”和“这次撞击导致恐龙灭绝”,分别评估。
这就像读一篇文章,可以给出整体印象,也可以逐句分析,甚至考察每个观点背后的论据。粒度越细,定位错误的精度就越高。
2.3.2 细粒度奖励建模
奖励建模也对应两种粒度:序列级和令牌级。序列级奖励给整个答案或每个段落一个总体评分;令牌级奖励则精细到每一个词——好比老师在批改作文时,不仅能给总分,还能在错字、病句处留下批注。这种细粒度的反馈信号,让模型在优化事实性时有了更精确的“导航”。
结合不同粒度的评估与奖励,系统能够准确识别“小行星撞击发生的时间”这类细节错误,并提供针对性修正指导。相比传统RLHF只给一个整体分数,细粒度框架的反馈丰富度和有效性都上了一个台阶。
3 实验
3.1 实验场景介绍
实验主要验证FoRAG在生成连贯、有帮助且事实准确的长篇回答方面的能力,并与现有方法进行全方位对比。
3.2 实验设置
- :主要使用两个——WebGPT(272个样本,来自演示网站)和WebCPM(中文,5,500个样本)。
数据集
- :WebGPT(13B和175B)、WebGLM 10B、WebCPM 10B。
基线模型
- :使用Llama2-7B-chat和ChatGLM2-6B进行微调,最大上下文长度分别为4096和8192;在8个A100 GPU上训练5个epoch,初始学习率1e-5,余弦学习率调度器。
实现细节
- :连贯性(评估整体质量与结构)、有帮助性(满足信息需求的程度)、事实性(查询级与句子级事实准确性)。
评估指标
- :训练在8个A100 GPU,推理在单个A100 GPU。
环境
3.3 实验结果
实验1、FoRAG与现有web增强型RAG模型的性能比较
目的
图表
概述
结果
实验2、大纲增强和事实性优化的消融实验
目的
图表
概述
结果
实验3、不同事实性优化技术的对比实验
目的
图表
概述
结果
实验4、大纲增强生成技术的有效性验证
目的
图表
概述
结果
实验5、GPT4辅助自动评估与人工评估的一致性验证
目的
图表
概述
结果
实验6、双细粒度RLHF的训练效率评估
目的
图表
概述
结果
实验7、训练数据集中英文比例对模型性能的影响研究
目的
图表
概述
结果
4 总结后记
FoRAG方法围绕网络增强型长篇问答的事实性与逻辑性,给出了两个关键创新:大纲增强生成器(提升逻辑结构)和双重细粒度RLHF框架(提升事实准确性)。实验结果显示,基于Llama2-7B-chat的FoRAG-L 7B在英文和中文基准上均取得最优性能,尤其是在连贯性、有帮助性和事实性方面,甚至超越了175B的WebGPT模型——这充分说明,算法设计比单纯堆参数量更值得关注。
疑惑和想法:
- 大纲生成器对不同类型问题(如对比、因果、流程)的适应能力如何?是否存在某些领域或问题类型效果欠佳?
- 双重细粒度RLHF框架中,不同粒度的奖励信号如何自动平衡?有没有办法通过搜索或自适应选择最优粒度组合?
- FoRAG在多语言(如日语、德语)场景下的表现如何?是否需要针对不同语言调整大纲生成或细粒度评估策略?
- 在处理复杂或模棱两可的问题时,如何进一步提升事实性的上限?是否有更鲁棒的证据验证机制?
- 计算效率方面,子句级细粒度RLHF增加了约67%的训练时间,在工业部署中能否通过模型裁剪或蒸馏来平衡性能与成本?
可借鉴的方法点:
- 大纲增强的两阶段生成策略可迁移至任何需要结构化输出的NLP任务,如自动摘要、报告生成、甚至代码注释。
- 双重细粒度RLHF的思想适用于多目标优化任务(如多任务学习、多模态对齐),并且可以通过分层奖励设计来提高反馈质量。
- 用较小模型(7B)通过优化算法超越大模型(175B),为模型压缩与高效部署提供了范本。
- 结合搜索引擎与大模型的方式可应用于智能客服、个人助理等需要实时获取外部信息的场景。
- 本文提出的事实性自动评估方法(句子级、子主张级)可用于其他生成任务的评估,如机器翻译、文本摘要的事实一致性评测。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名