首页 > 教程攻略 > ai资讯 >RAG | (支付宝+清华KDD24论文)FoRAG: 基于大语言模型的网络增强型长篇问答系统

RAG | (支付宝+清华KDD24论文)FoRAG: 基于大语言模型的网络增强型长篇问答系统

来源:互联网 时间:2026-08-13 13:44:09

网络增强型长篇问答系统,近年来逐步成为自然语言处理与信息检索交叉领域的一个热点。但一个尴尬的现实是:当系统生成一长串回答时,事实错误和逻辑混乱几乎成了“标配”——比如用户问“为什么古代城市会被沙土掩埋”,系统可能答成“所有古代城市都被沙土掩埋”,或者把若干个原因混成一锅粥,让人读完后更糊涂了。这背后折射出的核心问题,正是本文试图攻克的:如何让长篇回答既事实准确、又逻辑清晰?

RAG

论文来源:FoRAG: Factuality-optimized Retrieval Augmented Generation for Web-enhanced Long-form Question Answering
地址:https://arxiv.org/html/2406.13779v1
代码:https://huggingface.co/forag
出版:KDD '24
机构:蚂蚁集团、清华大学

1 研究问题

问题的症结并不难理解。长篇回答涉及的信息量和逻辑层次远大于短句检索,而现有系统的几个短板正好扎在这根刺上:

  • 事实性错误频发,人工验证成本又高得离谱;
  • 生成的回答结构松散,用户很难分清主次因果;
  • 传统RLHF(基于人类反馈的强化学习)在长篇生成中,奖励信号稀疏得如同大海捞针;
  • 更尴尬的是,业界缺乏一个可靠的中英双语网络增强型长篇问答数据集。

针对这些痛点,蚂蚁与清华的团队提出了FoRAG方法。可以把FoRAG理解成一个“作家+编辑”的协作机制——作家先列大纲,保证逻辑骨架清晰,再动笔填充内容;编辑则从宏观到微观逐句逐词地核实事实,确保每一处信息都有根有据。这种组合既保障了回答的连贯性,又最大限度压缩了事实错误的生存空间。

2 研究方法

2.1 大纲增强生成器

大纲增强生成器是FoRAG的“作家角色”,采用两阶段策略:先列大纲,再扩写。以“为什么恐龙灭绝了”为例,系统首先判断这个问题适合“因果关系”组织模式,然后生成三个主要论点的大纲:小行星撞击理论、火山爆发理论、气候变化理论。第二阶段再基于这个大纲,逐一充实每个论点的细节、证据和逻辑链条。

这样做的好处很明显——就像盖房子要先搭框架,再砌砖瓦。如果一上来就堆砌信息,哪怕每块砖都是好砖,盖出来的房子也容易歪歪扭扭。大纲先行,保证了最终回答的结构感与可读性。

2.2 大纲增强长篇问答数据集

为了让生成器学会“先列大纲再写作”,团队构建了一个专门的训练数据集。他们从两个现成的网络增强型长篇问答数据集(英文WebGLM-QA和中文WebCPM)中保留了问题及相关段落,但用大纲增强生成技术重新生成了答案。每个样本不仅包含问题和答案,还显式给出了答案的大纲。

这个过程好比给一本没有目录的书添加目录,再根据目录重写每一章——既提高了内容的组织性,也为后续模型学习结构化生成提供了宝贵的“教材”。

2.3 双重细粒度RLHF框架

如果说大纲增强保证了“说清楚”,那么双重细粒度RLHF框架就是为了“说准确”。这个框架借鉴了人类审核信息的习惯:既看全局,也抠细节。它包含两个创新点:细粒度自动评估和细粒度奖励建模。

2.3.1 细粒度自动评估

评估分为三个层次:

  1. 整体评估——给整个答案打一个事实性总分;
  2. 句子级评估——逐句判断是否事实准确;
  3. 子主张级评估——把一个句子拆成多个“子主张”,比如“小行星撞击导致恐龙灭绝”拆成“小行星撞击地球”和“这次撞击导致恐龙灭绝”,分别评估。

这就像读一篇文章,可以给出整体印象,也可以逐句分析,甚至考察每个观点背后的论据。粒度越细,定位错误的精度就越高。

2.3.2 细粒度奖励建模

奖励建模也对应两种粒度:序列级和令牌级。序列级奖励给整个答案或每个段落一个总体评分;令牌级奖励则精细到每一个词——好比老师在批改作文时,不仅能给总分,还能在错字、病句处留下批注。这种细粒度的反馈信号,让模型在优化事实性时有了更精确的“导航”。

结合不同粒度的评估与奖励,系统能够准确识别“小行星撞击发生的时间”这类细节错误,并提供针对性修正指导。相比传统RLHF只给一个整体分数,细粒度框架的反馈丰富度和有效性都上了一个台阶。

3 实验

3.1 实验场景介绍

实验主要验证FoRAG在生成连贯、有帮助且事实准确的长篇回答方面的能力,并与现有方法进行全方位对比。

3.2 实验设置

  • 数据集

    :主要使用两个——WebGPT(272个样本,来自演示网站)和WebCPM(中文,5,500个样本)。
  • 基线模型

    :WebGPT(13B和175B)、WebGLM 10B、WebCPM 10B。
  • 实现细节

    :使用Llama2-7B-chat和ChatGLM2-6B进行微调,最大上下文长度分别为4096和8192;在8个A100 GPU上训练5个epoch,初始学习率1e-5,余弦学习率调度器。
  • 评估指标

    :连贯性(评估整体质量与结构)、有帮助性(满足信息需求的程度)、事实性(查询级与句子级事实准确性)。
  • 环境

    :训练在8个A100 GPU,推理在单个A100 GPU。

3.3 实验结果

实验1、FoRAG与现有web增强型RAG模型的性能比较

目的

:评估FoRAG在连贯性、有帮助性和事实性方面的整体表现。

图表

:表1

概述

:在WebCPM(中文)和WebGPT(英文)上,对比FoRAG-L 7B和FoRAG-C 6B与基线模型的结果。

结果

:FoRAG-L 7B在所有指标上全面超越现有方法,包括参数量是其24倍的WebGPT 175B。FoRAG-C 6B在大多数指标上也超过了基线。这表明,通过算法优化,小模型完全可以实现甚至超越大模型的性能。

实验2、大纲增强和事实性优化的消融实验

目的

:分别评估大纲增强技术和事实性优化对模型的贡献。

图表

:表2

概述

:比较有无大纲增强和事实性优化的FoRAG变体。

结果

:大纲增强显著提升了连贯性和有帮助性;事实性优化明显抬高了事实性分数,且不损害其他指标。两者结合时,模型在所有指标上达到最佳。

实验3、不同事实性优化技术的对比实验

目的

:比较不同粒度评估与奖励建模组合的效果。

图表

:表3

概述

:在FoRAG-L 7B上测试多种细粒度方案。

结果

:子句级评估+段落级奖励建模的组合效果最好;所有FoRAG变体均优于传统RLHF及MLE过滤基线。细粒度RLHF的优势十分明显。

实验4、大纲增强生成技术的有效性验证

目的

:单独验证大纲增强的作用。

图表

:表4

概述

:对比有无大纲增强的FoRAG-C 6B和FoRAG-L 7B在连贯性和有帮助性上的表现。

结果

:大纲增强显著提升两项指标,且在中文任务上改进幅度更大。

实验5、GPT4辅助自动评估与人工评估的一致性验证

目的

:验证GPT4评估的可靠性。

图表

:表5

概述

:10名中文母语者对200个样本做人工评估,与GPT4评估结果比对。

结果

:GPT4评估与人工评估在多数指标上有很高的一致性;但查询级事实性评估的一致性偏低,推测是因为长文本比较困难。

实验6、双细粒度RLHF的训练效率评估

目的

:计算细粒度RLHF的额外计算成本。

图表

:表6

概述

:对比不同RLHF方法的训练时间。

结果

:子句级双细粒度RLHF比标准RLHF多耗67.7%的时间,但可通过实现优化进一步压缩。

实验7、训练数据集中英文比例对模型性能的影响研究

目的

:分析中英文数据比例对双语LLM性能的影响。

图表

:图2

概述

:固定总样本数40k,调整中英文比例从1:10到10:1。

结果

:随着某语言数据比例增加,模型在该语言上的连贯性和有帮助性显著提升;但事实性受比例影响较小。Llama2-7B对中文训练样本数量变化更敏感,这可能与其预训练语料中英文占比过高有关。

4 总结后记

FoRAG方法围绕网络增强型长篇问答的事实性与逻辑性,给出了两个关键创新:大纲增强生成器(提升逻辑结构)和双重细粒度RLHF框架(提升事实准确性)。实验结果显示,基于Llama2-7B-chat的FoRAG-L 7B在英文和中文基准上均取得最优性能,尤其是在连贯性、有帮助性和事实性方面,甚至超越了175B的WebGPT模型——这充分说明,算法设计比单纯堆参数量更值得关注。

疑惑和想法:

  1. 大纲生成器对不同类型问题(如对比、因果、流程)的适应能力如何?是否存在某些领域或问题类型效果欠佳?
  2. 双重细粒度RLHF框架中,不同粒度的奖励信号如何自动平衡?有没有办法通过搜索或自适应选择最优粒度组合?
  3. FoRAG在多语言(如日语、德语)场景下的表现如何?是否需要针对不同语言调整大纲生成或细粒度评估策略?
  4. 在处理复杂或模棱两可的问题时,如何进一步提升事实性的上限?是否有更鲁棒的证据验证机制?
  5. 计算效率方面,子句级细粒度RLHF增加了约67%的训练时间,在工业部署中能否通过模型裁剪或蒸馏来平衡性能与成本?

可借鉴的方法点:

  1. 大纲增强的两阶段生成策略可迁移至任何需要结构化输出的NLP任务,如自动摘要、报告生成、甚至代码注释。
  2. 双重细粒度RLHF的思想适用于多目标优化任务(如多任务学习、多模态对齐),并且可以通过分层奖励设计来提高反馈质量。
  3. 用较小模型(7B)通过优化算法超越大模型(175B),为模型压缩与高效部署提供了范本。
  4. 结合搜索引擎与大模型的方式可应用于智能客服、个人助理等需要实时获取外部信息的场景。
  5. 本文提出的事实性自动评估方法(句子级、子主张级)可用于其他生成任务的评估,如机器翻译、文本摘要的事实一致性评测。