谷歌Speculative RAG:多打草稿少出错,效果优于Self-RAG、CRAG
说到当前RAG的优化方向,业界普遍聚焦在两大思路上:要么让大模型反复“自我反省”来迭代优化结果,要么通过专门的指令微调赋予模型一种批判性思维。但这两种方法似乎都绕不开一个核心矛盾——如何在增强推理能力的同时,别把响应速度拖垮。
最近,谷歌的几个核心AI研究部门(包括Google Cloud AI Research、DeepMind等)联合加州大学圣迭戈分校,提出了一个颇具巧思的新框架:
Speculative RAG
简单来说,它玩了一个“分而治之”的把戏。面对检索到的一堆文档,传统RAG是全部塞给大模型,导致输入冗长、推理缓慢。而Speculative RAG则先对这些文档进行智能聚类,确保多样性,然后从每个类别里挑一份代表,形成多个精简的“证据子集”。接着,这些子集被并行地喂给一个专门训练过的小模型(RAG Drafter),让它快速生成多个不同视角的答案草稿和推理依据。
重头戏在后面:这些并发生成的草稿,会统一提交给一个更大的通用模型(RAG Verifier)做“质检”。这个大模型不参与繁重的草稿生成,只负责高效地评估每一份草稿的逻辑自洽性和合理性,并打分。最后,得分最高的那个答案,就被采纳为最终输出。
这个过程妙在哪?它把耗时最长的“深思熟虑”环节(大模型推理)和相对轻量的“多角度尝试”环节(小模型并行起草)给解耦了。小模型并行反赌,大模型只做擅长的评判工作,整体效率自然就上来了。
Speculative RAG 的实现拆解
要理解这套机制如何运转,我们可以把它拆成几个关键部分来看。
1. 核心流程与分工
整个框架的核心是明确的分工协作:
- :这是一个经过指令微调的、规模较小的专家模型。它的任务很专一:快速理解分配给它的那份文档子集,并据此生成一个答案草稿(A)以及支持这个答案的理由(E)。它的优势在于小而快,可以多个并行实例同时工作。
RAG Drafter (起草专家 MDrafter)
- :这是一个更大的通用语言模型,比如Mistral或Mixtral。它不直接接触原始文档,而是对所有起草专家提交上来的“答案-理由”对进行评审。它利用自身的语言建模能力,计算每个方案的“自洽性分数”和“自反性分数”,从而选出最可靠的那一个。
RAG Verifier (验证法官 MVerifier)
2. 确保多样性的关键:多视角抽样
如果几个起草专家看到的文档都差不多,那生成的草稿也会雷同,就失去了“多视角”的意义。因此,在分发任务前,系统会对检索到的所有文档进行一次智能聚类。
具体做法是,先用一个能理解问题指令的嵌入模型,把所有文档转换成向量,然后用K-Means算法把它们按语义相似度分堆。分好类后,从每一堆里随机抽取一个文档,组合成一个文档子集。这样,每个子集都能代表一个独特的证据视角,同时又避免了文档重复,控制了输入长度。
3. 如何训练起草专家?
要让小模型(MDrafter)学会根据片段文档生成合理的答案和理由,需要专门的训练。这个过程分为两步:
- :首先,利用一个更强的大语言模型,为已有的“问题-答案-文档”三元组自动合成一个解释性“理由”。这个理由会提炼文档中的关键信息,简明地阐述答案为何成立。
理由合成
- :接着,将原始三元组和生成的理由组合成“问题-答案-文档-理由”四元组,用这些数据去微调一个预训练好的小模型。经过这个训练,小模型就学会了在给定问题和部分文档时,如何像专家一样生成答案并附上推理依据。
指令微调
4. 验证法官如何工作?
验证模型(MVerifier)的工作相对“优雅”。它不需要额外的训练,直接使用现成的预训练大模型。它的评判标准主要基于两种分数:
- :评估生成的答案与提供的理由之间逻辑是否一致、连贯。
自洽性分数
- :评估整个“答案-理由”对自身的合理性和可信度。
自反性分数
这两种分数都是通过计算模型自身的概率得出的。由于验证模型本身能力强,且只需对有限的几个候选方案进行评分,所以这个过程非常高效,几乎是“即插即用”。
效果如何?数据说话
理论很美好,实践出真知。研究团队在TriviaQA、MuSiQue、PubHealth和ARC-Challenge这四个公认的知识密集型问答基准上进行了测试。结果确实亮眼:
在大多数任务上,Speculative RAG都达到了当前最先进的性能水平。尤其是在PubHealth数据集上,它的准确率相比常规RAG系统提升了高达12.97%。更关键的是,它在提升效果的同时,大幅降低了延迟——在PubHealth上延迟降低了51%。
这意味着什么?意味着用户不仅能获得更准确的答案,而且等待时间还缩短了近一半。这对于追求实时交互的应用场景来说,价值巨大。
延迟的降低主要归功于架构设计:将庞大的文档并行编码,并用轻量级的起草器并行生成草稿,最后让验证器做高效选择。这比让单个巨型模型吞吐所有文档并进行复杂推理的传统方式要敏捷得多。
从公布的对比图可以清晰地看到,在不同数据集上,Speculative RAG(使用8x7B的验证器搭配7B的起草器)相比直接使用张量并行的Mixtral 8x7B标准RAG,其延迟都有显著的优势(图中用红色+百分比标出)。

总的来说,Speculative RAG 提供了一种解决RAG“效率-效果”权衡问题的新思路。它通过“小模型并行起草+大模型集中验证”的分工协作模式,在几乎不损失答案质量的前提下,实现了推理速度的大幅提升。这或许为未来构建更快、更准的检索增强生成系统,指明了一个富有潜力的方向。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名