首页 > 教程攻略 > ai资讯 >RAG生成任务:Base LLM竟然比Instruct LLM高出20%

RAG生成任务:Base LLM竟然比Instruct LLM高出20%

来源:互联网 时间:2026-08-15 14:46:22
---

在RAG(检索增强生成)这个框架里,模型的表现好坏,很大程度上取决于最后那个“生成”环节。目前,业内有个普遍的做法:给模型下达明确的指令,也就是用所谓的“指导”(Instruct)版模型。这看起来合情合理——既然要让模型干活,那总得把任务交代清楚吧?但最近一项研究得出的结论,却给这个“常识”泼了盆冷水。

有团队专门把“指导”版模型和它的“基础”(Base)版“孪生兄弟”放在RAG场景下,做了一次系统性的评估。他们设计了两类指令来考验模型:

任务指令I

要求模型从给定的文档中提取答案;

任务指令II

则更进一步,要求模型不仅要给出答案,还得拿出证据来支持。

结果呢?我们直接看图说话。

上图展示的是在TriviaQA数据集上,针对任务指令I的一个对比案例。左半部分,基础版模型(Base)给出了正确答案“Burgess Meredith”;而右半部分,指导版模型(Instruct)在模板的引导下,却错误地指向了“Danny DeVito”。同样的“翻车”场景也出现在了任务指令II中。

下图呈现的对比更为直观。基础版模型再次精准定位了答案,而指导版模型则给出了错误指认。尽管从逻辑上看,两个模型的回答都与它们引用的“证据”自洽——因为证据里确实都包含了它们各自抛出的名字——但事实证明,“遵循指令”和“给出正确答案”之间,并不是简单的等号。

更核心的数据在这里:

综合来看,在RAG任务中,基础模型平均比它的“指导”版本高出了整整20%的准确率

。这个数字相当有冲击力,它直接挑战了我们过去一直认为“指导模型更优”的假设。真相远比你想象的复杂。

来看看在NQ和TriviaQA两个主流数据集上的具体表现。

这张图是

任务指令I

的结果。“C”和“I”分别对应指导模型的“聊天版”和“指导版”,带“T”后缀的则表示使用了回答模板。无论检索文档数量是5篇还是20篇,除了个别模型(如Mistral)外,几乎所有基础模型在准确率上都把它们的指导版本远远甩在了后面。

而在需要提供证明的

任务指令II

中,差距更为明显。在考察的所有模型和设置下,基础模型再次实现了对指导版本的全面超越。

这不禁让人思考:问题出在哪儿?一个合理的推测是,“指导”模型为了提升遵循指令的能力,在监督微调和对齐(比如RLHF)的过程中,似乎牺牲了一些东西。它们变得更“听话”了,但也更倾向于从自己庞大的“记忆库”里调取信息,而不是老老实实地依赖检索到的文档。换句话说,它们变得更“自信”,即使文档里没有答案,它们也更愿意凭记忆“编”一个,而不是诚实地回答“不知道”。

上图就很能说明问题。当检索文档中不包含答案时,基础模型(Base)的“参数化记忆回忆率”——也就是依赖自己记忆答题的比例——在两种设置下都显著低于指导版。尤其是在不允许模型回答“不知道”的情况下(右图),指导版模型(Instruct)的记忆回忆率激增。这说明,指导模型在被“训练”得更听话的同时,也变得更难拒绝回答了。

再来看一个具体的例子。当要求模型不能拒绝回答时,基础版模型(Falcon 7B Base)准确识别出《洛奇》是1976年奥斯卡最佳影片得主;而指导版模型(Instruct)则凭借记忆给出了错误的“电视台风云”。这再次印证了,模型“记性好”和“能力强”是两回事。

所以,回到最初的问题:指导模型真的是RAG的最优解吗?从这项研究的结论来看,至少不能一概而论。这背后牵涉到的远不止是模型选型,还有对RAG整个评估流程的反思。**在追求模型“听话”的同时,我们如何确保它对事实的尊重和严谨?** 这或许是所有RAG实践者都需要重新审视的关键课题。