首页 > 教程攻略 > ai资讯 >人大等发布Think-on-Graph 2.0,基于知识图的大模型推理再升级!

人大等发布Think-on-Graph 2.0,基于知识图的大模型推理再升级!

来源:互联网 时间:2026-08-21 14:40:49

大家都有过这种体会吧——比起死记硬背知识点,把知识整理成清晰的脉络往往能让学习事半功倍。大模型其实也一样。就算允许它“开卷作答”,也就是通过检索增强(RAG)技术从知识库里把相关材料捞出来当参考,可真碰上复杂问题,RAG的增益效果还是不太理想。毕竟,谁能保证开卷考试就一定拿满分呢?

正因为这样,我们才希望给大模型的思考过程注入一些类似知识框架的方法指导。而已经发展多年、逐渐成熟的知识图谱(KG),或许正是破局的关键。

论文标题

:
Think-on-Graph 2.0: Deep and Interpretable Large Language Model Reasoning with Knowledge Graph-guided Retrieval

论文链接

:
https://arxiv.org/pdf/2407.10805.pdf

背景与动机

在当下的大模型研究中,RAG技术的出现确实为知识缺陷和幻觉问题提供了一剂良方——通过动态检索外部信息,大模型的能力被拔高了一个台阶,不再囿于静态训练数据的边界。然而,即便RAG系统在知识预处理、细粒度检索、生成思维链等方面做了各种花哨的优化,大模型在构建类似人类那种对复杂任务的洞察力上,依然力不从心。这类任务往往需要持续且有目的地去理解对象、数字、概念和事件之间的关联,才能预判走势并有效行动。

更关键的是,多数RAG系统严重依赖文本向量的相似度来检索,这导致它们在理解长距离的跨类型知识关联时,暴露出几个硬伤:

  1. 浅层相关性捕获

    :简单向量匹配很容易漏掉概念间的深层关联。比如“全球金融危机”和“2008年衰退”之间那种本质联系,向量相似度根本体现不出来。
  2. 聚合多样化事实的困难

    :只靠向量嵌入的检索系统,在理解复杂问题中关键点的相互关系时,常常抓不住重点,结果就是信息密度低,长距离知识关联形同虚设。
  3. 处理复杂逻辑的能力不足

    :简单的向量检索不适合多步推理,也没法跟踪不同信息片段之间的逻辑链条——除非事先把所有片段都拆分和编码好,可这对大多数推理类型来说,效率低到没法接受。

面对这些挑战,本文提出了Think-on-Graph 2.0(ToG2.0),用知识图谱引导的知识检索来实现深度、可解释的推理。ToG2.0把文档中的非结构化知识和知识图谱里的结构化洞察揉在一起,相当于给复杂问题解决能力铺了一张路线图。通过把问题对齐到知识图谱,并把图谱当作导航工具,它深化和细化了RAG范式:既保证了语义相似性上的事实一致性,又促进了逻辑一致性上的长距离关联。这套范式让大模型在推理和解决问题时更接近人类——先检查当前线索,再依据自身知识框架关联潜在实体,一层层深入直到找到答案。

基于知识图谱的检索增强

在RAG系统里,检索数据的粒度是个关键因素。粗粒度的检索单元理论上能提供更多相关信息,但多余的内容也容易分散检索器和生成器的注意力。反过来,细粒度的检索单元虽然让生成器轻松了,却把压力抛给了检索器,还很难保证语义完整性和所需知识不缺失。

跟纯语义检索不同,知识图谱提供的是动态、明确且结构化的知识表示,这种结构化为大模型能访问的知识引入了可解释性和精确度。近期的研究尝试过把图谱中的结构化知识转换成文本提示来增强大模型,但碰到了一些独特的限制——比如三元组提供的信息缺乏深度和细节。加上知识图谱本身的不完整性,甚至可能丢信息。

下图展示了传统RAG(a)、纯KG增强生成(b)和ToG2.0(c)的对比。这个例子清楚说明了纯语义检索和纯知识图增强框架在复杂QA任务里的短板,以及本文“KG+RAG”框架的优势所在:

ToG2.0

ToG2.0初始化

ToG2.0初始化阶段的核心任务,是为特定查询选对起点,这样才能让后面的推理更顺畅。打个比方,查询“腾讯公司的创始人中,谁曾是全国人民代表大会的成员?”——如果起点选得太宽或者没选好,比如直接拿“全国人民代表大会的成员”下手,那可就掉进海量无关数据的筛选陷阱里了,费时费力还不聚焦。有效的起点应该盯住“腾讯公司的创始人”这类实体。这个原则在推理任务里至关重要,尤其开放领域问答中问题五花八门,选对起点就更关键了。

因此,面对一个问题,ToG2.0先执行实体识别和主题修剪(TP),让大模型评估问题中间出现的实体,从中挑出一组适合当起点的主题实体。在复杂推理中,问题与有效中间线索句子之间的隐含关联,稀疏或密集向量检索模型往往识别不出来。为打破这个局限,ToG2.0提示大模型基于当前上下文,为每个主题实体生成线索查询问题,给下一步探索实体关系和上下文指了个方向。

还是拿上面那个问题举例:基于“全国人民代表大会”这个实体,大模型可能会生成一个线索查询,建议收集这些人关于整治身份或隶属关系的信息。这样,ToG2.0就能更高效地引导大模型在知识图谱里做有针对性的探索,推理的准确性和效率自然就上去了。

基于图驱动的知识检索推理

ToG2.0的推理过程靠图驱动的知识检索来实现,迭代地利用结构化和非结构化知识来推进。具体说,在第次迭代中,给定原始问题、第次迭代的线索查询,以及主题实体和前面的三元组路径(其中),每次迭代包括三步:关系修剪(RP)、实体修剪(EP)和检查与推理(ER)。

  • 关系修剪(RP)

    :基于问题和线索查询,ToG2.0提示大模型选出那些最可能找到有用上下文信息、且与线索查询匹配的实体。这一步通过同时考虑所有主题实体来减少API调用次数,加速推理,也让大模型能从更全局的视角做选择。对于某个实体,被选中的关系可表示为……(其中是超参数宽度)。
  • 实体修剪(EP)

    :给定一个主题实体和一个选定的关系,ToG2.0会找出所有在Wiki知识图谱中相连的候选实体节点,并拿到它们对应的维基百科页面文档。每个候选实体的文档上下文被切分成合适大小的块(块数量为)。随后,ToG2.0用两阶段搜索策略:
    • 首先,用预训练语言模型对所有候选实体的文档块做相关性评分。具体地,表示第个实体和第个文档块的相关性得分,是当前候选实体所来自的三元组。
    • 然后,通过排名前K的文本块分数,用指数衰减加权和算出候选实体的排名分数——排名为的文本块权重为(和均为超参数)。最后选排名前的候选实体,作为下一轮迭代的新主题实体,并更新对应的三元组路径。
  • 检查与推理(ER)

    :在RP和EP之后,ToG2.0给大模型提供了精心聚合的参考素材,包括问题、参考查询、三元组路径和前L个文本块()。随后,提示大模型检查逻辑一致性和事实证据的完整性。如果大模型觉得能回答这个问题,迭代就停止;不然就得根据问题以及收集到的上下文线索,为下一轮生成新的线索查询。

实验

数据、评测方法与基线

本文选了四个数据集来测ToG2.0的效果:两个多跳知识库问答数据集WebQSP和QALD-10-en,一个多跳复杂文档问答数据集HotpotQA,还有一个事实验证数据集FEVER。FEVER用准确率(Accuracy)评估;WebQSP、HotpotQA和QALD-10-en则用精确匹配(Exact Match, EM)。

基线方法包括:

  • 标准提示(Vanilla Prompt):直接回答问题
  • 思维链(CoT):先生成几个中间推理步骤,再给最终答案,提升大模型处理复杂推理的能力。
  • 知识链(CoK):一个异构源增强的LLM框架。
  • Think-on-Graph(ToG):基于知识图谱搜索有用三元组来进行推理的方法。

实验结果

跟上面这些基线——包括标准提示、CoT、CoK以及原版ToG——一比,ToG2.0的优势相当明显。具体说,ToG2.0在WebQSP、HotpotQA和QALD-10-en上都压过了所有基线。特别值得注意的是,在HotpotQA上,ToG2.0不仅全面领先,还比当前最强的基线CoK高出了5.51%的性能提升。相比原版ToG,ToG2.0在HotpotQA上涨了14.6%,在WebQSP上提升了4.93%,在QALD-10-en上提升了3.85%,在FEVER上提升了5.84%。

虽说在FEVER上,ToG2.0的准确率略低于CoK——但差异可能是因为CoK用了更多知识源,外加额外的LLM自我验证机制。为了降低计算成本和推理延迟,本文没使用自我验证机制,不过也说了,未来完全可以根据应用需求调整。

另外,消融实验用来评估每个组件的贡献。结果显示,主题修剪(TP)在WebQSP上效果尤其突出——估计是因为WebQSP的问题里包含更多一般性实体,容易引入不必要的噪声。关系修剪(RC)虽然可能会略微降低性能(因为它在单个提示里给大模型塞了更多任务,理解起来更费劲),但好处是大幅减少了推理次数和延迟。线索查询在每个数据集上都带来了相对一致的改进,说明适应性查询优化确实能帮大模型更好地理解任务。

本文还额外测试了把ToG2.0用在弱一些的LLM(比如Llama-2-13B)上。结果表明,ToG2.0对这些弱模型的提升更大——这说明它的适应性可能更强。弱模型处理复杂任务时常遇到瓶颈,而ToG2.0通过知识图谱做线索,优化推理路径、降低任务复杂度,再用实体上下文引导模型关注相关信息,从而提高了理解和回答的准确率。相比之下,像GPT-3.5这样的强模型本来就已经接近性能上限,所以提升反而不那么明显。

结论与展望

ToG2.0把结构化的知识图谱和非结构化的文档信息结合了起来,集众家之长,显著提升了LLM的推理能力。这就好比给一个超级聪明、特别会总结知识框架的学生,配了个装满各种书籍和资料的图书馆——那可想而知,他要再学不好才怪呢。

鉴于ToG2.0在系统化推理能力上的巨大增益潜力,随着未来LLM推理和理解能力的同步发展,说不定通过ToG2.0或类似技术加持的LLM,能更快地落地到医疗咨询、法律分析、教育辅导等更复杂也更专业的任务中。

总的来说,图与RAG的结合这个方向,从最近GitHub上各种Graph RAG方案飙升的星数就能看出来,大家对这个话题的热情相当高。不过话说回来,图的构建本身就是一个比较重的活儿,而且对准确率非常敏感;之前传统RAG之所以能流行起来,靠的是跟LLM搭配后那种“简单粗暴、方便好用”的效果。所以,怎么在两者之间权衡和取舍,可能也是未来研究中需要持续思考的问题。