首页 > 教程攻略 > ai资讯 >「大模型」之所短,「知识图谱」之所长

「大模型」之所短,「知识图谱」之所长

来源:互联网 时间:2026-08-08 15:28:02

最近一年以来,大语言模型技术突飞猛进,被广泛地认为开启了人工智能研究的新阶段。大语言模型时代的到来,给知识图谱技术也带来了新的机遇与挑战。在5月份的时候,我们曾经发布过知识图谱与AIGC大模型的知识地图,其中涵盖了文本生成、图像生成等技术。本次分享将聚焦于大语言模型最新的研究进展,从大模型对知识工程的帮助、知识图谱如何助力大模型的评测和应用,以及未来两者交互融合的展望等几个方面展开。

主要内容包括以下几个部分:

  • 大语言模型与知识图谱的对比
  • 大语言模型助力知识抽取
  • 大语言模型助力知识补全
  • 知识图谱助力大语言模型能力评测
  • 知识图谱助力大语言模型落地应用
  • 知识图谱交互融合
  • 结束语
  • 参考文献

01 大语言模型与知识图谱的对比

首先,我们来对比一下大语言模型和知识图谱各自的优势与劣势。

去年ChatGPT问世初期,曾有人断言知识图谱已过时,将被大模型取代。然而,经过一年多的深入探讨和研究,目前业界普遍认为,大语言模型和知识图谱各有所长,能够互相补充[1,2]

具体来说,基于深度神经网络技术的大语言模型是连接主义的最新里程碑,其优势在于对自然语言的理解和生成能力极强,适用范围广泛。而缺点则是知识以参数化的隐式形式存在,容易产生事实编造,缺乏可解释性——也就是我们常说的“幻觉”问题。

知识图谱则是符号主义的集大成者,过去十几年间得到了广泛的研究与应用。它的优点是知识结构化、显式化,可解释性非常强,特别是在某些特定领域,知识质量极高。当然,缺点也很明显:构建成本太高,往往不完全正确,在自然语言处理方面相对较差。

那么,二者应该如何结合,实现优势互补呢?接下来,我们将从不同角度来分析它们的相互作用。

02 大语言模型助力知识抽取

首先,大模型强大的语言理解能力可以助力知识抽取任务。

典型的例子如复旦大学提出的InstructUIE[3]和浙江大学的KnowLM[4]。通过特定指令,调动大模型从给定资源中提取出有用的知识,完成各种任务,比如实体抽取、关系抽取、事件抽取等。当然,也可以针对这些指令做专门的SFT(深度特征提取)微调,从而增强优化效果。换句话说,只要通过这些指令,就能在给定内容里轻松完成实体、关系等各种提取任务。

03 大语言模型助力知识补全

还有一些工作是通过特定指令,将大模型中的参数化知识提炼出来,构建成结构化知识,以便对知识图谱进行补全[5]

由于大模型在训练过程中已经接触了海量文本数据,其中蕴含着丰富的客观知识,如果能精确地萃取出来,将极大提升知识图谱的完备性。然而,鉴于当前大模型生成的内容可能出现幻觉,目前的方法需要采用特定的调优训练进行约束才能实现,这一领域尚有相当大的研究空间。

04 知识图谱助力大语言模型能力评测

反过来,知识图谱也可以帮助大模型。

1. 评测集

知识图谱对大模型的评测具有显著的助力,它从掌握和利用世界知识的角度,对大模型的能力进行全面的评测。典型的代表是清华大学提出的KoLA评测集[6],该评测集针对知识认知的四个层次——知识记忆、知识理解、知识应用和知识创新,对大模型进行全面测试。

2. 评测结论

从目前的测试结果来看,有几项颇具趣味性的结论值得关注。首先,大模型在知识记忆、理解、应用和创新等任务中普遍存在较大的局限性。其次,对于未经指令微调且与人无关的模型,其知识记忆能力与模型规模呈正相关——参数越多,记忆能力越强。然而,经过指令微调与人类对齐后,高阶能力(如知识的应用和创新)与模型规模呈正向相关,但低级能力(如记忆、理解)则呈负相关,这便是所谓的“对齐税”,这一发现极为重要[6]

05 知识图谱助力大语言模型落地应用

1. 知识图谱作为外接工具或插件,提高大模型生成内容的知识准确性和可解释性

知识图谱辅助大语言模型的另一个方面,是帮助大模型落地应用。大模型的幻觉问题是阻碍落地应用的重要因素之一。目前大家正在考虑采用检索增强模式[7],引导并约束大模型生成的内容。这意味着将与用户问题相关的内容输入给大模型作为参考信息,用以缓解“一本正经胡说八道”的现象,从而提升知识的准确性与可解释性。

知识图谱作为高质量的知识来源,为检索增强模式奠定了基础。相比Web搜索,知识图谱所承载的信息可信度更高,且知识更新过程中更容易发现错误,便于精准修正。当然,知识图谱也有局限性,例如覆盖范围相对较窄,尤其对于长尾知识、复杂知识容易遗漏。因此,知识图谱与Web搜索相结合,是知识检索增强的良策。事实上,Google提出知识图谱的初衷就是为了提升搜索引擎的性能。

2. 知识图谱可以提升大模型生成内容的安全性和一致性

知识图谱还有助于提高大模型生成内容的安全性和一致性。

例如,哈尔滨工业大学提出了两种方案。第一种:运用知识图谱作为后验工具,对输出内容进行核实,从而增强一致性。比如在左边的例子中,“亚里士多德使用笔记本电脑吗?”ChatGPT可能生成相关内容,如第一条回复“亚里士多德死于2000年”,但这与知识图谱中亚里士多德的生卒年代相悖,产生冲突。通过这种验证,可以发现错误知识,筛选出更符合客观事实的回答。

其次,知识图谱能协助大模型识别不安全问题,同时增强应对不安全场景的能力。在右边的例子中,用户可能会提问一些涉及违法违规行为的问题。大模型可以利用知识图谱甄别其中的敏感知识以及相关内容,进而生成更可靠的答复。

3. 知识图谱可以提升大模型的复杂推理能力

知识图谱还能提升大模型的复杂推理能力。

面对复杂问题时,大模型无法直接从检索增强中获取答案,而需要通过多跳的关系集合、属性比对等环节来寻找答案,这时就需要精准的推理。

清华大学研发了一款专为知识推理问答而设的编程语言——KoPL[8],它能够将自然语言转化为基本函数的组合,从而针对复杂问题进行推理和解答。例如观察右侧例子:问“勒布朗·詹姆斯和他的父亲谁的身高更高?”这个问题会被分解为一些基础函数,如查找勒布朗·詹姆斯的身高、查询其父亲信息、找到他父亲的身高,最后进行身高对比,从而得出答案。这一过程体现了精准且严谨的推理。值得一提的是,这套编程语言具有明显、透明及模块化的特性,利于推理过程的展示与理解,对人机交互十分有利,有助于提高大模型回答问题的可解释性。此外,这款软件还能处理不同知识库文本的各类格式,具有较强的可扩展性。

06 知识图谱交互融合

最后,基于当前的研究成果,展望未来知识图谱与大模型的交互融合。这一观点由天津大学的王鑫老师提出[1]

知识图谱中有明确的知识结构,而大模型可以提供强大的文本理解和生成能力。通过多轮迭代的方式,可以将大模型与知识图谱协同驱动,从而获得更深入的语义理解、更丰富的知识表示以及更强大的推理能力。

07 结束语

知识图谱与大模型相协同的模式,有望成为支持神经和符号人工智能的重要突破点,能够开辟通往通用人工智能的全新途径,也将成为人工智能在各领域应用的新型模式。

这些领域尚有大量工作亟待完成。对于知识图谱领域的从业者来说,应当积极面对并迎接大模型技术带来的变革。一方面,充分利用大规模模型的潜力,提升知识工程的效率和效果;另一方面,也应当借助知识图谱提升大模型生成内容的准确性、安全性以及可解释性,进行更深度的探索。这种将两者深度融合的能力,将引领这个领域走上更高的发展道路,其中蕴含着诸多引人入胜的科研机会。