首页 > 教程攻略 > ai资讯 >OpenKG-SIG | SIGData兴趣组:利用大模型构建LLM需要的知识图谱

OpenKG-SIG | SIGData兴趣组:利用大模型构建LLM需要的知识图谱

来源:互联网 时间:2026-08-16 14:27:34

随着大语言模型(LLM)的浪潮席卷而来,知识图谱这个领域也在悄然发生变化。过去,我们可能更关注如何规模化、自动化地构建图谱;但现在,一个核心问题摆在面前:既然大模型自己就能“说话”,那我们需要什么样的知识图谱来辅助它?

这个问题,正是OpenKG旗下数据兴趣组SIGData的核心探索方向。他们的使命可以用一句口号概括:为LLM构建知识图谱,并用LLM构建知识图谱。

SIGData兴趣组简介

主题Slogan

Build KGs for LLM and by LLM!

OpenKG的核心使命之一是促进中文知识图谱数据的开放与互联。进入大模型时代,这个使命被赋予了新的内涵:我们不仅要回答“大模型需要怎样的知识图谱”,还要实践“如何利用大模型构建更有价值的开放知识图谱”。

因此,SIGData小组应运而生。它致力于两件事:一是持续建设和维护OpenKG的开放数据体系;二是充分挖掘大模型的潜力,探索一种新型的、更贴合大模型需求的开放知识图谱构建范式。简单说,就是要开源并维护一套能有效辅助大模型落地、缓解其“幻觉”、知识过时等问题的权威知识库,并提供相应的数据操作与社区平台。

主题任务

  • 建设并维护OpenKG开源图谱数据体系;
  • 探索基于大模型的开放知识图谱构建方法;
  • 构建服务于大模型的开放知识图谱。

代表性贡献

目前,小组的代表性成果包括OpenKG数据地图、cnSchema以及近期重点推进的OneGraph项目。

SIGData成员结构

小组由浙江大学的张文和蚂蚁集团的刘志臻共同负责。目前团队已有来自学界与业界的11位成员加入,包括蚂蚁集团的梁磊、孙梦姝、伯仲璞,英国曼彻斯特大学助理教授Jiaoyan Chen,北京邮电大学教授鄂海红,杭州电子科技大学特聘副教授耿玉霞,以及浙江大学的多位博士生与硕士生:朱渝珊、徐雅静、孟佳卫、陈少凯、兰雅榕。

这个跨机构团队将不定期举行知识图谱数据的发布与专题研讨。

近期主要工作:OneGraph项目深度解析

OneGraph是SIGData当前的重点项目,其目标远大,旨在探索大模型与知识图谱的共生关系。

Q标志

Q:为什么会发起OneGraph这个项目?

A标志

A:动机主要来自两方面。

首先,是数据融合的内在需求。这些年开放的知识图谱数据越来越多,像WordNet和ConceptNet在词义上可以互补,又如“国内行政区划”图谱能完善“中国旅游景点”图谱的地理信息。如果能将这些分散但互补的数据自动融合起来,就能形成一份更完整、更强大的开放知识图谱。这是启动OneGraph的第一个初衷。

其次,也是更重要的,是大模型带来的时代机遇与挑战。大模型的崛起为知识图谱领域打开了新窗口:一方面,知识图谱以其准确、可编辑的特性,被视为矫正大模型“幻觉”和知识缺陷的利器;另一方面,大模型强大的通用理解能力,又为自动化、大规模构建高质量知识图谱提供了前所未有的可能。

但同时,一个根本性的拷问也随之而来:如果大模型本身已经像个庞大的“隐式知识库”,那我们还需要怎样的“显式知识图谱”?OneGraph项目,正是为了系统性地探索这个问题的答案。

Q标志

Q:能介绍一下OneGraph项目想要解决的具体问题吗?

A标志

A:项目主要围绕两个核心问题展开初步探索:

  1. 什么样的知识图谱对大语言模型更有用?
  2. 大模型能否反过来,高效地帮助构建这类知识图谱?例如,它能否显著降低构建成本?能否将图谱的规模和质量都提升一个量级?

Q标志

Q:请问现在OneGraph建设得怎么样了?

A标志

A:已经取得了阶段性进展。

项目以OpenKG等平台的开放图谱为数据源,初步构建了一个规模超过一亿三元组的融合知识库,覆盖常识、人物、医疗、地理、金融、历史等多个领域。这个图谱不仅包含了概念、实体、事件及其关系,还纳入了文本对象(句子、段落等)以及概念层次、因果关系等复杂结构。经人工抽样评估,当前数据的整体准确率达到了87%。

Q标志

Q:针对第一个问题“什么样的知识图谱对大语言模型更有用?”,SIGData找到答案了吗?

A标志

A:这是一个持续探索的过程,但目前我们形成了两点初步认识:

  • 准确性优于规模

    :与过去追求海量数据而容忍一定噪声的思路不同,服务于大模型的知识图谱,必须把事实准确性放在首位。只有当图谱的知识准确率高于大模型自身的内部知识准确率时,它才对模型有正向增益。可以说,准确率越高,价值越大。
  • 结构需更丰富,更具文本亲和性

    :传统图谱侧重对概念和实体的建模。未来对大模型有用的图谱,需要建立更丰富的连接层次——不仅仅是概念和实体,还要连接事件、句子、段落乃至整个文档。在数据量分布上,可能会形成一个“倒钻石”结构:底层是大量的文本片段,上层是精炼的实体与概念。这样的结构,才更利于重塑大模型的知识体系,并与其本身的文本处理能力相兼容。

Q标志

Q:那针对第二个问题“大语言模型是否可以帮助此类知识图谱的构建?”,有什么经验可以分享?

A标志

A:我们在几个关键环节已经验证了大模型的助力效果:

  • 生成Schema

    :利用大模型参数中存储的领域知识,我们能在给定顶层概念后,让它自动生成并构建详细的概念层次体系。例如,基于11个医疗顶层概念,大模型帮助我们构建了一个包含近1.5万个概念的医疗概念树。
  • 术语翻译

    :对于简短的英文概念或词组,使用大模型进行翻译,准确率可以达到84%。
  • 三元组分类校验

    :使用不同的大模型对现有三元组进行正确性分类。经过这一轮校验,概念类三元组的准确率从73.6%提升到了87.5%,实体类三元组的准确率也从84.3%提升至86.5%。

实践表明,大模型的生成能力,在提升图谱准确性、扩展知识覆盖面以及降低构建成本方面,确实能带来显著增益。

Q标志

Q:使用大模型构建知识图谱,目前有什么明显的局限吗?

A标志

A:局限性同样突出,主要集中在三个方面:

  • 处理效率低

    :受限于大模型的生成速度和上下文长度,处理海量三元组的效率不高。例如,用单卡推理一个720亿参数的大模型处理百万级三元组,可能需要长达20天(约每天5万条)。为此,我们不得不引入一个“前哨”模型:先训练一个Macbert模型对三元组进行粗分类(准确率83.5%),筛选后再交由大模型精处理,以提升整体流程效率。
  • 输出不规范

    :尽管可以通过提示词约束输出格式,但作为生成式模型,大模型仍有可能“不听话”,产生不符合约定的输出,这给批量、流程化的数据处理带来了额外的后处理负担。
  • 存在内部知识冲突

    :在生成概念层次时,偶尔会出现上下位概念形成循环的情况,这暴露了大模型内部知识存在矛盾。而且,除非是“环”这样明显的结构错误,否则很难发现其生成数据中更隐蔽的知识冲突。

Q标志

Q:针对OneGraph项目,SIGData后续有什么规划?

A标志

A:接下来的工作将沿着两个方向深化:

一是继续依托OneGraph,深入探索如何利用大模型为LLM“量身打造”更有用的知识图谱;二是反方向探索,研究如何用OneGraph这类高质量图谱去增强大语言模型的能力,构建更强大的知识增强型大模型系统。相关数据与技术报告也将陆续发布。

这场关于“知识”与“模型”如何相互成就的探索,才刚刚开始。