OpenKG-SIG | SIGData兴趣组:利用大模型构建LLM需要的知识图谱
随着大语言模型(LLM)的浪潮席卷而来,知识图谱这个领域也在悄然发生变化。过去,我们可能更关注如何规模化、自动化地构建图谱;但现在,一个核心问题摆在面前:既然大模型自己就能“说话”,那我们需要什么样的知识图谱来辅助它?
这个问题,正是OpenKG旗下数据兴趣组SIGData的核心探索方向。他们的使命可以用一句口号概括:为LLM构建知识图谱,并用LLM构建知识图谱。
SIGData兴趣组简介
主题Slogan
Build KGs for LLM and by LLM!
OpenKG的核心使命之一是促进中文知识图谱数据的开放与互联。进入大模型时代,这个使命被赋予了新的内涵:我们不仅要回答“大模型需要怎样的知识图谱”,还要实践“如何利用大模型构建更有价值的开放知识图谱”。
因此,SIGData小组应运而生。它致力于两件事:一是持续建设和维护OpenKG的开放数据体系;二是充分挖掘大模型的潜力,探索一种新型的、更贴合大模型需求的开放知识图谱构建范式。简单说,就是要开源并维护一套能有效辅助大模型落地、缓解其“幻觉”、知识过时等问题的权威知识库,并提供相应的数据操作与社区平台。
主题任务
- 建设并维护OpenKG开源图谱数据体系;
- 探索基于大模型的开放知识图谱构建方法;
- 构建服务于大模型的开放知识图谱。
代表性贡献
目前,小组的代表性成果包括OpenKG数据地图、cnSchema以及近期重点推进的OneGraph项目。
SIGData成员结构
小组由浙江大学的张文和蚂蚁集团的刘志臻共同负责。目前团队已有来自学界与业界的11位成员加入,包括蚂蚁集团的梁磊、孙梦姝、伯仲璞,英国曼彻斯特大学助理教授Jiaoyan Chen,北京邮电大学教授鄂海红,杭州电子科技大学特聘副教授耿玉霞,以及浙江大学的多位博士生与硕士生:朱渝珊、徐雅静、孟佳卫、陈少凯、兰雅榕。
这个跨机构团队将不定期举行知识图谱数据的发布与专题研讨。
近期主要工作:OneGraph项目深度解析
OneGraph是SIGData当前的重点项目,其目标远大,旨在探索大模型与知识图谱的共生关系。

Q:为什么会发起OneGraph这个项目?

A:动机主要来自两方面。
首先,是数据融合的内在需求。这些年开放的知识图谱数据越来越多,像WordNet和ConceptNet在词义上可以互补,又如“国内行政区划”图谱能完善“中国旅游景点”图谱的地理信息。如果能将这些分散但互补的数据自动融合起来,就能形成一份更完整、更强大的开放知识图谱。这是启动OneGraph的第一个初衷。
其次,也是更重要的,是大模型带来的时代机遇与挑战。大模型的崛起为知识图谱领域打开了新窗口:一方面,知识图谱以其准确、可编辑的特性,被视为矫正大模型“幻觉”和知识缺陷的利器;另一方面,大模型强大的通用理解能力,又为自动化、大规模构建高质量知识图谱提供了前所未有的可能。
但同时,一个根本性的拷问也随之而来:如果大模型本身已经像个庞大的“隐式知识库”,那我们还需要怎样的“显式知识图谱”?OneGraph项目,正是为了系统性地探索这个问题的答案。

Q:能介绍一下OneGraph项目想要解决的具体问题吗?

A:项目主要围绕两个核心问题展开初步探索:
- 什么样的知识图谱对大语言模型更有用?
- 大模型能否反过来,高效地帮助构建这类知识图谱?例如,它能否显著降低构建成本?能否将图谱的规模和质量都提升一个量级?

Q:请问现在OneGraph建设得怎么样了?

A:已经取得了阶段性进展。

Q:针对第一个问题“什么样的知识图谱对大语言模型更有用?”,SIGData找到答案了吗?

A:这是一个持续探索的过程,但目前我们形成了两点初步认识:
- :与过去追求海量数据而容忍一定噪声的思路不同,服务于大模型的知识图谱,必须把事实准确性放在首位。只有当图谱的知识准确率高于大模型自身的内部知识准确率时,它才对模型有正向增益。可以说,准确率越高,价值越大。
准确性优于规模
- :传统图谱侧重对概念和实体的建模。未来对大模型有用的图谱,需要建立更丰富的连接层次——不仅仅是概念和实体,还要连接事件、句子、段落乃至整个文档。在数据量分布上,可能会形成一个“倒钻石”结构:底层是大量的文本片段,上层是精炼的实体与概念。这样的结构,才更利于重塑大模型的知识体系,并与其本身的文本处理能力相兼容。
结构需更丰富,更具文本亲和性

Q:那针对第二个问题“大语言模型是否可以帮助此类知识图谱的构建?”,有什么经验可以分享?

A:我们在几个关键环节已经验证了大模型的助力效果:
- :利用大模型参数中存储的领域知识,我们能在给定顶层概念后,让它自动生成并构建详细的概念层次体系。例如,基于11个医疗顶层概念,大模型帮助我们构建了一个包含近1.5万个概念的医疗概念树。
生成Schema
- :对于简短的英文概念或词组,使用大模型进行翻译,准确率可以达到84%。
术语翻译
- :使用不同的大模型对现有三元组进行正确性分类。经过这一轮校验,概念类三元组的准确率从73.6%提升到了87.5%,实体类三元组的准确率也从84.3%提升至86.5%。
三元组分类校验
实践表明,大模型的生成能力,在提升图谱准确性、扩展知识覆盖面以及降低构建成本方面,确实能带来显著增益。

Q:使用大模型构建知识图谱,目前有什么明显的局限吗?

A:局限性同样突出,主要集中在三个方面:
- :受限于大模型的生成速度和上下文长度,处理海量三元组的效率不高。例如,用单卡推理一个720亿参数的大模型处理百万级三元组,可能需要长达20天(约每天5万条)。为此,我们不得不引入一个“前哨”模型:先训练一个Macbert模型对三元组进行粗分类(准确率83.5%),筛选后再交由大模型精处理,以提升整体流程效率。
处理效率低
- :尽管可以通过提示词约束输出格式,但作为生成式模型,大模型仍有可能“不听话”,产生不符合约定的输出,这给批量、流程化的数据处理带来了额外的后处理负担。
输出不规范
- :在生成概念层次时,偶尔会出现上下位概念形成循环的情况,这暴露了大模型内部知识存在矛盾。而且,除非是“环”这样明显的结构错误,否则很难发现其生成数据中更隐蔽的知识冲突。
存在内部知识冲突

Q:针对OneGraph项目,SIGData后续有什么规划?

A:接下来的工作将沿着两个方向深化:
这场关于“知识”与“模型”如何相互成就的探索,才刚刚开始。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名