知识图谱技术——知识图谱构建
知识图谱的逻辑结构,说到底,可以拆成两大块:数据层和模式层。数据层里装的是大量基础事实,通常以"实体-关系-实体"或"实体-属性-属性值"这样的三元组形式存在,这类数据一般存在图数据库里。模式层则是在这之上做了更高一层的抽象——它定义了数据该怎么组织、怎么关联,相当于给知识画了个框架,常用的管理工具就是本体库。

构建知识图谱,大部分时候靠的是自动化技术。数据源五花八门:结构化、半结构化、非结构化都有,从中抽取出知识后,分别存到模式层和数据层。整个构建过程,主要有两条技术路线:自顶向下和自底向上。
自顶向下
自底向上
以自底向上的方式为例,整个构建流程大致是这样:系统接收各类输入数据,然后依次经过信息抽取、知识融合和知识加工三个关键步骤,最后输出一个完整的知识图谱。
1. 信息提取
信息抽取是个多维度的活儿,具体抽取什么,要看任务需求。比如做情感和舆论分析,重点是抽事件和情感信息;做知识图谱,则更关注实体、关系、属性这些核心要素。拿城市来说,人口数量、地理位置这些就是它的固有属性。不管是抽实体、关系还是属性,都可以用监督、半监督或无监督的方法来做。信息抽取主要对付的是半结构化和非结构化数据,经过这一步,原本乱糟糟的非结构化数据就能变成结构化的,知识图谱才能用得上。
2. 知识融合
知识融合就是要整合来自不同源的数据,提炼成统一的知识体系。这个环节会面对多种输入:
- :已经符合系统标准,程序可以直接读。
直接可用的结构化数据
- :通过信息抽取变成结构化形式。
需要转换的半结构化和非结构化数据
- :从外部库拿过来的补充信息。
第三方知识库的数据
处理这些数据时,信息冗余不可避免。知识融合的目标就是识别并整理这些冗余信息,消除重复和不一致,最终形成一个统一、连贯的知识体系。核心技术包括实体消歧(把同名但不同指的实体区分开)和指代消解(确定文本里代词或短语到底指哪个实体)。
3. 知识加工
经过信息抽取,我们有了三元组数据——这是知识图谱的砖瓦。但即便做了知识融合解决了一些歧义,这些数据还是缺深层逻辑结构,质量也需要再验证。所以,在知识融合的基础上还得做知识加工,包括本体构建和质量评估,目的是完善知识图谱的逻辑结构,提升整体质量。
本体构建
- :基本单元,可以是对象、任务、功能或行为等,有明确的定义和描述。
类或概念
- :不同概念之间的连接,比如整体-部分关系(Part-of)、继承关系(Kind-of)、概念与实例的关系(Instance-of)。
关系
- :关系的一种特殊形式,定义两个概念之间的特定联系。
函数
- :在所有情况下都成立的描述,是本体的基础性陈述。
公理
- :概念在现实世界中的具体表现。
实例
质量评估
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名