首页 > 教程攻略 > ai资讯 >知识图谱技术体系(二)|图数据库的3点介绍

知识图谱技术体系(二)|图数据库的3点介绍

来源:互联网 时间:2026-08-14 20:06:28

在数据管理的世界里,图(Graph)是一个基础而重要的概念。它描述的是对象之间的关联关系——这些对象被抽象为顶点(节点),而它们之间的联系则称为边。通俗地讲,就是把数据变成点,把关系变成线,从而直观地表达“谁和谁有关”。图可以分为有向图和无向图:有向图的边有方向,比如区块链中的交易流向;无向图则不关心方向,图数据库通常用双向边来模拟。

上图中,A、B、C、D、E代表节点(实体或对象),连线代表关系(边)。节点和边上还可以附带属性,这就是常见的属性图模型。

一、什么是图

图是由顶点和边组成的结构,用于描述对象之间“在某种意义上是相关的”。顶点代表对象,边代表关系。图论是它的数学基础,而图可视化的呈现方式则让复杂关系一目了然。有向图的边有明确方向,典型应用如区块链中的有向无环图(DAG),可以追溯每一笔比特币的流向与归属。无向图忽略方向,实际图数据库中通常通过双向边存储来实现。

二、图数据库

图数据库是基于图论的数据管理系统,核心思路是通过节点、边和属性来存储数据。数据之间的关系和数据本身同等重要——在图数据库中,关系被当作数据的一部分直接存储,跳过了传统数据库用索引扫描的步骤,查询性能从O(logn)跃升到O(1)。这让图数据库在处理复杂关联查询时游刃有余。

图存储

不同格式的数据需要不同的存储组件。HDFS适合非结构化数据,Hive适合结构化数据。而图这种特殊结构,也需要高效的存储系统,即图数据库。图存储设计时重点考虑了数据查询遍历时的局部性——它能让一跳扩展甚至子图级别的数据在物理上邻近存储,从而大幅提升效率。

图计算

传统MapReduce任务假设数据之间耦合较弱,划分和并行计算相对容易。但图数据之间的耦合性很强,需要先对图进行划分,不同的划分方式对计算效率影响很大。MapReduce粗粒度的切分容易导致负载不均衡,最终拉低计算效率。

图可视化

图可视化通过展示实体和关系,帮助用户洞悉数据背后的逻辑。目的是让图数据“可看、可理解、可分析”。目前图可视化已广泛应用于知识图谱、网络安全、金融风控、调度依赖等领域。以欺诈团伙判定为例,可视化工具可以在事中或事后分析,验证模型检测结果,或观察欺诈团伙的形成过程,从而调整业务策略和规则。

图模型:属性图与RDF

使用图数据库时,需要根据业务需求构建图模型。下图是一个电影知识图谱的属性图示例。图模型主要分两种:属性图模型和RDF模型。

属性图模型由顶点、边及其属性构成。顶点和边都能带属性,节点可以通过“标签(Label)”分组。关系边从起点指向终点,有明确方向,因此属性图本质上是有向图。关系上的属性可以为节点间的关系提供额外的语义。现在提到的图数据库,其图模型通常指属性图。

RDF(Resource Description Framework)模型在顶点和边上没有属性,只有一个唯一的资源描述符——这也是RDF与属性图模型最根本的区别。在RDF中,每增加一条信息都要用一个单独的节点表示。比如给一个人节点添加姓名,属性图只需在节点上加属性,而RDF必须创建一个姓名节点,并通过hasName关系与原节点相连。

三、图数据库与关系型数据库对比

关系型数据库在设计时要求严格的数据规范化:将数据拆分成不同表,删除重复项,以保证强一致性和ACID事务。但这种规范化的代价是复杂关系查询时的性能损耗。关系型数据库擅长逐行快速访问,可一旦数据之间形成复杂关联,跨表查询和索引开销就会飙升。

图数据库则把关系直接映射到数据结构中,对高关联度数据的查询更快,尤其适合面向对象的应用程序。同时,图数据库的Schema更灵活,能自然扩展到大数据场景,也适合管理临时或不断变化的数据。

当然,关系型数据库在处理大量同类数据元素时依然有优势——因为这是它的自然工作方式。图数据库并非要替代关系型数据库,而是在关联分析场景中提供性能提升和延迟降低。图数据库能更直观地建模,更全面地展示数据之间的关系。

上图展示了客户、订单、产品、供应商之间的关系。很明显,图数据库模型以“人脑思维”的方式呈现,相比之下关系型数据库的模型复杂得多。图模型极大降低了数据复杂度,无论业务人员还是技术人员都能轻松理解,沟通效率自然提升。