一篇大模型在生成式图谱分析方面的综述
图(graph)是一种基础数据模型,用于表征社会和自然界中各类实体及其复杂关系——社交网络、交通网络、金融网络、生物医学系统,无一不在其列。大型语言模型(LLMs)凭借强大的泛化能力,在处理这些图任务时展现出了独特的优势:省去了训练专门图学习模型的需求,也大幅降低了人工标注的成本。那么,把LLM和图数据放到一起,到底能碰撞出什么火花?
这篇综述对现有研究做了全面梳理,将基于LLM的生成式图分析(LLM-GGA)归纳为三大核心组成部分:
图1: LLM-GGA领域的说明

进一步地,这三大组成部分又可以细分为六个具体的研究方向:
- :LLMs能不能真正理解图结构?比如识别节点、判断连通性、解决最大流问题等。
图结构理解
- :结合图结构和节点属性做学习,例如节点分类、图分类、生成图查询语言(GQL)。
图学习
- :借助图结构来模拟人类的推理过程,处理更复杂的算法、逻辑甚至数学问题。
图形式推理
- :如何通过LLMs增强图的表示能力,尤其针对文本属性图(TAGs)。
图表示
- :LLMs和知识图谱(KGs)的互动,以及如何用KGs弥补LLM在事实知识处理上的短板。
知识图谱增强检索
- :把图-LLM框架用到推荐系统、对话理解、响应预测等非图任务中去。
基于图+LLM的应用
一、图结构理解
这个方向的核心问题很简单:LLM到底能不能理解图结构?从邻居节点、最短路径、连通性这些基础查询,到最大流问题、拓扑排序等更复杂的任务,研究者设计了21种不同的图结构理解任务来检验LLM的能力,包括图大小检测、节点度数检测、边检测、图密度计算、节点偏心率计算等等。
图2:21个不同的图结构理解任务

目前主要有两条技术路线:
- :通过精心设计提示,引导LLM更好地理解图结构和任务目标,从而提升性能。
提示方法
- :在特定图数据集上微调LLM,直接增强其结构理解能力。
监督微调
提示本身又可以分为三类:手动提示(研究者手写)、自提示(LLM自己迭代优化初始提示)、以及API调用提示(让LLM学会调用外部工具来解决复杂图任务)。
图3:图结构理解任务中prompt方法:手动提示、自提示和API调用提示

图4:图结构理解任务的提示,其中 [graph] 是数据的输入


图5:使用 GPT 3.5 的二分图匹配任务示例 - 图结构理解任务
在监督微调这条线上,GraphLLM是一个代表性的工作。它试图打破LLM在图推理上的障碍,引入了一个混合模型——既能继承图学习模型优越的表达能力,又能让LLM熟练地解读和推理图数据。
图6:在图结构理解任务中的监督微调(SFT)方法。上图展示了前缀调整:在前缀调整中结合图结构和文本信息作为前缀,并带有指令(如GraphLLM)输入到LLM中。也可以使用指令调整。
二、图学习任务
图学习任务的覆盖面相当广:节点分类、图分类、边分类、节点生成、知识图谱问答(KGQA)、图查询语言(GQL)生成、节点特征解释……现有的LLM-GIL研究基本可以归为三大类:
- :利用LLM对文本语义的深度理解和推理能力,通过编码图信息到嵌入、生成伪标签、提供外部知识等方式,来增强GNN的性能。
LLMs作为增强器
- :把LLM直接当成独立的预测器使用。关键就在于设计一个能把文本属性和图结构都包含进来的提示,让LLM有效理解图结构,提升预测准确率。
LLMs作为预测器
- :用提示的方法来统一预训练和下游任务,通过提示工程针对不同任务做优化。
图提示
三、图形式推理
图形式推理目前有两个主要方向:
- :把图作为LLM推理过程的中间步骤,通过把LLM的响应添加到图上,构建一个有向无环图(DAG)来表示推理过程。这样,LLM的思考路径就变成了可解释的图形结构。
think on the graph
- :通过验证LLM输出的中间或最终结果是否与图中的信息一致,来提升推理的正确性。具体做法是把LLM的输出作为图中的节点,验证不同路径的输出是否一致,从而判断推理结果是否可靠。
verify on the graph
四、图表示
LLMs强大的文本表示能力,让文本嵌入能够捕捉更深层的语义细微差别,这对于增强图表示——特别是文本属性图(TAGs)——意义重大。核心挑战在于:如何把图结构有效整合到LLM生成的文本嵌入中?目前主要有三种策略:
- :把图转换成特定的有序序列,输入LLM,利用其语义捕捉能力来学习序列嵌入,进而推导图的嵌入。
图嵌入
- :核心是把结构嵌入纳入文本嵌入中。结构嵌入捕捉局部结构,文本嵌入捕捉语义含义,如何巧妙结合两者是关键。
图增强文本嵌入
- :聚焦于如何描述一个图,让LLM能更高效地理解它。比如在常规图中,可以通过假设节点之间的关系是朋友或同事,把整个图放到一个故事背景里去描述。
图编码提示
五、知识图谱增强检索
LLM在处理事实知识时有不少硬伤:幻觉、领域知识不足、知识遗忘、准确性难以保证。而知识图谱(KG)天然的优点是提供结构化的、可靠的信息来源。两者的结合便顺理成章:用KG检测LLM的幻觉、增强领域知识、提升知识提取能力、甚至增强推理能力。反过来,LLM也可以用来解决知识图谱嵌入、补全、构建、图到文本生成、问答等任务。
六、基于图+LLM的应用
图-LLM框架并不局限于图相关的任务,它在对话理解、响应预测、多域对话状态跟踪、推荐系统、图神经架构搜索等众多领域都有用武之地。常见的框架包括:GNN与LLM的结合、图数据与LLM的结合,以及各类利用图结构和语言模型优势来解决不同任务的创新方法。
七、评估方法与基准
最后,综述还系统整理了LLM-GGA方法的数据集和代码链接,以及六个细分研究方向各自的数据集。对于新提出的数据集和评价指标,也有专门的讨论。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名