首页 > 教程攻略 > ai资讯 >GraphRAG重走西游路,看悟空那些年历经的劫难!

GraphRAG重走西游路,看悟空那些年历经的劫难!

来源:互联网 时间:2026-08-25 14:22:55

《黑神话:悟空》最近简直火得不行,微软那个GraphRAG也跟着火起来了。既然都这么火,咱们就不绕弯子了——直接拿GraphRAG把整部《西游记》原文翻一遍,看看那个“天命人”孙悟空,究竟经历了怎样的九九八十一难。顺便也聊聊GraphRAG在社区发现过程中,你可能遇到的那些小坑。

这次的GraphRAG配置是这样的:模型用的是qwen1.5-14b,向量模型是bge-m3e。整体跑下来,效果还挺有意思的。

西游记社交关系

从生成的图谱来看,整个故事网络形成了两个非常明显的中心:一个是孙悟空,一个是唐僧。然后所有的人物和事件,基本上都是围绕这两个核心展开的——花果山的逍遥、大闹天宫的狂放、取经路上的磨砺,全都在这个图谱里串起来了。

GraphRAG对西游记的整体概括

那GraphRAG是怎么理解整本书的呢?它给出的概要相当凝练,直接把《西游记》定义为一部充满寓言和神话色彩的小说,核心就是唐僧师徒四人——唐三藏、孙悟空、猪八戒、沙僧——历经千辛万苦去取经的故事。其中几个关键事件被重点拎了出来:

  • 孙悟空大闹天宫:故事的开端,一股子敢把天捅个窟窿的反叛劲儿。
  • 三打白骨精:师徒间的信任危机,也是孙悟空的智勇担当。
  • 过火焰山:象征旅途上各种“过不去的坎”,必须有团队协作才行。
  • 女儿国真假公主:考验的不只是情感,还有智慧。
  • 取经路上与各路妖怪的斗争:善恶交锋,道德选择成了每次战斗的核心。

此外,故事还完整交代了孙悟空的成长脉络——从花果山的猴群、水帘洞的日子,到与东海龙王、观音菩萨这些神话人物的互动。如来佛祖和观音菩萨在整个取经过程中,始终扮演着道德与智慧的双重引路人。可以说,GraphRAG抓取的主线骨架,基本把《西游记》的精神内核给概括出来了。

那些年揍过猴哥的妖怪

话说回来,孙悟空虽然神通广大,但《西游记》里能跟他扳手腕的妖怪其实不少。以下是GraphRAG梳理出的一些“战绩记录”:

  • 黄狮精

    :这妖怪的宝贝实在诱人,猴哥想去凑个热闹,结果差点被怀疑是来“通风报信”的。
  • 红孩儿

    :牛魔王和铁扇公主的儿子,一个三昧真火差点把唐僧烤熟,逼得孙悟空不得不去南海搬观音菩萨当救兵。
  • 金角大王和银角大王

    :这俩是太上老君身边的看守,手里法宝多,在莲花洞跟猴哥好好干了一仗。
  • 蜘蛛精

    :盘丝洞里一群女妖精,蛛网缠身,要不是观音菩萨出手,猴哥还真就困在里面了。
  • 独角兕大王

    :偷了如来的金钢琢,硬碰硬不行,最后还是靠观音菩萨帮忙才搞定。

不难发现,这些厉害的妖怪,背后多半都站着某位大佬。正是这些有背景、有法宝的对手,才让取经路上的每一次战斗都充满了戏剧性和不可预测性。

GraphRAG之孙悟空大战红孩儿劫难过程

单拎出“大战红孩儿”这一劫来看,GraphRAG把整个事件的脉络梳理得非常清晰:从红孩儿拦路,到孙悟空中了三昧真火,再到请观音菩萨出山,最后用玉净瓶降服红孩儿——整个过程,逻辑链条完整,关键实体和关系都标注得明明白白。

那些年揍过猴哥的神仙

除了妖怪,一些神仙也曾让猴哥吃过苦头。GraphRAG给出的清单如下:

  • 如来佛祖

    :大闹天宫后,佛祖一翻手,五指化山,直接把孙悟空压了五百年。
  • 观音菩萨

    :观音院那一回,孙悟空放火,菩萨净瓶甘露一洒,火就灭了,法力显然高出一等。
  • 文殊菩萨和普贤菩萨

    :在万寿山五庄观,猴哥偷吃人参果被发现,被两位菩萨教训了一顿。
  • 菩萨化身的美女

    :黎山老母安排四圣试禅心,孙悟空因为动了色心而中计,也是菩萨们教育的一课。
  • 太上老君

    :虽没在原著里直接分出胜负,但老君的法宝——兜率宫的丹炉、各种金丹——分分钟暗示着他的深不可测。
  • 天庭其他神将

    :比如李天王、哪吒这些,虽然没详细描写具体怎么打的,但也说明猴哥在天庭并不总是横着走。

值得注意的是,孙悟空败给这些神仙,更多是因为策略和计谋,而不仅仅是武力上的碾压。这也正是《西游记》比普通爽文高明的地方——冲突是多维的,角色的塑造是立体的。

GraphRAG社区划分的一些坑

好了,干货讲完,该聊聊实际操作中容易踩的坑了。必须吐槽的是,GraphRAG在进行社区划分时,结果并不总是“理想”。比如这次对《西游记》的社区划分,就出现了一些明显不合理的地方:

根据输出,图谱被分成了十几个社区,比如“取经团队与妖精冲突社区”、“唐僧、孙悟空、观音菩萨等取经社区”、“科技创业中心”(这什么鬼?)、“天庭神话与孙悟空的传奇世界”、“唐朝佛教与整治”等等。但仔细一看就会发现,第2个和第9个社区居然都叫“科技创业中心:创新与合规并存”,明显是跑偏了,属于把完全不相关的内容错误地划分在了一起。

这说明什么问题?

GraphRAG的社区发现算法,对数据质量和文本本身的语义边界非常敏感。

在实际应用中,如果语料本身存在主题跳跃(比如你同时混合了小说文本、科技报道、商业文档),或者模型对上下文感知不够强,就很容易把风马牛不相及的内容强行归到一个社区里。这种“误分”在实际项目中是家常便饭,尤其是在数据量巨大、主题杂陈的情况下。

所以,如果你也想用GraphRAG来剖析自己的数据,有几个小建议:

  • 第一,

    尽可能保证输入语料的主题纯净

    。如果非要混搭,起码要分批次处理,最后再手动合并结果。
  • 第二,

    不要完全信任默认的社区划分结果

    。建议输出后,自己抽样看一看,确认一下社区内部的语义一致性。
  • 第三,

    模型的选型至关重要

    。像qwen1.5-14b这种通用模型,处理纯中文古典小说还行,但一旦遇到混合主题或强专业性的文本,就得考虑用更合适的专用模型或调整参数了。

总之,GraphRAG是个好东西,但用起来,还是得留个心眼。