【大比武08】利用RAG技术构建档案智能问答系统
在数字化浪潮席卷各行各业的今天,档案管理领域正经历一场深刻变革。随着ChatGPT等大语言模型的出现,从数字化向智慧化的转型不再是远景,而成为现实。RAG技术与LLM的结合,为档案领域的智慧应用场景开拓提供了全新动力——这背后,是燕山大学档案馆(校史馆)与河北科怡科技开发有限公司、南京兰征信息科技有限公司联合打造的实战项目。
01 RAG技术概述
RAG技术之所以被提出,归根结底是为了解决预训练语言模型在处理知识密集型NLP任务时面临的几个关键挑战。
1. 知识存储有限
尽管LLM能存储大量知识,但训练数据终究有限,只能记住当时所见所学。一旦遇到模型从未见过的知识点,结果往往不尽如人意。
2. 知识更新困难
外部世界日新月异,知识在不断更新迭代。但预训练模型一旦“毕业”,知识就定格在了那一刻。要想更新,就得推倒重来,重新进行大规模预训练——耗时耗力,成本极高。
3. 事实性与准确度
生成式任务中,模型经常输出看似流畅、实则不准确甚至虚构的内容。这就是所谓的“幻觉”问题,根源在于模型缺乏对特定事实的直接访问能力。
4. 解释性与透明度
用户希望理解模型的判断依据,尤其是在涉及事实信息的场景。纯粹的预训练模型很难提供生成结果的决策逻辑,仿佛一个“黑箱”。
RAG需要解决的核心问题
RAG+LLM的核心思路,是将LLM的生成能力与信息检索技术深度融合,从而提升模型在处理各类问答任务时的精确度和可靠性。其运行流程通常包含三个阶段:检索、生成与增强。
检索
当用户提问时,系统首先从外部知识库中搜索关联信息。这一步要把问题转化为查询指令,借助向量空间模型之类的检索模型,找到最相关的文档或信息片段。
生成
检索到的信息会连同原始问题一起喂给LLM,为其提供额外的上下文支撑。这样一来,模型能更准确地理解问题,生成的回答也更丰富、更靠谱。
增强
RAG框架还包含对检索和生成过程的持续优化,比如对检索结果进行重排序、上下文压缩、模型微调等,旨在让整个系统的表现更上一层楼。
简而言之,RAG利用外部知识库来补充和强化LLM的内在知识储备,让模型有能力应对超出训练数据范围、或需要最新信息的任务。
以上所说的是基于端到端训练方法的
朴素RAG
高级RAG
模块化RAG
高级RAG
模块化RAG
LLM通过RAG获得了领域知识扩展,在特定任务上表现更佳,落地难度和成本也随之降低。这为档案领域引入LLM应用提供了理想的切入点。
02 档案智能问答系统的构建
RAG技术能帮助LLM更准确地理解查档用户的问询,提供更精确、更相关的信息。这样一来,用户既享受到LLM的生成能力,又保障了档案知识的本地安全。
基于RAG+LLM构建档案智能问答系统,是档案智能化应用的重要方向。系统的原理图如下所示:
整张原理图可拆解为三大模块,共涵盖15个步骤(step1-step15)。
1. 档案知识库的构建(step1-step6)
数据收集
这是构建档案知识库的第一步。关键在于确保收集的数据质量过硬——不能有错误、偏见或不准确的信息。数据质量直接决定系统生成的答案是否靠谱。
数据预处理
原始数据通常夹杂噪声和不规范内容,需要“洗澡”提升质量。这项清洗工作量大且繁琐,既依赖数据处理工具,也离不开大量人工参与。数据预处理的质量同样至关重要,会直接影响后续大模型的问答效果。
文本切分
将档案长文本切分成适合模型处理的小块,同时保证每个文本块的语义独立且完整。处理档案数据时,要根据文本的结构和内容特性来制定切分规则。切分点应尽量尊重自然语言中的语义单位,比如句子、段落或意群,确保每个片段语义完整,避免将一个完整意群拦腰截断,造成信息丢失或不连贯。
2. 检索模块的构建(step7-step11)
检索模块是连接档案知识库与用户查询的关键枢纽。向量数据库的构建、检索算法的选择与优化,是确保高效、精准检索的核心技术。
向量数据库构建
这是检索模块的基础。需要将档案知识库中的所有文本块转换为向量表示,一般选择一个合适的向量化模型,比如bge-large、bce或text2vec,将文本块转换为固定维度的向量,再存储在向量数据库中,以便后续检索操作。
检索算法选择
算法选择直接决定检索模块的性能。常见算法包括BM25、TF-IDF和混合检索等。BM25会根据文档长度对检索结果加权,TF-IDF则结合词频与文档频率进行加权——各有侧重,适合不同场景。
3. 生成答案(step13-step15)
生成答案模块负责将检索到的档案信息整合为用户能理解的回答。查询重构、结果重排序和语义理解是其中的关键环节。
查询重构
这一步是为了提升检索效果。用户提出的原始问题可能含糊或不精确,查询重构就是通过扩展语义,让问题更精准,或与知识库中切分的文本长度对齐,从而提高检索的相关度。
结果重排序
向量数据库与向量化的查询文本进行相似度计算后,可能返回多个候选答案。需要将这些结果按相似度重新排序,选出最靠前的几个。
内容生成
将排序后最靠前的结果输入LLM,让它利用生成能力,基于用户问题输出答案。过程中可能涉及端到端微调或对比学习等多种优化方法。
除了上述三大模块,安全访问控制也值得一提。在档案系统设计中,要根据用户角色分配不同访问权限,并通过身份认证确保数据访问安全。在档案智能问答系统中,借助RAG技术结合原有的档案系统角色权限,可以限定某个角色所能访问的知识库范围,从而实现了基于角色权限访问控制的RAG+LLM技术应用。
03 实施效果
在燕山大学档案馆(校史馆)的实际项目中,我们基于RAG+LLM构建了档案智能问答系统,取得了良好的应用效果。
硬件配置
CPU:Intel Xeon Gold 6271C *2
GPU:Nvidia Geforce RTX 4090*4
内存:256G
软件配置
基座大模型:零一万物Yi-34b-chat
向量化模型:bge-large
开发框架:LangChain
系统测试结果(3倍速录屏):
04 结语
档案智能问答系统是我们将大模型融入档案智能化应用的一次初步尝试,涉及档案知识库构建、检索模块开发、答案生成以及安全访问控制等多个方面。从实际测试效果来看,RAG技术与大模型的结合为档案问答系统的智能化提供了有力支撑。受限于篇幅,本文只能对基本原理和系统框架做简要介绍,实际开发过程中碰到的困难和挑战远不止这些,后续有机会再和大家详聊。我们也在不断探索和优化解决方案,以期实现更好的应用效果。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名