详解:RAGFlow知识库管理和嵌入网站的方法全攻略
来源:互联网
时间:2026-07-21 13:59:53
掌握RAGFlow知识库管理与网站嵌入的全面指南。
这次我们来深入拆解一下RAGFlow的知识库功能,以及如何将它嵌入到自己的网站中。内容比较实操,会从知识库的创建、配置细节,一直聊到最终在对话中绑定应用、甚至嵌入到网页里。
一、知识库
路径很简单:菜单 → 知识库 → 创建知识库。
点击“确定”后,就完成了初步创建。接下来会进入详情页面,真正的配置挑战才刚开始。
1、配置
先说说几个核心配置项:
- 这里有两个选项。DeepDoc 是利用视觉模型来做PDF布局分析的,能更精准地识别出标题、文本块、图像、表格的层级关系。如果你选 Naive,那只会提取纯文本内容。请注意,这个设置仅对PDF文件生效。
PDF解析器:
- 选择你已经配置好的模型即可。
嵌入模型:
- 这里的选项很多,得根据实际场景来选。比如 General 适用于通用文档,Q&A 适合问答对格式的数据,Paper 则是专门为PDF论文设计的。
切片方法:
- 这是一个关于token数的阈值。系统会把切分后的小文本段不断合并,直到接近这个阈值为止。但如果文本中没有遇到分段标识符,即使超过了这个阈值,也不会自动生成新块。理解这个机制很重要。
建议文本块大小:
- 支持多字符作为分隔符,需要用 `` 包裹起来。举个例子,你设置成
文本分段标识符:
n`##`;,系统就会先用换行符、两个#号和分号对文本进行初步分割,然后再按建议的文本块大小进行拼装。如果你整理的数据里每条知识都用换行符隔开了,那这里就正好可以利用起来。
配置完成后,点击“保存”就跳转到了数据集界面。
2、数据集
在这个界面,你可以添加数据集,上传本地文件,而且支持一次选择多个文件。
操作流程上有一点需要特别注意:
- 文件上传完成后,还需要手动点击“解析”按钮。
- 解析是比较耗时的操作,数据量越大时间越长。所以建议等一个文件解析完毕,再点击下一个进行解析。
- 解析完成后,数据会被保存到对应的向量数据库中。
3、示例
这里用三个具体案例来演示不同文档类型的配置差异:论文-PDF、GPT报错-QA、中医诊断。
(1)论文-PDF:
(2)GPT报错-QA:
配置上,切片方法要选择 Q&A,这样才能正确处理这种结构化的数据。
(3)中医诊断:
配置上,就需要在文本分段标识符里填入换行符,来告诉系统如何正确切分数据。
二、聊天对话
1、绑定知识库
新建对话助理的方法之前聊过,核心就是将助理与你刚刚创建好的知识库关联起来。
2、聊天对话
开始对话后,你会看到答案都来自知识库里存储的数据。更棒的是,系统还会显示答案是从哪个具体文档里获取到的,溯源非常清晰。
三、嵌入网站
RAGFlow 还提供了两种外部系统接入方式:iframe嵌入 和 API调用。
1、设置API Key
路径:头像 → API → API Key。创建新密钥后,系统会自动生成一个Token。
2、嵌入网站
路径:菜单 → 聊天 → 点击某一个聊天助理 → 嵌入网站。
可以看到有“全屏嵌入”和“部分嵌入”两种模式。“全屏嵌入”是iframe形式,适合直接嵌入到页面里;“部分嵌入”则是API形式调用,适合需要更灵活集成的场景。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名