Dify v1.11.0:知识库支持多模态检索
翻开任何一份企业文档,你会发现知识从来不只是文字。产品说明书里有实拍图,技术报告附带架构图,各类培训手册和操作指南也包含了大量截图。这些视觉内容承载的信息量,往往不亚于文字本身。
尽管多模态 Embedding 能力早已出现,真正将其落地到知识库产品中的方案并不多见。企业要么自行构建复杂的跨模态处理链路,将图片与文本分开处理后再尝试融合;要么暂时搁置图片,仅依赖文本检索。两种方式都有明显局限。
现在,dify 知识库正式支持多模态能力,文本与图片能被统一理解、共同检索,并直接用于 Workflow 应用的构建。AI Agent 从知识库获取的上下文不再局限于文字,而是可以看见图片内容、理解其中的信息,并据此作出回答。
核心突破:统一语义空间
从 Dify v1.11.0 开始,系统引入了统一语义空间的多模态向量,让图片和文本 Embedding 具有共同的语义坐标体系,使得“以图搜文、以文搜图、以图搜图”成为现实,大幅提升用户检索准确度。
- 在最新版本中,系统可自动提取文档中通过 Markdown 语法引用、且链接可访问的图片(支持 JPG、PNG、GIF,单图不超过 2MB)。而选择多模态嵌入模型后,这些图片将进一步进行向量化处理,与文本一同参与检索。
多模态支持:
- 在模型侧,Dify 支持多家云厂商与开源生态的多模态 Embedding 和 Rerank 模型,例如 AWS Bedrock、Google Vertex AI、Jina、通义等。所有支持的多模态模型在面板中都会带有统一的 VISION 标识,便于识别和选择。
广泛的模型生态:
从“语义匹配”到“图片理解”
- 用户不仅可以用自然语言描述问题需求和特征,还可以上传相关图片,同时检索语义相关的文本和图片,帮助用户快速定位要点信息。
直观捕捉用户意图:
- 在使用支持 VISION 的 LLM 生成回答时,AI 不再局限于文本引用,还可以将相关配图一并带入推理过程,根据图片中的细节进行解释,让回答更贴近用户需求。
更完整的 RAG 推理路径:
技术价值
为什么 RAG 离不开 Embedding 与 Rerank 的协同?
在广义的 RAG 架构中,信息历经“切片-索引-召回-重排-生成”的完整路径后,实现了从散落文档到精准信息流的转化。这一过程体现了 RAG 的本质:信息的精准筛选与深度理解。在这个过程中,Embedding 与 Rerank 缺一不可:
1. 多模态 Embedding:
2. 多模态 Rerank:
场景实例
多模态知识库实现“看图答疑”助手。用户可以使用自然语言描述需求,上传真实场景图片,使其实现 “检索-识别-分析-回答”的一体化流程。
Step 1:创建多模态知识库并导入用户手册
1. 文档导入:
2. 知识库配置:
3. 检查图片解析情况:
4. 测试召回效果:
Step 2:搭建 Workflow 实现流程化查询
构造 Workflow 以实现以图搜图,本篇内容以用户上传实际使用场景,借助 LLM 进行实际问题分析。
1. 用户输入进行分支判断:
2. 知识检索节点:
3. 配置 LLM 节点:
4. 变量聚合以及结果输出:
结语:从单一文本走向多模态全量检索
多模态知识库的上线,标志着 Dify 功能正在从单一的文本知识检索工具,迈向一个更完整的企业知识理解与自动化平台。
它不再仅仅是“看懂”一张图,而是将视觉信息转化为流程上下文,在此基础上参与推理。无论是查询技术实践、下发自动通知,还是驱动复杂的业务 Workflow,让你的 Agent 不再只是被动回答问题,而是基于真实世界的信息做出判断、分析并执行任务,成为企业中真正可落地、可信赖的智能执行体。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名