传统 RAG 系统通常只处理文本内容,但在企业文档里,超过 50% 的关键信息往往分布在表格、流程图和截图中。若在检索阶段直接忽略这部分非文本数据,语义信息会出现明显缺口。多模态 RAG 的做法是把文本与图像嵌入到统一向量空间中,使 LLM 在生成结果时能够结合“视觉证据”进行引用,从而在图表问答、产品手册检索等任务中提升准确率(实测提升27%~41%)。
Python 3.10 LangChain(编排框架)Chroma(本地向量库)OpenCLIP(多模态嵌入模型)Qwen-VL-Chat(视觉语言模型,亦可替换为GPT-4V)Unstructured(文档解析,支持PDF/PPT中的图像抽取)