本地大模型构建知识库 Ollama + LobeChat + AnythingLLM
本地部署大模型,从选模型到搭RAG,一篇讲透
(本文封面图来源于unsplash)
在本地部署大模型搭建知识库,好处其实很直接:数据隐私安全有保障,不依赖网络,企业内部用起来踏实;更关键的是,模型和知识库都能按需定制,适配特定业务场景。既可以内部用,也能做成Server对外服务。
哪里可以获取大模型?
大模型种类多,版本更新也快,但所有流行的开源模型几乎都能在HuggingFace上下载。HuggingFace堪称AI模型圈的GitHub,70多万种模型覆盖多模态、计算机视觉、NLP、强化学习等领域,应有尽有。
通过HuggingFace的Libraries分类下的Transformers,就能看到模型的Trending流行趋势。目前Meta的Llama3系列、法国Mistral AI的Mistral系列、阿里的Qwen系列,是业内用得最广的开源模型。
横向评分测评也值得关注。下面这张图是三个模型的对比——阿里的通义千问Qwen2-72B在同等规模下表现最强。不过对国内用户来说,更推荐Qwen2的原因很简单:中文支持程度差异明显,Qwen2显然是更合适的选择。
Ollama、WebUI工具链
本地部署大模型需要运行框架,可选方案包括vLLM、LM Studio,但更推荐Ollama。它支持Windows、MacOS、Linux,能智能调配GPU和CPU资源加速推理,安装和管理各种模型(包括Qwen2)都非常方便。
Ollama的安装和模型部署很简单。官网下载安装后,一条命令就能部署Qwen2 7b模型:
ollama run qwen2
部署完成后默认只有命令行界面,但Ollama生态丰富,可以搭配WebUI工具实现聊天交互,也能基于API与应用程序和工作流集成。

WebUI方案不少,比如Open WebUI、NextChat。生态里还有个LobeChat,支持很多闭源模型API,也兼容云端和离线部署,用起来比较顺手。

本地用Docker安装LobeChat即可,关于如何在LobeChat中配置Ollama,官方文档有详细的说明。

RAG应用的构建
如果只是想要一个离线的聊天平台,前面这些已经够用。但既然选择本地部署,就不该止步于此——结合本地大模型、Ollama和个人或企业的内部资料(知识库),可以定制开发专属且私密的RAG应用。
RAG框架很多,比如RAGFlow、AnythingLLM、Verba、Flowise、Langflow、Quivr等,这里以AnythingLLM为例。它同样支持MacOS、Windows、Linux。安装完成后打开软件,在大模型服务商里选中Ollama,输入Ollama服务端地址(通过ollama serve开启)http://127.0.0.1:11434,就能看到之前安装的Qwen2 7b模型了。

设置完成后进入下一步,构建RAG的三要素——大模型、嵌入模型、向量数据库——AnythingLLM都已经帮你安排好了。

在工作区可以添加txt文本、代码文件、CSV、表格、音频文件、外部网页等等,还支持搜索和连接数据库。用AnythingLLM管理本地知识库,确实方便很多。

这种本地部署方式尤其适合需要离线运行、对知识库安全要求较高的企业内部场景。如果是中小企业,也可以考虑阿里云的百炼——部署更简单,硬件成本更低,而且目前token费用已经是白菜价了。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名