聊聊Ollama如何离线部署GLM4-9b
来源:互联网
时间:2026-08-20 14:33:27
## 概述
Ollama 的官方地址是 ollama,文档本身写得还算清楚。但如果要在离线环境下部署,官方的说明就显得有点绕,而且关于镜像库的拉取部署也没有交代明白。
目前接触到的 Agent、RAG 等框架,最常见的接入模式是调用官方开放平台的免费 API,申请一个 api_key 就能用。自己玩倒是挺方便,但放到内网环境就麻烦多了——连不上外网,本地部署的模型框架又不支持引入。比如 LangChain,我就遇到过这种情况。
好在现在开源的推理部署框架越来越多,像 Ollama、xinference、vllm 这些,接入原生 LLM 后,能实现高并发、高性能、简单快捷的部署。部署完之后,对外只需提供一个 API 端口甚至 UI 界面,第三方框架就能直接接进来。
## Ollama 离线部署
先下载离线二进制包(ollama),注意这是个二进制文件,下载后直接就能运行,不过得先给权限。我的 docker 系统环境是 Ubuntu。创建一个新文件夹,路径设为 /home/Ollama,把下载好的二进制包重命名为 ollama:
```bash
chmod +x ./ollma
```
文件夹结构准备好后,执行 ollama 命令启动服务,可以先看看它支持哪些命令:
!(http://img.318050.com/uploads/20260530/17801217176a1a80755d6c0196528883.webp)
启动就行,像这样:
!(http://img.318050.com/uploads/20260530/17801217196a1a8077d589b381687702.webp)
这里强烈建议把 info 那段输出仔细读一遍,里面包含了 ollama 的环境变量信息。
列举模型列表,执行 `list` 命令即可。刚部署完,列表是空的。
## 模型拉取
在内网环境下,服务器不能联网,自然没法用 `ollama run xxx` 一键拉取。Ollama 官方虽然提供了手动下载的方式,但我试了一下,有点麻烦,而且感觉不太顺手。后来换了个思路:先在 VM 上把模型拉到本地,再把整个模型目录上传到内网服务器,Ollama 能直接识别就行。按理说没问题,因为 `run` 命令也是下载到本地,然后 Ollama 识别,只要下载到了指定目录,不管是手动还是自动,应该是一致的。在 VM 上,指定模型的下载路径:
```bash
OLLAMA_MODELS=/home/ollama_sitepackage/ ./ollama run glm4:9b
```
环境变量在之前 info 级别的日志里都打印出来了,留心看就能发现。最后总会报一个错,但可以忽略——模型已经下载好了,在文件夹里能看到。然后把整个文件夹上传到内网。
查看 `list` 列表,确认模型已存在。
最终,指定环境变量启动 ollama:
```bash
OLLAMA_HOST=0.0.0.0:11434 OLLAMA_MODELS=/home/ollama_sitepackage/ ./ollama serve
```
完美运行。
## 总结
很多框架都支持在线拉取模型,但实际环境往往没那么方便。无论是远程在线拉取还是离线下载上传,只要搞清楚底层的原理和逻辑,顺着推演,总能找到可行的方案。 -
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名