本地运行Llama3极简傻瓜教程
Meta 在 4 月 19 号放出了最新的开源模型,动作之快,直接打了某度一个措手不及。有网友甚至调侃道:“水一百度会开,人一百度会死”——这讽刺意味,懂的都懂。好了,闲话少说,咱们直接进入正题:如何在本地极简地跑起来 Llama 3。

Ollama 在本地简单的运行 Llama
Ollama 是一个非常简化的小工具,专门用来在本地运行开源大模型,比如 Mistral 和 Llama 2。它把模型权重、配置和数据集打包成一个统一包,由 Modelfile 管理。目前支持的模型列表如下:
| Model | Parameters | Size |
|---|---|---|
| Llama 3 | 8B | 4.7GB |
| Llama 3 | 70B | 40GB |
| Mistral | 7B | 4.1GB |
| Dolphin Phi | 2.7B | 1.6GB |
| Phi-2 | 2.7B | 1.7GB |
| Neural Chat | 7B | 4.1GB |
| Starling | 7B | 4.1GB |
| Code Llama | 7B | 3.8GB |
| Llama 2 Uncensored | 7B | 3.8GB |
| Llama 2 13B | 13B | 7.3GB |
| Llama 2 70B | 70B | 39GB |
| Orca Mini | 3B | 1.9GB |
| LLaVA | 7B | 4.5GB |
| Gemma | 2B | 1.4GB |
| Gemma | 7B | 4.8GB |
| Solar | 10.7B | 6.1GB |
官方地址:https://ollama.com/
安装
下载页面:https://ollama.com/download
- 从官网下载 Ollama 安装包。
- 下载后安装过程跟普通软件一样简单。对于 MacOS 和 Linux,一条命令就能搞定:
curl -fsSL https://ollama.com/install.sh | sh
Windows 现在也支持预览版了,不过我在安装过程中遇到了失败,最后选择用 Windows WSL 在 Ubuntu 上运行,后面会详细说。
运行 Llama 3
在终端中输入:
ollama run llama3
之后程序会自动下载模型权重(默认是 llama3:8b)。下载完成后会出现提示 send a message ?,这时候直接测试一个问题就行了。
加个 Web UI 来运行,更直观!
这里推荐一个开源项目 open-webui,项目地址:https://github.com/open-webui/open-webui。它的 UI 和 ChatGPT 非常像,截图如下:
我打算直接用它的 Docker 镜像来运行,简单快捷。前提是你的电脑已经安装了 Docker。
下载 open-webui Docker 镜像
docker pull ghcr.io/ollama-webui/ollama-webui:main
启动镜像
docker run -d --network=host -v open-webui:/app/backend/data -e OLLAMA_BASE_URL=http://127.0.0.1:11434 --name open-webui --restart always ghcr.io/open-webui/open-webui:main
如果你遇到了连接问题,通常是因为 WebUI Docker 容器无法访问容器内的 127.0.0.1:11434(host.docker.internal:11434)的 Ollama 服务器,使用 docker 命令中的 --network=host 标志可以解决这个问题。注意端口从 3000 改为 8080,所以访问链接是:http://localhost:8080。
访问
输入地址 http://localhost:8080 进行访问,首次访问需要注册。
配置
需要配置 Ollama 访问 URL(填 http://127.0.0.1:11434)并选择模型,录屏如下:
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3422939340194611204"></iframe>测试效果
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3422941082055507976"></iframe>将 Ollama 与 Python 结合使用
你也可以把 Ollama 和 Python 一起用。LiteLLM 是一个 Python 库,提供了统一的接口来对接各种 LLM,包括通过 Ollama 运行的模型。使用前要确保 Ollama 服务器正在运行,然后调用 litellm.completion 函数即可。示例代码如下:
from litellm import completion
response = completion(
model="ollama/llama3",
messages=[{ "content": "respond in 20 words. who are you?", "role": "user"}],
api_base="http://localhost:11434"
)
print(response)
和 LlamaIndex、LangChain 整合使用
LangChain
from langchain_community.llms import Ollama
llm = Ollama(model="llama3")
llm.invoke("Why is the sky blue?")
LlamaIndex
from llama_index.llms.ollama import Ollama
llm = Ollama(model="llama3")
llm.complete("Why is the sky blue?")
补充资料
什么是 WSL
WSL 的全称是 Windows Subsystem for Linux,也就是 Windows 的 Linux 子系统。有了它就不用装虚拟机或双系统了,可以直接在 Windows 上顺畅运行 Linux。
安装指南:https://learn.microsoft.com/zh-cn/windows/wsl/install
在 WSL 中安装 CUDA 来加速模型
前提是你的显卡是 NVIDIA 的,安装 CUDA 可以大幅加速模型推理。否则只能靠 CPU,回答速度会慢很多。
安装指南参考:https://github.com/ashishpatel26/Cuda-installation-on-WSL2-Ubuntu-20.04-and-Windows11
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名