首页 > 教程攻略 > ai资讯 >本地运行Llama3极简傻瓜教程

本地运行Llama3极简傻瓜教程

来源:互联网 时间:2026-08-03 12:41:26

Meta 在 4 月 19 号放出了最新的开源模型,动作之快,直接打了某度一个措手不及。有网友甚至调侃道:“水一百度会开,人一百度会死”——这讽刺意味,懂的都懂。好了,闲话少说,咱们直接进入正题:如何在本地极简地跑起来 Llama 3。

本地运行Llama3极简傻瓜教程

Ollama 在本地简单的运行 Llama

Ollama 是一个非常简化的小工具,专门用来在本地运行开源大模型,比如 Mistral 和 Llama 2。它把模型权重、配置和数据集打包成一个统一包,由 Modelfile 管理。目前支持的模型列表如下:

ModelParametersSize
Llama 38B4.7GB
Llama 370B40GB
Mistral7B4.1GB
Dolphin Phi2.7B1.6GB
Phi-22.7B1.7GB
Neural Chat7B4.1GB
Starling7B4.1GB
Code Llama7B3.8GB
Llama 2 Uncensored7B3.8GB
Llama 2 13B13B7.3GB
Llama 2 70B70B39GB
Orca Mini3B1.9GB
LLaVA7B4.5GB
Gemma2B1.4GB
Gemma7B4.8GB
Solar10.7B6.1GB

官方地址:https://ollama.com/

安装

下载页面:https://ollama.com/download

  1. 从官网下载 Ollama 安装包。
  2. 下载后安装过程跟普通软件一样简单。对于 MacOS 和 Linux,一条命令就能搞定:
curl -fsSL https://ollama.com/install.sh | sh

Windows 现在也支持预览版了,不过我在安装过程中遇到了失败,最后选择用 Windows WSL 在 Ubuntu 上运行,后面会详细说。

运行 Llama 3

在终端中输入:

ollama run llama3

之后程序会自动下载模型权重(默认是 llama3:8b)。下载完成后会出现提示 send a message ?,这时候直接测试一个问题就行了。

加个 Web UI 来运行,更直观!

这里推荐一个开源项目 open-webui,项目地址:https://github.com/open-webui/open-webui。它的 UI 和 ChatGPT 非常像,截图如下:

我打算直接用它的 Docker 镜像来运行,简单快捷。前提是你的电脑已经安装了 Docker。

下载 open-webui Docker 镜像

docker pull ghcr.io/ollama-webui/ollama-webui:main

启动镜像

docker run -d --network=host -v open-webui:/app/backend/data -e OLLAMA_BASE_URL=http://127.0.0.1:11434 --name open-webui --restart always ghcr.io/open-webui/open-webui:main
如果你遇到了连接问题,通常是因为 WebUI Docker 容器无法访问容器内的 127.0.0.1:11434(host.docker.internal:11434)的 Ollama 服务器,使用 docker 命令中的 --network=host 标志可以解决这个问题。注意端口从 3000 改为 8080,所以访问链接是:http://localhost:8080。

访问

输入地址 http://localhost:8080 进行访问,首次访问需要注册。

配置

需要配置 Ollama 访问 URL(填 http://127.0.0.1:11434)并选择模型,录屏如下:

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3422939340194611204"></iframe>

测试效果

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3422941082055507976"></iframe>

将 Ollama 与 Python 结合使用

你也可以把 Ollama 和 Python 一起用。LiteLLM 是一个 Python 库,提供了统一的接口来对接各种 LLM,包括通过 Ollama 运行的模型。使用前要确保 Ollama 服务器正在运行,然后调用 litellm.completion 函数即可。示例代码如下:

from litellm import completion

response = completion(
    model="ollama/llama3",
    messages=[{ "content": "respond in 20 words. who are you?", "role": "user"}],
    api_base="http://localhost:11434"
)

print(response)

和 LlamaIndex、LangChain 整合使用

LangChain

from langchain_community.llms import Ollama
llm = Ollama(model="llama3")
llm.invoke("Why is the sky blue?")

LlamaIndex

from llama_index.llms.ollama import Ollama
llm = Ollama(model="llama3")
llm.complete("Why is the sky blue?")

补充资料

什么是 WSL

WSL 的全称是 Windows Subsystem for Linux,也就是 Windows 的 Linux 子系统。有了它就不用装虚拟机或双系统了,可以直接在 Windows 上顺畅运行 Linux。

安装指南:https://learn.microsoft.com/zh-cn/windows/wsl/install

在 WSL 中安装 CUDA 来加速模型

前提是你的显卡是 NVIDIA 的,安装 CUDA 可以大幅加速模型推理。否则只能靠 CPU,回答速度会慢很多。

安装指南参考:https://github.com/ashishpatel26/Cuda-installation-on-WSL2-Ubuntu-20.04-and-Windows11