首页 > 教程攻略 > ai资讯 >全网唯一!手把手教你 DeepSeek-R1-Distill-Qwen-32B 云端部署 + Dify 配置全攻略

全网唯一!手把手教你 DeepSeek-R1-Distill-Qwen-32B 云端部署 + Dify 配置全攻略

来源:互联网 时间:2026-07-20 13:10:13

Deepseek最近太火了,关于它的文章铺天盖地,但仔细一翻,大多停留在Ollama部署这种“玩具”场景,真正能扛住企业级应用的文章少之又少。低质量内容虽然热闹,但对于追求高效、稳定解决方案的团队来说,总觉得隔靴搔痒。

这篇文章就直奔主题:从镜像选择到推理框架,从云服务器部署到Dify配置,把企业级部署的完整流程掰开了揉碎了讲清楚。每个步骤都经过反复验证,确保专业性和可复现性——既是一份技术指南,也是企业走向智能运营的实用工具。

1. 选择镜像

先说镜像选型。满血版R1有671B参数,对显存和存储的要求都相当高。如果没有集群环境,完全可以考虑DeepSeek-R1-Distill-Qwen-32B作为平替。在精度要求不那么高的场景下,这个蒸馏版部署起来更轻便,作为满血版的补充很合适。

接下来是推理框架的选择。目前主流的框架有这么几种:

  • Transformers

    :通过集成Huggingface的Transformers库作为后端,Xinference可以最快地接入NLP领域最前沿的模型(当然也包括LLM)。适合快速验证和实验场景。
  • vLLM

    :由加州大学伯克利分校开发,专为高效服务大模型而生。它的PagedAttention算法通过有效管理注意力键值对来改善内存利用,吞吐量能达到Transformers的24倍。生产环境中面对高并发访问,vLLM是首选。
  • SGLang

    :一个用于LLM和视觉语言模型的推理框架,基于并吸收了LightLLM、vLLM、Guidance等引擎的优秀设计,并利用了FlashInfer注意力性能CUDA内核。

经过实际测试,部署满血版R1建议用SGLang镜像,而部署蒸馏版模型(如32B、70B)则用vLLM效果更好。

2. 配置GPU服务器

这次选择以火山引擎的GPU ECS为例(因为火山引擎已经缓存了推理引擎和模型文件,直接拉取速度更快)。

推理引擎镜像:cp-controller-cn-beijing.cr.volces.com/appdeliver-ml/vllm:0.7.1

运行docker时会自动下载对应模型文件。如果有手动下载需求,下面链接供参考:

模型名称参数量对象存储服务链接
DeepSeek-R1-Distill-Qwen-7B7Bhttps://cp-public-model-cn-beijing.tos-cn-beijing.volces.com/models/DeepSeek-R1-Distill-Qwen-7B/
DeepSeek-R1-Distill-Qwen-32B32Bhttps://cp-public-model-cn-beijing.tos-cn-beijing.volces.com/models/DeepSeek-R1-Distill-Qwen-32B/
DeepSeek-R1-Distill-Llama-70B70Bhttps://cp-public-model-cn-beijing.tos-cn-beijing.volces.com/models/DeepSeek-R1-Distill-Llama-70B/

ECS实例规格可以参考以下配置:

模型名称参数量CPU内存存储显存需求显卡推荐(Nvidia)
DeepSeek-R17B8C16GB30GB8GB1x RTX 3060
32B16C64GB200GB48GB2x L20 48GB
70B32C128GB+500GB+96GB+1x H20 96GB 或 4x RTX 4090
671B128C512GB+1T+700GB+8x H20 96GB

实际选择的服务器配置:

3. 部署环境配置

购买ECS后,进入控制台,需要完成两步:安装Docker和安装nvidia-container-toolkit。具体命令如下:

  • 安装Docker:
# Update the apt package index and install packages to allow apt to use a repository over HTTPS
sudo apt update
sudo apt install ca-certificates curl gnupg lsb-release
# Add Docker’s official GPG key
sudo mkdir -p /etc/apt/keyrings
curl -fsSL https://mirrors.ivolces.com/docker/linux/ubuntu/gpg | sudo gpg --dearmor -o /etc/apt/keyrings/docker.gpg
# Use the following command to set up the repository
echo "deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.gpg] https://mirrors.ivolces.com/docker/linux/ubuntu $(lsb_release -cs) stable" | sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
# update package index
sudo apt update
# Install docker-ce
sudo apt install docker-ce docker-ce-cli containerd.io docker-compose-plugin
  • 安装nvidia-container-toolkit:
curl -s https://mirrors.ivolces.com/nvidia_all/ubuntu2204/x86_64/3bf863cc.pub | sudo apt-key add -
cat </etc/apt/sources.list.d/nvidia.list
deb http://mirrors.ivolces.com/nvidia_all/ubuntu2204/x86_64/ /
EOF
apt update
apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

4. 部署镜像

接下来正式部署Docker镜像(单机4卡,TP=4,PORT=8888可自定义):

docker run -d --network host --privileged --gpus=all --name=vllm_qwen32B --ipc=host \
  -v /data00/models:/data00/models \
  -v /var/run/nvidia-topologyd/:/var/run/nvidia-topologyd/ \
  -e MODEL_PATH=/data00/models \
  -e PORT=8888 \
  -e MODEL_NAME=DeepSeek-R1-Distill-Qwen-32B \
  -e TP=4 \
  cp-controller-cn-beijing.cr.volces.com/appdeliver-ml/vllm:0.7.1

静等pull完成。返回completed并不代表加载完成,需要打开Docker日志继续观察:

docker logs vllm_qwen32B

日志输出如下:

等到进度显示100%,恭喜!模型加载完成,Docker启动成功。

5. 服务测试

先在服务器内部验证一下。执行以下curl命令,如果观察到流式输出,说明模型正常运行,可以进入下一步集成。

curl -X POST http://0.0.0.0:8888/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
  "model": "/data00/models/DeepSeek-R1-Distill-Qwen-32B",
  "messages": [{"role": "user", "content": "请证明一下黎曼猜想"}],
  "stream": true,
  "max_tokens": 100,
  "temperature": 0.7
}'

提醒:如果curl返回拒绝连接,大概率是权重文件还没下载加载完毕,稍后再试即可。

如果你部署在云端,需要调整安全组策略,添加入方向规则开放8888端口。配置完毕后,用Postman调用接口测测看:

返回结果中可以看到reasoning_content字段,R1推理成功。

好了,接下来就是集成到应用平台。这里用Dify作为应用构建平台。

6. 部署Dify

以下安装流程比较通用,也可以参考Dify官网的说明。

系统要求

CPU >= 2 Core,RAM >= 4GB。

安装Docker及Docker Compose

此处不再赘述,自行百度即可。

克隆Dify源代码

git clone https://github.com/langgenius/dify.git

启动Dify

cd dify/docker
cp .env.example .env
docker compose up -d

检查所有容器是否正常运行:

docker compose ps

应该看到3个业务服务(api / worker / web)和6个基础组件(wea viate / db / redis / nginx / ssrf_proxy / sandbox)。

更新Dify

cd dify/docker
docker compose down
git pull origin main
docker compose pull
docker compose up -d

注意:同步环境变量配置

。如果.env.example文件有更新,请务必同步修改本地.env文件,确保所有配置项与实际运行环境匹配。

访问系统

项目中启动了一个nginx容器将web服务转发到80端口,直接在浏览器中输入公网IP地址,设置管理员的账号密码,即可进入Dify主界面。在浏览器中输入http://localhost访问Dify。

7. 集成模型服务

最后一步,配置大模型。

选择用户信息下拉列表 → 设置 → 模型供应商,选择【OpenAI-API-compatible】模块,配置自定义模型接口。

按照下图格式配置信息,API Key没有就填EMPTY。

保存后,记得在模型列表选择配置按钮,开启模型。

8. 创建应用并发布

最后,创建一个空白应用,在模型列表里选择刚配置的模型即可。

点击发布应用,就可以进入聊天界面了。

当然,目前与Dify的集成还有些小问题:比如思考内容不能输出,上下文对话轮次不能调整等。后续有待优化。