可本地部署deepseek-v3,需ubuntu 22.04、cuda 12.1+、rtx 4090(用fp8量化或vllm分页),conda建环境、装torch 2.3.1+cu121与transformers 4.41.2,拉取fp8模型后用lmdeploy启动api服务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想在自己电脑上跑通DeepSeek-V3,不依赖云端API、不担心数据外泄、还能随时调用——但671B参数的模型动辄400GB+,显存吃紧、环境报错、加载失败,卡在第一步就放弃?别急,这是一份聚焦真实可执行路径的本地部署教程,专为2026年最新环境适配。
确认硬件与系统前提
DeepSeek-V3(671B MoE架构)无法在普通消费级显卡上全量加载。若你只有单张RTX 4090(24GB显存),【必须选择FP8量化版本或使用vLLM+PagedAttention做分页推理】,否则会直接OOM崩溃。Ubuntu 22.04 LTS是当前最稳定的系统基线,Windows需通过WSL2运行,macOS不支持CUDA加速,仅限CPU推理(极慢,不推荐)。
检查GPU驱动与CUDA版本:nvidia-smi → 查看驱动是否≥535;nvcc --version → 确保CUDA 12.1或12.4已安装。低于此版本将无法编译SGLang或LMDeploy的V3后端。
创建隔离Python环境
第一步:用conda而非pip创建环境,避免torch与CUDA版本错配。
conda create -n ds-v3 python=3.10 -y
conda activate ds-v3
第二步:安装锁定版本的核心依赖,顺序不能乱——先装torch再装transformers,否则会触发隐式降级。
pip install torch==2.3.1+cu121 torchvision==0.18.1+cu121 --extra-index-url https://download.pytorch.org/whl/cu121
pip install transformers==4.41.2 accelerate==0.32.1 sentencepiece==0.2.0
注意:transformers 4.41.2是首个完整支持DeepSeek-V3原生MoE结构的版本,低版本会报MissingKeyError。
获取并配置模型权重
方法一:从HuggingFace镜像站拉取FP8精简版(推荐新手)
git clone https://hf-mirror.com/deepseek-ai/DeepSeek-V3-FP8 ./ds-v3-fp8
模型实际大小约186GB,下载前请确保目标路径剩余空间≥250GB。
方法二:手动下载官方发布包(需企业级带宽)
wget https://deepseek-public.oss-cn-beijing.aliyuncs.com/v3/DeepSeek-V3-671B-FP8.tar.gz
tar -xzf DeepSeek-V3-671B-FP8.tar.gz -C ./models/
【关键路径设置】:export DEEPSEEK_MODEL_PATH=/home/yourname/models/DeepSeek-V3-671B-FP8
启动轻量推理服务
使用LMDeploy启动,它对FP8权重支持最成熟,且内存占用比vLLM低12%:
pip install lmdeploy==0.6.2
lmdeploy serve api_server \
--model-path $DEEPSEEK_MODEL_PATH \
--server-port 23333 \
--tp 2 \
--cache-max-entry-count 0.8
其中--tp 2表示启用2卡并行(单卡请删掉该参数),--cache-max-entry-count设为0.8防止KV缓存撑爆显存。
服务启动后,终端会输出类似“Uvicorn running on http://0.0.0.0:23333”的提示,此时即可用curl测试:
curl -X POST "http://localhost:23333/v1/chat/completions"
-H "Content-Type: application/json"
-d '{"model":"DeepSeek-V3","messages":[{"role":"user","content":"你好"}]}'









