DeepSeek模型本地部署指南(Windows/Mac)

秋明姑娘_4045

秋明姑娘_4045

2026-02-15

397人浏览

原创

需先满足硬件与系统要求、安装推理框架与依赖、获取转换模型权重、启动本地推理服务、配置客户端访问接口五步。windows需cuda 12.1+及nvidia驱动≥535.00,mac需m1/m2/m3芯片及macos≥13.5,python限3.10/3.11;推荐llama.cpp(mac)或vllm(windows);模型需从hugging face下载并转换为gguf(mac)或直用hf路径(windows);服务启动后通过openai兼容客户端调用。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

deepseek模型本地部署指南(windows/mac)

如果您希望在本地计算机上运行DeepSeek模型,但尚未配置好运行环境,则可能是由于缺少必要的依赖库、硬件资源不足或模型文件加载失败。以下是完成DeepSeek模型本地部署的具体步骤:

一、确认硬件与系统要求

DeepSeek模型对计算资源有明确要求,尤其是运行较大参数量版本(如DeepSeek-V2、DeepSeek-Coder-33B)时,需确保本地设备满足最低运行条件。GPU显存不足将导致模型加载中断,CPU模式则仅适用于极小规模量化版本。

1、Windows用户需安装NVIDIA驱动程序(版本不低于535.00),并确认已启用CUDA 12.1或12.2支持。

2、Mac用户需使用搭载M1 Pro/Max/Ultra或M2/M3系列芯片的设备,且macOS版本不低于13.5。

3、检查可用磁盘空间:DeepSeek-Coder-7B-Quantized需至少8GB空闲空间,DeepSeek-V2-Full需预留45GB以上。

4、验证Python版本:必须为Python 3.10或3.11,不兼容3.12及以上版本。

二、安装推理框架与依赖

DeepSeek模型依赖特定推理后端进行高效加载与执行,推荐使用llama.cpp(CPU/Metal)或vLLM(GPU)作为主运行时。不同平台适配策略不同,需按系统类型选择对应方案。

1、Windows用户执行:pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121,随后运行pip install vllm==0.6.3.post1

2、Mac用户执行:brew install rust,再运行git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp && make clean && make LLAMA_METAL=1

3、统一安装Hugging Face生态工具:pip install transformers accelerate sentencepiece tiktoken

4、验证CUDA可用性(仅Windows GPU用户):python -c "import torch; print(torch.cuda.is_available(), torch.cuda.device_count())",输出应为True 1或更高。

三、获取并转换模型权重

DeepSeek官方未直接提供GGUF格式模型,需从Hugging Face Hub下载原始权重,并转换为本地推理框架可识别的格式。转换过程需保留注意力层结构完整性,避免精度损失。

1、访问Hugging Face DeepSeek仓库页面,定位至deepseek-ai/deepseek-coder-7b-basedeepseek-ai/deepseek-v2,点击“Files and versions”标签页。

Unified LLM Gateway - One API for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more
Unified LLM Gateway - One API for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

下载

2、Windows用户使用git lfs install && git clone https://huggingface.co/deepseek-ai/deepseek-coder-7b-base下载全量权重。

3、Mac用户进入llama.cpp目录后执行:python convert-hf-to-gguf.py ../deepseek-coder-7b-base --outfile deepseek-coder-7b.Q4_K_M.gguf

4、Windows用户使用vLLM时无需转换,直接指定--model deepseek-ai/deepseek-coder-7b-base参数即可启动服务。

四、启动本地推理服务

完成模型加载后,需通过HTTP API或命令行交互方式启用推理能力。服务端口冲突、上下文长度超限或批处理尺寸设置不当均会导致请求失败。

1、Windows+vLLM方式:执行vllm serve --model deepseek-ai/deepseek-coder-7b-base --tensor-parallel-size 1 --port 8080

2、Mac+llama.cpp方式:执行./main -m deepseek-coder-7b.Q4_K_M.gguf -p "Write a Python function to merge two sorted lists" -n 256 -t 4 -c 2048

3、验证API服务:在新终端中运行curl -X POST http://localhost:8080/v1/completions -H "Content-Type: application/json" -d '{"model":"deepseek-coder-7b-base","prompt":"def fib","max_tokens":50}'

4、若返回JSON含"choices":[...]字段且无error键,则表示服务已就绪。

五、配置客户端访问接口

本地部署完成后,需通过兼容OpenAI API规范的客户端发起调用。直接使用curl易出错,推荐采用标准化Python脚本封装请求逻辑,规避认证头缺失或数据格式错误问题。

1、创建client.py文件,写入以下内容:import openai; client = openai.OpenAI(base_url="http://localhost:8080/v1", api_key="none")

2、添加调用语句:response = client.completions.create(model="deepseek-coder-7b-base", prompt="def quicksort", max_tokens=100)

3、运行脚本前确保vLLM服务仍在前台运行,且终端未被关闭或中断。

4、观察输出中response.choices[0].text是否返回有效代码片段,若为空字符串或报错ConnectionError,需检查端口占用情况。

相关文章

AI工具
AI工具

AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型,支持联网搜索。

下载

相关标签:

windows deepseek

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

180

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

60

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

380

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程