本地部署deepseek模型只需三步:第一步下载安装ollama;第二步运行ollama serve启动服务;第三步按显存大小执行对应ollama run命令,10分钟内即可在终端或网页界面调用离线ai。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想在自己电脑上跑DeepSeek模型,不依赖网络、不上传数据、随时调用,就得完成本地部署。整个过程不需要写代码、不用配环境变量、不碰CUDA版本冲突,只要选对工具、按顺序执行三步操作,10分钟内就能让DeepSeek在本地终端里开口说话。
用Ollama一键安装并运行DeepSeek
这是目前Windows/macOS/Linux三端最省心的方案,底层自动处理GPU驱动适配、Python依赖隔离、模型格式转换,连显存不足时的量化加载都内置好了。
第一步:访问 ollama.com → 点击右上角【Download】→ 选择对应系统安装包 → 双击安装(Windows/Mac)或执行 curl -fsSL https://ollama.com/install.sh | sh(Linux)
第二步:安装完成后,桌面会出现小羊驼图标 ?,打开终端(CMD/PowerShell/Terminal),输入 ollama serve 启动服务。这一步必须先做,否则后续命令会报错“connection refused”。
第三步:根据你电脑的显存大小,选择合适参数量的模型执行下载与运行命令——【显存低于6GB请务必选1.5b,否则模型加载失败且无法回退】
• 显存6–12GB:执行 ollama run deepseek-r1:7b
• 显存12–24GB:执行 ollama run deepseek-r1:14b
• 显存24GB以上:执行 ollama run deepseek-r1:32b
命令回车后,Ollama会自动拉取模型、解压、加载到内存或GPU,首次运行需等待2–8分钟(取决于网速和磁盘速度)。进度条走完,光标变成 >>>,说明模型已就绪。
验证本地DeepSeek是否正常工作
模型加载成功后,直接在 >>> 提示符后输入任意中文问题,比如“今天北京天气怎么样”,按回车。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
如果看到逐字生成的回答(不是报错、不是卡死、不是空响应),说明部署已完成。
注意:首次提问可能稍慢,因模型正在预热KV缓存;后续响应将稳定在10–30 token/s,具体取决于CPU单核性能与GPU型号。
让DeepSeek变成网页界面(可选)
如果你习惯图形化操作,不想敲命令行,可以用Open-WebUI套一层网页壳——它本质是Docker容器,不干扰原有Ollama服务。
方法一(推荐):已装Docker → 打开终端 → 执行:docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v ~/.ollama:/root/.ollama -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui --restart always ghcr.io/open-webui/open-webui:main
方法二(免Docker):访问 github.com/open-webui/open-webui/releases → 下载最新Windows/macOS可执行版 → 双击运行 → 浏览器打开 http://localhost:3000 → 登录后自动识别本地Ollama中的DeepSeek模型。
打开 http://localhost:3000,选中 deepseek-r1 模型,点击「Chat」标签页,即可像使用网页版一样对话。









