必须在本地启动openai兼容服务端并配置cursor自定义模型:先下载量化版deepseek-v3权重,用llama.cpp或transformers+fastapi启动http://127.0.0.1:8080/v1服务,再在cursor设置中填入该endpoint、模型名deepseek-v3且无需认证,即可离线使用。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在Cursor中使用本地部署的DeepSeek模型,必须绕过官方API限制,在本地启动兼容OpenAI格式的服务端,再让Cursor将其识别为自定义模型。这一步不依赖网络、不上传代码,但要求你有至少16GB显存的NVIDIA GPU或32GB内存的纯CPU推理环境。
准备本地DeepSeek模型与服务框架
从Hugging Face下载DeepSeek-V3的开源权重(如deepseek-ai/deepseek-v3),注意选择已量化版本(如deepseek-v3-7b-q4_k_m)——未量化模型在消费级显卡上根本无法加载。
安装llama.cpp或transformers+fastapi组合:前者适合CPU/低端GPU,后者需CUDA 12.1+且显存≥16GB。执行pip install llama-cpp-python transformers fastapi uvicorn torch即可覆盖两种路径。
运行服务前,确认模型路径不含中文或空格,否则llama.cpp会静默失败——这是90%本地部署卡住的第一原因。
启动OpenAI兼容API服务
方法一:用llama.cpp一键启动(推荐CPU/RTX 3090以下)
进入模型目录,执行:./server -m deepseek-v3.Q4_K_M.gguf -c 4096 --port 8080 --host 127.0.0.1。服务默认监听http://127.0.0.1:8080/v1,完全兼容OpenAI的/chat/completions接口。
方法二:用transformers+FastAPI(需GPU且显存≥16GB)
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
新建app.py,粘贴官方适配脚本(含device_map="auto"和torch_dtype=torch.bfloat16),关键行必须写成:model = AutoModelForCausalLM.from_pretrained("deepseek-ai/deepseek-v3", device_map="auto", torch_dtype=torch.bfloat16)——漏掉device_map会导致显存爆满后进程被OOM killer强制终止。
【必须关闭防火墙或放行8080端口】 macOS用户还需在系统设置→隐私与安全性→防火墙选项中允许Python通过。
在Cursor中配置自定义模型
第一步:打开Cursor → Cmd/Ctrl+, → 进入「AI」→「Custom Model」
第二步:勾选「Enable custom model」→ 在「Endpoint URL」填入http://127.0.0.1:8080/v1
第三步:Model name栏输入deepseek-v3(必须与你实际加载的模型ID一致,否则Cursor发送请求时会被服务端拒绝)
第四步:Authentication留空(本地服务无需密钥)→ 点击「Save」
此时重启Cursor,状态栏应显示「Custom model: deepseek-v3」。若仍显示「Loading…」,说明服务未响应——请立刻检查终端是否报错OSError: [Errno 48] Address already in use,这意味着8080端口被占用,需改用--port 8081重新启动服务。










