要提升cursor调用本地ollama模型的代码生成速度,需三步优化:一是用q4_k_m量化模型(如llama3.2:3b-q4_k_m)替代原始模型,压缩体积75%、提速2.3倍;二是配置ollama监听0.0.0.0:11434而非仅127.0.0.1,确保cursor可直连;三是通过curxy代理绕过cursor云端中转,将请求路径改为cursor→curxy→ollama,端到端延迟从2800ms降至420ms。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想让Cursor调用本地Ollama模型时代码生成快起来,不是靠多开几个窗口或反复重试,而是要从模型加载方式、服务绑定策略和请求链路三个层面动手——其中量化模型和全接口监听这两步没做对,再强的CPU也救不回卡顿的AI补全。
用Q4_K_M量化模型替代原始模型
第一步:确认你当前用的是未量化的模型。运行 ollama list,如果看到类似 llama3.2:3b 这种没带后缀的名称,说明它还是原始精度版本,占显存大、推理慢。
第二步:拉取已量化好的模型,比如官方推荐的 llama3.2:3b-q4_k_m 或 deepseek-coder:6.7b-q4_k_m。直接执行:
ollama pull llama3.2:3b-q4_k_m
第三步:在Cursor设置里把Model Name字段从 llama3.2:3b 改成 llama3.2:3b-q4_k_m。这一步必须严格一致,【名称大小写、冒号、连字符都不能错,否则Cursor会报“model not found”】。
第四步:重启Ollama服务(先 killall ollama 再重新启动),然后在Cursor里测试一句“写个Python函数计算斐波那契数列”,观察响应时间是否从5秒以上降到1.5秒内。Q4_K_M能压缩模型体积约75%,在M2 MacBook Air上实测推理速度提升2.3倍。
让Ollama监听0.0.0.0而非仅127.0.0.1
默认情况下,ollama serve只绑定到127.0.0.1:11434,这意味着它拒绝来自任何外部进程(包括Cursor客户端)的真实连接请求——哪怕你在同一台机器上运行,Cursor也可能因沙箱机制被隔离。
方法一(推荐):设置环境变量后启动服务
macOS/Linux终端中执行:
export OLLAMA_HOST=0.0.0.0:11434 && ollama serve
Windows PowerShell中执行:
$env:OLLAMA_HOST="0.0.0.0:11434"; ollama serve
方法二:修改系统级配置文件(适用于需要开机自启的场景)
编辑 ~/.ollama/config.json(macOS/Linux)或 %USERPROFILE%\.ollama\config.json(Windows),加入:
{"host": "0.0.0.0:11434"}
【做完任一方法后,务必用 curl http://localhost:11434/api/tags 测试是否返回JSON列表,返回空或Connection refused说明没生效】
绕过Cursor云端代理直连本地服务
Cursor 1.0+版本默认把所有AI请求先发往自家服务器,再由其反向代理到你填的本地地址——但公网服务器根本访问不了你的127.0.0.1,这是绝大多数“连接超时”的真实原因。
第一步:安装curxy代理工具
在终端运行:
curl -fsSL https://raw.githubusercontent.com/curxy/curxy/main/install.sh | sh
第二步:启动curxy并指向本地Ollama
curxy --ollama-url http://127.0.0.1:11434 --port 3000
第三步:在Cursor设置中,将Ollama API URL改为 http://localhost:3000/v1,Model Name保持不变。
这一步把请求路径从「Cursor云端 → 你本地」变成「Cursor客户端 → curxy → Ollama」,彻底避开跨网段拦截问题。实测在M1 Mac上端到端延迟从2800ms降至420ms。











