qoder本地模型连接失败需验证vllm/ollama服务是否真正在目标端口监听,检查cuda驱动版本≥535.0、模型路径与gguf完整性、config.json中model_endpoint和model_name严格匹配,清除runtime缓存并调试重连。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Qoder本地模型连接失败意味着你已部署好离线模型,但IDE插件无法与vLLM或Ollama等后端服务建立有效通信,常见于端口未监听、模型路径错误、GPU驱动异常或配置字段拼写错误等情况。
确认vLLM服务是否真正启动并监听正确端口
这一步必须验证,不能只看终端是否显示“Starting server…”——很多情况下服务因CUDA版本不匹配或GGUF文件损坏而静默退出,仅打印一行日志就终止。
打开命令行,执行:netstat -ano | findstr :8080(Windows)或lsof -i :8080(macOS/Linux),检查是否有PID绑定到你配置的端口(默认8080)。若无输出,说明服务根本没起来。
手动启动vLLM服务并捕获完整错误:进入模型目录,运行vllm serve --model ./models/qwen3-0.6b.Q4_K_M.gguf --host 127.0.0.1 --port 8080 --dtype auto --gpu-memory-utilization 0.9。如果报错Failed to load model: GGUF file is corrupted,立刻停止后续步骤,重新校验模型文件SHA256值。
【必须确保nvidia-smi能列出GPU且Driver Version ≥535.0】,低于该版本的驱动无法支持vLLM 0.6.x对CUDA Graph的调用,会导致服务启动后立即崩溃且无明确提示。
检查Qoder配置中模型地址与协议是否严格匹配
Qoder CN不支持自动降级或协议嗅探,填错一个字符就会连接拒绝。
方法一:直连vLLM OpenAI兼容API
打开%LOCALAPPDATA%\.lingma\config.json(Windows)或~/.lingma/config.json(macOS),确认存在且仅存在以下字段:"model_endpoint": "http://127.0.0.1:8080/v1""model_name": "qwen3-0.6b"(必须与vLLM启动时--model参数值完全一致,包括大小写和连字符)
方法二:通过Ollama代理中转
若改用Ollama,先确保ollama serve已在后台运行,再将model_endpoint改为http://127.0.0.1:11434/api/chat,同时model_name设为qwen3:0.6b-q4_k_m(Ollama tag格式,不可省略:q4_k_m)。
⚠️ 注意:model_endpoint末尾不能多加斜杠,如http://127.0.0.1:8080/v1/会导致404;也不能少写/v1,否则返回空响应。
强制重载模型连接并跳过缓存校验
第一步:关闭IDE所有窗口,彻底结束残留进程
Windows:任务管理器 → 结束所有java.exe、Lingma.exe、vllm相关进程
macOS:终端执行pkill -f "vllm\|Lingma\|java"
第二步:清空Qoder运行时状态
删除目录:%LOCALAPPDATA%\.lingma\runtime(Windows)或~/.lingma/runtime(macOS)。该目录下model_cache和connection_state.json会固化上一次失败的握手参数,不清除会导致重试时复用错误token。
第三步:以调试模式重启IDE
Windows:右键IDE快捷方式 → 属性 → 目标栏末尾添加 -Dqoder.debug.model.connect=true
macOS:终端执行open -a "IntelliJ IDEA" --args -Dqoder.debug.model.connect=true
启动后观察IDE底部状态栏,出现[Model Connect] Trying http://127.0.0.1:8080/v1...即表示开始重连。
第四步:触发一次最小化请求验证
在任意代码文件中按下Alt+Q(Windows)或Option+Q(macOS),输入“你好”,等待3秒。若弹出Connection refused,说明端口或协议仍不匹配;若弹出Model loaded but no response,说明服务已通但推理链卡在tokenizer加载环节。










