openclaw对接ollama必须使用原生api(/api/chat)并关闭模型reasoning功能,否则会触发静默重定向至远程api、响应延迟飙升、显存爆满甚至崩溃;v0.8.3+版本才原生支持该协议,且需通过--reasoning-depth 0或reload配置生效。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

OpenClaw对接Ollama时若未强制使用Ollama原生API协议、且未关闭模型的reasoning功能,会导致请求被 silently 重定向至远程API、响应延迟飙升、显存爆满甚至服务崩溃——这不是配置失误,而是协议层与推理层双重错配引发的级联故障。
必须使用Ollama原生API而非OpenAI兼容接口
OpenClaw默认配置会优先尝试OpenAI兼容接口(/v1/chat/completions),但Ollama的该接口仅做字段映射,不承载完整推理控制权。当OpenClaw发送含tool call、streaming或system message的复杂请求时,Ollama兼容层无法正确解析messages结构中的role嵌套与tool_choice字段,直接返回400错误并触发fallback逻辑。
这一步操作起来很简单,直接把base_url从http://localhost:11434/v1改成http://localhost:11434/api即可。
改完后必须验证:用curl发一条最简请求curl -X POST http://localhost:11434/api/chat -H "Content-Type: application/json" -d '{"model":"llama3","messages":[{"role":"user","content":"hi"}]}',返回含done: true的JSON才算真正走通原生链路。
【关键前提】 OpenClaw v0.8.3+才原生支持Ollama /api/chat 协议;低于此版本需手动打patch或降级至v0.7.x,否则请求永远卡在request timeout。
必须关闭DeepSeek-R1等模型的reasoning功能
reasoning功能在Ollama中不是可选插件,而是深度绑定在模型加载时的推理引擎行为。只要模型配置文件中enable_deep_think为true,哪怕OpenClaw只发单轮请求,Ollama后台也会自动启动3~5轮内部迭代——每轮都重新加载KV cache、复用前序token embedding,导致显存占用翻倍、GPU利用率锁死在98%以上。
方法一:运行时禁用(推荐用于调试)
执行ollama run deepseek-r1 --reasoning-depth 0,该参数会覆盖config.json中所有reasoning相关字段,且无需重启服务。
方法二:配置文件硬禁用
编辑~/.ollama/models/deepseek-r1/config.json,将"enable_deep_think": true改为false,再执行ollama reload deepseek-r1生效。
【致命陷阱】 若只改config.json但忘记reload,Ollama仍按内存中缓存的旧配置运行,显存泄漏问题持续存在,且日志无任何报错提示。
验证是否真正生效的三步检查法
第一步:确认请求未回退到云端
启动OpenClaw时添加--log-level debug参数,观察终端输出中是否出现POST http://api.openai.com/v1/chat/completions字样——只要出现,说明fallback未彻底关闭。
第二步:监控本地端口流量
在终端执行lsof -i :11434 | grep ESTABLISHED,正常应只看到OpenClaw进程连接,若同时出现curl或python等其他进程,说明有第三方工具偷偷调用云端API。
第三步:实测显存与延迟基线
用nvidia-smi观察GPU memory usage,关闭reasoning后应稳定在7.2GB/24GB左右(RTX 4090);发送相同请求,响应时间从4.7秒降至1.3秒内即达标。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!









