根本原因是context未适配硬件,ollama默认设262144远超12gb显卡承载力;需通过setx ollama_num_ctx "8192" /m设环境变量(重启生效)或修改openwebui.json中qwen3.5:9b的contextwindow为20000、maxtokens为4096(重启服务生效)。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

OpenClaw接入Ollama后显存或内存持续飙高,导致系统卡顿、任务中断甚至崩溃,根本原因是模型上下文窗口(Context)未做硬件适配限制,Ollama默认启用超大值(如262144),远超RTX 4070S等12GB显卡实际承载能力。
强制限制全局Context长度
方法一:通过系统环境变量锁定最大上下文长度
以管理员身份打开PowerShell,执行:setx OLLAMA_NUM_CTX "8192" /M
该命令将永久写入系统级环境变量,重启电脑后生效。
【必须重启才能生效,不重启设置无效】
方法二:在Open WebUI配置文件中精准控制
定位到openwebui.json文件,找到models.providers.ollama.models下的qwen3.5:9b段落,将contextWindow字段改为20000,同时确认maxTokens设为4096。
保存后需手动重启Open WebUI服务,否则前端调用仍走默认值。
启用GPU分层卸载
第一步:确认Ollama识别到你的NVIDIA GPU
运行ollama list后执行ollama run qwen3.5:9b,观察终端输出是否含gpu_layers: X字样。若显示0或无此字段,说明GPU未启用。
第二步:手动指定GPU加载层数
在OpenClaw调用Ollama时,向API请求体中注入options参数:{"gpu_layers": 24}
该数值需根据显存实测调整:RTX 4070S建议从24起步,若OOM则递减至20→16→12,每次减4;显存占用稳定在7–8GB即为合理区间。
PHP中文网提供Qwen-1.0.2.6 MacOS官方客户端下载,专为苹果电脑优化的阿里通义千问桌面应用。本版本深度适配Mac系统,支持本地高效运行与多模态交互,集成超长上下文处理、AI写作、代码生成及智能体构建等核心功能。通过官方渠道下载,确保安全稳定,助您实现智能办公与创作升级。
第三步:验证GPU卸载是否生效
运行nvidia-smi,观察GPU-Util是否在推理期间跳升至40%以上。若长期低于10%,说明模型仍在CPU上全量运行,需检查CUDA驱动版本是否≥12.4且Ollama为v2.5+。
切换Q4_K_M量化模型
直接拉取已量化版本,避免本地转换耗时与失败风险:ollama pull qwen3.5:9b-q4_k_m
该镜像基于GGUF格式,权重压缩至原始体积的1/4,运行时显存占用比FP16版本降低约35%。
若原模型已存在,先删除再重拉:ollama rm qwen3.5:9b → ollama pull qwen3.5:9b-q4_k_m
【删除操作不可逆,确保无未导出对话记录】
OpenClaw配置中同步更新模型名:将model: qwen3.5:9b改为model: qwen3.5:9b-q4_k_m,保存后重启Agent进程。









