openclaw本地响应缓慢主因是模型加载不全、cpu/gpu资源争抢或网络代理干扰;需检查hugging face缓存完整性、禁用gnome后台服务、调低vllm显存利用率、关闭冗余解析器、启用awq量化,并清除代理环境变量以避免hub验证超时。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

OpenClaw本地部署后响应缓慢,常见于模型加载不全、CPU/GPU资源争抢或网络代理干扰,需逐层排查并针对性优化。
检查模型是否完整加载
启动日志中若出现 loading model... 后长时间卡住,或反复重试 Failed to load tokenizer,说明模型权重未完整下载或路径错误。执行 ls -lh ~/.cache/huggingface/hub/ 查看对应模型目录大小——Ornith-1.0-9B 类模型完整缓存应超 18GB;若仅几百MB,就是下载中断导致的残缺。
手动清理并强制重拉:rm -rf ~/.cache/huggingface/hub/models--deepreinforce-ai--Ornith-1.0-9B* → 再运行服务命令,确保全程无网络中断。
【关键前提】 必须在执行 vLLM 或 SGLang 启动命令前,确认 ~/.cache/huggingface/hub/ 下对应模型文件夹已存在且大小达标,否则后续所有优化都无效。
关闭后台干扰进程
Ubuntu 桌面环境默认启用 GNOME Shell、Snapd、Tracker 等常驻服务,会抢占 CPU 和内存带宽。用 htop 观察:若 gnome-shell 占用 >30% CPU 或 tracker-miner-fs 持续读盘,立即禁用:
systemctl --user stop tracker-store tracker-miner-fs tracker-miner-apps
systemctl --user mask tracker-store tracker-miner-fs tracker-miner-apps
GNOME 用户额外执行:gsettings set org.gnome.desktop.background show-desktop-icons false,关闭桌面图标索引——这一步能释放约 1.2GB 内存和大量 I/O 带宽。
调整 vLLM 启动参数
方法一:降低显存占用率
将原命令中的 --gpu-memory-utilization 0.90 改为 --gpu-memory-utilization 0.75。过高利用率会导致显存碎片化,触发频繁 swap,实测在 80GB GPU 上反而使吞吐下降 40%。
方法二:关闭非必要解析器
删除启动命令中 --tool-call-parser qwen3_xml 和 --reasoning-parser qwen3 这两项。OpenClaw 默认使用内置 parser,外挂解析器仅在调试时启用,开启后会多启动两个 Python 子进程并争抢 CUDA 上下文。
方法三:启用量化加载(仅限 NVIDIA GPU)
在 vLLM 启动命令末尾追加 --dtype half --quantization awq。注意:必须确认模型支持 AWQ 量化(Ornith-1.0-9B 官方发布包含 awq_model_path),否则会直接报错退出。
验证网络代理影响
若系统设置了全局 HTTP_PROXY 或 HTTPS_PROXY,vLLM 初始化阶段会尝试连接 Hugging Face Hub 验证 token,但超时长达 30 秒才失败。临时清除代理再启动:
unset HTTP_PROXY HTTPS_PROXY http_proxy https_proxy
然后运行 vllm serve ...。如需保留代理访问其他服务,可在 vLLM 命令中显式禁用 Hub 访问:--disable-log-stats --disable-log-requests --disable-log-prompts。









