openclawai可通过三种方式运行wizard系列模型:一、用ollama加载gguf量化模型并配置为llmprovider="ollama";二、通过lm studio启用本地api,设llmprovider="openai"并指向其http服务;三、用llama.cpp server直连,配合自定义插件设llmprovider="custom"。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望在OpenClawAI框架中运行Wizard系列大语言模型(如WizardLM-2、WizardMath、WizardCoder等),需明确其兼容性与适配路径。OpenClawAI本身不直接内置Wizard系列模型,但可通过对接支持GGUF格式的本地推理后端实现调用。以下是可行的部署方式:
一、通过Ollama加载WizardLM GGUF量化版本
Ollama原生不支持Wizard系列模型的直接命名拉取,但可借助自定义Modelfile方式导入已转换的GGUF格式模型文件。该方法依赖社区维护的WizardLM-GGUF仓库提供的量化权重,适用于Windows/Linux/macOS全平台。
1、访问Hugging Face或TheBloke仓库,下载目标WizardLM模型的GGUF格式文件(例如:wizardlm-2-7b.Q5_K_M.gguf)。
2、在Ollama安装目录下新建文本文件,命名为Modelfile,内容为:FROM ./wizardlm-2-7b.Q5_K_M.gguf。
3、打开终端,进入该目录,执行命令:ollama create wizardlm2-7b -f Modelfile。
4、运行模型:ollama run wizardlm2-7b,验证基础响应能力。
5、在OpenClaw配置文件config.json中,将llmProvider设为"ollama",model字段填入"wizardlm2-7b",保存后重启OpenClaw服务。
二、通过LM Studio桥接WizardLM并启用OpenClaw本地API调用
LM Studio提供图形化界面与本地HTTP API服务,可绕过Ollama限制,直接加载未经Ollama封装的GGUF模型。OpenClaw支持配置任意符合OpenAI兼容API规范的后端,因此可将LM Studio作为推理网关。
1、启动LM Studio,点击“Load Model”,选择已下载的WizardLM GGUF文件(如wizard-math-7b.Q6_K.gguf)。
2、进入Settings → Local Server,启用Enable local server,确认端口为1234,勾选Allow remote connections(若OpenClaw与LM Studio同机可忽略)。
3、在OpenClaw的config.json中,将llmProvider设为"openai",openaiBaseUrl设为"http://localhost:1234/v1",model字段填入"wizard-math-7b"(需与LM Studio加载时显示名称一致)。
4、确保openaiApiKey字段值为任意非空字符串(LM Studio不校验Key,但OpenClaw要求必填)。
三、使用llama.cpp CLI直连+OpenClaw自定义LLM插件扩展
对于高级用户,可跳过Ollama/LM Studio中间层,直接以llama.cpp编译后的main或server二进制程序提供API服务。此方式对显存/内存控制更精细,且支持Flash Attention 2与CUDA Graph优化,适合WizardLM-2-13B等较大参数量模型。
1、从llama.cpp官方仓库编译支持CUDA的版本,并确认make server成功生成可执行文件。
2、执行命令启动服务:./server -m ./models/wizardlm-2-13b.Q4_K_M.gguf -c 4096 --port 8080 --threads 12。
3、在OpenClaw项目根目录下创建plugins/llm-wizard-custom/index.js,实现init与chat方法,使用fetch调用http://localhost:8080/chat/completions。
4、修改OpenClaw主配置,将llmProvider设为"custom",customLlmPlugin指向"llm-wizard-custom"。










