需通过openai兼容接口桥接llama-factory微调模型与openclawai,方法包括:一、vllm服务暴露标准api;二、gpustack图形化部署;三、自定义cli backend脚本直连。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已使用 LLaMA-Factory 对 Llama3 或其他兼容模型完成微调,并希望将产出的 Hugging Face 格式模型权重接入 OpenClawAI 进行推理与 Agent 调用,则需通过 OpenAI 兼容接口层进行桥接。以下是实现该目标的多种可行方法:
一、通过 vLLM + OpenAI 兼容 API 接入 LLaMA-Factory 微调模型
该方法利用 vLLM 作为高性能推理后端,加载 LLaMA-Factory 输出的 HF 格式模型(如 output/llama3.1-lora-merged),暴露标准 OpenAI `/v1/chat/completions` 接口,OpenClaw 以 Provider 方式直连调用。
1、确认微调模型已合并 LoRA 权重并导出为完整 HF 格式目录,路径形如 /path/to/llama3.1-custom-merged,且包含 config.json、pytorch_model.bin(或 model.safetensors)及 tokenizer* 文件。
2、启动 vLLM 服务,指定模型路径与端口:vllm serve --model /path/to/llama3.1-custom-merged --host 0.0.0.0 --port 8080 --tensor-parallel-size 1(GPU 数量适配后调整 --tensor-parallel-size)。
3、验证接口可用性:执行 curl http://localhost:8080/v1/models,确认返回中包含模型 ID(默认为目录名)。
4、在 OpenClaw Dashboard 的 Config → Models → Providers 中新增 Provider,填写:
Provider 名称:vllm-local
Base URL:http://localhost:8080/v1
API Key:任意非空字符串(如 dummy)
Models 列表中添加条目,id 字段必须与 vLLM 返回的模型 ID 完全一致,contextWindow 设为不低于模型实际支持的上下文长度(如 8192)。
二、通过 GPUStack 管理 LLaMA-Factory 模型并对接 OpenClaw
GPUStack 提供图形化模型部署界面,支持直接上传 Hugging Face 格式模型包并一键启动 OpenAI 兼容服务,适合无需命令行操作的用户,且内置健康检查与自动重启机制。
1、访问 GPUStack Web 控制台(如 http://your-gpustack-ip:3000),登录后进入 Models → Add Model。
2、选择 “Upload from local” 模式,上传 LLaMA-Factory 导出的完整模型文件夹压缩包(ZIP 格式),确保根目录含 config.json 和权重文件。
3、填写模型名称(如 llama3.1-finetuned-customer-support),启用 “OpenAI-compatible API”,保存后等待状态变为 Running。
4、复制该模型详情页显示的 API Endpoint(形如 http://your-gpustack-ip:15827/v1-openai)与 Model ID。
5、在 OpenClaw CLI 执行:openclaw models add --provider gpustack --base-url http://your-gpustack-ip:15827/v1-openai --api-key dummy --model-id llama3.1-finetuned-customer-support。
三、通过自定义 CLI Backend 直接调用推理脚本
该方法绕过任何中间服务,由 OpenClaw 启动一个独立进程执行本地 Python 脚本,脚本负责加载微调模型(使用 transformers + accelerate)、接收 stdin 输入、输出 JSON 格式响应,适用于严格隔离环境或需动态加载多版本模型的场景。
1、编写推理脚本 llama3-finetune-infer.py,使用 AutoTokenizer.from_pretrained() 与 AutoModelForCausalLM.from_pretrained() 加载本地微调路径,调用 model.generate() 并按 OpenClaw CLI Backend 协议输出 JSON(含 choices[0].message.content 字段)。
2、赋予脚本可执行权限:chmod +x llama3-finetune-infer.py。
3、在 OpenClaw 配置中注册 CLI Backend:openclaw models add --provider cli --command "./llama3-finetune-infer.py" --model-id llama3.1-cli-finetuned。
4、确保脚本运行时能访问 CUDA 设备(如设置 CUDA_VISIBLE_DEVICES=0)且 Python 环境已安装 transformers、torch、accelerate。











