octop v0.9.20通过openai兼容接口对接本地llm服务,需手动配置base url、模型名等参数,支持ollama/vllm/llama.cpp等多种后端,且允许多模型共存与按需分配。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Octop v0.9.20 支持本地 LLM 提供商,但不是“开箱即用”自动识别模型——它需要你明确告诉它:模型在哪、怎么调、用什么协议。核心思路是:Octop 本身不运行模型,而是作为调度中枢,通过标准 API(主要是 OpenAI 兼容接口)对接你本地已部署的推理服务。
确认本地推理服务已就绪
Octop 不内置模型加载能力,所以第一步必须确保你本地已有可响应 OpenAI 格式请求的服务在运行,常见组合有:
-
Ollama + 自定义 host/port:默认监听
http://127.0.0.1:11434,需确认服务正在运行(ollama serve或开机自启已启用) -
vLLM + --host 0.0.0.0 --port 8000:启动时显式暴露端口,且允许跨域(
--allow-credentials和--cors-origins "*"建议加上) -
llama.cpp + server 模式:使用
./server -c 2048 -ngl 99 -p 8080启动,注意它默认提供的是/completion接口,需配合 Octop 的「非标准 OpenAI endpoint」选项使用
在 Octop 中添加本地 LLM 提供商
进入 Octop WebUI → 左侧菜单「Settings」→ 「LLM Providers」→ 点击「+ Add Provider」:
使用AIsa生成图像与视频。仅需一个API密钥即可调用Gemini 3 Pro Image(图像)和Qwen Wan 2.6(视频)。
-
Type 选
OpenAI Compatible -
Name 填个易识别的名字,比如
Local-Qwen2-7B或Ollama-Llama3 -
Base URL 填你本地服务地址,例如:
• Ollama:http://127.0.0.1:11434/v1
• vLLM:http://127.0.0.1:8000/v1
• llama.cpp:http://127.0.0.1:8080(注意这里不加/v1) -
API Key:Ollama 无需密钥,填任意非空字符串(如
sk-ollama);vLLM 若启用了--api-key则需一致;llama.cpp 默认无认证 -
Model Name 必须与你本地注册的模型名完全一致(区分大小写),例如:
• Ollama 中ollama list显示为qwen2:7b,这里就填qwen2:7b
• vLLM 启动时用了--model Qwen2-7B-Instruct,这里就填Qwen2-7B-Instruct
验证与调试要点
保存后,Octop 会尝试发起一次健康检查。若失败,优先查三处:
- 终端里看本地服务日志是否收到请求(比如 Ollama 控制台是否打印
POST /v1/chat/completions) - Octop 日志(
docker logs octop-server或日志文件)中是否有HTTPConnectionPool或Connection refused类错误 - 浏览器控制台(F12 → Network)看请求是否发出去、状态码是否为 200/404/500 —— 特别注意 Ollama 对
/v1/chat/completions的支持从 v0.1.40+ 才稳定,旧版本会 404
进阶:让多个本地模型共存并按需切换
Octop v0.9.20 支持为不同 Agent 或不同用户分配不同 Provider。比如:
- 给「代码专家」Agent 绑定
vLLM-Qwen2.5-Coder提供商 - 给「会议纪要」Agent 绑定
Ollama-Llama3-8B提供商 - 管理员可在「User Management」中为家庭成员单独指定默认 LLM,互不干扰
所有配置都存在 PostgreSQL 或本地 SQLite 中,重启不丢失。不需要改 YAML、也不用碰 Docker Compose 文件。










