要让hermes agent完全本地运行,必须连接本地ollama服务而非云端api;需安装ollama、拉取模型(如qwen2.5:7b)、配置hermes指向ollama的base_url(注意wsl2/docker需用宿主机局域网ip)、设置format:"json"、禁用api_key,并通过命令行或手动修改config.yaml完成配置,最后验证响应成功。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要让Hermes Agent完全脱离云端API、在自己电脑上跑通大模型推理,必须让它连上本地运行的Ollama服务,而不是依赖OpenAI或Kimi这类远程接口——这一步没配对,后续所有“自进化”“本地记忆”功能都只是空转。
确认Ollama已就位并拉取模型
打开终端(Windows用PowerShell,macOS/Linux用Terminal),执行ollama list。如果返回空列表或报错“command not found”,说明Ollama未安装或未加入PATH。此时需先去ollama.com/download下载对应系统安装包,安装后重启终端。
执行ollama run qwen2.5:7b(或其他你想要的模型名,如gemma4、llama3.1:8b)。首次运行会自动拉取模型文件,耗时取决于网速和模型大小;等待出现>提示符即表示模型已加载就绪。
【Ollama默认监听127.0.0.1:11434,但Hermes Agent若运行在WSL2或Docker中,必须改用宿主机局域网IP(如192.168.1.100)才能访问】
修改Hermes Agent的LLM适配器代码
进入Hermes Agent项目根目录,定位到LLM初始化逻辑所在文件——通常为src/llm/adapter.py或hermes/llm/client.py。用VS Code或Notepad++打开该文件。
找到类似openai.AsyncOpenAI(...)或anthropic.AsyncAnthropic(...)的实例化语句,将其整体替换为自定义Ollama客户端类。该类需继承基类BaseLLMClient,并在__init__中设置base_url="http://192.168.1.100:11434/api/chat"(注意:此处必须填你本机真实局域网IP,不能写localhost)。
关键请求体结构必须严格匹配Ollama API规范:{"model": "qwen2.5:7b", "messages": [...], "format": "json", "options": {"temperature": 0.2}}。漏掉"format": "json"会导致Hermes解析响应失败,卡在Waiting for LLM response...不动。
配置Hermes Agent使用本地模型
方法一:通过命令行快速覆盖配置
PHP中文网提供Qwen-1.0.2.6 MacOS官方客户端下载,专为苹果电脑优化的阿里通义千问桌面应用。本版本深度适配Mac系统,支持本地高效运行与多模态交互,集成超长上下文处理、AI写作、代码生成及智能体构建等核心功能。通过官方渠道下载,确保安全稳定,助您实现智能办公与创作升级。
在终端中执行:hermes config set model.default qwen2.5:7b → hermes config set model.provider ollama-local → hermes config set model.base_url http://192.168.1.100:11434/api/chat。这三步会自动写入~/.hermes/config.yaml对应字段。
方法二:手动编辑config.yaml
打开~/.hermes/config.yaml,在model:节点下补全以下内容:
default: qwen2.5:7bprovider: ollama-localbase_url: http://192.168.1.100:11434/api/chatapi_mode: chat_completions
⚠️ 注意:不要在api_key字段填任何值,Ollama不校验密钥;若误写会导致Hermes尝试发起带Authorization头的请求而被拒绝。
验证本地推理是否生效
第一步:确保Ollama服务正在运行——执行ollama serve(后台常驻)或保持之前ollama run的终端窗口开着。
第二步:在Hermes Agent项目目录下执行hermes start,观察启动日志。若看到LLM client initialized with provider: ollama-local且无红色报错,则初步成功。
第三步:向Agent发送一条测试指令,例如“用中文写一首关于夏天的五言绝句”。如果3秒内返回完整诗句,且hermes logs中出现ollama api call success字样,说明本地模型推理链路已通。










