hermes agent可零成本7×24运行:需切换至ollama等本地模型、禁用深度思考模式、启用技能自动沉淀,并绑定telegram等轻量网关,彻底切断云api依赖。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想在不花一分钱服务器费用的前提下,让 Hermes Agent 7×24 小时运行在自己电脑上,同时规避所有 API 调用账单,关键在于切断对云模型的依赖、复用本地算力,并把“越用越省”的成长逻辑真正落地到配置层。
彻底停掉 API 调用:切换到纯本地模型
第一步:确认本机已安装 Ollama 并运行正常。若未安装,访问 ollama.com 下载对应系统版本,安装后终端执行 ollama list 应能看到至少一个模型(如 qwen2.5:0.5b 或 phi-3:mini)。
第二步:执行 hermes model 进入模型配置界面,选择 Custom endpoint → 输入 Base URL:http://localhost:11434/api/chat → 模型名填你本地已有的模型 ID(如 qwen2.5:0.5b)→ 保存退出。
第三步:验证是否生效——运行 hermes 后输入简单问题(如“今天星期几?”),观察终端日志中是否出现 [OLLAMA] streaming response 字样。若仍显示 [OPENROUTER] 或 [VOLC],说明配置未覆盖默认模型,需手动编辑 ~/.hermes/config.yaml,将 【default_model: openrouter/...】 改为 【default_model: ollama/qwen2.5:0.5b】 并重启服务。
关闭深度思考模式:从源头压降 Token 消耗
深度思考模式(Deep Reasoning Mode)会强制触发多轮反思与轨迹扩展,哪怕你只问一句“总结这份PDF”,它也可能调用模型 3~5 次。本地小模型虽免费,但推理延迟高、内存占用大,频繁调用极易卡死或触发 OOM。
打开 ~/.hermes/config.yaml,找到 reasoning: 区块,将 enabled: true 改为 enabled: false。
这一步做完后,Hermes 将跳过 Observe→Reflect→Crystallize 全流程,只保留 Execute 阶段。日常文档摘要、代码解释、格式转换等任务响应速度提升 3 倍以上,且不再因反复自问自答导致本地显存爆满。
启用技能自动沉淀:让每次使用都降低下一次成本
第一步:确保 ~/.hermes/config.yaml 中 skills: → auto_generate: 设为 true,并检查 memory: → enabled: 也为 true。
第二步:手动执行一次可沉淀任务,例如:“把当前目录下所有 .txt 文件内容合并成 report.md”。待任务完成,进入 ~/.hermes/skills/ 目录,确认生成了以时间戳命名的新 YAML 文件,且文件内含完整工具调用链与参数模板。
第三步:下次再执行同类任务时,直接输入“合并当前目录 txt 文件”,Hermes 会自动匹配该 Skill 并跳过全部推理过程——【这不是缓存,是真正可复用、可编辑、可跨会话调用的功能模块】。你不用再描述“怎么找文件、怎么读、怎么拼接”,系统已经记住了你的工作流。
绑定轻量消息网关:避免微信/飞书 SDK 带来的隐性资源开销
方法一:禁用全部网关,纯命令行交互。执行 hermes gateway list 查看已启用通道,对每个启用项运行 hermes gateway disable [name](如 wechat、feishu)。这是最省资源的方式,适合调试和单人高频使用。
方法二:仅启用 Telegram Bot 网关。Telegram 官方 Bot API 对请求频率宽松,无需 Webhook 服务器、不依赖公网 IP、无 SSL 证书维护成本。只需在 BotFather 创建 bot 获取 token,再执行 hermes gateway setup telegram 粘贴 token 即可。相比企业微信或飞书,它不会在后台常驻 HTTP 服务进程,也不会因 OAuth 回调失败反复重试消耗 CPU。











