hermes-ui可实时监控每条消息的token消耗及对应费用,安装后访问http://127.0.0.1:3001,在costs面板查看总用量、会话/消息数、按模型拆分的明细及7天趋势图,并支持按会话、profile维度定位高消耗源头。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想清楚知道每次AI对话花了多少钱,而不是等月底账单吓一跳——Hermes Agent 的 Web 界面能实时显示每条消息消耗多少 Token、对应多少费用,连模型调用明细和趋势图都给你列得明明白白。
安装 Hermes-UI 监控面板
打开终端,依次执行四行命令:
git clone https://github.com/joeynyc/hermes-hudui.git → cd hermes-hudui → ./install.sh → hermes-hudui
这一步必须在 Hermes Agent 已安装并正常运行的前提下操作,否则界面将无法读取 ~/.hermes/ 下的状态数据。【当前目录必须是 hermes-hudui 根目录,否则 ./install.sh 会报错找不到依赖】
安装完成后终端会输出 “Hermes HUD UI started on http://127.0.0.1:3001”。
查看 Token 消耗详情
浏览器访问 http://127.0.0.1:3001,进入 Dashboard 默认页。
点击顶部导航栏的 COSTS 面板。
这里显示三项核心数据:总 Token 用量(如 28.4K)、会话数、消息数,以及下方按模型拆分的明细表——OpenAI/gpt-4o 消耗了多少、Claude/sonnet 又用了多少,全都带金额预估。
图表默认展示最近 7 天的 Token 消耗趋势,鼠标悬停在折线点上可查看当日具体数值。
定位高消耗会话与消息
第一步:切换到 Sessions 面板,按 “Tokens Used” 列降序排列;
第二步:找到 Token 占比最高的那条会话,点击右侧 “View Details”;
第三步:在弹出的消息流中,逐条查看每条 AI 响应右侧标注的 in/out tokens 数值;
第四步:重点检查输出 token 异常偏高的响应——这类消息往往包含大段重复解释、未截断的代码输出或冗余 JSON 补全,正是成本优化的第一靶点。
对比不同 Profile 的成本分布
方法一:进入 Profiles 面板,每个 Profile 名称右侧直接显示其累计 Token 消耗量;
方法二:点击任一 Profile 进入子页,在左侧菜单选择 Token Costs,查看该 Profile 独立维度下的模型调用明细与日度趋势;
注意:多 Profile 场景下,各 profile 的 state.db 是隔离存储的,所以成本数据天然不交叉。如果你发现 default profile 消耗远超其他 profile,大概率是忘了在启动时指定 -p 参数,导致所有未声明 profile 的请求都 fallback 到了 default。
设置 Token 预警阈值(需手动配置)
打开终端,编辑 Hermes Agent 主配置文件:
vim ~/.hermes/config.yaml
在全局配置块下新增字段:
token_budget:
daily_limit: 50000
notify_on_exceed: true
保存后重启 Hermes Agent(hermes stop → hermes start),预警不会自动出现在 Web UI,但会在终端日志中输出 WARNING,并触发系统通知(需本地已配置 notify-send 或 osascript)。











