需配置router.yaml实现多模型路由:在rules下添加task_type与廉价模型映射规则,如-extract_keywords: qwen2.5-0.5b;启用fallback降级并设min_confidence_score为0.65;工具链可通过model_override.yaml或skill.md中exec_model单独绑定模型;调试时用/debug router on验证日志输出。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让Hermes Agent在执行关键词提取、布尔判断、格式转换这类轻量任务时,自动跳过GPT-4或Claude-3,转而调用qwen2.5-0.5b或phi-4这类毫秒级响应、单次成本不到0.001元的模型,从而把API支出压到最低——这需要配置多模型路由策略,而不是靠人工每次敲/model命令切换。
配置router.yaml实现任务类型路由
打开Hermes Agent安装目录下的config/router.yaml文件。
在rules:字段下新增规则,例如:- task_type: "extract_keywords" model: "qwen2.5-0.5b"。每行一条,支持的廉价模型包括qwen2.5-0.5b、phi-4、tinyllama和hermes-2.5-1.3b。
必须确保task_type与Hermes内置分类器输出的标签完全一致,常见可路由类型有:summarize_short、classify_bool、rewrite_format、extract_entities——拼错一个字母就无法命中路由。
保存后,在终端执行hermes reload router命令激活新策略。该操作不中断服务,但仅对后续新会话生效。
启用fallback降级机制防超时浪费
编辑config/agent.yaml,将fallback_enabled设为true。
在fallback_models列表中按优先级填入至少两个廉价模型,例如:["phi-4", "tinyllama"]——顺序决定重试路径,第一个失败才试第二个。
【min_confidence_score必须设为0.65】。低于该值即触发降级,过高会导致本该降级的任务仍强行用高价模型重试三次,反而更费钱。
重启Agent:执行hermes restart。注意,此操作会清空当前所有会话上下文,但持久记忆(USER.md/MEMORY.md)不受影响。
为工具链单独绑定廉价模型
方法一:针对web_search类工具,新建config/model_override.yaml文件。
写入内容:web_search: model: "qwen2.5-0.5b"。该配置优先级高于全局router.yaml,专用于工具调用阶段。
方法二:在SKILL.md文件顶部YAML头中声明:exec_model: phi-4。这样每次执行该技能时,无论当前会话主模型是什么,都会强制使用phi-4执行。
注意:SKILL.md中的exec_model只对本技能生效,且必须是已注册到providers中的模型标识,否则启动时报错退出。
验证路由是否真实生效
第一步:在终端启动Hermes Agent,输入/debug router on开启路由调试日志。
第二步:发送一句明确触发轻量任务的指令,例如:“列出下面句子中的所有动词:她快速关上窗户并转身离开。”
第三步:观察终端输出——若看到[ROUTER] matched task_type=extract_entities → model=qwen2.5-0.5b,说明路由成功;若显示no rule matched,则需检查router.yaml中task_type拼写或分类器是否未启用。
第四步:执行一次web_search指令,确认日志中出现[OVERRIDE] web_search → qwen2.5-0.5b字样。
第五步:手动触发一次低置信度场景(如输入乱码提问),等待3秒后观察是否出现[FALLBACK] retrying with phi-4提示。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!











