要实现hermes agent自然语音交互,必须同时配置stt(如whisper)与tts(如edge tts),并确保系统麦克风/扬声器权限开启、音频设备正常、模型路径正确、唤醒词触发有效。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让Hermes Agent真正“听懂”你说的话,并用自然语音回应,而不是只靠键盘输入和文字输出——这需要同时打通语音识别(STT)与语音合成(TTS)两个关键链路,缺一不可,否则交互就是单向的、断裂的。
确认硬件与系统权限就绪
语音功能无法启动,90%的情况源于麦克风或扬声器被系统拦截。必须先验证物理通路是否畅通。
在Windows中:打开“设置”→“隐私和安全性”→“麦克风”,确保全局开关开启,并在下方应用列表中找到HermesAgent,将其右侧滑块设为“开”。【若列表中无HermesAgent,需先运行一次hermes agentstart命令,触发系统注册】
在macOS中:前往“系统设置”→“隐私与安全性”→“麦克风”,点击左下角“+”号,手动添加路径/Applications/HermesAgent.app/Contents/MacOS/HermesAgent。
接着测试音频设备:运行hermes doctor --audio,观察输出是否显示input: ok、output: ok。如任一项为failed,说明驱动未加载或设备被占用,需重启音频服务或拔插USB麦克风。
配置本地Whisper语音识别后端
使用本地Whisper模型可规避网络延迟与API费用,但对CPU/GPU有明确要求。tiny/base模型可在普通笔记本实时运行,small及以上建议启用CUDA加速。
方法一:一键安装Whisper CLI工具链
执行hermes tools install whisper,该命令会自动检测系统并安装ffmpeg、whisper.cpp或whisper-ct2适配版本。
方法二:手动指定模型路径
下载量化模型whisper-ct2-base-zh至~/.hermes/models/whisper-ct2/,编辑~/.hermes/config.yaml,在stt段落中写入:
provider: whisper-ct2
model_path: ~/.hermes/models/whisper-ct2/base-zh
配置完成后,运行hermes stt test --file sample.wav。如果返回中文文本且时间戳对齐,说明STT链路已通。
接入语音合成(TTS)并完成闭环
语音输出不是锦上添花,而是交互连续性的必要条件。没有TTS,AI即使理解了你,也只能沉默或弹出文字框,体验断裂。
第一步:选择TTS provider
推荐优先试用Edge TTS(免密、离线可用):执行hermes tools install edge-tts。
第二步:配置默认语音与语速
编辑config.yaml,在tts段落下添加:
provider: edge-tts
voice_id: zh-CN-XiaoxiaoNeural
rate: 1.1
第三步:验证合成效果
运行hermes tts test "你好,我是你的AI伴侣",注意听发音是否自然、停顿是否合理。若语音卡顿或报错,请检查系统是否已安装Microsoft Edge浏览器(Edge TTS依赖其运行时组件)。
启动语音监听并触发对话
所有底层组件就绪后,才能进入实际语音交互阶段。Hermes不默认常驻监听,每次会话都需主动唤起,避免误触发与资源空转。
① 在终端中执行:hermes voice start
② 等待提示音(短促双音“滴—滴”),表示VAD(语音活动检测)已激活
③ 清晰说出唤醒词:hey hermes
④ 紧接着提出请求,例如:“查一下今天北京的天气”
⑤ 听取TTS播报结果,同时观察CLI界面是否同步显示原始语音文本与AI响应
这一步操作起来很简单,直接把命令敲进去就行。但要注意:首次运行hermes voice start时,系统会弹出麦克风权限二次确认窗口,必须手动点击“允许”,否则后续所有语音输入都将静默失败。











