已成功部署hermes agent但未启用语音交互,需按四步配置:一、启用cli语音模式;二、配置openai whisper+tts;三、接入discord语音频道;四、切换本地ollama语音模型。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已成功部署 Hermes Agent,但尚未启用语音交互功能,则可能是由于语音模块未配置或语音提供商未接入。以下是开启实时语音对话模式的详细步骤:
一、启用 CLI 语音模式
CLI 语音模式是 Hermes Agent 最轻量级的语音交互方式,依赖本地系统音频设备与终端直连,无需额外消息平台,适合快速验证语音输入输出能力。
1、确保系统已安装 PulseAudio(Linux)或 Core Audio(macOS),Windows 用户需启用 Windows Audio Session API(WASAPI)。
2、在已激活的 Hermes Agent 虚拟环境中执行命令:hermes --voice cli。
3、首次运行时,Agent 将自动检测默认输入/输出设备并提示权限请求;请允许麦克风与扬声器访问。
4、听到提示音后开始说话,语音将被实时转为文本送入模型;回复生成后,将通过 TTS 合成语音播放。
二、配置 OpenAI Whisper + TTS 语音栈
该方案使用 OpenAI 官方 Whisper 模型进行语音识别、配合内置 TTS 引擎实现端到端低延迟语音流处理,适用于对识别准确率要求较高的本地场景。
1、确认已配置 OPENAI_API_KEY 并在 .env 文件中启用语音相关参数:
2、向 .env 文件追加以下两行:
VOICE_ASR_PROVIDER=whisper
VOICE_TTS_PROVIDER=system
3、重启 Hermes Agent:先按 Ctrl+C 停止当前进程,再执行 hermes --voice cli。
4、运行 hermes doctor --voice 验证语音组件状态,输出中应显示 ASR: whisper (online) 与 TTS: system (ready)。
三、接入 Discord 语音频道
Discord 语音频道提供稳定的 WebRTC 音频通道与多用户实时协作能力,适合团队语音会话、远程会议辅助等场景,需通过 Hermes Gateway 模块路由音频流。
1、执行 hermes gateway setup,在交互式向导中选择 discord 作为网关类型。
2、登录 Discord 开发者门户,创建新应用,启用 Privileged Intent: SERVER MEMBERS INTENT 和 MESSAGE CONTENT INTENT。
3、复制 Application ID 与 Bot Token,粘贴至向导对应字段。
4、完成配置后,在 Discord 服务器中将 Bot 添加至语音频道,发送指令 /voice join 即可激活双向语音流。
四、切换本地 Ollama 语音模型(离线可用)
当网络受限或需完全离线运行时,可使用 Ollama 托管的开源语音模型替代云端 ASR/TTS 服务,所有语音处理均在本地完成,保障隐私与响应确定性。
1、确保已安装 Ollama 并运行服务:ollama serve。
2、拉取 Whisper 本地模型:ollama pull systran/faster-whisper-large-v3。
3、编辑 .env 文件,设置:
OLLAMA_BASE_URL=http://localhost:11434
VOICE_ASR_PROVIDER=ollama
VOICE_ASR_MODEL=systran/faster-whisper-large-v3
4、重启 Hermes Agent 并附加 --voice cli 参数,此时语音识别将完全脱离网络依赖。











