openclaw支持“能听会说”的完整语音交互,提供本地whisper、groq云端及混合stt方案,tts首选免密edge tts,支持多触发模式与闭环验证。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

OpenClaw 支持完整的语音交互能力,即“能听会说”——语音输入(STT)转文字、语音输出(TTS)播文字。它不依赖单一服务商,可按需组合本地模型、云端API或免密服务,兼顾隐私、成本与效果。
语音输入(STT)怎么配
语音输入有三种主流方式,选一种即可:
-
本地 Whisper(推荐给注重隐私的用户):下载 large-v3 模型后,在
~/.openclaw/openclaw.json中配置路径和麦克风设备 ID;需确认系统音频输入权限正常,可用arecord -d 3 test.wav测试录音是否成功。 -
Groq 云端 Whisper(推荐给硬件受限用户):注册 groq.com 获取免费 API Key(每月 1000 万 token),填入配置中并设
"provider": "groq";支持 MP3/WAV/WEBM 等常见格式,识别快、准确率高。 - 混合策略(进阶用法):在配置中同时声明多个 STT 提供方,OpenClaw 会按顺序自动降级——例如先试 Groq,失败则回落到本地 Whisper,再失败则报错。
语音输出(TTS)怎么配
TTS 配置更轻量,微软 Edge TTS 是零门槛首选:
- 无需申请密钥,直接启用:
"tts": {"provider": "edge", "voice": "zh-CN-XiaoxiaoNeural"};中文推荐使用XiaoxiaoNeural(晓晓)、YunxiNeural(云希)或XiaoyiNeural(晓伊)。 - 支持语速调节(
"rate": "1.2")、音调微调("pitch": "+10Hz"),适合不同场景节奏。 - 若需更高表现力,可切换 ElevenLabs 或 OpenAI TTS,但需自行配置 API Key 和 voice ID,属于付费增强方案。
语音功能如何触发
OpenClaw 提供灵活的响应模式,不用每次手动开关:
- always:所有 AI 回复都自动转语音,适合驾驶、做饭等双手不便看屏的场景。
- inbound:仅当用户发的是语音消息时,AI 才用语音回复;发文字则回文字,避免打扰。
-
tagged:只对含
[[tts]]标记的回复启用语音,精准控制,适合混合内容输出。 - 还可临时用斜杠命令控制,比如在聊天中输入
/tts always或/tts off,实时生效不重启。
验证语音是否真正跑通
别只改配置,要闭环测试:
- 运行
openclaw listen:它会启动监听→录音→识别→TTS播报全流程,终端实时显示中间结果,是排查链路问题最直接的方式。 - 执行
openclaw speak "你好,龙虾已就绪":单独测试 TTS 输出是否响、音色是否正确、系统音频设备是否被静音。 - 检查
pactl list sinks short和arecord -l:确认声卡和麦克风设备在系统层已被识别且未被其他进程独占。










