OpenClaw 实时语音助手。通过可配置的 STT(Deepgram 或 ElevenLabs)将麦克风音频流发送给 OpenClaw 代理,再通过可配置的 TTS(Deepgram Aura 或 ElevenLabs)返回语音。全流程流式传输,首音延迟低于 2 秒。
语音助理 : 您的 OpenClaw 代理的实时语音接口是一项面向实际任务的技能,主要用于与您的代理交谈并听到其响应 —— 由可配置的 STT 和 TTS 提供商, 在每个阶段全流, 以及 sub-2 se。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
为您的 OpenClaw agent 提供实时语音接口。与您的 agent 对话,并即时听到其语音回复 —— 支持可配置的 STT(语音转文本)和 TTS(文本转语音)服务提供商,全链路流式处理,首段音频延迟低于 2 秒。
浏览器麦克风 → WebSocket → STT(Deepgram / ElevenLabs)→ 文本 → OpenClaw 网关(/v1/chat/completions,流式响应)→ 响应文本 → TTS(Deepgram Aura / ElevenLabs)→ 音频分块 → 浏览器扬声器
该语音接口连接至您正在运行的 OpenClaw 网关所暴露的 OpenAI 兼容端点。它使用的是同一套 agent,具备全部上下文、工具与记忆能力,仅新增了语音交互能力。
cd {baseDir}
cp .env.example .env
# 填写您的 API 密钥和网关 URL
uv run scripts/server.py
# 打开 http://localhost:7860 并点击麦克风按钮
| 提供商 | 模型 | 延迟 | 说明 |
|---|---|---|---|
| Deepgram | nova-2(流式) | 约 200–300ms | WebSocket 流式传输,准确率与速度综合表现最佳 |
| ElevenLabs | Scribe v1 | 约 300–500ms | 基于 REST,多语言支持良好 |
| 提供商 | 模型 | 延迟 | 说明 |
|---|---|---|---|
| Deepgram | aura-2 | 约 200ms | WebSocket 流式传输,成本较低 |
| ElevenLabs | Turbo v2.5 | 约 300ms | 语音质量最优,支持流式输出 |
所有配置均通过 .env 文件中的环境变量完成:
# === 必需项 === OPENCLAW_GATEWAY_URL=http://localhost:4141/v1 # 您的 OpenClaw 网关地址 OPENCLAW_MODEL=claude-sonnet-4-5-20250929 # 网关路由所用模型 # === STT 提供商(二选一)=== VOICE_STT_PROVIDER=deepgram # 可选 "deepgram" 或 "elevenlabs" DEEPGRAM_API_KEY=your-key-here # 若 STT=deepgram,则必需 ELEVENLABS_API_KEY=your-key-here # 若 STT=elevenlabs,则必需 # === TTS 提供商(二选一)=== VOICE_TTS_PROVIDER=elevenlabs # 可选 "deepgram" 或 "elevenlabs" # 使用与上述相同的 API 密钥 # === 可选调优项 === VOICE_TTS_VOICE=rachel # ElevenLabs 语音名称/ID VOICE_TTS_VOICE_DG=aura-2-theia-en # Deepgram Aura 语音标识 VOICE_VAD_SILENCE_MS=400 # 转换轮次前的静音阈值(毫秒) VOICE_SAMPLE_RATE=16000 # 音频采样率 VOICE_SERVER_PORT=7860 # 服务端口 VOICE_SYSTEM_PROMPT="" # 可选:系统提示词覆盖
| 配置方案 | 适用场景 |
|---|---|
| Deepgram STT + ElevenLabs TTS | 语音输出质量最优 |
| Deepgram STT + Deepgram TTS | 端到端延迟最低,单一供应商集成 |
| ElevenLabs STT + ElevenLabs TTS | 多语言支持最佳 |
当用户在 agent 正在说话时开始发言:
用户:"嘿,帮我配置语音助手"
→ OpenClaw 执行:cd {baseDir} && cp .env.example .env
→ 自动打开 .env 文件,提示用户填写 API 密钥
→ 执行:uv run scripts/server.py
用户:"启动语音聊天"
→ 在浏览器中打开 http://localhost:7860
用户:"切换 TTS 到 Deepgram"
→ 将 .env 中 VOICE_TTS_PROVIDER 修改为 deepgram
→ 重启服务端
VOICE_VAD_SILENCE_MS 增加至 600–800ms| 阶段 | 目标延迟 | 实际延迟(典型值) |
|---|---|---|
| 音频采集 + VAD | <200ms | 约 100–150ms |
| STT 转录 | <400ms | 约 200–400ms |
| OpenClaw LLM 首 token | <1500ms | 约 500–1500ms |
| TTS 首音频分块 | <400ms | 约 200–400ms |
| 首段音频总延迟 | <2.5s | 约 1.0–2.5s |
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.4万人学习
共49课时 | 82.2万人学习