WhatsApp 语音对语音模式,采用 KittenTTS 与 ffmpeg,用 whisper 转录收到的音频,再用TTS 语音回复并转为 WhatsApp 兼容格式。
Kittens WhatsApp Voice.是一项面向实际任务的技能,主要用于Generates WhatsApp-compatible 语音注释 来自文本使用 KittenTTS + ffmpeg. 具体解决格式不匹配导致无声故障: KittenTTS 输出 24。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;
涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
使用 KittenTTS + ffmpeg 将文本生成兼容 WhatsApp 的语音备忘录。专门解决因格式不匹配导致的静默失败问题:KittenTTS 输出 24kHz WAV → 通过 ffmpeg 转换为 16kHz OGG Opus → 作为 WhatsApp 语音备忘录发送。
⚠️ 安装前请务必阅读。 本技能会安装系统级软件包并下载大型机器学习模型。详见下方“Setup(安装配置)”部分。
| 依赖项 | 安装命令 | 大小 | 备注 |
|---|---|---|---|
ffmpeg |
apt-get install -y ffmpeg |
约 30MB | 大多数 Linux 发行版仓库中均提供 |
kittentts |
pip3 install kittentts --break-system-packages |
首次运行时从 Hugging Face 下载约 25–80MB 模型文件 | Python 包 |
libopus |
随 ffmpeg 一并打包提供 | — | 支持 OGG 编码 |
soundfile |
由 kittentts 自动拉取 | — | Python 包 |
huggingface.co/KittenML 下载 TTS 模型(约 25–80MB)HF_TOKEN 可避免未认证用户在模型下载时遭遇速率限制| 模型 | 参数量 | 大小 | Hugging Face ID |
|---|---|---|---|
| nano(int8) | 15M | 25MB | KittenML/kitten-tts-nano-0.8-int8 |
| nano | 15M | 56MB | KittenML/kitten-tts-nano-0.8-fp32 |
| micro | 40M | 41MB | KittenML/kitten-tts-micro-0.8 |
| mini | 80M | 80MB | KittenML/kitten-tts-mini-0.8 |
默认模型:kitten-tts-mini-0.8(音质最佳)。可在 scripts/tts_walkie.sh 中修改。
在首次使用该技能前,请手动执行以下步骤:
# 1. 安装系统级软件包(需 root / 特权权限) apt-get install -y ffmpeg # 2. 安装 Python 包 pip3 install kittentts --break-system-packages # 3. (可选)设置 Hugging Face Token 以规避下载速率限制 # echo 'export HF_TOKEN="hf_your_token_here"' >> ~/.bashrc
安装完依赖后,请重启 OpenClaw,确保新安装的软件包已加入系统 PATH。
bash scripts/tts_walkie.sh "您的消息内容" Bella # 输出:/tmp/walkie_reply.ogg(16kHz OGG Opus,可直接用于 WhatsApp)
# 安装 whisper(一次性操作,模型大小约 140MB–1.4GB 不等) pip3 install whisper --break-system-packages bash scripts/transcribe.sh /path/to/audio.ogg [model] # model 参数可选:tiny | base | small | medium | large(默认为 base)
当前支持:Bella、Jasper、Luna、Bruno、Rosie、Hugo、Kiki、Leo
默认语音:Bella
/tmp/kittentts-walkie/(权限模式为 700),仅当前运行用户可读取。VOICE_SPEED 调整语速(默认值:1.0)。kittentts-whatsapp/
├── SKILL.md
└── scripts/
├── tts_walkie.sh # 文字转语音 + ffmpeg 格式转换(现已启用 speed 参数)
└── transcribe.sh # whisper 语音识别(可选)
依赖项安装命令中使用了 --break-system-packages 和 apt-get install -y。这些操作需要 root 权限,并会修改系统级软件包。若您处于受管系统(如企业环境或容器平台),请在执行前仔细审查。
语音成功发送,但在 WhatsApp 中静音或被拒绝:
→ 运行 ffprobe -v quiet -print_format json -show_streams /tmp/walkie_reply.ogg
→ 输出中必须包含 codec_name: opus 且 sample_rate: 48000(或 16000)。若不符合,则 ffmpeg 转换链执行失败。
文字转语音生成速度过慢:
→ 在 scripts/tts_walkie.sh 中切换至更小模型(例如将 mini 替换为 nano)。
Hugging Face 下载遭遇速率限制:
→ 在环境中设置 HF_TOKEN。免费账户享有较低的速率配额。
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.4万人学习
共49课时 | 82.2万人学习