本地语音转文字,支持可选后端:Parakeet(精度最高)或 Whisper(速度最快,支持多语言)。
本地 STT (Parakeet / Whisper). 统一本地语音对文本使用 ONNX 运行时以 int8 的量化是一项面向实际任务的技能,主要用于. 选择您的后端 : 1.;Parakeet (默认): 英语最准确, 正确抓取 nam。
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;
若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
基于 ONNX Runtime 的统一本地语音转文字方案,支持 int8 量化。请选择后端:
# 默认:Parakeet v2(英文识别准确率最佳)
~/.openclaw/skills/local-stt/scripts/local-stt.py audio.ogg
# 显式指定后端
~/.openclaw/skills/local-stt/scripts/local-stt.py audio.ogg -b whisper
~/.openclaw/skills/local-stt/scripts/local-stt.py audio.ogg -b parakeet -m v3
# 静默模式(不显示进度)
~/.openclaw/skills/local-stt/scripts/local-stt.py audio.ogg --quiet
-b/--backend:parakeet(默认)、whisper-m/--model:模型变体(详见下文)--no-int8:禁用 int8 量化-q/--quiet:不显示进度信息--room-id:Matrix 房间 ID,用于直发消息| 模型 | 描述 |
|---|---|
| v2(默认) | 仅支持英文,准确率最高 |
| v3 | 多语言支持 |
| 模型 | 描述 |
|---|---|
| tiny | 速度最快,准确率较低 |
| base(默认) | 速度与准确率兼顾 |
| small | 准确率更高 |
| large-v3-turbo | 质量最优,但速度较慢 |
| 后端/模型 | 耗时 | 实时因子(RTF) | 备注 |
|---|---|---|---|
| Whisper Base int8 | 0.43 秒 | 0.018x | 最快 |
| Parakeet v2 int8 | 0.60 秒 | 0.025x | 准确率最高 |
| Parakeet v3 int8 | 0.63 秒 | 0.026x | 多语言支持 |
{
"tools": {
"media": {
"audio": {
"enabled": true,
"models": [
{
"type": "cli",
"command": "~/.openclaw/skills/local-stt/scripts/local-stt.py",
"args": ["--quiet", "{{MediaPath}}"],
"timeoutSeconds": 30
}
]
}
}
}
}
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.1万人学习
共49课时 | 82万人学习