使用 OpenAI 音频转录 API(Whisper)进行音频转录。
OpenAI Whisper API (curl). 通过 OpenAI 的 /v1/audio/ trrancription 端点对音频文件进行描述是一项面向实际任务的技能,主要用于/// 快速启动;默认:. 模式: 低声-1. 输出: < input >. txt. 有用旗帜.;
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
通过 OpenAI 的 /v1/audio/transcriptions 接口转录音频文件。
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a
默认参数:
whisper-1.txt{baseDir}/scripts/transcribe.sh /path/to/audio.ogg --model whisper-1 --out /tmp/transcript.txt
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --language en
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --prompt "Speaker names: Peter, Daniel"
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --json --out /tmp/transcript.json
设置环境变量 OPENAI_API_KEY,或在 ~/.clawdbot/clawdbot.json 中配置:
{
skills: {
"openai-whisper-api": {
apiKey: "OPENAI_KEY_HERE"
}
}
}