使用 DubbingX 智声云配 API 为角色台词生成 TTS 配音。支持音色查询筛选、情绪自动匹配、单条/批量台词异步生成与下载。当用户想要配音、TTS、文字转语音、角色配音、台词配音,或提到"dubbingx"、"配音"、"tts"、"语音合成"、"生成语音"、"角色声音"时,务必使用此 skill。
DubbingX TTS 配音技能是一项面向实际任务的技能,主要用于通过 DubbingX 智声云配 API 为角色台词生成高质量 TTS 配音音频;本 skill 的脚本位于: {SKILL_DIR}/scripts/;
它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
通过 DubbingX 智声云配 API 为角色台词生成高质量 TTS 配音音频。
本 skill 的脚本位于: {SKILL_DIR}/scripts/
pip install requests
脚本需要 DubbingX 平台的 API Key,在环境变量中配置:
DUBBINGX_API_KEY: DubbingX API KeyAPI Key 在 DubbingX 客户端中生成。如未配置环境变量,可通过 --api-key 参数传入。
运行 list_voices.py 筛选合适音色:
python {SKILL_DIR}/scripts/list_voices.py --grade premium --gender 1 --age-group 青年
python {SKILL_DIR}/scripts/list_voices.py --grade premium --gender 0 --age-group 青年
参数说明:
--grade: premium(全情绪) / ordinary(单情绪) / custom(多情绪)--gender: 0(女) / 1(男)--age-group: 孩童/少年/青年/中年/老年--keyword: 关键字搜索用户确认每个角色对应的 voiceId 后,进入下一步。
使用 generate_tts.py 生成单条台词试听:
python {SKILL_DIR}/scripts/generate_tts.py
--voice-id 30002
--text "都交给我。"
--emotion "常规-日常说话-2"
--language zh
--format mp3
参数说明:
--voice-id: 音色 ID(从 list_voices.py 获取)--text: 台词文本,支持 <break time="0.5"/> 停顿标签和 <phoneme ph="duan2">段</phoneme> 音素标注--emotion: 情绪格式,全情绪音色为 类型-风格-档位(如 常规-日常说话-3),详见 emotion-map.md--language: zh/en/jp/yue--audio-speed: 语速 0.7-1.3,默认 1.0--audio-pitch: 语调 0.7-1.3,默认 1.0--format: wav/mp3,默认 mp3脚本返回 task_id,然后用 query_tts.py 查询和下载。
# 单个任务
python {SKILL_DIR}/scripts/query_tts.py
--task-id <TASK_ID> --output-dir ./output/
# 批量任务(传入 task_map.json)
python {SKILL_DIR}/scripts/query_tts.py
--task-map task_map.json --output-dir ./output/
Completed: 自动下载音频Generating/Ready: 提示等待Failed: 显示错误准备 JSON 配置文件,格式如下:
{
"voice_map": {
"红狼": {"voice_id": "30002", "language": "zh"},
"露娜": {"voice_id": "30010", "language": "zh"},
"牧羊人": {"voice_id": "30005", "language": "zh"}
},
"dialogues": [
{
"shot_id": "E1-S1-03",
"character": "红狼",
"emotion": "常规-日常说话-2",
"text": "都交给我。"
}
]
}
运行批量生成:
python {SKILL_DIR}/scripts/batch_generate.py
--config dialogue_config.json
--output-dir ./赛博朋克/配音/
脚本会输出 task_map.json,用 query_tts.py --task-map 批量下载。
详见 references/emotion-map.md。
DubbingX 全情绪音色支持 8 大类情绪(常规/开心/恐惧/厌恶/惊喜/生气/悲伤/哭泣),每类有多种风格,全情绪音色支持 1-5 档强度。格式为 类型-风格-档位,如 开心-大声-4。
emotionCustom 参数,可用自然语言描述情绪<break time="秒数"/> 标签控制,最长 20 秒