MiniMax 语音合成技能 - 支持同步/异步文本转语音(T2S)、音色克隆(Voice Clone)、音色设计(Voice Design)、音色查询与删除。使用模型 speech-2.8-hd,输出 mp3/wav/pcm 音频文件至本地。
MiniMax Speech Skill是一项面向实际任务的技能,主要用于使用 MiniMax API 进行语音合成、语音克隆和音色设计;支持同步/异步文本转语音、音色克隆、音色设计、音色查询与删除;
它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
使用 MiniMax API 进行语音合成、语音克隆和音色设计。支持同步/异步文本转语音、音色克隆、音色设计、音色查询与删除。使用模型 speech-2.8-hd,输出 mp3/wav/pcm 格式音频文件。
{
"MINIMAX_API_KEY": "your-api-key",
"MINIMAX_REGION": "cn" | "int"
}
MINIMAX_API_KEY: MiniMax API 密钥MINIMAX_REGION: 区域设置,cn 为中国,int 为国际(默认 cn)同步文本转语音
参数:
text: 要转换的文本voice_id: 音色ID(默认: female-tianmei)output_file: 输出文件路径示例: text_to_speech("你好世界", "female-tianmei", "hello.mp3")
异步文本转语音,返回任务ID
参数:
text: 要转换的文本voice_id: 音色ID返回: 任务ID
查询异步任务状态
参数:
task_id: 任务ID返回: 任务状态信息
音色快速复刻
参数:
audio_file_path: 参考音频文件路径title: 新音色名称返回: 新音色的 voice_id
音色设计
参数:
text: 音色描述文本style: 音色风格返回: 设计生成的 voice_id
获取音色列表
返回: 音色列表
获取单个音色信息
参数:
voice_id: 音色ID删除音色
参数:
voice_id: 音色ID返回: 是否成功
| 音色ID | 描述 |
|---|---|
| female-tianmei | 女声甜美 |
| male-yunyang | 男声播音 |
| female-badu | 女声巴度 |
| male-shawn | 男声 Shawn |
| female-shanshan | 女声杉杉 |
python scripts/speech.py tts "欢迎使用 MiniMax 语音服务" -v female-tianmei -o output.mp3
python scripts/speech.py tts-async "这是一段较长的文本" -v male-yunyang
python scripts/speech.py query
python scripts/speech.py clone reference_audio.mp3 -t "我的音色"
python scripts/speech.py design "温柔的女性声音,适合朗读" -s gentle
python scripts/speech.py delete
相关专题
热门下载
相关下载
精品课程
共1课时 | 533人学习
共0课时 | 0人学习
共1课时 | 204人学习
最新文章