需通过音色设计、声音克隆或参数微调实现角色化tts:一、音色设计用结构化提示词生成新音色;二、声音克隆上传真人音频复刻声纹;三、调试台调节低沉度、情绪、语速等参数优化已有音色。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望在 MiniMax 语音合成(TTS)中创建符合特定角色或品牌调性的发音人,则需通过“音色设计”或“声音克隆”路径实现。以下是实现该目标的多种可行方法:
一、使用音色设计功能一句话生成专属发音人
该方法无需原始音频,仅依赖自然语言描述即可生成全新音色,适用于虚构角色、IP化内容或风格化播报场景。系统基于大模型理解提示词语义,生成具备情绪、质地、节奏特征的声音原型。
1、访问 MiniMax Audio 官网(https://www.minimax.io/audio),登录账户后进入「音色设计」模块。
2、在 Prompt 输入框中输入结构化提示词,格式为:职业+人物特征+声音特征+语速+场景效果,例如:“儿童动画片中的活泼小朋友,声音清脆稚嫩,语速轻快跳跃,充满好奇与快乐,用于演绎卡通冒险故事”。
3、点击「生成」按钮,系统将在30秒内输出3个音色变体供试听对比。
4、选择满意版本,填写发音人名称(限5字以内,仅支持中英文字符)、性别、语种(中文普通话或英文),点击保存至「我的音色」。
二、通过声音克隆技术复刻真实人声
该方法适用于需高度还原真人语音特征的场景,如主播配音、企业代言人语音库建设等。海外版 MiniMax 支持此功能,要求提供干净、稳定、无背景音的原始语音样本。
1、前往海外官网 https://www.minimax.io/audio,进入「Voice Clone」页面。
2、上传至少一段时长10秒以上的清晰人声录音,单次最多上传10段,总大小不超过200MB,格式为 WAV 或 MP3。
3、启用「口音优化」开关,并选择目标语言(如中文普通话),确认提交训练请求。
4、等待系统完成建模(通常数分钟至数小时),生成成功后,该发音人将自动同步至「我的音色」列表,可在 TTS 页面直接调用。
三、利用调试台对已有音色进行参数化微调
该方法适用于已生成音色但需强化个性表达的场景,通过调节底层声学参数,使语音更贴合角色设定或内容情绪,不依赖重新训练。
1、在「语音合成」界面选择任一预设音色或已保存的自定义音色。
2、点击「调试台」进入高级控制面板,可独立调节:低沉度、力量感、磁性、回声强度、电话音效果等维度。
3、在情绪标签栏中选择对应状态(如开心、生气、惊讶、严肃),并手动设置语速(-100% 至 +100%)、声调(-6 至 +6)、音量(0–100)。
4、在「Text to Preview」框中输入测试文本(最多300字符),实时试听调整效果,满意后保存为新音色副本。











