6月4日,微软正式发布全新一代文本转语音(tts)模型——mai-voice-2。作为当前语音合成领域性能最突出的模型之一,mai-voice-2在语音保真度、多语言支持广度、说话人身份一致性以及情感表达丰富性等关键指标上均取得突破性进展,专为品牌智能助手、高质量有声读物制作及无障碍信息访问等高要求应用场景提供底层语音能力支撑。
该模型将语言覆盖范围由原先仅支持英语,大幅拓展至涵盖15种主流语言,且所有语种均达到与英语一致的自然流畅度与表现张力。其核心能力包括:基于细粒度情感标签的情感精准调控(如“低沉”“耳语”“激昂”等),以及依托极短参考音频(仅需5–60秒)即可完成个性化声音克隆的零样本语音生成技术。为保障伦理合规与声音权益,系统内嵌授权验证机制,严格限定仅可合成经明确授权许可的声音资产。
实测数据显示,MAI-Voice-2在用户偏好度方面相较上一代模型提升达72%。模型在处理长文本时仍能持续维持说话人声纹稳定,并原生支持印地语-英语、西班牙语-英语等混合语境下的无缝语码转换。目前,MAI-Voice-2已正式上线Azure Foundry平台,并同步推进与VSCode开发环境及Dynamics 365 Contact Center客服系统的深度集成。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












