6月15日,zyphra公司正式对外宣布,其全新语音合成模型zonos2已全面开源。作为业界首个基于稀疏混合专家(moe)架构的开源tts系统,zonos2拥有总计80亿参数,但在实际推理过程中仅需激活其中9亿参数,兼顾性能与效率。
该模型聚焦于高保真语音生成与零样本声音克隆能力,用户无需任何微调即可快速生成高度自然、逼真的语音内容。
在技术实现层面,ZONOS2直接预测DAC离散音频标记,原生支持44.1kHz录音室级音质输出;同时彻底取消传统音素解析器,转而直接处理UTF-8字节序列,大幅优化了中文、日文、韩文以及中英文混读场景下的发音准确性和流畅度。训练数据规模也实现跨越式升级——从初代版本的20万小时跃升至超600万小时,并引入多阶段数据清洗机制,显著抑制语音幻觉与文本误读问题。
此外,Zyphra同步推出全新TTS专用评估基准ZTTS1-Eval。ZONOS2模型权重以Apache 2.0协议完全开放,GitHub上已提供完整推理代码;同时,用户还可通过Zyphra云平台享受限时免费在线体验服务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












