9月24日讯,据谷歌官方消息,google正式推出gemini 3.8 flash tts与gemini 3.8 flash-lite tts两款全新文本转语音模型,推动语音生成技术由传统静态预设迈入动态创意生产新阶段。
其中,Gemini 3.8 Flash TTS聚焦深度创意与角色塑造,允许用户通过自然语言提示从零构建专属语音,广泛适配游戏开发、沉浸式有声读物、播客制作及交互式媒体等场景;Gemini 3.8 Flash-Lite TTS则侧重于高吞吐、高性价比的大规模语音产出,专为批量配音、富表现力音频内容生成及智能语音代理优化设计。
二者均具备逐行表演指导能力——用户可自定义舞台指令,或交由模型依据脚本语境智能演绎;支持数小时连续高质量音频输出,角色音色稳定、漂移极低;原生支持单脚本双声轨编排,实现自然流畅的多角色对话轮换。此外,模型集成语音复刻(仅需30秒样本)、语音混音(即将上线)、自定义语音保存管理,以及多重安全机制:强制语音所有者授权验证、嵌入不可见SynthID水印、C2PA内容凭证认证,全面保障声音权益与内容可追溯性。
在 Go 中使用 google/wire 实现编译时依赖注入——wire.NewSet、wire.Build、wire.Bind(接口→实现)、wire.Struct、wire.Value、wire.Interface
性能方面,Gemini 3.8 Flash TTS在Hume AI语音设计综合基准测试中斩获71.4分,位居榜首;口音建模达60.8分,同样领跑行业。两款模型均已登陆Google AI Studio开放体验,Figma、HeyGen等生态伙伴亦启动集成工作。企业级服务将通过Gemini Enterprise API提供,普通用户则可在Gemini Notebook与Google Vids中直接调用。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜











