gemini提供四种零成本高保真文本转语音方案:一、storybook生成交互式有声绘本;二、api批量合成精细控制音频;三、omniaudio一键转换文档为mp3;四、本地部署glm-tts实现离线定制化合成。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望将文字内容转化为自然流畅的有声书,但缺乏专业配音资源或预算,Gemini 的文本转语音功能可提供零成本、高保真度的解决方案。以下是具体实施路径:
一、使用 Gemini Storybook 直接生成有声绘本
该方式无需任何本地部署或代码操作,完全依托 Gemini 官方 Web 应用,自动生成含语音、图文与结构化叙事的完整有声故事。适用于短篇、儿童向或主题明确的轻量级有声书项目。
1、打开浏览器,访问 https://gemini.google.com/gem/storybook。
2、在输入框中明确描述:目标读者年龄、核心主题(如“武侠少年成长”)、期望图画风格(如“水墨手绘风”)及叙事语气倾向(如“温暖旁白+角色对话分明”)。
3、点击生成按钮,等待约 90 秒,系统将自动输出带嵌入语音播放控件的交互式网页绘本。
4、点击页面中的播放图标即可收听全书语音,语音由 Gemini 原生 TTS 驱动,支持语速调节与暂停续播。
二、调用 Gemini API 实现自主文本转语音合成
此方法适用于已有完整文本稿、需批量处理章节、或要求精细控制语音参数(如停顿、重音、情感标签)的场景。全程免费,仅需基础开发环境与有效 API 认证。
1、访问 https://aistudio.google.com/ 并登录 Google 账号,进入 Google AI Studio 控制台。
2、创建新项目,在 API 密钥管理页生成 Gemini Pro 或 Gemini 3.1 Pro 的 API Key。
3、克隆官方示例仓库:在终端执行 git clone https://gitcode.com/GitHub_Trending/coo/cookbook。
4、进入 quickstarts/Get_started_TTS.ipynb 文件,按注释提示填入 API Key,并将您的小说文本分段写入 text_input 变量。
5、运行单元格,输出为 WAV 格式音频文件,每段对应一个独立音频轨道,便于后期分轨编辑。
三、通过 OmniAudio 工具实现网页/文档一键转音频
OmniAudio 是一款面向非技术用户的免配置工具,专为将长文本(如 Word、PDF、网页文章)直接转为可下载音频而设计,底层调用 Gemini 语音模型,支持多语种与语速调节。
1、访问 OmniAudio 官方服务入口(当前托管于 omnibook.ai/convert)。
2、粘贴小说正文或上传 .docx/.txt 文件,系统自动识别段落结构并去除格式残留。
3、在语音设置面板中选择 “Gemini-3.1-TTS” 引擎,启用 “情感连贯模式” 开关。
4、点击“生成音频”,进度条完成后可下载 MP3 文件,单次最大支持 50,000 字连续合成。
四、本地部署 GLM-TTS 搭建离线语音工作室
当您需要完全掌控数据隐私、复刻个人声纹、或进行高频次定制化语音训练时,GLM-TTS 提供了无依赖、WebUI 友好的本地部署方案,且全部组件开源免费。
1、在阿里云或腾讯云市场搜索 “GLM-TTS 预装镜像”,选择标注“含 WebUI”与“GPU 加速”的实例规格(推荐 NVIDIA T4)。
2、实例启动后,获取公网 IP,在浏览器中访问 http://[您的IP]:7860 进入图形界面。
3、切换至“基础语音合成”标签页,在文本框内粘贴小说章节,从下拉菜单中选择已训练的中文情感音色(如“沉稳男声_v2”或“温柔女声_emotion”)。
4、点击“合成”按钮,生成的 WAV 文件将自动出现在右侧“输出历史”列表中,支持单击播放与右键下载。











