语音生图功能需从「一句话生大片」入口进入,点击麦克风说清描述,选nano banana pro模型和1:1或4:3比例,25~38秒生成高清png图。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用说话的方式直接生成图片,不用打字、不拼提示词、不调参数——对着麦克风说一句“夕阳下的海边咖啡馆,藤编座椅,玻璃幕墙反光,胶片颗粒感”,30秒内就能拿到高清图。
确认语音生图功能可用
打开浏览器访问 https://bot.n.cn/ → 登录账号 → 页面加载完成后,**不要点首页任何智能体卡片** → 直接滚动到页面中部偏下位置,找到「一句话生大片」蜂群模块 → 点击右侧【立即体验】按钮 → 进入后切换顶部标签栏至「图片生成」页。
这一步必须走对:如果看到的是“视频生成”或“智能体广场”,说明路径错误。只有从「一句话生大片」入口进,语音识别引擎才会自动激活,否则麦克风按钮根本不会出现。
开启麦克风并说出完整描述
在图片生成页中央的大文本框左侧,点击麦克风图标 → 系统提示“请开始说话”后,清晰说出你的完整画面描述,例如:“一只柴犬戴着草帽坐在阳台秋千上,背景是盛夏的蓝花楹树,阳光透过树叶洒下光斑,水彩手绘风格”。
语音输入有严格长度限制:单次录音不得超过18秒,超时会自动截断,导致关键信息丢失。建议提前在备忘录里写好描述,念的时候语速平稳、不拖音、不换气停顿过长。
纳米AI是一款基于人工智能大模型技术开发的智能应用工具,主要用于提供AI问答、内容生成、信息整理与智能搜索辅助等功能。用户可通过自然语言交互方式获取结构化信息与文本内容,用于学习、办公及内容创作等多种场景。
说完后系统自动转文字并填充到文本框,你可手动删改错别字(如“柴犬”被误听为“豺犬”),但不要大段重写——语音模型已对中文语义做了预校准,人工改写反而干扰理解。
设置关键参数并触发生成
下方参数区做两处必要设置:【模型必须选“Nano Banana Pro”】(该模型专为中文语音转图优化,其他模型无法解析语音中隐含的节奏停顿与语气强调)→ 比例选“1:1”或“4:3”(9:16比例会强制压缩构图,主体易变形)。
点击【立即生成】按钮 → 等待约25~38秒 → 生成完成后,预览图下方自动出现三枚图标:放大镜(查看原图)、下载箭头(保存PNG)、重试按钮。
点击下载箭头 → 图片默认以PNG格式保存至电脑默认下载目录,文件名含时间戳和前12个字符的提示词摘要,例如“柴犬戴草帽_202610022327.png”。










