纳米ai语音输入有五种激活路径:一、手机app端一键语音输入;二、网页版语音搜索+写作联动;三、拍照+语音双模输入;四、siri/小爱同学快捷指令集成;五、本地部署百聆语音助手接入纳米ai后端。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已打开纳米AI搜索应用或访问其网页版,但尚未实现“说话即成文”的语音输入体验,则可能是由于未启用语音通道、未授予权限或未选择匹配的输入模式。以下是激活并高效使用纳米AI语音输入功能的多种可行路径:
一、手机APP端一键语音输入
该方法直接调用设备系统级语音识别服务,无需额外安装插件,兼容安卓与iOS主流机型,识别响应快、操作链路最短,适合日常快速记录与内容初稿生成。
1、打开纳米AI搜索App,确保已登录账号并进入首页对话界面。
2、点击输入框,唤出软键盘;在键盘左下角找到并点击麦克风图标(部分安卓输入法需长按空格键调出)。
3、开始清晰、匀速口述内容,例如“请帮我写一篇关于‘人工智能对教育公平的影响’的议论文提纲”,系统实时转写为文字。
4、转写完成后,可直接点击发送按钮提交至纳米AI模型处理;若需即时生成全文,可在发送后追加指令如“据此提纲扩写成1200字完整文章”。
5、如希望AI以语音播报生成结果,点击回复消息下方的扬声器图标即可触发TTS朗读,支持调节语速与音色(需在“设置→语音输出”中提前开启)。
二、网页版语音搜索+语音写作联动
该方案依托纳米AI官网提供的多模态交互入口,将语音输入与AI深度思考能力结合,支持边说边生成结构化文本,适用于撰写报告、邮件、学习笔记等中长文本场景。
1、使用Chrome或Edge浏览器访问纳米AI搜索官网(https://www.nami.ai),登录账户后进入主搜索界面。
2、在顶部搜索框右侧点击话筒图标,授权网站使用麦克风权限(首次需手动允许)。
3、口述明确指令,例如“用学术语言写一段关于‘大模型幻觉成因’的300字说明,并分三点列出关键机制”,系统自动完成语音转写与AI生成。
4、生成内容默认以文本呈现,点击文本区域右上角的“语音播放”按钮,即可听取AI朗读版本,便于校对语感与逻辑流。
5、如需连续口述修改意见,例如“把第二点改成更通俗的例子”,可再次点击话筒图标继续语音输入,系统自动上下文关联处理。
三、拍照+语音双模输入协同工作流
该方法突破纯语音局限,适用于需结合图像信息生成文字的场景,例如解读图表、翻译外文标识、描述实物特征后生成说明文案,实现“所见即所说、所说即所写”的闭环。
1、在纳米AI App首页,点击输入框旁的相机图标,拍摄或从相册选取一张含文字/图形的图片(如会议白板、产品说明书局部)。
纳米AI是一款基于人工智能大模型技术开发的智能应用工具,主要用于提供AI问答、内容生成、信息整理与智能搜索辅助等功能。用户可通过自然语言交互方式获取结构化信息与文本内容,用于学习、办公及内容创作等多种场景。
2、上传成功后,点击图片下方出现的“语音补充说明”按钮,口述需求,例如“这是某新能源汽车的电池参数表,请提取核心指标并写成面向消费者的一段宣传文案”。
3、系统同步解析图像OCR文本与语音指令,融合生成目标内容,避免纯语音描述图像细节时的模糊与遗漏。
4、生成结果支持一键复制、导出为TXT或分享至微信,亦可点击“重听生成过程”回溯AI理解逻辑,便于验证信息准确性。
四、Siri/小爱同学快捷指令深度集成(iOS/安卓高阶用户)
该方案通过系统自动化将语音唤醒、文本转写、API调用、语音合成四步封装为单次触发动作,全程免触屏,真正实现“张嘴即写作”,适合通勤、驾驶等双手受限场景。
1、iOS用户:打开“快捷指令”App,点击右上角“+”新建指令,添加“听写文本”操作,语言设为中文;安卓用户:在“小爱同学”App中进入“自定义指令”,创建新语音命令。
2、添加“URL获取”操作(iOS)或“HTTP请求”操作(安卓),填写纳米AI官方API端点(https://api.nami.ai/v1/chat/completions),设置POST方法与Header:Content-Type为application/json,Authorization为Bearer + 您的纳米AI API Key。
3、将听写文本变量嵌入JSON请求体的messages字段,同时配置response字段为text,确保返回纯文本结果。
4、添加“朗读文本”操作(iOS)或“TTS播报”操作(安卓),将API返回内容作为输入源,选择自然度高的语音引擎。
5、保存指令并命名为“纳米写作”,随后对Siri说“嘿Siri,纳米写作”,或对小爱同学说“小爱同学,纳米写作”,即可启动全语音写作流程。
五、本地部署百聆语音助手接入纳米AI后端
该方案基于开源项目百聆(Bailing),在本地设备运行语音识别与合成模块,所有语音数据不出设备,保障隐私安全,同时支持离线识别与毫秒级响应,适合对数据敏感的专业创作者与企业用户。
1、从GitHub克隆百聆项目仓库(https://github.com/bailing-ai/bailing),执行pip install -r requirements.txt安装依赖。
2、下载SenseVoice-small离线语音识别模型,放入models目录;配置config.yaml文件,将nano_api_url字段指向纳米AI的私有API网关地址。
3、在config.yaml中填入您的纳米AI平台颁发的API Key,并设定语音输入采样率(推荐16kHz)、静音阈值(建议0.02)等参数。
4、运行python app.py启动服务,终端显示“Listening…”后,即可对麦克风说出指令,例如“根据我上周会议录音要点,生成一份待办事项清单”。
5、AI生成结果将同步显示于终端窗口,并由本地TTS引擎实时播报,所有音频与文本均保留在本机,不上传任何原始语音片段。










