需借助外部asr与文本生成协同实现语音转文字及回复,因deepseek v4本身无内置语音直采与端到端理解能力,但可通过网页扩展、手机系统输入、本地脚本、第三方平台或ios快捷指令五种路径构建闭环。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用DeepSeek V4时希望将语音消息自动转为文字并生成回复,需借助外部语音识别(ASR)与文本生成协同机制。DeepSeek V4本身不内置麦克风直采或端到端语音理解能力,但可通过结构化接入实现“语音输入→文字转写→AI处理→语音/文本回复”的闭环。以下是多种可立即实施的技术路径:
一、网页端+VoiceWave扩展实现语音转文字与自动回复
VoiceWave扩展在Chrome中为DeepSeek V4提供实时语音输入通道,其底层调用浏览器Web Speech API进行语音识别,并将识别结果自动填入输入框触发V4响应。该方案无需API密钥,适合日常轻量交互。
1、访问 https://voicewave.xyz/zh/voice-mode-for-deepseek/ 下载并安装VoiceWave Chrome扩展。
2、打开DeepSeek V4官网,确保页面加载完成,在输入框右侧点击 ⚙ 图标进入设置。
3、将语音识别语言设为“中文(简体)”,TTS语音类型选择“女声-自然语调”,启用“松开即发送”模式。
4、点击输入框外任意位置,按住键盘X键开始说话,松开后语音自动转为文字并提交至DeepSeek V4。
5、等待V4生成回复后,点击回答下方的扬声器图标即可播放语音回复。
二、手机端通过系统语音输入+粘贴触发V4处理
安卓与iOS均支持系统级语音转文字服务,该服务输出纯文本后可直接粘贴至DeepSeek V4对话框,由V4完成语义理解与结构化回复,规避了模型对原始音频的不可见性问题。
1、在DeepSeek V4手机网页版或兼容App中,点击输入框唤出软键盘。
2、安卓用户长按空格键激活语音输入;苹果用户点击键盘左下角麦克风图标启动听写。
3、清晰说出内容,系统完成转写后,点击“完成”或“发送”按钮退出语音界面。
4、确认转写文本无误,点击输入框内任意位置,再点击“粘贴”将文字插入。
5、手动点击发送,DeepSeek V4即以文本形式返回处理结果;如需语音播报,可用系统“朗读屏幕”功能辅助收听。
三、本地脚本链:Whisper离线转写 + DeepSeek V4 API自动调用
对于隐私敏感或需批量处理语音文件的场景,可部署Whisper.cpp等轻量级离线ASR模型,将音频转为文本后,通过curl或Python脚本调用DeepSeek V4官方API完成推理,全程不上传原始语音至云端。
1、从GitHub下载Whisper.cpp Windows预编译包(v1.7.0+),解压至本地目录。
2、将语音文件(.wav/.mp3)放入同一文件夹,运行命令:.\main.exe -m ggml-base.bin -f input.wav -otxt,生成input.wav.txt。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
3、使用Python脚本读取该txt文件内容,构造JSON请求体,其中messages字段包含role:"user"与content:转写文本。
4、向https://api.deepseek.com/v1/chat/completions发起POST请求,Header中设置Authorization为Bearer + 您的API Key。
5、解析返回JSON中的choices.0.message.content字段,提取V4生成的回复文本并保存为output.txt。
四、第三方平台代理:纳米AI搜索网页端一键语音接入
纳米AI搜索已深度对接DeepSeek V4模型,其前端集成了浏览器原生MediaRecorder API,可直接采集麦克风流并交由后端完成ASR+LLM联合推理,用户仅需单次点击即可完成“说→听”全流程。
1、访问https://nanoai.search/,点击首页“深度思考”按钮进入DeepSeek V4交互页。
2、在聊天窗口中点击麦克风图标(PC端)或左下角外放按钮(移动端)启动语音采集。
3、说话完毕后自动停止录音,界面显示“正在思考中…”状态。
4、V4生成回复后,页面自动显示文字结果,并在右下角出现“朗读”按钮。
5、点击该按钮,系统调用Web Speech Synthesis API实时播报回复内容,支持暂停与语速调节。
五、iOS快捷指令自动化:Siri唤醒→语音转写→V4请求→语音播报
苹果设备用户可通过快捷指令APP构建全链路自动化流程,实现“对Siri说一句话”即可完成语音采集、转写、调用DeepSeek V4、语音合成四步操作,无需手动打开任何应用。
1、打开“快捷指令”App,点击右上角“+”,命名指令为“DeepSeek语音问答”。
2、添加操作“听写文本”,语言设为“中文(简体)”,启用“始终使用此语言”。
3、添加“获取URL内容”操作,URL填写https://api.deepseek.com/v1/chat/completions,方法改为POST。
4、在“头部”中添加两项:Content-Type: application/json 与 Authorization: Bearer [您的API Key]。
5、在“请求体”中添加字段:model为deepseek-v4,messages为含role/user和content/听写文本的数组。
6、添加“获取词典值”,键为choices.0.message.content;再添加“朗读文本”,音调设为“自然”,启用“后台朗读”。









