必须同步打通asr、多模态理解、tts三段通路,缺一不可;需启用工作区多模态能力、配置asr(内置或第三方)、绑定multimodal大模型、接入tts并正确映射audio_url,最后通过日志验证全流程。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在扣子平台实现用户通过语音提问、智能体实时听懂并语音回复的完整链路,必须同步打通输入端语音识别(ASR)、中间层多模态理解、输出端语音合成(TTS)三段通路——漏掉任一环节,语音消息就会卡在“正在转写”状态或直接变成文字气泡,用户永远听不到一句人声回复。
确认工作区已启用多模态能力
登录扣子后台 → 点击左上角头像 → 进入「设置」→ 找到「高级功能」选项卡 → 开启「多模态输入支持」开关。
这一步不可跳过。未开启时,即使后续接入了语音插件,用户发送的语音也会被自动过滤,【系统不会报错,但所有多模态节点将静默失效】。
配置语音识别(ASR)服务
方法一:使用扣子内置ASR插件(推荐新手)
进入智能体编辑页 → 左侧工具栏点击「插件」→ 搜索“语音识别” → 选择官方「语音转文字(ASR)」插件 → 点击「添加」→ 在插件配置中勾选「启用实时流式识别」。
方法二:对接第三方ASR API(适合已有语音服务的企业)
在「插件」→「自定义HTTP插件」中新建插件 → 填写ASR服务商提供的POST接口地址(如阿里云智能语音交互的/v1/asr)→ 设置Header含Authorization和Content-Type → 请求体Body模板中插入变量{{audio_base64}} → 输出字段映射为text。
注意:若使用方法二,音频编码格式必须为PCM(16kHz、单声道、16bit),其他格式(如MP3、OPUS)会导致识别失败且无错误提示。
绑定适配语音任务的大模型
进入智能体编辑页 → 点击右上角「模型设置」→ 在模型列表中筛选带「multimodal」标签的模型(如「Doubao-Pro-VL」「Qwen-VL-Plus」)→ 点击选中并保存。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
普通文本模型(如「Doubao-7B」)无法解析语音特征向量,强行使用会导致输入中断在预处理阶段;而部分标有「VL」但未标注「multimodal」的模型,实测仅支持图文对齐微调,不支持端到端跨模态推理——务必认准官方标注。
接入TTS语音合成服务
第一步:在插件市场搜索并添加「语音合成(TTS)」官方插件
第二步:点击插件右侧「配置」→ 选择音色(推荐「zh-cn-xiaoyan」女声或「zh-cn-yunxi」男声)→ 设置语速为1.0 → 勾选「启用流式音频输出」
第三步:在工作流中,将大模型节点的text输出连接至TTS插件的input字段
第四步:TTS插件输出字段audio_url需映射至最终响应节点的audio_url参数
若需支持多语言TTS,必须在「设置中心」→「基础配置」→「启用多语言交互」开关打开,并在TTS插件配置中手动指定lang参数(如en-US、ja-JP),否则默认只合成中文。
测试与调试语音链路
进入智能体「测试」页 → 点击麦克风图标开始说话 → 观察左侧日志面板是否出现「ASR完成」「模型推理完成」「TTS生成成功」三段连续日志。
若卡在ASR环节:检查浏览器是否授予麦克风权限,且当前页面为HTTPS协议(HTTP下Chrome禁用麦克风API)。
若TTS返回空白音频:确认TTS插件输出字段是否正确映射到响应节点的audio_url,【audio_url必须是直链可播放的MP3或WAV地址,不能是JSON对象或base64字符串】。










