扣子平台可零代码实现音频转文字及结构化提炼:先启用whisper插件并配置文件输入节点,再通过大模型节点用固定格式或json输出结论、待办事项和决策点,最后添加校验、错误处理与文本清洗机制确保稳定性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要把会议录音、访谈音频或播客文件上传后,自动转成文字并提炼出关键结论、待办事项和决策点,而不是手动听写再整理——扣子(Coze)平台能用零代码方式实现这个流程,前提是正确配置语音识别与文本结构化两个核心模块。
准备音频输入与转录基础能力
第一步:在扣子 Bot 设置页 →「插件」→ 点击「+ 添加插件」→ 搜索并启用「Whisper Audio Transcription」插件。该插件调用 OpenAI Whisper 模型,支持 MP3/WAV/M4A 格式,【单次上传音频时长不能超过 25 分钟】,超时会静默失败且不报错。
第二步:回到 Bot 编辑页 →「工作流」→ 新建节点 → 选择「用户输入」→ 类型设为「文件」→ 允许格式勾选 mp3、wav、m4a。这一步必须做,否则用户无法上传音频文件。
第三步:添加「插件节点」→ 选择刚启用的 Whisper 插件 → 将上一节点的「文件」输出拖入插件的「audio_file」输入槽。注意:不要手动填 URL 或 Base64,插件只认扣子原生文件对象。
设计会议要点结构化提取逻辑
方法一:用内置大模型节点直接解析
在 Whisper 转录节点后接一个「大模型」节点 → 模型选「Qwen-2.5-72B」或「GLM-4-Flash」(响应快、中文强)→ 系统提示词写:「你是一名专业会议秘书。请严格按以下格式输出:【结论】:……;【待办事项】:1. …… 2. ……;【决策点】:……。禁止添加解释性语句,禁止使用项目符号以外的任何标记。」
用户原始音频转出的文字会自动流入此节点,模型将原文压缩为三段式结构。这一步操作起来很简单,直接把 Whisper 的「transcript」字段连过去就行。
PHP中文网提供Qwen-1.0.2.6 MacOS官方客户端下载,专为苹果电脑优化的阿里通义千问桌面应用。本版本深度适配Mac系统,支持本地高效运行与多模态交互,集成超长上下文处理、AI写作、代码生成及智能体构建等核心功能。通过官方渠道下载,确保安全稳定,助您实现智能办公与创作升级。
方法二:用结构化 JSON 指令提升稳定性
在大模型节点中,把系统提示词改为:「输出必须是合法 JSON,字段固定为 conclusion(字符串)、action_items(字符串数组)、decisions(字符串数组)。不加任何说明文字,不加 markdown,不加```json```包裹。」
然后在后续节点用「JSON 解析」插件提取字段,再分别映射到 Bot 回复的不同段落。这样能避免模型自由发挥导致格式错乱,尤其适合对接企业微信或飞书机器人场景。
配置多格式兼容与错误兜底机制
第一步:在用户输入文件节点开启「文件类型校验」→ 设置「不支持类型提示语」为“请上传 mp3、wav 或 m4a 格式音频”。
第二步:在 Whisper 插件节点后加一个「条件分支」→ 判断「transcript」是否为空 → 若为空,则走「失败路径」→ 发送固定回复:“音频可能过长、静音过多或格式损坏,请检查后重试。”
第三步:为防止 Whisper 对方言/多人混音识别不准,在大模型节点前插入一个「文本清洗」节点 → 使用正则替换掉连续空行和异常符号(如\u200b\u200c),【清洗前务必保留换行符,否则模型会丢失说话人分段信息】。
第四步:发布前,在 Bot 测试窗上传一段含背景音乐的 Zoom 录音(MP4 转成 M4A 后测试),确认转录结果无大面积乱码,且待办事项能准确提取出“张三周五前提交方案”这类带责任人和时间节点的条目。










