workbuddy 依赖外部 voicebox 服务实现客服录音转写,通过 mcp 协议打通“录音输入→voicebox 识别→任务执行”链路,支持拖拽上传、自然语言指令触发、双角色区分与结果编辑优化。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy 本身不内置语音识别模型,它依赖外部语音能力模块(如 Voicebox)来完成客服录音的转文字任务。识别客服录音的关键不在 WorkBuddy 界面点选某个“语音模型”,而在于打通录音输入 → Voicebox 语音识别服务 → WorkBuddy 任务执行这一链路。以下是清晰、可落地的操作步骤:
使用 draw.io(.drawio 格式)和 SVG 生成兼容 Microsoft Visio 的架构图。当用户需要以下任一场景时触发: - 用于 Visio 或技术文档的架构/系统/网络图 - 带连接标注的分层控制系统图 - 将 draw.io XML 转换为稳定、可嵌入的 SVG - 修复 Visio 或 draw.io 无法打开的故障排查类图表 - 任何需专业级布局且文本可编辑的图表
一、确认基础环境已就绪
- WorkBuddy 桌面端已安装并登录(支持 Windows/macOS,需联网);
- 本地已部署 Voicebox 服务(不是下载一个模型文件,而是运行一个 Python 服务进程);
- Voicebox 配置中已指定支持中文客服场景的 STT 引擎(例如 Whisper.cpp、FunASR 或 VAD+Whisper 组合),且模型权重已下载到本地路径;
- WorkBuddy 的 MCP 连接器已启用,并指向你本机运行的 Voicebox 地址(默认
http://127.0.0.1:8000)。
二、上传客服录音文件
- 支持格式:MP3、WAV、M4A、FLAC(推荐 WAV 无损格式,识别更稳);
- 单文件建议 ≤ 200MB,时长建议 ≤ 2 小时(超长录音建议分段);
- 在 WorkBuddy 对话区直接拖入音频文件,或点击「+」→「上传文件」选择录音;
- 上传后,WorkBuddy 会自动识别为语音类输入,并准备调用 Voicebox。
三、触发语音转写任务
- 上传完成后,在对话框输入自然语言指令,例如:
- “把这段客服录音转成文字,保留说话人区分”
- “提取录音中客户提出的所有问题,按条列出来”
- “总结这段售后通话的核心诉求和处理结果”
- 不需要手动选择“模型”或“语种”——WorkBuddy 会根据音频内容自动判断为中文,并通过 MCP 协议将请求转发给 Voicebox;
- Voicebox 接收后,调用你配置好的 STT 引擎进行识别(如使用 FunASR,会自动启用 VAD 切分+标点恢复+角色分离)。
四、查看与优化识别结果
- 转写完成后,文字稿直接显示在结果区,支持:
- 时间戳对齐(可点击某句跳转对应音频位置);
- 自动区分“客服”“客户”双角色(需录音声道分离或语音活动检测准确);
- 关键信息高亮(如手机号、订单号、投诉关键词等,由 WorkBuddy 后续 NLP 模块提取);
- 若识别有误(如专有名词、方言、背景噪音干扰),可在结果区直接编辑修正,WorkBuddy 会记忆该术语,后续类似发音识别准确率提升。
整个过程无需打开命令行、不需写代码、不涉及模型参数调整。真正起作用的是 Voicebox 的协议桥接能力和 WorkBuddy 的上下文理解力——它把“听录音”这件事,变成了和打字提问一样自然的操作。










