语音输入功能由本地 whisper 引擎驱动,全程离线运行,与所选大模型无关。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy所有支持语音输入的场景,底层都依赖本地 Whisper 引擎完成语音识别,与当前所选大模型无关——也就是说,无论你切换成混元、GLM 还是 Kimi,语音转文字功能都照常运行,因为它是独立于大模型的本地 ASR 模块。
语音输入功能由谁驱动?
WorkBuddy 的语音识别采用 Whisper 本地化部署,不调用任何云端 API,全程离线运行。它在沙箱环境中直接处理麦克风流或音频文件,输出文本后才交由当前选定的大模型进行后续理解、提炼或格式化。因此【语音转文字能力不取决于你选了哪个大模型,而取决于是否启用了语音输入开关】。
使用 draw.io(.drawio 格式)和 SVG 生成兼容 Microsoft Visio 的架构图。当用户需要以下任一场景时触发: - 用于 Visio 或技术文档的架构/系统/网络图 - 带连接标注的分层控制系统图 - 将 draw.io XML 转换为稳定、可嵌入的 SVG - 修复 Visio 或 draw.io 无法打开的故障排查类图表 - 任何需专业级布局且文本可编辑的图表
如何开启并使用语音输入?
1、点击 WorkBuddy 主界面右下角头像 →「设置」→「语音交互」→ 开启「麦克风输入」和「自动语音识别」两项开关。
2、返回主聊天窗口,点击输入框左侧的麦克风图标(不是键盘图标),系统开始监听。
3、说话时界面会实时显示“正在识别中…”字样,停顿约1秒后自动提交文字内容到对话框。
4、语音识别结果将作为普通文本参与后续推理——此时才轮到大模型出场,比如你刚说完“把刚才的会议录音整理成纪要”,这句话会被 Whisper 转成文字,再由你当前设定的模型(如 GLM)执行技能调用。
不同模型对语音任务的实际影响
方法一:用混元处理口语化指令最顺滑
例如你说“把刚录的周会转成文字发我微信”,混元能快速匹配 send_to_wechat 技能,响应延迟最低。
方法二:用 GLM 处理需调用文件技能的语音链路最稳
比如你口述“读取桌面audio\q3-review.wav,转写后生成带时间戳的PDF”,GLM 对 audio_skill + pdf_export_skill 的串联成功率近100%,其他模型可能卡在第二步。
方法三:Kimi 不适合纯语音触发的文件操作
【Kimi-K2.5-Thinking 在语音指令中调用本地文件系统时,大概率返回 permission_denied: no file system access 错误】,它擅长听清后做逻辑推演,但不擅长“听指令→找文件→执行”这一整条动作链。










