通义听悟需开启说话人分离功能才能准确区分会议中不同发言者。上传前确保录音含至少两位清晰发音者,格式为mp3/wav/m4a/flac/mp4且≤500mb;网页端或app端上传时须勾选“区分发言人”,转写后可手动修正或合并说话人标签。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让通义听悟准确区分会议中不同人的发言内容,避免多人声音混在一起导致纪要错乱、责任归属不清。
上传音频前确认基础条件
确保原始录音文件中至少包含两位发音清晰、语速适中、无严重重叠的说话人。单人独白或两人全程同时抢话的音频,系统无法可靠分离角色。
检查音频格式是否为MP3、WAV、M4A、FLAC或MP4,单文件不超过500MB。其他格式(如AMR、OGG)需先转码,否则上传后会直接报错“不支持的文件类型”。
【必须开启说话人分离功能,否则默认输出为无角色标记的连续文本】
网页端上传并启用发言人识别
方法一:直接上传本地文件
1. 登录 https://tingwu.aliyun.com/ → 点击首页「上传音视频」→ 选择本地音频文件 → 等待上传完成。
2. 在转写设置弹窗中,勾选「区分发言人」→ 若已知人数(如3人会议),可在「说话人数」下拉菜单中选“3”;若不确定,保持默认“自动识别”。
3. 点击「开始转写」→ 系统启动声纹聚类分析,耗时约为音频时长的1/8(例如60分钟音频约需7~8分钟)。
方法二:从阿里云盘导入(适合批量处理)
先绑定个人阿里云盘账号 → 在上传页切换至「从阿里云盘导入」标签 → 进入对应文件夹 → 多选音频 → 勾选「区分发言人」→ 一次性提交转写任务。
手机App端操作路径
打开通义听悟App → 底部导航栏点「我的」→ 右上角「+」→ 选择「上传音视频」→ 从相册或文件管理器选取目标文件。
进入转写参数页后,滑动到底部找到「高级选项」→ 开启「说话人分离」开关 → 若录音环境嘈杂,建议同步开启「降噪增强」(该选项会略微延长处理时间,但能提升声纹区分准确率)。
点击「确认转写」→ 转写完成后,返回列表页,该条目右上角会出现「?」图标,表示已启用发言人识别。
验证与修正发言人标签
转写完成进入文本页后,每段文字左侧会显示“说话人1”“说话人2”等临时标识。这不是最终角色名,只是系统聚类结果。
点击任意一段左侧的说话人编号 → 弹出编辑框 → 可手动修改为真实姓名或角色(如“张经理”“李工”“客户代表”)。修改后,全文同声纹段落将自动同步更新标签。
注意:若发现同一人被拆成两个编号(如“说话人1”和“说话人3”实际是同一人),说明声纹特征在录音中发生明显变化(比如中途接电话、捂住话筒、音量骤变),此时需长按其中一段 → 选择「合并为同一说话人」→ 系统重新校准声纹边界。











