讯飞听见ai语音识别通过声纹建模、上下文语义与降噪协同实现高鲁棒性多角色对话分离,依托高质量音频输入、动态说话人聚类算法及星火大模型逻辑校验,支持3–8人会议自动聚类与分角色摘要生成。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

讯飞听见的AI语音识别在多角色对话分离上,不是简单“听出不同声音”,而是通过声纹建模、上下文语义和降噪协同判断,实现高鲁棒性的角色区分。核心支撑来自三方面:高质量音频输入、动态说话人聚类算法、以及星火大模型对发言逻辑的校验。
降噪是分人的前提
多人会议中空调声、翻页声、键盘敲击等干扰会模糊人声边界。讯飞AI录音卡搭载自研听感降噪算法,针对80+大类、近千种办公噪音做专项优化,优先保留人声频段,过滤环境杂音。只有人声清晰,后续的声纹提取才有可靠基础。
- 实测显示,在65分贝背景噪音下(接近普通会议室空调+投影仪运行声),说话人分离准确率仍保持在92%以上
- 设备支持4mm超薄磁吸设计,贴合手机或桌面摆放,减少因位置偏移导致的拾音失衡
- 不依赖额外麦克风阵列,单设备即可完成有效分离,适合临时会议室、咖啡厅等非标环境
自动聚类,不预设人数
系统不强制要求提前输入说话人数量。它基于实时音频流,用改进型i-vector + PLDA模型对声纹特征持续聚类,在发言切换、停顿间隙动态合并或拆分说话人簇。即使中途有人加入或离场,也能逐步收敛到稳定角色标签。
- 支持区分3–8人常规会议场景,交叉发言频繁时仍能维持角色一致性
- 网页端/客户端均默认开启该功能,无需手动设置人数;如已知固定角色(如“甲方”“乙方”),可在录音后快速备注替换默认编号
- 同一人短时间离席再发言,系统会基于声纹相似度自动归并,避免生成多个碎片化角色
AI校验提升结构可信度
单纯靠声纹容易混淆音色相近者(如两位年轻女性)。讯飞引入星火大模型,结合上下文语义做二次校验:比如某句“我负责下周交付”大概率出自负责人角色,若此前标注为“发言人3”,而“发言人3”在前10分钟内多次使用“我们组”“我来跟进”等表述,模型会强化该角色归属。
- 会后可一键生成“分角色摘要”,每段提炼不超过3个要点,直接对应原始音频时间戳
- 支持点击任意发言段落,跳转至对应音频位置,实现“文字→声音”双向溯源
- 若发现误标(如把领导发言标成同事),可批量修改说话人名称,系统同步更新所有关联摘要与时间轴
整个流程不依赖人工预设或复杂配置,从录音开始到分角色纪要输出,平均耗时比传统整理缩短80%。关键在于——它把“听清谁在说”这件事,从经验判断变成了可复现、可验证的技术链路。











