讯飞听见通过端到端模型架构、长时上下文建模与工程级优化三方面协同提升长音频处理稳定性;采用conformer和改进型transformer实现最长5小时全局建模;结合动态语音分割与上下文缓存实现“分而不断”;集成多层级鲁棒性增强设计;支持17个专业领域模型切换及200个中文热词注入。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

讯飞听见通过端到端模型架构、长时上下文建模与工程级优化三方面协同,显著提升长音频处理稳定性,避免传统ASR在会议、课程等场景中常见的准确率衰减问题。
基于Transformer的全局注意力机制
讯飞听见采用Conformer和改进型Transformer架构,其自注意力机制能对整段音频(最长支持5小时)进行统一建模,不依赖分段滑窗。这意味着即使说话人中途停顿、语速变化或插入背景音,模型仍能保持前后语义连贯性,有效缓解长时依赖丢失问题。
动态语音分割与上下文缓存技术
系统并非简单“一气呵成”处理整条长音频,而是结合声学边界检测与语义连贯性判断,智能划分逻辑片段(如发言轮次、话题切换点),并在片段间保留关键上下文缓存。这种“分而不断”的策略既保障实时性,又避免因单次推理过长导致的显存溢出或精度下降。
多层级鲁棒性增强设计
- 音频预处理层:集成降噪、回声抑制、人声增强模块,针对教室混响、会议室空调噪声、远程会议网络抖动等典型长音频干扰源做定向优化;
- 模型训练层:使用大量真实会议、课堂、播客长录音数据进行对抗训练,强制模型学习跨分钟级语义一致性;
- 后处理层:AI自动标点+段落切分+说话人角色聚类,将原始流式输出结构化,减少人工整理负担,间接提升结果可用稳定性。
专业领域适配与热词注入能力
针对金融财报解读、医疗查房记录、法律庭审等专业长音频场景,讯飞听见支持17个垂直领域模型切换,并允许用户上传最多200个中文热词(如“CIPS系统”“腹腔镜下胆囊切除术”)。这些术语在模型解码阶段被动态加权,大幅降低专有名词误识别率,尤其在持续数十分钟的专业叙述中效果明显。











