☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

7月6日,阿里巴巴正式发布升级版流式语音实时识别大模型——Fun-ASR-Realtime。该模型在保持极低延迟的同时,识别精度逼近离线模型水平:首字响应延迟稳定在百毫秒以内,长句尾字输出延迟同样出色;支持16种中文方言及30种全球语言,覆盖范围广泛。
在7月2日落幕的影视飓风“重返荒岛”100小时极限直播中,Fun-ASR-Realtime全程承担实时字幕生成任务,累计输出字幕超六万条、总字数达132万,成功应对高强度、多变声源与复杂环境挑战。
语音识别技术通常划分为离线型与实时型两类:前者适用于已录制完成的音频整体处理,追求极致准确率;后者则需边输入边识别,对速度与精度提出双重严苛要求,广泛应用于直播字幕、会议速记、智能客服等低时延关键场景。
此次迭代后的Fun-ASR-Realtime实现了“快”与“准”的深度协同。在响应速度方面,模型做到话音刚起、文字即现,首字延迟控制在百毫秒量级;即便面对冗长语句,尾字输出亦无明显滞后。以“重返荒岛”直播为例——节目涉及双岛多人高频互动、说话人频繁切换、规则动态调整,叠加突发暴雨干扰,系统仍能即时呈现Tim与中国boy等嘉宾发言内容,显著提升观众沉浸感与信息获取效率。
在识别准确性方面,Fun-ASR-Realtime已逼近其配套离线模型Fun-ASR-Flash的表现,并特别强化了泛Context建模能力(涵盖历史对话上下文与实时热词注入),具备上下文感知与动态纠错能力。例如,在直播中Tim提及“夜鹭”一词,初期被误识别为“叶鹿”,但结合后续语境“观鸟的朋友应该知道”,模型迅速完成修正。

图说:影视飓风“重返荒岛”100小时直播期间,Fun-ASR-Realtime依托上下文理解能力,将初始误识的“叶鹿”精准校正为“夜鹭”。
相比当前主流实时语音识别方案,Fun-ASR-Realtime展现出更全面的语言适配能力,支持16种方言与30种语言。在覆盖全国八大方言区的16种方言专项测评中,其平均字符准确率达88.62%,于12类方言测试中位居榜首,表现优于火山引擎与腾讯相关产品。尤其在公认难度最高的吴语体系中,上海话与苏州话识别准确率分别高达92.41%和89.21%;而素有“最难懂方言”之称的温州话,准确率亦达82.74%。此外,在福建话、客家话等复杂方言识别上,该模型同样实现全面领先。

图说:Fun-ASR-Realtime在16种方言识别横向评测中综合表现最优。CER为字符错误率(Character Error Rate),1−CER即为字符准确率。
在面向工业落地的5类典型中文与英文语音场景评测中——包括强背景噪声、远场拾音、多方言口音混杂等复杂条件——Fun-ASR-Realtime依旧保持稳健输出,中文平均字符准确率为88.42%,英文达91.58%,均处于行业领先位置。

图说:Fun-ASR-Realtime在5类工业级中英文语音识别横向对比中稳居前列。
针对泰语等东亚及东南亚多语种场景,模型进行了定向优化,识别准确率整体提升达20%,可高效支撑出海企业客服系统、跨国会议同传等国际化应用需求。
与此同时,Fun-ASR-Realtime对应的离线识别模型Fun-ASR-Flash也已同步上线。在全球权威AI评测平台Artificial Analysis榜单中,Fun-ASR-Flash(曾用名“Fun-realtime-ASR-preview”)以1.7%的错字率荣登全球第一。

目前,Fun-ASR-Realtime与Fun-ASR-Flash均已正式接入阿里云百炼平台,面向开发者开放调用。
Fun-ASR-Realtime:
https://www.php.cn/link/568f7cad7966985188ed28c5810d7c96
Fun-ASR-Flash:











