☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

7月31日,阿里巴巴通义实验室正式推出新一代语音识别大模型——Qwen-Audio-3.0-ASR-Flash,聚焦“长音频精准不漏词、垂直领域术语零配置”,目前已在阿里云百炼平台全面开放API调用。
本次升级涵盖五大核心能力突破:
第一,强化长时序上下文建模能力,支持跨小时级音频语义连贯理解,会议中人物名称、专有技术名词等关键信息全程统一,彻底解决传统ASR在分段处理时的语义断裂问题;
第二,预置多行业高精度词库,医疗领域专业术语识别召回率达95.36%,IT与编程类词汇达91.87%,开箱即用,无需额外标注或微调;
Gemini Notebook网页版是一款基于AI的智能笔记工具,其核心功能是让用户上传个人文档(如PDF、文本等),并以此为基础进行交互。它能针对你的资料进行总结、解答疑问、生成新内容,让信息处理更高效。该版本为在线使用,无需下载安装。
第三,支持分级热词动态注入机制,企业专属术语可秒级生效,主流业务场景下召回率普遍超99%,且不受热词规模扩大影响识别稳定性;
第四,原生集成智能语音后处理模块,自动过滤填充词、合并重复表达、修正自我更正语句,并进行逻辑性语义重构,输出质量直逼“ASR识别+大模型二次润色”的组合效果;
第五,单模型原生支持30余种语言识别,中、英、日、韩、法、西、德七种主流语言平均语义错误率为17.09%,显著优于Azure Speech、Gemini Audio等竞品,在跨国会议记录与海外本地化客服场景中表现突出。
与此同时,配套发布的Qwen-Audio-3.0-ASR-Streaming专为低延迟实时语音识别设计,理论端到端出字延迟低至300毫秒,中文工业级错字率为7.80%,英文为11.52%,综合指标位居业界前列。该系列模型此前已在Artificial Analysis权威评测中以1.7%的错字率斩获全球榜首,现已规模化落地于智能会议纪要生成、直播实时字幕、在线教育课程录制、多模态智能客服等实际业务场景。










