腾讯混元今日正式发布全新一代语音识别模型——hy asr 3.0 preview。该模型深度融合了最新大语言模型 hy3 的强大语义理解能力,将高精度语音转录与深层次语义解析有机融合,在通用识别准确率、上下文感知能力、多场景鲁棒性以及方言覆盖广度四大关键维度实现系统性跃升,显著提升复杂真实语音输入下的识别质量,输出结果更精准、更连贯、更贴合用户真实表达意图——正如官方所言,已从“字字对应、局部优化”迈向“理解语境、适配多样场景、一键生成高质量文本”的新阶段。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

实测表现尤为突出。在国际主流开源评测集上,Hy ASR 3.0 Preview 在多种语言任务中均取得突破性进展,词错误率(WER)稳定控制在3%左右:中文普通话为3.34%,英语低至2.62%,粤语达3.12%。而在腾讯内部构建的多样化评测体系中,无论面对通用语音、方言识别、上下文依赖型对话、专业术语解析,抑或高噪声环境、耳语等极端声学条件,WER 均保持低位水平,并在综合评估中斩获最低错词率成绩。

聚焦用户体验层面,本次升级重点围绕四大方向持续精进:其一,通用识别能力再升级,在日常语音、方言混合、中英夹杂等典型场景下,进一步减少错别字与漏字现象,同时有效抑制长时音频中识别误差逐级累积的问题;其二,语义理解更深入,依托上下文建模能力,精准捕捉用户表达意图,智能区分同音异义词、消除歧义表达;其三,专业适配更灵活,支持热词动态注入机制,使模型可快速识别品牌名称、产品术语、人物称谓及垂直领域专有名词,大幅降低业务方接入门槛与后期运维成本。











