千问大模型于9月23日正式推出qwen-audio-3.1系列语音大模型,构建起涵盖音频理解、生成、实时交互与创意制作的全栈式音频能力体系。该系列包括:语音识别模型qwen-audio-3.1-asr、进阶音频理解模型asr-next、语音合成模型tts、音频内容创作模型tts-next,以及低延迟全双工实时交互模型realtime。目前相关api已全面接入千问ai平台,asr-next的api也即将开放。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在能力升级方面,Qwen-Audio-3.1-ASR显著提升了多语种及方言识别精度,并强化了上下文建模能力;新增原生转写后处理功能,可智能过滤语气词、冗余重复表达;支持端到端分角色识别,同步输出说话人标识、精确时间戳与规范化文本;单模型覆盖30种国际语言及16种中文方言,流式识别首字响应延迟低至约160毫秒。
ASR-Next采用新一代底层架构,将音频理解维度从传统语音文字解码,拓展至情绪识别、环境音解析与机械声判别,具备声音场景描述、关键事件定位及基于音频的问答推理能力。TTS模型实现同音色跨语言自然发音迁移,并支持通过自然语言指令灵活调控语调、情绪与语速。TTS-Next面向专业音频内容生产,可一体化生成人声、音效与背景环境音,支持多角色音色克隆、毫秒级细粒度时间戳对齐,以及高达48kHz的高保真音频输出,广泛适配播客制作、有声读物、影视配音与游戏音效等场景。Realtime模型基于多教师知识蒸馏架构,实现真正意义上的全双工语音交互,用户可随时打断并插话,同时支持多语种无缝切换、情绪感知响应及对话中动态调用外部工具。
实测数据显示:Qwen-Audio-3.1-ASR在主流开源方言测试集上平均字符错误率(CER)为4.55%,在自建中文方言测试集上平均CER为10.38%,方言转普通话的语义级句子准确率达82.10%;ASR-Flash-Next与ASR-Flash在四大基准测试集共八项核心指标中,分别斩获五项与三项第一,整体性能全面超越此前业界标杆Fun-ASR级联方案。
当前,Realtime模型正深度集成至Qoder智能体、千问办公助手等AI Agent系统,以及千问AI眼镜等新一代智能硬件终端,持续推动语音作为最自然、最高效人机交互入口的发展进程。
从零搭建飞书机器人。支持 MiniMax/MiMo 等模型、工具调用(搜索/天气/百科/记忆)、Skill 架构。一站式交付可上线运行的飞书群聊 bot。基础版本,后续可自行升级能力
Qwen-Audio-3.1-ASR:
https://www.php.cn/link/854de648cbfe8c7e2a3e0597acb07ad6Qwen-Audio-3.1-TTS:
https://www.php.cn/link/a605a210266fcf2eca4819969a7d54e8Qwen-Audio-3.1-TTS-Next:
https://www.php.cn/link/1d85c2bd02088464fc116fa8ffbe06d3Qwen-Audio-3.1-Realtime:
https://www.php.cn/link/1ebf1720908a0863f83711f48cefde5d
(Qwen-Audio-3.1-ASR-Next API即将上线)










