9月23日,千问大模型官方正式宣布推出qwen-audio-3.1系列语音大模型。本次升级全面覆盖asr(自动语音识别)、tts(文本转语音)及realtime(实时语音交互)三大核心能力,并同步发布两款全新音频专用模型:面向高质量音频生成的qwen-audio-3.1-tts-next与专注深度语音理解的qwen-audio-3.1-asr-next。至此,五款模型共同构建起涵盖“理解—生成—交互—创作”全链路的音频智能能力体系。
在能力方面,ASR模型现已支持30种语言及16种方言识别,并新增智能转写润色功能,首字响应延迟低至约160毫秒;TTS模型实现跨语言音色迁移与精细化情绪表达控制;TTS-Next进一步突破,可一体化合成自然人声、多类型音效及沉浸式环境音;Realtime模型则全面支持全双工实时对话,并具备调用外部Agent工具的能力。此外,全线模型服务价格大幅下调:TTS服务成本降低约70%,Realtime服务降幅达85%,ASR服务降价幅度高达95%。
从零搭建飞书机器人。支持 MiniMax/MiMo 等模型、工具调用(搜索/天气/百科/记忆)、Skill 架构。一站式交付可上线运行的飞书群聊 bot。基础版本,后续可自行升级能力
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜











