阶跃星辰今日正式推出stepaudio3系列全新模型,涵盖stepaudio3realtime、stepaudio3asr、stepaudio3tts、stepaudio3gen与stepaudio3music五大方向,全部模型现已在阶跃星辰开放平台上线。其中多项能力在artificial analysis权威评测榜单中斩获全球榜首成绩。该系列全面覆盖高拟真语音合成、端到端音频生成、低延迟实时语音交互、深度语音语义理解以及专业级音乐创作等核心应用场景。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

具体来看,StepAudio3Realtime原生支持全双工实时语音对话,具备语义、语气、情绪、副语言特征及环境声的同步感知能力,并实现语音理解、逻辑推理与语音生成的并行处理,同时兼容Tool Calling机制与长周期任务的异步执行。其在Artificial Analysis Conversational Dynamics榜单中以98.9%的综合得分位居全球第一;语音级推理准确率高达99.7%,亦为全球最高水平。
StepAudio3ASR深度融合语音识别技术与大语言模型的上下文建模能力,可稳定应对中文、英文、各地方言、中英混合表达、超长语音片段,以及医疗、法律、金融等垂直领域专业术语场景,词错误率(WER)低至1.7%,与顶尖方案并列全球第一。StepAudio3TTS则重点提升音色还原度、语调自然性、节奏韵律感及停顿合理性,并精准复现笑声、迟疑、口吃等丰富副语言细节,支持流式低延迟输出,专为实时语音交互场景深度优化。

此外,StepAudio3Gen支持一体化生成角色语音、特效音、空间环境声与背景配乐,具备多角色语音协同调度与精确声音时间轴控制能力;StepAudio3Music则面向音乐内容生产,提供原创歌曲生成、人声清唱智能配器、风格化翻唱,以及基于ABC记谱法的多轮迭代式编曲能力,用户可通过自然语言灵活调控曲风、旋律走向、节拍结构、乐器编配与情感基调。整体而言,StepAudio3正推动语音AI从传统单点能力(如仅识别或仅合成)迈向全链路音频内容生成与高响应实时智能交互的新范式。











