近日,阶跃星辰正式推出全新升级的实时语音大模型——stepaudio 2.5 realtime。该模型已全面开放接入,开发者可通过阶跃星辰开放平台快速集成与部署。stepaudio 2.5 realtime 聚焦于打造更拟真、更具沉浸感的语音交互体验,在副语言理解、角色人格定制及多维对话能力三大方向实现了系统性突破。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

其核心技术亮点在于对副语言信号的精细化建模能力。副语言涵盖语调起伏、语速变化、呼吸停顿,以及轻笑、叹息、嗯哼等非词汇化表达,是情绪传递与意图识别的重要载体。StepAudio 2.5 Realtime 能够实时解析这些声学线索,精准捕捉用户当下的心理状态——例如从绵长低沉的发音中推断倦怠感,或从高频短促的节奏中感知紧张与焦虑,并据此智能切换应答风格与交互策略,显著增强对话的流畅性与共情力。
在人设可配置性方面,StepAudio 2.5 Realtime 提供高度自由的AI角色定义能力。开发者可通过标准API接口,灵活设定角色的性格倾向、成长背景、职业身份及语言偏好等维度。模型底层依托超10,000个高质量原生角色样本,经算法扩展构建出覆盖百万级组合的人设特征空间,并融合海量真实语音对话数据完成端到端训练。团队还引入强化学习机制,持续优化角色在高压力、高干扰等边缘场景下的行为稳定性与人格连贯性。同时,平台预置5类典型人设模板,开箱即用,便于快速上手验证。
在综合对话能力层面,StepAudio 2.5 Realtime 坚持“智性”与“感性”并重的设计理念。它不仅具备深度语义解析能力,可应对模糊指代、隐含前提、多轮逻辑嵌套等复杂语言现象;还能动态调度跨领域知识库,在情感陪伴、专业咨询、技能教学等多元场景中提供有温度、有深度的交互服务——既可化身知心倾听者,亦能胜任模拟面试官、金融顾问等结构化角色。
据阶跃星辰最新发布的权威评测报告,StepAudio 2.5 Realtime 在五大核心指标中均位居前列,尤其在用户主观体验维度斩获80.41分,大幅领先于GPT-Realtime-1.5与Gemini Live等主流竞品,充分印证了其在实时语音交互领域的技术领先性与落地成熟度。











