☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

当语音AI被卷入一场持续数小时、跨越数十轮的真实对话时,它能否准确记住“这句话是谁说的、以何种语气说出、背景中又混杂着哪些声音”?墨尔本大学联合新南威尔士大学的研究团队指出:现有评估方法根本无法回答这一关键问题。为此,他们推出了直击短板的新基准——VoxMem。
团队首先指出了传统评测的两大顽疾:其一,仅聚焦于语音转录后的文本内容,将蕴含在声学信号中的说话人身份、情绪状态、环境音等关键线索全部忽略;其二,无法独立控制“历史长度”这一变量,导致模型性能下滑究竟是源于记忆容量不足,还是单纯被长上下文拖累,始终模糊不清。VoxMem则采用“声学证据 × 记忆操作”的二维正交分类框架,精细覆盖15种能力组合,并确保所有测试样本在8K至64K不同上下文长度下完全一致——即仅调节“对话历史长度”这一个维度,其余条件全部锁定,从而让记忆衰减效应可清晰归因于长度本身。
将小说章节转换为电影分镜剧本。用户上传txt/md/docx文本,AI分析场景、角色、情绪、镜头语言,输出专业分镜脚本。适用于用户提及“分镜”“storyboard”“小说转分镜”“影视改编”“镜头脚本”或需要将小说改编为分镜的场景。
该基准规模可观:共含3196个评测样本、34743段语音会话,累计音频时长约177小时,足以复现真实场景下的长程多轮交互。而对15个主流音频大模型的实测结果令人警醒:在32K上下文长度下,所有模型的整体准确率均未突破40%。更值得注意的是其能力失衡现象——模型对“说了什么”这类语义信息的记忆明显优于对说话人身份、副语言特征(如语气、情绪)以及环境声等原生声学信息的记忆;尤其在追踪语气波动与背景音变化方面,准确率极低,几近失效。且随着历史长度增加,各类声学信息的记忆表现同步下滑。
基于此,研究团队提出核心判断:当前音频大模型的语音记忆瓶颈,并非出在高层推理环节,而卡在更底层的“识别—定位—绑定”链条上——即模型尚未稳定捕获并关联“谁在何时、以何种方式说了什么”这一基础事实,上层推理自然无从建立。VoxMem正如一支精度更高的体温计,在语音AI的评估体系中引入了前所未有的细粒度测量能力,迫使整个领域直面一个长期被文字转写所掩盖的真相:听懂词,不等于记得住人、语气,更不等于感知得到整个声音世界。










