在多模态大模型持续演进的当下,音频处理能力常常成为被“妥协”的一环——不少模型在提升音频理解能力的同时,却不可避免地削弱了文本推理与逻辑生成能力。近期,nvidia 研究团队正式推出了名为 nemotron-labs-audex-30b-a3b(简称 audex)的统一音频-文本大语言模型,旨在突破这一长期存在的技术瓶颈。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Audex 的设计哲学强调极简与高效。其底层基于高性能纯文本 MoE(混合专家)架构,仅依赖单一 Transformer 解码器,即可同步处理文本与量化后的音频 token。该设计不仅使音频信号能够自然映射至文本嵌入空间,还保障了模型在执行跨模态任务时,能与当前主流 LLM 生态系统完全兼容,真正实现模态间的深度协同。
为支撑这一能力,研究团队构建了规模庞大的训练语料库,包含 1574 亿音频 token 和 3205 亿文本 token。通过分阶段监督微调、纯文本 Cascade RL(级联强化学习)以及覆盖多领域的在线知识蒸馏策略,Audex 在多项基准测试中均取得领先表现。它不仅在语音识别、音频理解、语音翻译与音频生成等任务上展现出卓越性能,更关键的是,其原始 LLM 所具备的复杂推理、指令对齐、常识知识及长上下文建模能力几乎未受损失,性能衰减可忽略不计。
作为一款完全开源的模型,Audex 的落地发布为语音技术领域注入了实质性动力。它已超越传统论文级原型阶段,转变为可供开发者直接评估、集成与部署的成熟解决方案。对于面向真实场景、需应对多样化音频交互需求的产品团队而言,Audex 提供了一条兼顾音频能力与语言智能的可行路径,同时也为下一代多模态智能体的研究与应用开辟了全新可能。











