☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在持续优化大模型推理效率的进程中,英伟达于7月1日推出全新技术路径。当天,公司正式开源其最新研发的
常规自回归模型依赖逐词(token)顺序生成机制,解码过程天然串行,在高并发或大批量文本合成场景中易成为性能瓶颈。而英伟达所采用的“双塔”范式,则将建模逻辑解耦为两个协同模块:其一为固定参数的“上下文塔”,专注编码输入提示、延续原有语义理解能力;其二为可训练的“去噪塔”,专司并行化 token 生成与质量校正。
该设计的核心优势在于兼顾输出精度与推理速度。实测显示,在配备2张H100 GPU的硬件环境下,模型在默认配置下仍维持基线模型98.7%的生成保真度,同时实现2.42倍的吞吐量跃升。对需高频产出合成内容的数据工程团队而言,这一突破显著提升了单位算力下的产出效能。
功能层面,模型提供三重解码策略——原生扩散模式、类自回归模拟模式及标准自回归模式,开发者可根据任务特性灵活切换。当前版本已以开放权重形式发布,并严格遵循 NVIDIA Nemotron 开放模型许可协议,允许无限制商用部署。
当然,该方案亦存在权衡:在代码生成与数学推演等强逻辑任务上,相较原始基线略有性能折损;同时对GPU显存容量提出更高要求。但不可否认,它为大模型推理加速开辟了一条以架构创新驱动性能跃迁的新路径。随着AI应用不断向实时性、规模化方向演进,此类通过底层模型结构优化换取生成效率提升的技术思路,正日益成为业界研发的重要范式。











