英伟达透露,其blackwell架构借助端到端推理软件栈的深度优化,已将deepseek v4模型的单token推理成本在短短一个月内最多压缩至初始水平的20%。
当AI应用正加速从实验性探索迈入规模化生产阶段,“AI工厂”成为主流范式,基础设施的评估重心也随之迁移——不再仅聚焦于芯片理论峰值性能,而是更看重单位算力成本、单位能耗效率,以及在既定延迟约束下所能稳定交付的有效Token数量。

为实现Token成本的显著下降,英伟达构建了三层协同优化体系:生产运营层承担分布式服务调度与弹性扩缩容任务;应用加速层通过计算与通信重叠、算子融合等手段完成运行时精细化调优;基础设施访问层则直接对接GPU硬件、高速互联网络及底层系统资源,释放底层潜力。
在引入分离式服务架构、NVLink支持的大规模专家并行、NVFP4低精度计算、多Token联合预测等多项关键技术后,Blackwell平台单卡GPU的Token吞吐能力最高可提升20倍。与此同时,英伟达已将单Token成本正式确立为衡量AI总体拥有成本(TCO)的关键标尺,并推动该指标达到当前业界最优水平。

多家头部推理服务厂商已完成相关技术落地:Baseten基于TensorRT-LLM开源工具链,在Blackwell平台上部署DeepSeek V4 Pro,实测每秒Token生成速率最高提升50%;Cognition采用Dynamo推理框架统一管理GPU资源,无需重复开发即可快速承载强化学习类复杂负载;Together AI则利用TensorRT-LLM大幅压缩Cursor模型从优化到上线的全流程周期。

活跃的开源生态持续强化全栈协同优势。PyTorch等主流AI框架原生构建于CUDA之上,使前沿算法成果可无缝迁移至NVIDIA GPU平台。DeepSeek V4发布后,vLLM、SGLang等热门推理框架迅速完成Blackwell适配,仅用一个月时间即达成最高5倍的性能跃升。












