谷歌于2026年6月10日正式推出实验性开源语言模型diffusiongemma,突破了传统大语言模型依赖逐词预测的自回归生成方式,首次将图像生成领域广泛应用的扩散建模思想迁移至文本建模任务中。该模型不再按顺序逐个生成token,而是以噪声为起点,通过多轮迭代去噪过程,一次性并行产出包含256个标记的完整词块。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在硬件适配层面,借助英伟达提供的深度软硬协同优化方案,DiffusionGemma在单GPU、单用户部署场景下的推理吞吐量相较同规模自回归模型提升约4倍。具体而言,在H100显卡上处理单条请求时,其输出速率可达每秒1000 token;即便运行于RTX 5090等高性能消费级显卡,亦能稳定维持每秒超700 token的生成速度。
该模型参数总量为260亿,采用混合专家(MoE)结构设计,每次前向传播仅激活其中约38亿参数。虽然在常规语言理解与生成基准测试中,其整体文本质量与精确度略低于Gemma4系列标准模型,但其特有的“全局块级建模”能力有效克服了自回归架构固有的单向依赖限制。由于所有输出标记在生成阶段可彼此感知、协同优化,模型在文本续写、代码自动补全、数独逻辑推演以及蛋白质氨基酸序列建模等具有强结构性与非线性特征的任务中表现尤为突出。

目前,DiffusionGemma的全部权重已依据Apache 2.0开源协议发布于Hugging Face平台,并原生支持vLLM、MLX等主流高效推理框架。此次技术尝试不仅缓解了GPU内存带宽对大规模语言模型推理效率的瓶颈制约,更在复杂逻辑推理与非线性文本生成方向上,为下一代AI系统提供了全新的架构范式与演进路径。











