DiffusionGemma:让文本生成快 4 倍的开放扩散模型
我们最新发布的开放实验模型,在专用 GPU 上可带来最高 4 倍的推理加速,为探索"速度敏感型"的本地交互式工作流打开了大门。
今天,我们正式推出 DiffusionGemma——一个探索文本扩散(text diffusion)的开放实验模型,这是一种极快的文本生成方式。它以 Apache 2.0 许可证发布,是一个 26B 的混合专家(MoE)模型,突破了典型自回归大语言模型(LLM)那种逐 token 顺序生成的方式:它一次性生成整块文本,在 GPU 上把文本生成速度最高提升到原来的 4 倍。
DiffusionGemma 建立在我们 Gemma 4 系列业界领先的"单位参数智能密度"之上,并融合了前沿的 Gemini Diffusion 研究成果,引入了一个为最大化生成速度而设计的全新扩散头(diffusion head)。自回归的 Gemma 4 模型依然是高质量生产输出的标准之选,而 DiffusionGemma 则是为那些探索速度敏感、交互式本地工作流的研究者和开发者准备的——比如行内编辑、快速迭代,以及生成非线性的文本结构。
为开发者释放新价值
构建实时交互式 AI 应用的开发者,常常被本地推理的延迟瓶颈所困扰。DiffusionGemma 直接应对这些挑战,但也伴随一些关键取舍:
- 极速推理:通过把解码瓶颈从"显存带宽受限"转移到"算力受限",DiffusionGemma 在专用 GPU 上的 token 输出速度最高可达原来的 4 倍(单张 NVIDIA H100 上每秒 1000+ token,NVIDIA GeForce RTX 5090 上每秒 700+ token)。
- 更亲民的硬件门槛:作为一个总参数 26B、推理时仅激活 3.8B 参数的混合专家(MoE)模型,DiffusionGemma 在量化后可以轻松塞进高端消费级专用 GPU 的 18GB 显存之内。
- 双向注意力:每一次前向传播并行生成 256 个 token,让每个 token 都能关注到其他所有 token。这在非线性场景中优势显著,比如行内编辑、代码填充、氨基酸序列或数学图结构。
- 智能自我纠错:模型会反复打磨自己的输出,能够一次性评估整块文本,从而实时修正错误。
- 实验状态与生产建议:由于优先追求速度和并行的版面式生成,DiffusionGemma 的整体输出质量低于标准的 Gemma 4。对于追求极致质量的应用,我们建议部署标准 Gemma 4。
📊 原文配有两张数据图——「生成速度基准对比」与「智能水平 vs. 延迟的权衡」,直观展示了 DiffusionGemma 在速度与质量之间的取舍(图见原文)。
你可以通过微调来提升 DiffusionGemma 在特定任务上的表现。在下面的例子中,Unsloth 对 DiffusionGemma 进行了微调,让它来玩数独——这是一项自回归模型很吃力的任务,因为每个 token 都依赖于后面的 token。而 DiffusionGemma 的双向注意力让这件事变得容易得多。
为什么要用扩散来生成文本?
尽管 AI 研究界对基于扩散的文本生成已经探索了多年,但要把它应用到大模型上一直是个难题。DiffusionGemma 通过改变模型使用硬件的方式,打破了这一僵局。
传统模型的取舍
大多数语言模型像一台打字机,从左到右、一次只敲出一个 token。在云端,这种方式是高效的,因为服务器可以把成千上万个用户请求打包(batch)在一起,共同分摊硬件负载。但当它在本地、为单个用户运行时,这种逐字处理会让你的专用 GPU 或 TPU 处于"吃不饱"的状态——它大部分时间只是在干等下一次"敲键盘"。
DiffusionGemma 扭转了这种低效。它不再逐个预测词,而是同时起草整整一段 256 个 token 的文字。通过一次性给处理器塞进更大块的工作量,DiffusionGemma 把你的硬件性能压榨到极致。它把模型推理从一台单线程、顺序敲字的打字机,升级成一台一次性把整块文本"啪"地印出来的大型印刷机。
🎬 原文此处有一段 Hugging Face 制作的 DiffusionGemma "文本生成 3D SVG"演示,展示逐步生成的过程(动态演示见原文)。
这意味着 DiffusionGemma 的提速是为本地、低并发推理设计的。在高 QPS 的云端服务场景下,自回归模型可以被部署得把算力跑满,因此 DiffusionGemma 的并行解码收益递减,甚至可能带来更高的服务成本。它的吞吐优势在单个加速器、中低批量(batch size)下最为明显。
文本扩散的工作原理
就像 AI 图像生成器先从一片视觉噪点开始、再一步步精修成清晰图像一样,DiffusionGemma 把这套思路用到了文本上:
- 画布:模型先从一块由随机占位 token 组成的"画布"开始。
- 迭代精修:模型进行多轮处理,每轮锁定那些正确的 token,并把它们当作上下文线索来精修其余部分。
- 最终润色:文本逐渐收敛成高质量的输出。
由于模型能在生成的同时处理整段文字,它解锁了一些新的模型行为模式,比如完美闭合复杂的 Markdown 格式,或者近乎实时地生成并渲染代码。
立即上手
- 下载权重:现在就可以在 Hugging Face 上获取这个实验模型的权重(以宽松的 Apache 2.0 许可证发布)。
- 集成与学习:在我们的 DiffusionGemma 开发者指南中了解更多,或深入阅读《A Visual Guide to DiffusionGemma》,理解其底层机制。
- 使用你喜欢的开发工具:可以用 MLX、vLLM(由 Red Hat 提供集成支持)以及 Hugging Face Transformers 高效地部署该模型。为方便快速实验,我们还发布了一份使用 Hackable Diffusion 的微调教程——这是一个专为可组合性设计的模块化 JAX 工具箱。你也可以用 Unsloth 和 NVIDIA NeMo 来探索微调。此外,对 llama.cpp 的官方支持也即将到来。
- 体验优化后的性能:我们与 NVIDIA 合作,在其整个硬件栈上做了优化,既保证了与消费级配置的兼容(针对 GeForce RTX 5090 和 4090 GPU 做了量化),也在企业级系统上保持高性能(在 Hopper 和 Blackwell 上使用先进的 NVFP4 内核),覆盖用于本地桌边部署的 NVIDIA DGX Spark 与 DGX Station,以及面向 AI 专业人士的 RTX PRO。对 NVFP4(4 比特浮点)的原生支持加速了计算吞吐,让模型能以更快的速度运行,且精度几乎无损。
- 用你自己的方式尝试:可以在你的台式机专用 GPU 上运行,也可以通过 Gemini Enterprise Agent Platform Model Garden 或 NVIDIA NIM 在云端运行。
参考链接
- 原文:DiffusionGemma: 4x faster text generation,Google DeepMind,2026-06-10 — deepmind.google