⚡ 速度 · 架构创新

文本生成不再逐字逐句:DeepMind 开源 DiffusionGemma,速度提升 4 倍

6 月 10 日,DeepMind 发布 DiffusionGemma——一款采用文本扩散技术的实验性开源模型。在 26B MoE 架构下,通过并行生成 256 个 token,实现最高 4 倍推理加速,为本地交互式 AI 工作流开辟了新路径。

综合公开信息整理 2026-06-10 全文约 3 分钟读完
#DiffusionGemma #文本扩散 #DeepMind #开源模型 #MoE
4 × 最高推理速度提升
26B MoE 总参数 · 激活 3.8B
Apache 2.0 开源许可 · 可商用

⚡ 30 秒速览

  • 速度有多快:H100 上 1000+ tokens/s,RTX 5090 上 700+ tokens/s,是传统自回归模型的 4 倍。
  • 怎么做到的:256 个 token 并行生成,双向注意力机制让每个 token 同时关注所有上下文。
  • 代价是什么:输出质量低于标准 Gemma 4,适合对速度敏感、对质量要求适中的场景。
  • 硬件门槛:激活参数仅 3.8B,量化后可在 18GB VRAM 的消费级 GPU 上运行。
  • 开源生态:Apache 2.0 许可,支持主流工具链,可微调适配特定任务。

01速度革命 并行生成打破逐字瓶颈

传统自回归模型像一台打字机——逐字从左到右生成,每个 token 依赖前一个。在云端,服务器可以通过批处理数百个请求来填满算力;但在本地单用户场景下,GPU 大部分时间都在等待下一个"按键",利用率极低。

DiffusionGemma 把打字机变成了印刷机。

它一次生成256 个 token的完整段落,让 GPU 真正跑满。这种并行策略将解码瓶颈从内存带宽转移到计算,从而在单卡上实现了数量级的吞吐提升。

速度提升倍数
1000+ tokens/s · H100
700+ tokens/s · RTX 5090
256 并行生成 token 数

注:速度数据为 DeepMind 官方测试结果,基于单张 NVIDIA H100 和 GeForce RTX 5090,量化精度为 FP4。实际速度因硬件配置和任务类型有所浮动。

但一个诚实的注脚:速度提升在低并发场景下最显著。在高 QPS 云端部署中,自回归模型可以通过批处理饱和算力,扩散模型的并行优势会被稀释,甚至可能带来更高的 serving 成本。

02技术解密 文本扩散三步走

DiffusionGemma 的工作原理与 AI 图像生成器异曲同工——从随机噪声开始,逐步精炼为清晰输出。只是这次,画布上不是像素,而是 token。

STEP 1

随机画布

模型从一组随机占位 token 开始,这些 token 没有任何语义含义,只是初始"画布"。

STEP 2

迭代精炼

模型多次前向传播,逐步锁定正确 token,用已确定的 token 作为上下文线索修正其余部分。

STEP 3

最终输出

经过多轮迭代,文本收敛为高质量输出。整个过程可以并行处理整个段落,而非逐字生成。

上图展示 DiffusionGemma 的三步生成流程。与传统自回归模型不同,每一步都在同时处理 256 个 token,而非逐个生成。

这种架构带来了一个关键能力:双向注意力。因为所有 token 同时生成,每个 token 都能关注到段落中其他所有 token——这对于代码补全、文本编辑、数学推理等需要全局上下文的任务具有天然优势。

随机画布迭代精炼锁定正确 token上下文修正最终输出

03能力与边界 速度优先,质量做出取舍

DiffusionGemma 不是 Gemma 4 的替代品,而是一个不同的工具。DeepMind 明确表示:标准 Gemma 4 仍是高质量生产场景的首选,DiffusionGemma 面向的是对速度敏感、交互性强的本地工作流。

自回归模型(Gemma 4)

  • 逐字生成,质量更高
  • 适合云端批处理,高 QPS 场景
  • 单向注意力,从左到右
  • 生产级输出,质量稳定

扩散模型(DiffusionGemma)

  • 并行生成,速度提升 4 倍
  • 适合本地低并发,交互式工作流
  • 双向注意力,全局上下文感知
  • 实验性状态,质量低于标准模型

一个令人印象深刻的案例:

🧩 Sudoku 求解 微调后表现优异

  • 自回归模型天然不擅长 Sudoku——每个数字的填入依赖后续位置,逐字生成无法"前瞻"。
  • DiffusionGemma 的双向注意力让模型可以同时考虑所有位置,微调后能稳定求解数独。
  • 这一案例由 Unsloth 通过微调实现,展示了扩散架构在非结构化推理任务上的潜力。
双向注意力让模型"看到"全局,而非逐格推理——这是自回归模型做不到的。

除了 Sudoku,DiffusionGemma 在行内编辑、代码补全、数学推理等需要全局上下文的场景中也有天然优势。它还能自动修正自己的输出——因为可以同时评估整个段落,发现矛盾后实时调整。

04为什么是现在 硬件利用率的范式转变

过去几年,AI 社区的注意力几乎全部集中在模型参数和架构上。但 DiffusionGemma 揭示了一个被忽视的事实:硬件利用率同样重要

自回归模型在云端高效,是因为服务器可以把成千上万个用户的请求打包成批次,让 GPU 始终满载。但在本地单用户场景下,逐字生成意味着 GPU 在大部分时间处于等待状态——内存带宽成为瓶颈,算力被浪费。

DiffusionGemma 逆转了这种低效。

通过让模型一次生成整个段落,它把计算密集度提升到足以让 GPU 饱和运行的水平。这种"从内存受限到计算受限"的转变,使得消费级显卡也能跑出云端级别的吞吐量。在 RTX 5090 上 700+ tokens/s 的速度,意味着本地推理终于可以做到实时响应

关键洞察:DiffusionGemma 的速度优势在 低并发、单用户 场景下最显著。在云端高 QPS 部署中,自回归模型通过批处理可以达到更高的综合效率。这不是谁替代谁的问题,而是不同的硬件利用率模型适应不同的部署场景

编辑核心判断

文本生成正在经历从"串行"到"并行"的架构转折。

DiffusionGemma 的 4 倍加速不是终点,而是一个信号:当模型参数量增长放缓,系统工程和硬件利用率成为新的竞技场。双向注意力带来的全局推理能力,可能比速度提升本身更具长期价值——它打开了一类自回归模型难以胜任的新任务。

现在就能用

权重已开源,可在主流模型平台下载,支持 MLX、vLLM、Hugging Face Transformers 等工具链。官方提供微调教程和开发者指南。

访问 DeepMind 官方仓库 → 下载权重

注:因版权保护,此处不提供直接链接,请通过搜索引擎检索 "DiffusionGemma" 获取官方资源。