文本生成不再逐字逐句:DeepMind 开源 DiffusionGemma,速度提升 4 倍
6 月 10 日,DeepMind 发布 DiffusionGemma——一款采用文本扩散技术的实验性开源模型。在 26B MoE 架构下,通过并行生成 256 个 token,实现最高 4 倍推理加速,为本地交互式 AI 工作流开辟了新路径。
6 月 10 日,DeepMind 发布 DiffusionGemma——一款采用文本扩散技术的实验性开源模型。在 26B MoE 架构下,通过并行生成 256 个 token,实现最高 4 倍推理加速,为本地交互式 AI 工作流开辟了新路径。
传统自回归模型像一台打字机——逐字从左到右生成,每个 token 依赖前一个。在云端,服务器可以通过批处理数百个请求来填满算力;但在本地单用户场景下,GPU 大部分时间都在等待下一个"按键",利用率极低。
DiffusionGemma 把打字机变成了印刷机。
它一次生成256 个 token的完整段落,让 GPU 真正跑满。这种并行策略将解码瓶颈从内存带宽转移到计算,从而在单卡上实现了数量级的吞吐提升。
注:速度数据为 DeepMind 官方测试结果,基于单张 NVIDIA H100 和 GeForce RTX 5090,量化精度为 FP4。实际速度因硬件配置和任务类型有所浮动。
但一个诚实的注脚:速度提升在低并发场景下最显著。在高 QPS 云端部署中,自回归模型可以通过批处理饱和算力,扩散模型的并行优势会被稀释,甚至可能带来更高的 serving 成本。
DiffusionGemma 的工作原理与 AI 图像生成器异曲同工——从随机噪声开始,逐步精炼为清晰输出。只是这次,画布上不是像素,而是 token。
模型从一组随机占位 token 开始,这些 token 没有任何语义含义,只是初始"画布"。
模型多次前向传播,逐步锁定正确 token,用已确定的 token 作为上下文线索修正其余部分。
经过多轮迭代,文本收敛为高质量输出。整个过程可以并行处理整个段落,而非逐字生成。
上图展示 DiffusionGemma 的三步生成流程。与传统自回归模型不同,每一步都在同时处理 256 个 token,而非逐个生成。
这种架构带来了一个关键能力:双向注意力。因为所有 token 同时生成,每个 token 都能关注到段落中其他所有 token——这对于代码补全、文本编辑、数学推理等需要全局上下文的任务具有天然优势。
DiffusionGemma 不是 Gemma 4 的替代品,而是一个不同的工具。DeepMind 明确表示:标准 Gemma 4 仍是高质量生产场景的首选,DiffusionGemma 面向的是对速度敏感、交互性强的本地工作流。
一个令人印象深刻的案例:
除了 Sudoku,DiffusionGemma 在行内编辑、代码补全、数学推理等需要全局上下文的场景中也有天然优势。它还能自动修正自己的输出——因为可以同时评估整个段落,发现矛盾后实时调整。
过去几年,AI 社区的注意力几乎全部集中在模型参数和架构上。但 DiffusionGemma 揭示了一个被忽视的事实:硬件利用率同样重要。
自回归模型在云端高效,是因为服务器可以把成千上万个用户的请求打包成批次,让 GPU 始终满载。但在本地单用户场景下,逐字生成意味着 GPU 在大部分时间处于等待状态——内存带宽成为瓶颈,算力被浪费。
DiffusionGemma 逆转了这种低效。
通过让模型一次生成整个段落,它把计算密集度提升到足以让 GPU 饱和运行的水平。这种"从内存受限到计算受限"的转变,使得消费级显卡也能跑出云端级别的吞吐量。在 RTX 5090 上 700+ tokens/s 的速度,意味着本地推理终于可以做到实时响应。
关键洞察:DiffusionGemma 的速度优势在 低并发、单用户 场景下最显著。在云端高 QPS 部署中,自回归模型通过批处理可以达到更高的综合效率。这不是谁替代谁的问题,而是不同的硬件利用率模型适应不同的部署场景。
文本生成正在经历从"串行"到"并行"的架构转折。
权重已开源,可在主流模型平台下载,支持 MLX、vLLM、Hugging Face Transformers 等工具链。官方提供微调教程和开发者指南。
访问 DeepMind 官方仓库 → 下载权重注:因版权保护,此处不提供直接链接,请通过搜索引擎检索 "DiffusionGemma" 获取官方资源。