← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

Google DeepMind 发布 DiffusionGemma:端侧 AI 推理速度提升 4 倍

AI/Agent 阅读原文(微信)↗

——不用逐个 token 生成,一块\"噪声画布\"直接\"降噪\"出整段文字

Google 又发布新模型了。但这一次不一样。

DiffusionGemma 不是又一个更大更强的 MoE 模型,而是从头改变了文本生成的方式——把图像生成领域的扩散(Diffusion)技术搬到了语言模型上,实现\"一次生成整段文字\"。

在 RTX 5090 上 700 tokens/s,在 H100 上 1000+ tokens/s,是同等规模自回归模型的 4 倍

━━━ ━━━ ━━━

① 颠覆认知:把文本生成当\"降噪\"

所有主流大模型(GPT、Gemini、Claude、Llama)都是自回归(Autoregressive)的——从左到右一个 token 一个 token 地生成。好比你在键盘上一个字母一个字母地打字。

DiffusionGemma 完全不同:

\"铺好一整个画布,铺满 placeholder token(噪声),然后逐步降噪,最终一次性得到完整的文本块。\"

!DiffusionGemma 文本扩散生成示意图

这和 Stable Diffusion、Midjourney 的思路如出一辙——先用随机噪声铺满,再通过迭代去噪过程逐步逼近目标。

具体的执行过程:

  1. 初始化:在预设长度(最多 256 token)的\"文本画布\"上填满占位符
  2. 迭代去噪:模型在画布上多次\"扫描\",每次根据已确定的部分修正其他位置
  3. 最终输出:所有 token 同时确定,一次性输出完整文本段落

关键区别在于:自回归是线性串行,扩散是并行全局优化。

━━━ ━━━ ━━━

② 硬核数据:4 倍速度提升

指标 DiffusionGemma 同等规模自回归 Gemma
总参数量 26B MoE \~26B MoE
激活参数 3.8B \~4B
RTX 5090 吞吐 \~700 tok/s \~175 tok/s
H100 吞吐 1000+ tok/s \~250 tok/s
推理相对速度 4x 1x
许可证 Apache 2.0 Apache 2.0

4 倍的提升从哪来?瓶颈从内存带宽转移到了算力

云端推理时,自回归模型靠批量处理(batch)填满 GPU 利用率。但本地推理不一样——消费级 GPU 的内存带宽是瓶颈,自回归每步都要搬权重,GPU 常处于\"等数据\"的空闲状态。

扩散模型一次并行生成 256 个 token,更有利用满本地 GPU 的算力,大幅摊薄了搬权重的开销。

━━━ ━━━ ━━━

③ 不仅仅是快:有些事扩散模型做得更好

Google 在文章中展示了一个极其直观的例子:数独(Sudoku)求解

自回归模型在数独上一直表现很差——因为每个数字的填写依赖于它前后的数字,自回归从左到右的约束让它没法\"回头看\"。扩散模型天然可以全局修正,直接把格子里的数独填对了。

\"这是一个自回归模型众所周知的难点——每个 token 依赖于未来的 token,扩散模型的持续自纠能力让它更合适。\"

同样的逻辑适用于:

  • 行内编辑(Inline Editing):改一篇文章的中间段落
  • 分子序列(Molecular Sequencing):需要全局理解的生物信息学任务
  • 数学绘图(Mathematical Graphing):坐标点之间互相依赖

这是结构性优势,不是补丁式的优化。

━━━ ━━━ ━━━

④ 为什么谷歌的云端 Gemini 不用它?

这是个好问题。既然扩散那么快,为什么不全面替换?

Google 自己尝试过,但有三个硬伤:

① 语言是离散的,不是像素

图像扩散里一个像素预测错了不影响整体。但语言不同——一个 token 错位可能让整句话失去意义,必须从头再来。图像可以容忍\"模糊\",语言不行。

② 短文本场景效率反而低

如果用户只想要一个 5 token 的回复(比如\"是\"),扩散模型要跑多轮去噪才能得到 5 个 token。自回归模型 5 步就搞定了。

③ 云端的批量处理抹平了差距

云端 HBM(高带宽内存)可以同时处理成百上千个请求,GPU 永远满载。扩散的并行优势在云端被批量处理的规模效应抵消了。

所以结论很清晰:扩散 + 端侧自部署是绝配,扩散 + 云端大模型反而没那么大优势。

━━━ ━━━ ━━━

⑤ 对开发者意味着什么

场景推荐:

场景 推荐模型 原因
端侧实时对话 DiffusionGemma 4x 更快,更适合低内存带宽的消费级 GPU
云端大批量推理 传统自回归 Gemma 批处理效率最高
数独/谜题/编辑任务 DiffusionGemma 全局修正能力天然适配
长文档生成 自回归 扩散的 256 token 并行上限限制了单次输出
本地应用嵌入 DiffusionGemma 26B/3.8B 激活,RTX 5090 18GB 可用

可用性:模型权重已在 Hugging Face 上架,Apache 2.0 开源许可证。

Google 与 NVIDIA 合作优化了 RTX GPU(量化版)和 H100/DGX Spark 等企业级平台的适配,今天就能下载跑起来。

━━━ ━━━ ━━━

⑥ 技术视角的评估

✅ 这是真突破:从一个全新的技术路线改进了端侧推理效率,不是微调参数而是改变范式。4x 速度提升是实测数据,不是宣传稿。

⚠️ 局限明显:错误率偏高、短文本效率低、256 token 输出上限。这是一个补位模型,不是替代品。

🔮 长期意义:扩散 + 语言的交叉创新是 2026 年最值得关注的 AI 架构方向之一。Apple 的 AFM 3 Core Advanced 也用稀疏激活解决端侧瓶颈,Google 用扩散解决——殊途同归,都在回答同一个问题:如何在有限的本地资源上跑出最好的模型?

━━━ ━━━ ━━━

总结

DiffusionGemma 是 Google DeepMind 在开源生态里投下的一颗\"路线之争\"的棋子。

它证明了:文本生成不一定非要一个 token 一个 token 来。 扩散模型在其他领域已经证明了能力(图像、音频、视频),现在轮到语言了。

对于自己做本地部署的开发者、需要隐私合规的企业、以及所有在消费级 GPU 上跑模型的极客——这是 2026 年 6 月最值得下载试玩的开源模型之一。

Hugging Face: google/diffusiongemma-26B-A4B-it

Google Blog: DiffusionGemma: Faster Text Generation

━━━ ━━━ ━━━

*🤖 本文基于 Ars Technica 报道及 Google DeepMind 官方博客整理。*

Apple 端侧 AI 闪存路由架构:20B 参数不碰 DRAM

Token狂欢结束,谁来收拾烂摊子?——Revenium的AI成本可观测之道

Google DeepMind 论文论证:大语言模型永远不会产生意识

Google Cloud Certified Generative AI Leader 认证介绍

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)