——不用逐个 token 生成,一块\"噪声画布\"直接\"降噪\"出整段文字
Google 又发布新模型了。但这一次不一样。
DiffusionGemma 不是又一个更大更强的 MoE 模型,而是从头改变了文本生成的方式——把图像生成领域的扩散(Diffusion)技术搬到了语言模型上,实现\"一次生成整段文字\"。
在 RTX 5090 上 700 tokens/s,在 H100 上 1000+ tokens/s,是同等规模自回归模型的 4 倍。
━━━ ━━━ ━━━
① 颠覆认知:把文本生成当\"降噪\"
所有主流大模型(GPT、Gemini、Claude、Llama)都是自回归(Autoregressive)的——从左到右一个 token 一个 token 地生成。好比你在键盘上一个字母一个字母地打字。
DiffusionGemma 完全不同:
\"铺好一整个画布,铺满 placeholder token(噪声),然后逐步降噪,最终一次性得到完整的文本块。\"
!DiffusionGemma 文本扩散生成示意图
这和 Stable Diffusion、Midjourney 的思路如出一辙——先用随机噪声铺满,再通过迭代去噪过程逐步逼近目标。
具体的执行过程:
- 初始化:在预设长度(最多 256 token)的\"文本画布\"上填满占位符
- 迭代去噪:模型在画布上多次\"扫描\",每次根据已确定的部分修正其他位置
- 最终输出:所有 token 同时确定,一次性输出完整文本段落
关键区别在于:自回归是线性串行,扩散是并行全局优化。
━━━ ━━━ ━━━
② 硬核数据:4 倍速度提升
| 指标 | DiffusionGemma | 同等规模自回归 Gemma |
|---|---|---|
| 总参数量 | 26B MoE | \~26B MoE |
| 激活参数 | 3.8B | \~4B |
| RTX 5090 吞吐 | \~700 tok/s | \~175 tok/s |
| H100 吞吐 | 1000+ tok/s | \~250 tok/s |
| 推理相对速度 | 4x | 1x |
| 许可证 | Apache 2.0 | Apache 2.0 |
4 倍的提升从哪来?瓶颈从内存带宽转移到了算力。
云端推理时,自回归模型靠批量处理(batch)填满 GPU 利用率。但本地推理不一样——消费级 GPU 的内存带宽是瓶颈,自回归每步都要搬权重,GPU 常处于\"等数据\"的空闲状态。
扩散模型一次并行生成 256 个 token,更有利用满本地 GPU 的算力,大幅摊薄了搬权重的开销。
━━━ ━━━ ━━━
③ 不仅仅是快:有些事扩散模型做得更好
Google 在文章中展示了一个极其直观的例子:数独(Sudoku)求解。
自回归模型在数独上一直表现很差——因为每个数字的填写依赖于它前后的数字,自回归从左到右的约束让它没法\"回头看\"。扩散模型天然可以全局修正,直接把格子里的数独填对了。
\"这是一个自回归模型众所周知的难点——每个 token 依赖于未来的 token,扩散模型的持续自纠能力让它更合适。\"
同样的逻辑适用于:
- 行内编辑(Inline Editing):改一篇文章的中间段落
- 分子序列(Molecular Sequencing):需要全局理解的生物信息学任务
- 数学绘图(Mathematical Graphing):坐标点之间互相依赖
这是结构性优势,不是补丁式的优化。
━━━ ━━━ ━━━
④ 为什么谷歌的云端 Gemini 不用它?
这是个好问题。既然扩散那么快,为什么不全面替换?
Google 自己尝试过,但有三个硬伤:
① 语言是离散的,不是像素
图像扩散里一个像素预测错了不影响整体。但语言不同——一个 token 错位可能让整句话失去意义,必须从头再来。图像可以容忍\"模糊\",语言不行。
② 短文本场景效率反而低
如果用户只想要一个 5 token 的回复(比如\"是\"),扩散模型要跑多轮去噪才能得到 5 个 token。自回归模型 5 步就搞定了。
③ 云端的批量处理抹平了差距
云端 HBM(高带宽内存)可以同时处理成百上千个请求,GPU 永远满载。扩散的并行优势在云端被批量处理的规模效应抵消了。
所以结论很清晰:扩散 + 端侧自部署是绝配,扩散 + 云端大模型反而没那么大优势。
━━━ ━━━ ━━━
⑤ 对开发者意味着什么
场景推荐:
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 端侧实时对话 | DiffusionGemma | 4x 更快,更适合低内存带宽的消费级 GPU |
| 云端大批量推理 | 传统自回归 Gemma | 批处理效率最高 |
| 数独/谜题/编辑任务 | DiffusionGemma | 全局修正能力天然适配 |
| 长文档生成 | 自回归 | 扩散的 256 token 并行上限限制了单次输出 |
| 本地应用嵌入 | DiffusionGemma | 26B/3.8B 激活,RTX 5090 18GB 可用 |
可用性:模型权重已在 Hugging Face 上架,Apache 2.0 开源许可证。
Google 与 NVIDIA 合作优化了 RTX GPU(量化版)和 H100/DGX Spark 等企业级平台的适配,今天就能下载跑起来。
━━━ ━━━ ━━━
⑥ 技术视角的评估
✅ 这是真突破:从一个全新的技术路线改进了端侧推理效率,不是微调参数而是改变范式。4x 速度提升是实测数据,不是宣传稿。
⚠️ 局限明显:错误率偏高、短文本效率低、256 token 输出上限。这是一个补位模型,不是替代品。
🔮 长期意义:扩散 + 语言的交叉创新是 2026 年最值得关注的 AI 架构方向之一。Apple 的 AFM 3 Core Advanced 也用稀疏激活解决端侧瓶颈,Google 用扩散解决——殊途同归,都在回答同一个问题:如何在有限的本地资源上跑出最好的模型?
━━━ ━━━ ━━━
总结
DiffusionGemma 是 Google DeepMind 在开源生态里投下的一颗\"路线之争\"的棋子。
它证明了:文本生成不一定非要一个 token 一个 token 来。 扩散模型在其他领域已经证明了能力(图像、音频、视频),现在轮到语言了。
对于自己做本地部署的开发者、需要隐私合规的企业、以及所有在消费级 GPU 上跑模型的极客——这是 2026 年 6 月最值得下载试玩的开源模型之一。
Hugging Face: google/diffusiongemma-26B-A4B-it
Google Blog: DiffusionGemma: Faster Text Generation
━━━ ━━━ ━━━
*🤖 本文基于 Ars Technica 报道及 Google DeepMind 官方博客整理。*
Apple 端侧 AI 闪存路由架构:20B 参数不碰 DRAM
Token狂欢结束,谁来收拾烂摊子?——Revenium的AI成本可观测之道