

6月10日,谷歌DeepMind正式发布了一款名为DiffusionGemma的实验性开放模型。
这款模型最关键的变化不在参数规模,而在生成方式。它不再像主流大语言模型那样从左到右逐个token地"吐字",而是一次性生成包含256个token的整块文本,再通过多轮扩散过程对其进行精修。
谷歌官方公布的性能数据相当抢眼。在NVIDIA H100上每秒可生成1000个以上的token,在消费级的GeForce RTX 5090上也能达到每秒700个以上。
相比传统自回归模型,速度最高可达4倍。
DiffusionGemma的具体规格也值得关注。它采用混合专家架构(MoE),总参数量260亿,推理时实际激活38亿参数。
模型基于谷歌的Gemma 4家族和Gemini Diffusion研究构建,量化后只需18GB显存即可在高端消费级GPU上运行。
模型权重以Apache 2.0许可证开放,已在Hugging Face上线,并获得了vLLM、Transformers、MLX、Unsloth等主流推理框架的当日支持。
不是更强,而是另一种逻辑
这里需要把一件事说清楚。
DiffusionGemma并不是"更强的Gemma 4"。谷歌自己在官方文档中明确指出,这款模型在各项基准测试上的输出质量低于标准的Gemma 4。
这一点谷歌没有遮掩。在追求最高质量的推理任务或通用对话场景上,他们仍然推荐使用标准版Gemma 4。
那为什么还要发布这样一款模型?答案在于使用场景的本质性差异。
传统自回归模型像打字机,每个字母敲完才能敲下一个。扩散模型更像印刷机,整版铺开后再统一刷新。
对于需要看整体上下文才能写好的任务,比如在代码文件中部补全一行、改写一段已有文字、填补结构化数据的空缺,扩散方式从底层逻辑上就更合适。
因为在生成过程中,每一个token都可以同时引用前后所有其他token,包括"还没写出来"的那些。传统自回归模型只能向后看,扩散模型可以双向参照。
谷歌给出的一个典型案例是数独求解。基础模型起始正确率几乎为零,经过专门微调后跃升到80%,同时所需的步骤从48步以上压缩到12步。
这是非线性任务上扩散结构的天然优势。
适用场景与隐含的产业信号
DiffusionGemma被明确定位为面向本地、交互式、对延迟敏感的开发者工作流。
典型场景包括代码补全与中部插入、行内文本编辑、快速迭代生成,以及氨基酸序列、数学图结构等非顺序领域的应用。
需要注意的是一个限制条件。这种4倍加速主要在本地低并发推理场景下成立,在高并发的云端服务中,自回归模型可以高效占满计算资源,并行解码的优势会被显著稀释,甚至可能推高服务成本。
这个细节释放了一个清晰的产业信号。
谷歌选择以开放权重的方式释放扩散文本模型,瞄准的并不是云端商业市场,而是日益壮大的本地部署开发者群体。这个群体关心的不是绝对峰值性能,而是隐私、成本、自主可控这些"在自己机器上跑"的现实诉求。
把扩散方法从图像生成迁移到文本生成本身并不新鲜。OpenAI、Inception Labs、Mistral等机构在过去一两年里都有相关探索。
但谷歌这次是首个以工程化级别的开放权重大模型,把这条技术路线推到主流工具链兼容的程度。
一个值得关注的方向
把DiffusionGemma放到更长时间尺度看,意义可能不止于速度。
文本生成的主流范式从2017年Transformer问世以来,长期由自回归架构主导。这种"从左到右一个一个吐"的模式深刻塑造了今天大语言模型的能力边界、推理方式和应用形态。
扩散方式提供的不仅是速度替代,更是一种结构性的另一种可能。
它让模型能够同时持有一整块文本,全局调整、自我纠错、双向参照。这种能力在长文档编辑、多模态对齐、复杂结构生成等任务上,长期潜力可能远超当下的4倍加速本身。
当然,扩散文本模型距离成为主流还有很长的路要走。质量问题、长上下文处理、与RAG等工程实践的对接,都是需要逐步解决的真实挑战。
但今天的发布至少说明,下一代生成式AI的范式之争,可能不只是参数规模和数据质量的较量。
底层生成机制本身,正在重新打开。
易云达配资提示:文章来自网络,不代表本站观点。