Google的DiffusionGemma证明,构建文本扩散模型无需从头训练。

Google DeepMind 将现成的 Gemma 4 模型改装成文本扩散模型 DiffusionGemma,只用不到 10% 的训练数据预算,换来约每秒 1500 token 的生成速度。这件事说明,构建文本扩散模型不一定要从头训练。

一句话看懂:Google DeepMind 将现成的 Gemma 4 模型改装成文本扩散模型 DiffusionGemma,只用不到 10% 的训练数据预算,换来约每秒 1500 token 的生成速度。这件事说明,构建文本扩散模型不一定要从头训练。

事件核心:发生了什么

Google DeepMind 在 6 月中旬发布了 DiffusionGemma 模型,并于 8 月公开了详细技术报告。与逐字生成文本的传统大语言模型不同,DiffusionGemma 每次并行精修 256 个 token 的文本块,工作方式更接近图像生成模型从噪声中恢复画面。

团队没有从零训练,而是基于现有的 Gemma-4-26B-A4B 模型进行改造,训练所消耗的 token 预算不到原始训练量的 10%。整个改造分为两个阶段:先让模型学会从加噪文本块中重建内容,再用 Google 称为 SD·RL 的流程合并强化学习与采样蒸馏,在提升回答质量的同时减少推理步数。

报告显示,该模型在推理基准上的质量评分平均提升约 10 分,生成速度接近原 Gemma 4 模型的四倍,回答长度也缩短约 50%。模型还支持双向推理,可以在最终输出前修正早期错误——比如一道数学题中,原版模型先写出“-1”,后改为“-25”,而 DiffusionGemma 能直接在生成过程中纠错。在数独任务上,经过少量微调后正确率接近 85%,原版模型则完全无法完成该任务。

为什么重要

过去业内普遍认为,扩散语言模型需要专门设计、从头训练,成本极高。DiffusionGemma 展示了一条更经济的路径:把已经成熟的预训练模型改造成扩散架构,用不到 10% 的训练预算,就能获得数倍于传统自回归模型的推理吞吐。这对算力受限的研究团队和中小企业来说,意味着文本扩散模型的门槛被明显拉低。

同时,Google 以 Apache 2.0 许可在 Hugging Face 上开放模型权重,延续了 Gemma 系列的开源策略。这不仅是在技术上秀肌肉,也是在为文本扩散这一相对小众的方向搭建社区生态,给后续研究提供了一个可直接修改的基线。

对用户/开发者/创作者的影响

对开发者而言,最直接的价值是速度。DiffusionGemma 在单卡 Nvidia H100 上能达到约每秒 1500 token,是原版 Gemma 4 的数倍,适合高并发、对延迟敏感的应用场景。模型同时保留了逐字生成模式,开发者可以在扩散模式和自回归模式之间切换,按任务需求做取舍。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

模型特别适合结构化输出场景。报告称,JSON 生成和代码修复只需两到三次精修即可完成,因为输入已经决定了大部分 token,这让它在数据清洗、API 响应格式化等任务上有实用潜力。初创公司 Interfaze 已将其用于多语种语音识别,也有研究团队在探索交互式放射学报告生成。

需要留意的是,DiffusionGemma 在绝对质量上仍落后于自回归版本,偶尔会出现单词重复循环,多模态任务中也可能忘记闭合推理部分。它的速度优势主要集中在单用户场景,约 32 个并发请求之后,吞吐优势就会被传统模型追平。

值得关注的后续

目前公开信息显示,DiffusionGemma 仍是实验性模型。后续可以观察三个方向:一是改装路线能否被其他团队复现,形成新的微调工具链;二是重复循环和多模态推理缺陷是否在后续版本中修复;三是 Google 是否会把这套技术整合进 Gemini 系列或面向企业提供服务,以及开源社区能否在现有基础上述生出更实用的垂直模型。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18306

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注