一句话看懂:扩散模型正从图像生成走向语言模型领域,Google、NVIDIA、Inception Labs 等机构已发布基于扩散架构的大语言模型,这种技术路线有望改变文本生成的方式与效率。
事件核心:发生了什么
Kuleshov Group 发布技术长文,系统梳理了扩散式语言模型的构建方法。文章指出,当前主流大语言模型采用自回归方式,逐字生成文本;而扩散模型则一次性生成整个序列,再通过多步迭代去噪来优化结果。2024 年,扩散模型在文本质量上首次与自回归模型达到同等水平;到 2026 年,Inception Labs 的 Mercury 2、Google 的 Gemma Diffusion、NVIDIA 的 Nemotron Diffusion 等商业级扩散 LLM 已陆续发布。该团队提出的“掩码扩散”方法,通过随机遮盖 token 并训练双向 Transformer 填空,已成为多数开源扩散语言模型的基础。
为什么重要
自回归模型虽然强大,但存在生成速度慢、无法回头修正、只能依赖左侧上下文等固有局限。扩散模型从随机噪声出发,逐步精炼,具备三大优势:生成步数可调,能在速度与质量之间灵活取舍;生成过程中可修正早期错误;每一步都能利用双向上下文信息。这意味着文本生成不再必须“从左到右逐字硬写”,技术路线首次出现实质性分流。头部实验室相继推出开源或商业模型,说明扩散架构已从学术探索进入工程落地阶段,对现有大模型训练与推理范式构成直接竞争。
对用户/开发者/创作者的影响
对普通用户而言,扩散式语言模型可能带来更快的文本生成响应,尤其在长文本场景下,不需要等待逐字输出。对开发者来说,Mercury 2、Gemma Diffusion 等模型的发布意味着新的 API 接入选项和架构选择,应用可以在推理成本与生成质量之间做更细粒度的配置。对创作者而言,扩散模型支持“先粗后精”的生成逻辑,更接近人类修改草稿的过程,未来可能在文案改写、代码补全、剧本迭代等任务中提供更自然的交互体验。不过,目前这些模型的应用生态仍处于早期,工具链和社区支持尚不如自回归模型成熟。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是扩散 LLM 实测表现能否在长文本、复杂推理等任务上持续逼近自回归模型;二是开源扩散模型是否会被更多开发者采用,形成新的生态;三是商业化定价与推理成本是否具备竞争力,尤其是在云端 API 服务中。另外,掩码扩散与多模态扩散的融合进展也值得留意,这可能影响未来统一生成模型的技术选型。


