扩散语言模型出规划补丁方案:Plan-and-Patch 修复成功率超自回归近一倍

arXiv 新论文提出 Plan-and-Patch,用扩散语言模型(dLLM)生成程序式规划并在出错时只修补局部区域;在 Natural Plan 任务上,无任务训练的扩散规划修复成功率达到 53.7%,约为自回归模型 27.0% 的两倍。

一句话看懂:arXiv 新论文提出 Plan-and-Patch,用扩散语言模型(dLLM)生成程序式规划并在出错时只修补局部区域;在 Natural Plan 任务上,无任务训练的扩散规划修复成功率达到 53.7%,约为自回归模型 27.0% 的两倍。

事件核心:发生了什么

根据 arXiv cs.AI 2026 年 10 月 9 日发布的新论文摘要,研究者提出一个名为 Plan-and-Patch 的“规划加执行”框架。其思路是让扩散语言模型通过并行去掩码生成结构化的、类似程序的计划;当环境变化、工具返回异常或某个动作失败时,不重新生成整份计划,而是固定前后文,只填补受影响区域,完成计划修复。

对比实验使用 DreamReasoner-8B 和 Qwen3-8B 分别作为扩散和自回归(AR)规划器。在未做任务专项训练的 Natural Plan 任务上,扩散模型的计划修复成功率为 53.7%,自回归为 27.0%。在 ALFWorld 和 TextCraft 等智能体基准上做任务专项训练后,两类规划器的计划生成成功率接近,但扩散模型将平均计划生成延迟降低了 39% 至 46%。

为什么重要

长程智能体常因环境变化或工具异常而需要改计划。传统做法是重写整份计划,代价高,还可能把原本正确的步骤改坏。Plan-and-Patch 把“修复局部”变成核心能力,与扩散模型天然适合并行填充和局部生成的特点相契合,给规划这一智能体关键环节提供了不同于自回归逐 token 生成的技术路线。

如果后续工作能复现并扩展到更复杂的工具调用场景,这类方法可能推动智能体框架从“一次性生成计划”转向“生成加在线修复”,对多步骤任务、复杂工作流自动化和低延迟部署都有参考价值。目前公开信息仅来自论文摘要,尚不清楚完整实验细节和泛化能力。

对用户/开发者/创作者的影响

对开发者而言,这项研究提示在构建多步骤 AI 应用时,可以把“计划修复”设计成独立模块,而不是每次失败都让模型从头推理。目前公开的对比局限在 DreamReasoner-8B、Qwen3-8B 以及 Natural Plan、ALFWorld、TextCraft 等基准,不能直接推断真实生产环境下的表现,但低延迟和局部修复的思路值得关注。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用智能体完成自动化任务的团队来说,如果未来有开源实现或 API 支持,可能降低长流程任务失败后的重试成本。对创作者和企业采购方,短期内影响有限,更多是技术路线信号,而非可直接采购的产品发布。

值得关注的后续

第一,看 Plan-and-Patch 是否有代码或模型权重开源,以及是否在更复杂工具调用上复现修复成功率优势。第二,看扩散语言模型与主流自回归模型在智能体规划上的延迟和成本差距能否在真实服务中保持。第三,看这一方法是否被智能体框架或厂商产品吸收,变成可调用的计划修复能力。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28548

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注