ReSAIL 提出迭代智能体自蒸馏防崩溃方案,ALFWorld 成功率提升 22.5%

Hugging Face Papers 收录的 ReSAIL 论文提出一种可插拔增强方法,用于缓解 LLM 智能体在迭代自蒸馏中的性能崩溃,在 ALFWorld 与 TextCraft 上三个循环内平均最终成功率绝对值提升 22.5%。

一句话看懂:Hugging Face Papers 收录的 ReSAIL 论文提出一种可插拔增强方法,用于缓解 LLM 智能体在迭代自蒸馏中的性能崩溃,在 ALFWorld 与 TextCraft 上三个循环内平均最终成功率绝对值提升 22.5%。

事件核心:发生了什么

2026 年 9 月 30 日,Hugging Face Papers 平台收录了一篇论文摘要,标题为 ReSAIL: Mitigating Collapse in Iterative Agent Self-Distillation。该研究指出,迭代自蒸馏能让 LLM 智能体从 successive deployments 中持续学习,但现有方法在实践中出现部署性能跨循环崩溃,且依赖特权信息(PI)的任务表现也会下降。

为此,作者提出 ReSAIL,一种面向基于 PI 的迭代自蒸馏的可插拔增强组件。其核心做法是:优先选择 PI 对教师模型预测改变最大的交互步骤进行蒸馏,并在不同轨迹间平衡蒸馏损失;同时将学生的 PI 条件输出分布正则化到冻结教师的分布上,以保留特权信息行为供下一循环监督。摘要称,在 ALFWorld 和 TextCraft 上,ReSAIL 在多个模型规模上维持了三个循环的增益,相对自蒸馏基线,最终循环成功率的平均绝对提升为 22.5%。此外,在 AITZ 多模态 GUI 智能体上,基于敏感性引导的离线数据选择也提升了动作预测准确率。论文声称这是首个证据表明更稳健的学习机制能有效缓解迭代智能体自蒸馏跨部署轨迹的性能崩溃。

为什么重要

迭代自蒸馏被视为 LLM 智能体走向递归自我改进(RSI)的一条可能路径,即智能体在持续部署中不断从自身经验学习。但性能崩溃意味着模型在多个循环后可能越学越差,这会直接限制智能体长期自主进化的可行性。ReSAIL 的价值在于,它把问题从“能不能自我改进”转向“如何让自我改进不退化”,为递归自我改进路线提供了工程化的纠偏思路。目前公开信息仅为摘要,尚未核验全文实验,也未说明是否经过同行评审。

对用户/开发者/创作者的影响

对开发者和研究者而言,ReSAIL 是以插件形式增强现有迭代自蒸馏流程,不要求替换教师模型或训练架构,这可能降低在智能体训练中引入防崩溃机制的成本。对关注 AI 智能体产品化的团队,动作预测准确率和跨循环成功率的提升若能复现,将影响多轮任务型智能体在客服、自动化操作、GUI 交互等场景的可靠性和维护周期。不过,摘要只覆盖 ALFWorld、TextCraft 和 AITZ 等特定任务,不能直接外推到所有大模型或商业应用。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,观察 ReSAIL 是否被开源或集成到主流智能体训练框架,成为可复用的自蒸馏组件。第二,关注论文全文是否披露更多模型规模、任务类型和超参数敏感性结果,以判断 22.5% 增益的可复现性。第三,留意多模态 GUI 智能体方向是否有团队跟进敏感性引导的数据选择方法。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28135

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注