GUI-HARVEST让冻结大模型自我优化,OSWorld测试提升12.33分

GUI-HARVEST 提出一种自动优化 GUI 智能体运行框架的方法,在不改动大模型参数的前提下,通过分析截图前后变化和重复执行差异来改进代码,让固定模型在 GUI 任务上表现更好。

一句话看懂:GUI-HARVEST 提出一种自动优化 GUI 智能体运行框架的方法,在不改动大模型参数的前提下,通过分析截图前后变化和重复执行差异来改进代码,让固定模型在 GUI 任务上表现更好。

事件核心:发生了什么

根据 Hugging Face Papers 上收录的论文摘要,GUI-HARVEST 是一个面向 GUI 智能体的自动运行框架优化器。它不训练或微调大模型,而是优化模型外部的执行框架——即观察如何组织、动作如何执行、验证与恢复如何控制、任务何时终止。其核心方法分三步:把模型输出和实际执行动作与操作前后的截图对齐,定位到具体界面变化;把同一任务的多次运行视为一个联合证据单元,通过任务内比较找出与结果相关的行为差异;再把跨任务验证过的发现归纳为可复用的失败模式,映射为有边界的源代码修改,并在评测前记录预期效果,最后通过重复执行检验行为与任务表现。

摘要显示,在 OSWorld-Verified 测试中,该方法在六个通用开源、GUI 专用开源和闭源骨干模型上均取得一致的留出集提升。其中 Qwen3-VL-32B-Instruct 在全套测试上提升 12.33 分。用冻结的优化后框架迁移到 WindowsAgentArena,GPT-5 在 50 步设置下提升 13.87 个百分点。在相同骨干模型和初始框架下,GUI-HARVEST 优于 Self-Harness 和 Meta-Harness。代码已在 GitHub 公开。

为什么重要

目前 GUI 智能体的能力很大程度上受限于模型本身,而运行框架往往靠人工调参。GUI-HARVEST 把优化对象从模型参数转向可执行的框架代码,意味着即便使用 API 提供的闭源模型,开发者也可能通过改进外层逻辑获得性能提升。摘要中六个不同来源模型的测试结果,提示这条路线在开源和闭源生态中都有一定通用性。对于依赖大模型操作电脑、浏览器和桌面软件的 AI 应用来说,这提供了一种不增加训练算力、而是靠工程手段提升任务成功率的思路。

对用户/开发者/创作者的影响

对开发者而言,最直接的价值是:如果项目使用 GUI 智能体完成网页操作、表单填写或软件自动化,可以参考 GUI-HARVEST 的思路,记录每次动作前后的截图和多次运行结果,建立失败模式库,再把修复映射为框架代码改动。这比反复调整提示词更有结构性。对使用闭源模型 API 的团队来说,由于不需要访问模型权重,该方法尤其值得评估。对普通用户,短期内不会立刻感知变化,但如果这类工具被集成进 AI 助手或自动化产品,未来 GUI 操作类 AI 应用的稳定性和可恢复性可能逐步改善。目前公开信息显示,论文摘要未说明全套实验细节、推理成本变化和工程迁移难度。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,GUI-HARVEST 是否会被主流 GUI 智能体框架或商业产品采纳,形成更标准的运行框架优化流程。第二,在 OSWorld-Verified 之外的动态网页、移动端和跨应用场景中,自动修改框架代码的收益能否保持。第三,代码开源后社区复现情况如何,是否会出现更轻量的实现或与现有 API 工具链的整合方案。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 27956

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注