移动端基准全面超越GPT与Claude!阿里发布Qwen-UI-Agent,开启GUI智能体新纪元

阿里发布GUI智能体基础模型Qwen-UI-Agent,在移动端、桌面和网页多项图形界面基准上全面超越GPT和Claude系列旗舰,同时验证了复杂长任务执行与安全管控能力。

一句话看懂:阿里发布GUI智能体基础模型Qwen-UI-Agent,在移动端、桌面和网页多项图形界面基准上全面超越GPT和Claude系列旗舰,同时验证了复杂长任务执行与安全管控能力。

事件核心:发生了什么

8月20日,阿里巴巴正式发布新一代GUI智能体基础模型Qwen-UI-Agent,覆盖移动端、桌面端、网页端与深度搜索(DeepSearch)环境。据官方公布的评测数据,该模型在MobileWorld基准上达到82.1%,领先GPT-5.6Sol约12个百分点、领先Claude Opus4.8约14.6个百分点;在AndroidDaily基准上取得97.5%,接近满分。桌面与浏览器场景中,Qwen-UI-Agent在OSWorld-Verified上获得79.5%,在WebArena上以73.6%的成绩位居所有对比模型首位。此外,它在GUI Grounding ScreenSpot-Pro测试中拿下81.5%,并在其余四个评估基准上刷新SOTA。

为应对仿真环境到真实设备迁移的挑战,Qwen-UI-Agent构建了覆盖超100台真实智能手机和150余款应用的移动测试环境,并自建MobileWorld-Real真机基准,包含超400个任务与100余款应用。除了常规UI点击操作,模型还支持命令行直控与批量动作输出,桌面任务中约40%的动作以批量形式产生。

为什么重要

GUI智能体一直被看作大模型从文本对话走向“帮用户办事”的关键一跳,难点在于跨平台感知、任务分解与安全兜底。Qwen-UI-Agent在多项第三方基准上全面超越国际头部闭源模型,表明国产大模型在图形界面交互这一细分路线的训练和推理能力已经走到行业前列。它选择自建真实设备环境而非纯模拟器,也回应了智能体领域“仿真强、真机弱”的普遍痛点。

最值得关注的是两项设计:一是安全机制贯穿整个任务执行流程,涉及支付、数据删除、隐私授权等敏感场景会主动暂停并告知用户,非法请求直接拒绝;二是支持超100步长轨迹的在线强化学习训练,配合约1万并发环境持续试错,这一技术路线为长周期任务建模提供了新的可行性样本。

对用户/开发者/创作者的影响

对普通用户而言,GUI智能体意味着语音或文字指令可以直接驱动手机、电脑上的具体操作——订酒店、整理文件、填表单都可能不再需要逐级点击。前提是安全机制足够可靠,“关键步骤停下确认”会成为用户信任的基础功能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者与AI应用公司来说,Qwen-UI-Agent的出现降低了构建GUI自动化产品的门槛:模型已具备跨平台理解和批量输出动作能力,开发者可以在其上封装面向企业流程自动化、个人助理、测试工具等场景的应用。对创作者而言,这类模型可用于自动化处理跨软件的素材管理、批量上传和交互类内容生产,减少重复性界面劳动。目前公开信息显示,模型尚未公布API价格、开放范围与开源计划,实际接入成本仍需后续确认。

值得关注的后续

后续可以重点观察三点:第一,Qwen-UI-Agent是否开放API或模型权重,以及商用授权如何安排,这将直接决定它能否进入开发者的工具链;第二,GPT、Claude等竞品在GUI基准上是否会快速跟进,重写评测榜单的周期可能缩短到数月级别;第三,真实设备环境下长任务的安全边界如何被监管审视,尤其是支付和数据删除场景的“主动暂停”机制能否成为行业默认标准。

来源:AIbase

celebrityanime
celebrityanime
文章: 19632

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注