阿里开源 Qwen-UI-Agent:真机多模态基座模型登场

阿里正式开源 Qwen-UI-Agent,一个面向真实手机、桌面和网页环境的 GUI 智能体基座模型。它把测试场景从模拟器搬到真机,并在多个国际基准上超过了行业头部闭源模型,值得开发者重点关注。

一句话看懂:阿里正式开源 Qwen-UI-Agent,一个面向真实手机、桌面和网页环境的 GUI 智能体基座模型。它把测试场景从模拟器搬到真机,并在多个国际基准上超过了行业头部闭源模型,值得开发者重点关注。

事件核心:发生了什么

8 月 21 日,阿里巴巴开源了 Qwen-UI-Agent,这是一个以真实世界为中心的 GUI(图形用户界面)智能体基座模型。与传统的 GUI 模型只在模拟器或静态网页上验证不同,Qwen-UI-Agent 覆盖了移动设备、桌面端、Web 网页和深度搜索四类环境,目标是直接驱动真实设备完成复杂的跨应用操作任务。

来自官方公布的评测数据,Qwen-UI-Agent 在 MobileWorld 测试中拿到 82.1% 的得分,超过多款国际旗舰闭源模型。为了拉近模拟与现实的距离,团队搭建了包含超过 100 台真机、150+ 应用的移动环境,并推出包含 400+ 任务的 MobileWorld-Real 真机基准,模型在该基准上的任务成功率高达 92.2%。在 Android Daily 测试中接近满分。桌面端它在 OSWorld-Verified 得分 79.5%,同时在 WebArena 网页测试中排名第一。

为什么重要

这不仅是又多了一个大模型,而是把智能体落地的关键难点——从“能看懂屏幕”到“能操作真实系统”——往前推进了一步。过去很多 GUI Agent 在模拟器效果不错,但到了真机上会因界面渲染差异、网络延迟或权限弹窗而失效。Qwen-UI-Agent 选择直接用真机数据训练,并同步开源测试基准,等于把评判标准从厂商自说自话拉回到可复现的真实环境里。

同时,它采用了“单次决策输出批量动作”的交互方式,能在一次推理中连续执行多个界面操作,显著压缩执行步骤。对于推动大模型从被动问答走向主动执行复杂任务,这条技术路线有行业示范意义。

对用户/开发者/创作者的影响

对开发者而言,Qwen-UI-Agent 是开源模型,意味着可以本地化部署和微调,做自动化测试、移动端 RPA、智能客服辅助操作等应用时,不再完全依赖闭源 API,数据隐私和调用成本都能更好控制。它支持命令行操作和长轨迹(超过 100 步)的在线强化学习训练,也给研究智能体长期规划的团队提供了新底座。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户来说,这类模型是未来“一句话让手机帮你订票、比价、填表”这类功能的技术前提。虽然目前公开信息显示它主要面向开发者和企业级场景,但这层能力成熟后,普通用户的 App 使用方式可能会发生变化。

值得关注的后续

第一个观察点是开源协议的细节:模型权重是否可商用、是否附带完整训练数据管线,会直接影响中小团队是否会跟进部署。

第二个是竞品反应:国内字节、腾讯、百度,以及国外的 Anthropic、Google 都在押注 GUI Agent,Qwen-UI-Agent 开源后,头部闭源模型的定价和功能迭代速度可能被迫加快。

第三个是安全边界:模型内置了支付、删除数据、隐私授权等敏感操作的“等待确认”机制,但如何在真实业务中配合人机协同规则,还需要更多落地案例检验。

来源:AIbase

celebrityanime
celebrityanime
文章: 19632

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注