一句话看懂:阿里巴巴发布 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,能直接操作手机、电脑、网页和命令行完成跨应用任务。它在多个基准测试中超越 GPT、Gemini 和 Claude 等旗舰模型,意味着国产大模型在“AI 操作电脑/手机”这一关键赛道上已经进入第一梯队。
事件核心:发生了什么
8 月 20 日,阿里巴巴千问团队正式推出 Qwen-UI-Agent,定位为“以真实世界为中心的 GUI 智能体基座模型”,覆盖移动端、电脑端、网页端和深度搜索(DeepSearch)环境。与传统聊天机器人不同,它能跨 App 执行真实操作,例如用高德查地址、用大众点评找咖啡馆、再去小红书看推荐并汇总,全程无需人工切换应用。
官方公布的基准成绩非常亮眼:移动端 MobileWorld 得分 82.1%,分别领先 GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 12.0、14.6、8.9 个百分点;真机基准 MobileWorld-Real 达到 92.2%,电脑端 OSWorld-Verified 得分 79.5%,浏览器环境 WebArena 得分 73.6% 位列第一。此外,该模型在超长轨迹(100 步以上)上支持在线强化学习训练,并搭建了覆盖 100+ 台真机、150+ App 的移动测试环境。
为什么重要
这一发布的意义不仅在于跑分领先,更在于它验证了一条技术路线:GUI Agent 可以脱离模拟器,直接在真实设备上长程执行任务。此前许多 Agent 模型停留在“看懂屏幕”的层面,而 Qwen-UI-Agent 强调“会用每一块屏幕”——既能定位界面元素,也能理解任务意图,还能在关键节点做安全判断。
从竞争格局看,这意味着阿里在“AI 操作数字世界”这一入口上,与 OpenAI、Google、Anthropic 形成了正面竞争。对行业而言,真正的价值在于它打通了“从模拟到真实”的最后一公里:几乎满分(97.5%)的 Android Daily 成绩和自建的真机基准,说明该模型并非只在实验室失效,而是具备实用性。中文互联网的复杂 App 生态(高德、钉钉、小红书、12306)成为其差异化训练场,这在国际模型上并不常见。
对用户/开发者/创作者的影响
对普通用户而言,未来这类模型可以直接替代“人工跑腿”——帮忙查车次、订会议、整理相册收据等跨应用任务,只需一句话描述即可启动执行,而无需学习繁琐的 App 操作。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者和企业来说,Qwen-UI-Agent 意味着 GUI 自动化门槛大幅降低。它能在单次决策中批量输出多个动作,且电脑任务中约 40% 的动作以 CLI(命令行)形式完成,连接了 GUI 与脚本两种执行路径,适合用于流程自动化、RPA 替代、跨系统数据核对等场景。
对创作者,尤其是需要大量内容检索和跨平台信息汇总的从业者,该模型可帮助自动完成多平台调研、价格对比、笔记总结等耗时工作,但目前公开信息显示它仍以基座模型形式存在,具体开放方式和商业化路径尚未披露。
值得关注的后续
目前公开信息显示,Qwen-UI-Agent 已发布技术报告和项目主页,但尚未明确 API 发布时间与定价策略。建议关注以下三点:
第一,该模型是否会像 Qwen 系列其他成员一样开源。如果沿用千问的开源策略,开发者生态可能迅速扩张;第二,真机评测 MobileWorld-Real 的 92.2% 能否在更复杂的真实场景中稳定复现,尤其是涉及支付、隐私授权等敏感操作时,模型“主动停手”的安全机制是否可靠;第三,微软、Google 等竞品在 PC 端 Agent 上是否会加速跟进,带动整个 GUI Agent 赛道从跑分竞赛转向实际产品落地。
来源:IT之家(RSS)


