一句话看懂:谷歌开源了安卓自动化 Agent 项目 ARTEMIS,用自然语言就能指挥 AI 操作真实手机;它在谷歌 AndroidWorld 基准上完成率超过 99%,并原生提供 MCP Server 与 Python SDK,移动端 UI 自动化的脚本编写环节可能被大幅压缩。
事件核心:发生了什么
谷歌在 GitHub 上开源了一个名为 ARTEMIS 的项目,采用 Apache-2.0 协议,Python 实现。据素材信息,项目于 8 月 13 日放出,一个半月内 star 破万。其核心能力是:用户用自然语言下达任务,Agent 自己看屏幕、理解界面、规划动作并执行,比如“打开设置找到电池选项,告诉我当前电量”。
ARTEMIS 提供原生 MCP Server,可对接 Antigravity、Claude Code、Codex、Windsurf 等 AI 编程工具,也能接入 Gemini、Claude、GPT、Qwen-VL 等主流多模态模型。在谷歌研究院的 AndroidWorld 基准上,目前公开信息显示其完成率超过 99%,任务覆盖 20 多个 App、100 多条多步任务。官方将该成绩限定在 AndroidWorld 的评测条件内。
与 Appium 这类“写脚本、执行脚本”的自动化框架不同,ARTEMIS 是任务驱动型 Agent 系统,跨 App 操作时不需要开发者手写定位器、等待策略和页面编排。
为什么重要
移动端 UI 自动化长期被三件事困扰:装环境配驱动、定位元素写 xpath、处理自绘控件。Canvas、Compose、Flutter 等自绘页面在传统控件树里往往抓不到节点,脚本很容易死在上面。ARTEMIS 优先走无障碍层级拿元素索引,拿不到再用 OCR 和视觉模型兜底,这给过去难以自动化的界面提供了一条新路径。
更关键的是执行模式的变化。ARTEMIS 分 Flash 和 Pro 两档:Flash 单步 3 到 5 秒,适合日常冒烟和确定性操作;Pro 单步 15 到 40 秒,由 Planner、Operator、Checker 多角色协作,适合长流程探索并输出报告。它把“场景编排”这件事从人写脚本变成了人描述目标,测试团队最费工的环节可能因此被重新分配。
对用户/开发者/创作者的影响
对 Android 测试开发者,ARTEMIS 的上手成本较低:clone 仓库后运行 start.sh,会自动装齐 ADB、scrcpy、FFmpeg 和 Python 环境,并打开 Web 控制台,支持真机投屏、实时推理流和任务回放。命令行和 Python SDK 也都能调用,SDK 返回 Pydantic 强类型结果,可接 pytest 与 CI 流水线。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
但边界同样清楚。目前只支持 Android;每一步都是模型调用,token 成本和耗时不适合替代数千条用例的回归矩阵;模型输出的结论带概率属性,不等于脚本断言的“非黑即白”;如果 App 阉割了无障碍支持,稳定性会打折扣。
因此短期更现实的分工是:日常回归仍用 Appium 等脚本压缩执行成本,探索测试、冒烟、Bug 复现交给 ARTEMIS。对测试平台团队,MCP 和 SDK 两个入口值得关注,可以把 ARTEMIS 包成真机执行节点。
值得关注的后续
一是 iOS 支持、端侧轻量视觉模型和实时语音交互是否按路线图落地,这会决定它能否覆盖更多移动端测试场景。二是 MCP 与 Python SDK 的生态接入速度,决定它能否从单机工具变成测试平台组件。三是成本与稳定性:模型推理成本、自绘界面的坐标兜底成功率,以及企业质量门禁如何接纳概率性结论,都是落地必须回答的问题。
来源:juejin


