别再只给人写页面了:AI 已经开始自己点你的按钮、填你的表单

Anthropic 在 8 月下旬密集放出了 computer use、browser use 与 Claude in Chrome 等能力,AI 从此能直接操作浏览器、点击页面按钮和填写表单。这意味着网页不再只是给人看的界面,也成了机器 agent 需要读懂并操作的接口,前端开发的验收标准正在多出一个“机器…

一句话看懂:Anthropic 在 8 月下旬密集放出了 computer use、browser use 与 Claude in Chrome 等能力,AI 从此能直接操作浏览器、点击页面按钮和填写表单。这意味着网页不再只是给人看的界面,也成了机器 agent 需要读懂并操作的接口,前端开发的验收标准正在多出一个“机器读者”。

事件核心:发生了什么

8 月 26 日,Anthropic 的 Claude in Chrome 扩展正式可用,用户可以直接在浏览器中调用 Claude 完成操作。而在同月早些时候(8 月 20 日),Anthropic 已面向开发者开放了 computer use、browser use tool、Skills API 和 Files API 四项能力。这套组合拳让 AI agent 不再局限于编辑器里补代码,而是拥有了“眼睛”和“手”:它读取浏览器中的可访问性树(Accessibility Tree)来理解页面结构,然后模拟真实用户完成点击、输入、提交表单等操作。

值得注意的细节是,agent 读页面不依赖 CSS 渲染或视觉像素,而是依赖语义化的 HTML 结构、aria-label、aria-busy、aria-live 这类原本为读屏软件设计的属性。一个用裸 div 模拟的按钮,人类看着没问题,但在 agent 眼里可能只是一块无法识别的空白。

为什么重要

浏览器正在从“展示层”变成“执行层”。过去页面做好看、信息清晰就够了,但现在页面必须同时满足人和机器的阅读需求。原文将这一变化类比为“当年 SEO 的老课换了新阅卷人”——20 年前搜索引擎爬虫迫使开发者学习语义化标签和标题层级,今天的 agent 则进一步要求“可被操作”:控件状态要写入语义、表单要有可编程标签、关键动作不能依赖脆弱的 class 选择器。

区别在于赌注变大:爬虫只读不点,页面语义不清最多损失一点曝光;agent 读不懂还点不动,丢掉的可能是整笔交易转化。电商、注册流程、to B 后台这类表单和操作密集型产品会最先感受到压力。

对用户/开发者/创作者的影响

对前端开发者来说,这不是“AI 取代前端”的威胁论,而是交付物多了一个验收方。5 条可执行的落地建议:其一,用 button、input、a 等语义标签,别用裸 div 模拟可点击控件;其二,关键控件补充 aria-label 并明确状态文本——loading、成功、失败都要写进属性而非只换颜色;其三,状态变化同步通过 aria-live 区域广播,让人和 agent 都能收到结果;其四,避免把行为绑定在脆弱的类名上;其五,开始在监控里关注 agent 和自动化流量的占比变化。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户而言,agent 替你下单、填表的场景正在成为现实,但前提是网站能被机器读懂。对产品经理和业务方来说,这类“对机器友好”的改造成本不高,但应排上开发排期——尤其当产品落在表单、电商或后台管理这三个高风险区时。

值得关注的后续

一个直接的观察点:Claude in Chrome 的实际表现是否稳定——它在长流程操作(多步骤下单、复杂查询)中的成功率,将决定这到底是个演示功能还是可依赖的生产力工具。第二个观察点:竞争对手如何跟进,谷歌的 Gemini 和微软的 Copilot 是否会在浏览器侧推出类似能力,以及 Chrome 内置的端侧 AI(摘要、翻译、纠错)是否会和 agent 形成协同。第三个观察点:企业后台场景中 agent 流量的出现速度——原文判断 to B 后台会是 agent 替员工跑操作的最先落地场景,这个判断是否成立值得持续跟踪。目前公开信息显示,这套能力刚开放不到两周,实际落地案例和开发者生态规模都还在早期。

来源:juejin

celebrityanime
celebrityanime
文章: 22037

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注