WebMCP 详解

谷歌 Chrome 和微软 Edge 团队正在共同推进一个名为 WebMCP 的浏览器 API,让网站能以标准化格式描述自身功能,从而让 AI 智能体更可靠地完成搜索、下单等操作,而不是靠“截图猜按钮”。

一句话看懂:谷歌 Chrome 和微软 Edge 团队正在共同推进一个名为 WebMCP 的浏览器 API,让网站能以标准化格式描述自身功能,从而让 AI 智能体更可靠地完成搜索、下单等操作,而不是靠“截图猜按钮”。

事件核心:发生了什么

据社区更新信息(2026-08-29),谷歌和微软罕见地在同一方向上达成一致,正在联手推动 WebMCP(Web Model Context Protocol)浏览器 API。该 API 允许网站将自身的核心操作——如搜索、加入购物车、预订时段——以结构化方式写下来,每个操作包含名称、供模型阅读的描述以及可接受的输入列表。

这一做法针对的是当前 AI 智能体访问网页时的痛点。目前,智能体访问应用大致有六种方式:直接调用原始 API、连接后端 MCP 服务器、让智能体像人类一样看屏幕操作、使用浏览器自动化工具读取页面代码。前两种速度快但需要网站方主动提供接口,后两种无需配置但依赖智能体从截图或匿名 HTML 元素中“猜”含义,遇到页面改版就容易失效。WebMCP 属于第六种路径,核心思路是让网站主动把“自己能做什么”以机器可读的形式写出来,而不是让智能体去解析为人类设计的布局。

为什么重要

这一动向的意义在于它触及了智能体落地的一个根本瓶颈:网页本身只为人类阅读而编写,缺少对程序友好的接口描述。无论是视觉截图还是 DOM 解析,本质上都是在用通用方法去猜一个原本就存在的结构化能力。WebMCP 一旦普及,意味着智能体可以直接读取网站“自述”的操作清单,而不必每次消耗大量 token 去截屏、点击、等待、再截屏。

从竞争格局看,谷歌和微软同时在 Chrome 与 Edge 中推进这一标准,说明浏览器厂商正在试图成为智能体与网页之间的基础设施层。这也回应了 MCP(Model Context Protocol)此前的生态积累——差别在于,WebMCP 将定义权交给了网站本身,由了解产品的人来描述自己提供的服务,而非由智能体或通用工具去推断。这可能是网络协议层面多年来最实质的一次变革方向。

对用户/开发者/创作者的影响

对普通用户而言,如果这一标准落地,AI 购物助手或订票工具将不再依赖“看屏幕”的笨办法,操作成功率有望显著提升,出错率降低,响应速度也可能更快。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者来说,WebMCP 提供了一种新的集成范式:网站不再需要单独为每个智能体开发 API 适配层,只需按规范描述自己的操作即可。这意味着中小型网站可以用较低成本接入智能体生态,而不必维护复杂的后端接口。对于正在开发智能体应用或浏览器扩展的团队,这也会影响技术选型——是继续投资视觉识别和 DOM 解析,还是直接支持 WebMCP 标准。

对创作者或内容平台而言,如果页面操作可以被结构化描述,内容调度、订阅、支付等环节的自动化程度会提高,但同时也需要考虑哪些操作愿意被机器直接调用,涉及访问控制和商业规则的设计。

值得关注的后续

目前公开信息显示,WebMCP 仍处于浏览器 API 的提案和推进阶段,尚未看到大规模商用落地的时间表。值得观察的几点包括:

第一,Chrome 和 Edge 的正式支持版本何时发布,以及是否有第三方浏览器跟进;第二,主流电商、预订平台是否愿意采用这一标准,毕竟它要求网站主动暴露自己的操作接口;第三,MCP 服务器与 WebMCP 之间如何协同——是并行存在还是逐步融合,这将直接影响开发者的接入策略。

来源:社区更新 · 2026-08-29

celebrityanime
celebrityanime
文章: 21466

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注