研究发现,AI agents 虽声称能完成真实世界的浏览任务,实则尚未真正掌握。

Decodo 最新研究测试了 45 款 AI 智能体(Agent)的真实浏览能力,结果没有一款能拿满分,部分产品宣传与实际性能出入明显——AI 智能体离“自主替用户完成网上事务”仍有关键差距。

一句话看懂:Decodo 最新研究测试了 45 款 AI 智能体(Agent)的真实浏览能力,结果没有一款能拿满分,部分产品宣传与实际性能出入明显——AI 智能体离“自主替用户完成网上事务”仍有关键差距。

事件核心:发生了什么

据 TechRadar 报道,Decodo 以表单填写、交易支付、跨标签页操作、第三方集成等 10 类能力为测试项,对 45 款 AI 智能体进行真实浏览环境评测。结果显示,没有任何一款智能体获得满分 20 分。其中,Anthropic 的 Claude for Chrome 表现最好,拿到 18 分;OpenAI 的 ChatGPT Chrome 扩展则获 14 分。

交易相关任务是最普遍的短板,该类别平均得分仅为 0.43 分(满分 2 分)。研究指出,许多智能体虽然能完成“加入购物车”或来到结账页等流程,却无法真正替用户完成支付购买。此外,超过一半具备多步骤工作流能力的智能体,在发起不可逆操作前缺少可查证的安全保护机制,涉及信用卡号等敏感信息时存在安全隐患。

为什么重要

行业对“AI Agent 可自主浏览并完成业务流程”的预期持续升温,但 Decodo 的测试揭示出当前技术瓶颈:智能体并非原生理解真实网页的各种动态元素、第三方登录与支付网关,而是更擅长处理结构化的单一操作。厂商宣传中隐含的“通用自主能力”并不存在。研究建议,企业采购时应将智能体视为专用工具,而不是万能方案,应根据具体使用场景匹配产品能力,而非被最长的功能列表或营销话术左右。

这件事同时指向 Agent 赛道的一个深层问题——安全护栏落后于功能开发。当模型敢于执行支付等关键动作,却缺少可靠的加密存储与二次确认流程,规模化商用的信任基础就无法建立。

对用户/开发者/创作者的影响

对于普通用户,目前不宜把 AI 智能体当作可以全权托付金钱交易或重要资料填写的助手,尤其涉及跨站操作、登录验证或第三方支付时,务必要在关键步骤人工确认,减少信息泄露或误操作风险。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者与产品经理而言,这一测试结果提示应优先补足场景底层的工程能力,而非追求模型推理能力的“表面聪明”。在开发应用时,需要为涉及隐私或资金的操作设计更严谨的 API 权限边界、二次授权与可撤销机制。创作者在搭建内容自动化工作流时,也应选择在跨标签页处理和多步骤任务上表现较好的浏览器原生型智能体,以降低失败率。

值得关注的后续

第一,Claude for Chrome 和 ChatGPT 浏览器扩展的得分差距是否将持续,各厂商是否会针对交易类短板推出专项优化;第二,智能体厂商是否会在多步操作中引入更透明的安全确认机制,这将成为企业采购的重要参考指标;第三,Decodo 提出的“按需选型”是否能推动行业从通用 AI Agent 宣传转向场景化、可验证的交付标准。

来源:TechRadar

celebrityanime
celebrityanime
文章: 21660

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注