Cloudflare 用搜索、训练和代理爬虫的精细控制取代了其全面的 AI 机器人模块

Cloudflare 自 2024 年 7 月提供一键屏蔽所有 AI 爬虫功能后,现在将其拆分为搜索、训练和代理三类独立控制,并将于 2026 年 9 月 15 日起默认拦截携带广告页面的训练和代理爬虫。此举旨在迫使 AI 公司明确区分爬虫目的,同时让网站所有者更精细地管理 AI 对自身内容的访问。

Cloudflare 用搜索、训练和代理爬虫的精细控制取代了其全面的 AI 机器人模块

一句话看懂:Cloudflare 自 2024 年 7 月提供一键屏蔽所有 AI 爬虫功能后,现在将其拆分为搜索、训练和代理三类独立控制,并将于 2026 年 9 月 15 日起默认拦截携带广告页面的训练和代理爬虫。此举旨在迫使 AI 公司明确区分爬虫目的,同时让网站所有者更精细地管理 AI 对自身内容的访问。

事件核心:发生了什么

Cloudflare 在仪表盘内推出了新的 AI 爬虫控制面板,将此前“一键全禁”的单一选项替换为三个独立类别:搜索(搜索引擎索引)、训练(AI 模型训练数据收集)和代理(代表用户行动的 AI 代理,如 ChatGPT)。网站所有者可针对每个类别单独设置“允许”或“阻止”。

从 2026 年 9 月 15 日起,Cloudflare 将默认对包含广告的页面阻止训练和代理爬虫,理由是广告意味着网站希望吸引人类访客,而非数据采集。搜索爬虫仍将被允许。对于同时服务于搜索和训练的多用途爬虫(如 Googlebot),Cloudflare 将采用其中限制最严格的那一类规则。这些功能对 Cloudflare 的免费版用户同样开放。

此外,Cloudflare 为企业用户推出了BotBase,一个内置在后台的可搜索机器人数据库,能展示每个机器人的分类方式及其对内容的利用情况(例如仅链接还是完整复制内容)。同时,Cloudflare 更改了“已验证机器人”的规则:此前所有验证过的机器人默认放行,未来将根据其所属类别判断访问权限,“已验证”标签本身不再保证准入,运营商还需证明自身不会滥用授权。

Cloudflare CEO Matthew Prince 曾批评 Google 将搜索爬虫与 AI 爬虫捆绑在一起。2026 年 6 月,他提到机器人流量已首次超过人类流量,这一时间点比他最初预期的 2027 年底大幅提前。

为什么重要

这一变化对 AI 行业的内容获取模式产生了实质性影响。Cloudflare 作为全球最大的 CDN 和网络安全提供商之一,其默认策略直接决定了大量网站内容对 AI 训练方和代理服务的可及性。通过按目的拆分类别并默认拦截训练爬虫,Cloudflare 实际上在行业层面设定了标准:利用广告变现的内容网站,不应成为 AI 训练的免费数据源

此举也迫使 AI 公司(如 Google、OpenAI)必须更明确地区分其爬虫行为,否则可能被整体屏蔽。Cloudflare 重申了“多用途爬虫按最严格规则执行”的原则,这给那些尚未分离搜索和训练爬虫的厂商带来了合规压力。与此同时,BotBase 和验证规则的变化提高了 AI 爬虫的透明度,让企业和网站运营商能够像管理安全策略一样管理 AI 访问权限。

这一事件也反映了网站所有者与 AI 公司之间长期存在的数据使用权矛盾正从口头争议转向技术和默认规则层面的博弈。Cloudflare 作为中间层基础设施提供者,正在主动扮演规则制定者的角色。

对用户/开发者/创作者的影响

网站运营者和内容创作者:你现在可以在 Cloudflare 仪表盘中按类别精细控制 AI 爬虫访问,无需再通过 robots.txt 或自行编写防火墙规则。如果你在网站上放置了广告,你的训练和代理爬虫将被默认屏蔽,这意味着你无需额外操作即可阻止多数 AI 训练数据抓取。但如果你希望允许某些 AI 代理(如 ChatGPT 插件)为你的网站带来直接用户访问,可以单独开启“代理”类别。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

AI 公司和爬虫运营商:现在需要确保你的爬虫行为清晰分类,并且在请求中正确标识自身身份和目的。如果你同时进行搜索索引和 AI 训练,就必须提供独立的爬虫入口,否则将面临 Cloudflare 网络下大量网站的一刀切屏蔽。此外,“已验证”标签不再是一劳永逸的通行证,你需要持续证明自己没有滥用访问权限。Cloudflare 的 BotBase 数据库将让你的爬虫行为更加透明可查。

开发者:如果你正在开发基于 AI 代理的应用(如自动化客服、数据采集工具),需要特别注意 Cloudflare 网络下网站的代理爬虫默认拦截策略。你的应用可能无法正常访问这些网站,除非目标网站所有者手动开启代理访问权限,或你的爬虫能被明确识别并符合 Cloudflare 的安全规则。

值得关注的后续

1. 其他 CDN 和安全服务商是否跟进? Cloudflare 的分裂策略如果被采用,可能成为行业惯例。Akamai、Fastly 等竞品是否会推出相似功能,值得观察。2. 多用途爬虫的厂商如何回应? 尤其是 Google,其 Googlebot 同时服务于搜索和 AI 训练。Google 已可能被迫拆分爬虫功能,或以其他方式证明其不会将训练数据用于损害网站利益。3. 默认拦截对 AI 训练数据质量的影响:大量网站默认阻止训练爬虫后,公开可抓取的高质量文本语料库来源将进一步减少,这可能加速 AI 公司转向合成数据或付费数据许可模式。目前公开信息显示,Cloudflare 尚未公布广告检测的具体技术细节。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 16265

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注