Cloudflare为客户提供新的AI流量选项

Cloudflare 宣布从 9 月 15 日起,将根据网站所有者的 AI 训练屏蔽设置,统一拦截 Googlebot、Applebot、BingBot 等多用途爬虫。这实际上是要求搜索引擎和 AI 公司明确区分“搜索”与“训练”行为,否则将失去对全球超 20% 网站(Cloudflare 客户)的访问权。

一句话看懂:Cloudflare 宣布从 9 月 15 日起,将根据网站所有者的 AI 训练屏蔽设置,统一拦截 Googlebot、Applebot、BingBot 等多用途爬虫。这实际上是要求搜索引擎和 AI 公司明确区分“搜索”与“训练”行为,否则将失去对全球超 20% 网站(Cloudflare 客户)的访问权。

事件核心:发生了什么

Cloudflare 调整了爬虫管理政策:自 2025 年 9 月 15 日起,对于同时执行搜索索引和 AI 训练任务的多用途爬虫(如 Googlebot、Applebot、BingBot),将按照其所有行为中最严格的规则来执行。如果网站所有者选择“阻止 AI 训练”(通过新版 AI 流量管理选项或旧版“屏蔽 AI 机器人”服务),那么这些爬虫整体都会被阻止——即使它们只是来执行搜索索引任务。此前,网站只能分别处理搜索和训练请求,现在 Cloudflare 强制将两者绑定,迫使爬虫开发者明确身份声明。

为什么重要

这一政策直接击中了大型科技公司的“模糊地带”。许多搜索引擎(如 Google、Bing、苹果)的爬虫既抓取网页用于搜索排序,又用这些数据训练大模型。网站所有者往往愿意为搜索索引开放内容,但不愿意免费提供训练数据。Cloudflare 通过“按最严格规则执行”打破了这种两头通吃的状态。全球超过 20% 的网站使用 Cloudflare 服务,这意味着主要 AI 爬虫可能失去大量优质数据源。同时,Cloudflare 将“信任”转化为可继承的资产——爬虫一旦被判定为“训练用途”,就会在该客户的所有域名中失去访问资格。这种机制对反垄断和版权争议提供了有形的执行手段。

对用户/开发者/创作者的影响

  • 站点管理员:可以更精细地控制 AI 爬虫,无需自己编写复杂的 robots.txt 或 IP 黑名单。通过 Cloudflare 控制台一键选择“阻止 AI 训练”,即可屏蔽 Googlebot、BingBot 等混合用途爬虫,但会保留纯搜索爬虫(如果网站主选择禁止训练)。不过要注意,Cloudflare 本身也是代理服务,用户需要信任其爬虫识别准确度——有评论指出存在大量伪造的 Googlebot,Cloudflare 的识别机制是否可靠仍需检验。
  • AI 公司/模型训练方:规模化获取网页数据的门槛提高。如果爬虫被大规模屏蔽,训练数据的多样性和新鲜度将受冲击,倒逼 AI 公司与网站建立授权协议或付费机制。Hacker News 用户提到,这种“信任积分”制可能比法律诉讼更有效。
  • 普通用户:短期内搜索体验可能受影响(因为 Googlebot 等爬虫被屏蔽后,搜索引擎索引更新变慢);长期看,网站原创内容拥有更多议价权,可能推动更透明的数据使用生态。

值得关注的后续

1. 爬虫开发商如何应对:Google、微软、苹果是否会拆分爬虫角色(例如为训练单独声明身份)?如果保持现状,它们将不得不与 Cloudflare 谈判特殊协议。
2. 反垄断执法的连锁反应:素材中提到了欧盟监管,Cloudflare 这个“牙尖”(deterrent with teeth)可能成为监管机构施压科技巨头的参考案例。
3. 技术对抗升级:已有用户利用 Cloudflare 的自定义规则(如检查 URL 长度和 Cookie)有效过滤滥用爬虫。新政策后,伪造爬虫的伪装将更难穿透——但 Cloudflare 需要不断更新识别库,避免误伤正常搜索流量。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:hackernews

celebrityanime
celebrityanime
文章: 15120

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注