Cloudflare 上线新设置:允许搜索引擎爬取,同时拒绝 AI 训练

Cloudflare 推出"Disallow AI Training"新设置,让站长在继续被搜索引擎抓取的同时,拒绝内容被用于 AI 训练。苹果、谷歌、微软已承诺遵守这一设置。

一句话看懂:Cloudflare 推出”Disallow AI Training”新设置,让站长在继续被搜索引擎抓取的同时,拒绝内容被用于 AI 训练。苹果、谷歌、微软已承诺遵守这一设置。

事件核心:发生了什么

Cloudflare 上线了一项名为”Disallow AI Training”(禁止 AI 训练)的配置。站长启用后,Cloudflare 仍会放行搜索引擎爬虫,以及其他被系统标记为”Accountable”(可问责)的混合型爬虫;其余以 AI 训练为目的的爬虫则会被拦截。官方提示,如果直接屏蔽这类混合爬虫,可能波及网站的搜索排名。

对老用户来说迁移成本不高:此前在 Training 选项中选择了”Block”或”Block on pages with ads”的站点,会自动切换到”Disallow AI Training”。与此同时,谷歌将在未来几周上线 Google-Extended 的 URL 级透明度工具,苹果也在开发自己的 URL 级工具,微软则计划在 2027 年初通过 robots.txt 支持拒绝 AI 训练。

为什么重要

过去站长的处境相当被动:搜索引擎爬虫和 AI 训练爬虫常共用同一套抓取通道,一刀切屏蔽可能损伤 SEO,放任又等于免费贡献训练语料。Cloudflare 这次把”可被搜索”和”可被训练”拆成两个开关,等于在基础设施层给内容授权划了一条界线。

更关键的是三大厂商的背书。搜索引擎爬虫与 AI 训练爬虫长期共用抓取路径,单靠网站自己用 robots.txt 拦,执行效果有限。当 Cloudflare 和主流厂商在同一套标记体系下对齐,拒绝 AI 训练才真正具备可操作性。这也意味着内容方与 AI 公司之间关于训练数据的议价,正从零散的公开喊话转向平台化的技术约束。

对用户/开发者/创作者的影响

对站长和内容创作者而言,可以更精细地管理内容用途,既保留搜索流量,又不让作品默认进入大模型的训练集,但实际拦截效果仍取决于爬虫是否遵守声明。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者需要留意:站点策略变化可能影响依赖网页抓取构建数据集、RAG 检索或微调语料的项目,此前能拿到的内容源可能被挡在门外。使用闭源大模型 API 的团队短期感受不明显,但自建数据管线的一方要提前评估合规与数据来源风险。

普通用户侧影响间接:搜索结果大体不变,但未来部分内容可能不再被 AI 训练吸收,相应地,模型对某些垂直领域内容的覆盖度也可能变化。

值得关注的后续

一是谷歌 Google-Extended 的 URL 级工具和苹果同类工具能否按期落地,以及它们披露的颗粒度是否足够。二是微软 2027 年初的 robots.txt 方案会以什么形式实现,是否与 Cloudflare 的标记体系兼容。三是”Accountable”爬虫的判定标准由谁定义、如何审计——目前公开信息显示,这套机制的透明度和争议处理流程尚不清晰。

来源:AIbase

celebrityanime
celebrityanime
文章: 23809

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注