
一句话看懂:随着AI搜索的普及,大量用户不再直接访问传统网站,而是通过AI生成的摘要获取信息。这导致Reddit、路透社等平台开始重新评估与谷歌等科技巨头的合作,甚至计划屏蔽爬虫,一场围绕内容价值和流量分配的控制权争夺已经全面打响。
事件核心:发生了什么
据AIbase资讯,知名社区平台Reddit正在重新评估与谷歌的一份价值每年6000万美元的合同。该合同允许谷歌使用Reddit的内容来训练其AI模型。然而,随着AI搜索(如Google的SGE或Bing Chat)逐渐取代用户直接访问论坛查看原始讨论的需求,Reddit发现自身的流量正在被AI分流,因此可能不再续签或调整这一合作。
类似的情况也在传统新闻机构中蔓延。据报道,路透社(Reuters)和今日美国(USA Today)等知名媒体正在考虑完全屏蔽谷歌的网页爬虫(Crawler),阻止其抓取网站内容。媒体平台Politico计划引入注册墙等自动防御措施,而《经济学人》(The Economist)则在积极讨论退出AI搜索领域,并启动知识产权保护措施。作为应对,时代周刊(Time)尝试了一种新策略:向AI爬虫展示普通读者不可见的隐藏广告,以此让广告商能够通过AI生成的内容接触到潜在客户。
为什么重要
这一事件标志着AI搜索与传统内容生态之间的根本矛盾开始激化。从技术角度看,大语言模型的训练和推理需要海量、高质量的文本数据。过去,媒体和论坛通过内容交换获取流量,网站方允许搜索引擎(如谷歌)索引页面,搜索引擎则回馈用户点击。但AI搜索的出现打破了这一闭环:AI可以直接在搜索结果中提供摘要和答案,用户无需点击进入原始网站。这意味着媒体失去了广告展示和用户注册的机会,而开源社区依赖的爬虫数据(如Common Crawl)也可能面临内容方的全面封锁。
对于AI行业而言,这直接影响了大模型的训练数据供应链。如果大量高质量内容(新闻、专业讨论、原创报道)变得不可获取,模型在知识更新和事实准确性上可能面临退化。同时,这也可能推动AI公司与内容方之间的商业协议向“数据许可”模式彻底转变,而不是免费的数据爬取。
对用户/开发者/创作者的影响
对普通用户:未来在使用AI搜索时,可能会看到更多的付费墙或“引用来源限制”。如果你习惯了通过AI直接获取新闻摘要,可能会发现AI的回答变得更简短,或者干脆提示“无法获取该来源”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者与创作者:对于依赖爬取公开内容进行模型微调的开发者,未来获取高质量数据的门槛将显著提高。你可能需要付费购买数据许可,或者只能依赖合成数据或低质量的开源语料。对于内容创作者(如博主、媒体机构),这提示了一个必须主动“设防”的趋势:需要加入robots.txt限制、使用付费API或签订商业许可协议来保护自己的内容不被无偿利用。
对AI行业从业者:AI公司与内容方的关系将从“合作共赢”转向“商业竞合”。任何试图开发基于新闻或社区数据的AI产品,都必须提前规划内容获取的法律和财务成本。
值得关注的后续
1. 谷歌的回应与妥协:谷歌是否会像与Reddit签署巨额协议那样,与更多媒体签订“数据许可”合同,或者推出专门的媒体补偿机制(如流量分成或广告收入再分配)?这将直接影响AI搜索的商业模式。
2. 内容方的技术封锁效果:屏蔽爬虫是否真的有效?AI公司能否通过其他非官方渠道(如RSS、商业数据库或个人用户上传)获取这些内容?这将检验内容壁垒的实际强度。
3. 监管层面的连锁反应:欧盟的《版权指令》和美国的AI版权诉讼判例可能会加速出台。如果大型媒体集团集体起诉未授权的AI爬虫,将对整个大模型的训练合法性产生根本性影响。
来源:AIbase


