一句话看懂:Linux 基金会 IT 基础设施总监公开抱怨,AI 公司的爬虫正在对 git.kernel.org 发起海量抓取,消耗的 CPU 资源已超过所有合法访问的总和,迫使官方关闭部分功能来应对。
事件核心:发生了什么
据 Linux 基金会 IT 基础设施总监透露,git.kernel.org 目前每天收到约 600 万次请求,其中约 66% 会被 Anubis 验证挑战直接拦截,但仍有 33% 的机器爬虫能通过数学计算绕过关卡。经过估算,合法请求仅占整体流量的约 2%,其余全部是 AI 训练数据爬虫。这些爬虫不仅伪装成普通浏览器,还大量使用来自住宅或移动网络的随机 IP,每次只发 4-5 个请求就消失,使得传统基于 IP 的封禁手段几乎失效。目前,该站点在全球 5 个节点上共投入 14 个 CPU 核心,专门用于将 git 提交记录渲染成 HTML 页面供爬虫抓取。
为什么重要
这则新闻揭示了 AI 训练数据获取环节日益严峻的“军备竞赛”。Linux 内核提交历史约 148 万次,加上约 922 个 fork,理论上可生成数十亿个有效 URL,对需要高质量、无版权争议语料的 AI 公司极具吸引力。然而,这种大规模抓取行为正在基础设施层面造成真实损失:开源项目被迫牺牲匿名用户的正常功能来抵御恶意流量,“代理 SDK 变现”模式甚至可能利用普通用户的设备(如智能电视)参与抓取。这标志着 AI 数据采集已从早期的“友好爬虫”演进为一种不计成本的资源掠夺,开源社区的基础设施正在为此买单。
对用户/开发者/创作者的影响
对普通开发者而言,最直接的影响是 git.kernel.org 等开源基础设施将逐步关闭部分匿名访问功能,例如任意 commit 之间的 diff 渲染、patch 查看等。未来获取 Linux 内核数据仍可完整下载,但可能需要经过更严格的验证流程——Anubis 挑战本身需要消耗一定的计算资源,这可能影响自动化脚本和 CI/CD 流程的顺畅度。对于 AI 训练数据从业者,这一事件是一个信号:高质量开源代码数据将越来越难获取,依赖爬虫而非正规数据授权的做法正在面临基础设施层面的反制,未来数据合规成本只会更高。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,Linux 基金会已在考虑关闭部分高成本功能,但尚不清楚具体时间表和最终保留的功能范围。值得关注的观察点有三:其一,Anubis 验证方案是否会向其他开源项目推广,形成行业标准;其二,AI 公司是否会转向正规的数据授权渠道,甚至与开源社区达成付费协议;其三,这种对抗是否会促使更多基础设施采用“数据打包下载+API 认证”的模式,替代完全开放的网页访问。
来源:Slashdot


