有人冒充ClaudeBot等AI机器人,进行大规模漏洞扫描。

安全社区发现,有人在互联网上大规模伪造 ClaudeBot 等 AI 官方爬虫的身份,发起漏洞扫描。这类流量之前常被视为“正常的 AI 抓取”,现在被证实可能是攻击前的踩点行为。

一句话看懂:安全社区发现,有人在互联网上大规模伪造 ClaudeBot 等 AI 官方爬虫的身份,发起漏洞扫描。这类流量之前常被视为“正常的 AI 抓取”,现在被证实可能是攻击前的踩点行为。

事件核心:发生了什么

在 Hacker News 的相关讨论中,多位运维工程师报告称,其防火墙上出现了大量以 AI 爬虫名义发起的入站扫描流量。这些流量不仅来自常见的 Censys、Shadowserver、Deepfield 等基础设施扫描器,还混杂了标注为 ClaudeBot(Anthropic 官方爬虫)等 AI 产品抓取标识的请求,同时也有大量中国和俄罗斯 IP 段的传统扫描来源。

有用户建议通过 OpenWRT 路由器上的 tcpdump 命令(例如过滤入站 SYN 包)来观察这类流量,也有用户提供了 knock-knock.net 的封禁列表下载和蜜罐仪表盘作为实时观测工具。讨论中明确指出:仅凭 IP 归属地判断攻击来源并不可靠,数据包在到达目标前会经过多个中间节点,来源国信息并不等于攻击者的真实位置。

为什么重要

过去一年多,AI 公司普遍派出官方爬虫(如 ClaudeBot、GPTBot)采集公开网页内容用于大模型训练。许多网站为了保持内容被 AI 产品收录,选择对官方爬虫“开绿灯”,在 robots.txt 中放行或通过白名单机制允许访问。攻击者正是利用这种信任,将漏洞扫描伪装成 AI 爬虫流量,试图绕过安全设备的封禁策略。

这一现象暴露了两个层面的风险:一是基于 user agent 字符串做访问控制的方案极其脆弱,任何人花几行代码就能伪造;二是主流安全设备对“AI 爬虫流量”往往缺乏独立的身份校验机制。换句话说,AI 爬虫的通行证正在成为扫描攻击的免费门票。

对用户/开发者/创作者的影响

对于运行网站或 API 服务的开发者和运维人员,需要重新审视现有的爬虫放行策略:不能只看 user agent 名称,应进一步校验来源 IP 是否在各大 AI 公司官方公布的爬虫 IP 段内,必要时加入反向 DNS 或 ASN 归属验证。对普通用户而言,家用路由器被扫描并不罕见,影响有限;但那些暴露了管理后台、数据库或物联网设备的端口,仍然需要尽快收紧访问控制。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

另外,knock-knock.net 提供的封禁列表和实时蜜罐数据可以作为观测恶意扫描源的参考工具,但它无法单独证明某个 IP 是“官方爬虫”还是“仿冒者”。

值得关注的后续

第一,Anthropic、OpenAI 等 AI 公司是否会推出类似 Google 的 googlebot 反向 DNS 验证机制,让网站管理员可以确认流量确实来自官方爬虫;第二,安全社区是否会维护一份“已知仿冒 AI 爬虫”的 IP 黑名单,并与 WAF 规则联动;第三,在 AI 爬虫通行证被滥用后,网站对官方 AI 抓取的态度是否会更保守,甚至收紧 robots.txt 权限——这件事直接影响大模型训练数据的获取成本。

来源:hackernews

celebrityanime
celebrityanime
文章: 18306

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注