一句话看懂:两位设计师发布了一款名为 ShieldFont 的字体,利用排版连字机制,在不影响真人阅读的前提下,让 AI 爬虫抓取到的 HTML 源码变成语义错乱的文本,以此阻断 AI 公司未经授权的训练数据采集。
事件核心:发生了什么
设计者 Isaque Seneda 和 Gabriel Abrucio 在近期发布的白皮书中介绍了 ShieldFont。它的原理并不复杂:字体使用连字(Ligatures)机制,在浏览器渲染文字时,将”horse”(马)替换为”potato”(土豆)这类词性相同但含义完全无关的词语。真人看到的页面完全正常,但爬虫抓取原始 HTML 时,拿到的是一份被系统性篡改的文本。
这套方案的核心在于对抗语义分析。简单替换同义词容易被逆向还原,完全乱码则会被质量过滤器识别为垃圾内容。ShieldFont 选择了中间路线:让替换后的句子在语法上完全通顺,但信息内容被彻底破坏——例如”the southern engineer”(南方工程师)可能变成”the interstate potato”(州际土豆)。经过三个月的词库打磨,ShieldFont 覆盖了近 12,000 个常用词,并为每个词提供三种替换映射,发布者还可以自定义映射组合。
测试数据显示,ShieldFont 平均替换页面中 24.5% 的词,其中内容词(Content Words)替换比例达 45.8%,31% 到 56% 的段落含义被破坏。在六条公开爬虫管线的测试中,超过 90% 原本会被接受的页面在应用字体后被质量过滤器拒绝。
为什么重要
这篇文章的关键信号是:AI 数据采集攻防战已经从 robots.txt 和 IP 封锁,升级到内容层级的”语义污染”。过去,网站和平台主要靠技术公约和诉讼来约束 AI 爬虫,但这些手段要么依赖企业自觉,要么耗费漫长法律流程。ShieldFont 的方法找到了一种隐蔽性更强的技术路径——它不试图阻止爬虫抓取,而是让抓取到的数据”有毒”。
对大模型训练而言,被”投毒”的数据比缺失的数据更危险。质量过滤器可以把明显乱码的页面筛掉,但 ShieldFont 生成的是语法正确、拼写无误的”真实垃圾文本”。这类文本一旦进入训练集,会让模型学到错误的事实关联,且很难在后期清洗中识别。对于在公开网络大规模采集训练数据的 AI 公司来说,这种干扰手段会让爬虫的算力、带宽和清洗成本同时上升。
对用户/开发者/创作者的影响
对内容创作者和网站站长:ShieldFont 提供了一个不用修改服务器配置、不用与爬虫军备竞赛就能落地的反爬方案。但代价也很明确——字体加载会影响网页性能,且搜索引擎索引、屏幕阅读器、复制粘贴和翻译工具都可能被误导,普通用户的阅读体验也会受到轻微干扰。启用前需要权衡SEO友好度和反爬需求。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者:ShieldFont 不是一个插件,而是一套需要集成到网页排版系统中的字体方案。白皮书建议发布者根据自身内容调整词库映射,尤其是垂直领域的高频专业词。另外,官方也承认这个方案并非无懈可击——AI 爬虫如果渲染完整页面再跑 OCR 识别,就能绕过字体混淆。但目前来看,这种高成本方式很难覆盖所有需要全网抓取的页面。
值得关注的后续
第一,ShieldFont 是否会被打包成现成的 Web 字体服务或 WordPress 插件,降低站长的接入门槛。第二,OpenAI、Anthropic、Google 等主要 AI 公司的爬虫是否会开始引入浏览器级渲染和 OCR 技术,以及由此带来的采集成本上升是否会转嫁到 API 定价上。第三,同类对抗方案(如基于 JavaScript 内容混淆、CSS 隐藏文本等)是否会被更多网站采用,形成一套新的反爬技术栈。
来源:Ars Technica


