一句话看懂:皮尤研究中心(Pew)对2026年7月抓取的网页样本分析发现,约10%的页面带有明显的AI生成痕迹;而在ChatGPT发布后新建的页面中,这一比例超过三分之一,商业网站是AI内容的主要载体。
事件核心:发生了什么
皮尤研究中心利用Open Pangram检测器,对2021年1月至2026年7月期间Common Crawl档案库中近50万个英文页面进行了分类。结果显示,在2026年7月随机抽样的1万个网页中,约10%存在强烈的AI创作痕迹。更值得关注的是,自2022年11月ChatGPT发布以来发布的页面中,超过三分之一带有此类信号。
域名分布揭示了明显的结构性差异:约10%的.com域名页面被判定为AI生成,而.org域名的比例为4.6%,.edu和.gov域名的比例均约为1%。这种差异反映出,在以流量和搜索优化为核心目标的商业网站上,AI生成文本已成为一种低成本的生产方式。
为什么重要
这项研究的价值在于区分了“网页总量”与“新增内容”两个维度。互联网的大部分存量内容早于大模型出现,因此10%的整体比例容易低估AI对内容生态的实际影响。新增页面中超过三分之一的AI使用率,意味着大语言模型已经成为网络写作基础设施的一部分,而非边缘工具。
皮尤同时指出,检测工具在单篇文档上可能出错,但其结论建立在数十万页面的统计规律之上,具备一定的可靠性。此外,研究捕捉到了一些文体层面的变化:自2023年以来,破折号使用率翻倍,牛津逗号使用率上升63%,”delve”、”pivotal”等词汇以及“it’s not just X, it’s Y”的句式频繁出现。这些语言特征正在成为AI写作的“指纹”,也为平台和平台的检测系统提供了识别依据。
对用户/开发者/创作者的影响
对于普通读者而言,默认假设需要调整:2026年新发布的网页很可能经过了模型处理,这要求读者在筛选信息时保持更多判断力。对内容创作者来说,AI的介入正在模糊原创与生成的边界——如果连标点和常见句式都呈现趋同趋势,依靠风格建立辨识度的策略可能面临挑战。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者而言,检测技术正在成为工具链的一部分。LinkedIn声称其系统识别通用内容的准确率达94%,arXiv也已禁止提交未经检查的AI文本。这类检测API和集成方案为技术团队提供了新的接入方向。对于依赖搜索引擎流量的商业站点,优化AI文本的合规性策略将成为一项现实需求。
值得关注的后续
内容平台如何将检测能力嵌入发布流程,是否会像arXiv一样对违规者采取限制措施,是值得观察的第一点。其次,检测工具与生成模型之间的对抗升级——Open Pangram这类检测器是否有更新版本以应对下一代模型——将直接影响平台治理的实效。最后,广告系统和谷歌搜索排名算法是否会结合AI内容信号调整权重,这将决定商业网站是否继续维持目前的高AI内容比例。目前公开信息显示,皮尤的研究样本截止到2026年7月,后续数据能否反映更长周期的趋势,仍有待跟踪。
来源:The Next Web


