人类互联网已死?报告称自ChatGPT发布以来,超三分之一新网页有AI写作痕迹

皮尤研究中心(Pew Research Center)最新报告显示,ChatGPT 发布以来新上线的网页中超过 35% 带有 AI 生成痕迹。这意味着生成式 AI 已从“创作工具”变成互联网内容生产的主流基础设施,人类原创新闻、教程和评论正在被悄悄稀释。

一句话看懂:皮尤研究中心(Pew Research Center)最新报告显示,ChatGPT 发布以来新上线的网页中超过 35% 带有 AI 生成痕迹。这意味着生成式 AI 已从“创作工具”变成互联网内容生产的主流基础设施,人类原创新闻、教程和评论正在被悄悄稀释。

事件核心:发生了什么

皮尤研究中心基于 Common Crawl 项目数据,用机器学习模型抽取并评估了 10,000 个网页样本,同时单独分析了 490,000 个英文页面。结果显示:自 2023 年 ChatGPT 发布以来,新发布网页中有 35% 检测到 AI 生成或显著编辑痕迹;在涵盖 30 多年网页历史的全部样本中,约 9.6% 的页面被判定为 AI 创作。

报告还给出了几个可核查的“AI 指纹”:破折号(em dash)在 2023 年后发布的页面中出现频率翻倍,牛津逗号使用量增长 63%;词汇层面,“delve”“interplay”“testament”等所谓“AI 典型词汇”使用量翻了一倍以上,而“It’s not just X, it’s Y”这类否定平行句式使用量涨了两倍。

值得留意的是,AI 生成内容的分布并不均匀:2026 年检测到的大多数疑似 AI 网页集中在 .com 域名,明显属于商业性质;而 .edu 和 .gov 域名下仅有 1% 和 0.8% 的页面带 AI 痕迹,教育机构和政府部门的内容仍以人工写作为主。

为什么重要

这项研究首次用可量化的方式确认了“AI 内容已占新增网页三分之一”的临界点。对 AI 行业而言,这意味着大模型生成内容的边际成本已经低于人类写作,内容生产走向工业化;对搜索引擎和推荐系统来说,训练语料中 AI 生成文本占比迅速上升,可能引发模型塌缩(model collapse)风险,即后续训练的 AI 模型会因消费过多合成数据而退化。

从商业角度看,35% 的新增 AI 内容集中在 .com 商业域名,反映出许多企业已经在用大模型批量生成 SEO 页面、产品描述和营销文章。这种内容套利模式短期内能降低获客成本,但同质化内容的增加会降低用户信任度,也可能促使搜索引擎调整排名算法,对这些“AI 填充型页面”降权。

对用户/开发者/创作者的影响

对于普通用户,最直接的影响是信息筛选成本增加。搜索引擎和社交媒体信息流中的 AI 生成内容可能无法提供准确的实时信息,特别是涉及健康、法律或本地服务等场景时,建议优先查看 .gov 和 .edu 域名,或交叉验证多个独立来源。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于内容创作者和开发者,这份报告的实用价值在于它给出了相对可靠的 AI 文本检测特征。如果你的工作流依赖 AI 辅助写作,需要在发布前进行个性化编辑,加入个人经验、采访素材和专有数据,避开高频“AI 词汇”和句式,以降低被识别为机器生成的机率。API 开发者和创业团队也可以参考该报告调整内容管道——具体做法包括引入人工审查环节,或过滤批量生成的页面,以免损害域名声誉。

值得关注的后续

目前公开信息显示,皮尤研究中心使用的是基于词汇和句法特征的检测模型,尚未公布误判率和具体模型细节。后续值得关注三个方面:

第一,OpenAI、Anthropic 和 Google 是否会针对这些“AI 文本指纹”调整大模型的输出风格,使其更难被检测——这实质上是一场文本检测与反检测的军备竞赛;

第二,Google 搜索等平台是否会更新排名算法,对批量 AI 生成的商业页面进行降权;历史经验表明,这类算法调整通常会带动一轮 SEO 内容策略洗牌;

第三,Common Crawl 这类公开语料库中 AI 生成内容的占比是否会持续上升,以及是否会推动模型开发者调整训练数据筛选策略,减少对合成数据的依赖。

来源:TechRadar

celebrityanime
celebrityanime
文章: 20327

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注