Pew研究证实:自ChatGPT发布以来,网络上AI生成文本急剧增加

皮尤研究中心对近50万个英文网页的分析显示,自ChatGPT发布以来,超过三分之一的网页内容可能由AI生成,商业网站中的AI文本比例远高于教育或政府网站。

一句话看懂:皮尤研究中心对近50万个英文网页的分析显示,自ChatGPT发布以来,超过三分之一的网页内容可能由AI生成,商业网站中的AI文本比例远高于教育或政府网站。

事件核心:发生了什么

皮尤研究中心基于Common Crawl网页存档,使用AI检测工具Open Pangram,分析了近50万个英文网页。结果显示,在2026年7月的样本中,约10%的网页明显含有AI生成文本;而如果只看ChatGPT发布后产生的网页,这一比例飙升到三分之一以上。该趋势自2022年底ChatGPT上线后持续上升,从未回落。

从域名分布看,.com商业网站中约十分之一的页面带有AI创作痕迹,.org网站为4.6%,而.edu和.gov网站均只有约1%。商业网站使用AI文本的频率大约是教育或政府网站的十倍。皮尤还发现,自2023年以来,AI常用词汇和句式在网络上明显增多:破折号使用频率翻倍,牛津逗号使用量增长63%,”delve”(钻研)、”testament”(见证)、”pivotal”(关键)、”tapestry”(画卷)等AI偏好词汇的出现频率均翻了一倍以上。

为什么重要

这项研究首次用大规模数据证实了AI生成内容对公共互联网语料的结构性改变。此前,伦敦帝国理工学院、互联网档案馆和斯坦福大学在2026年4月的联合研究也得出了相近结论:约35%的新建网站内容完全或部分由AI生成,且AI文本之间的语义相似度高出33%,语气普遍更积极。这些数据意味着,互联网正在从人类创作主导转向人机混合创作,而用于训练下一代大模型的公开数据中,AI文本占比将越来越高,可能引发模型训练中的”数据污染”问题,影响输出的多样性和质量。

对用户/开发者/创作者的影响

对内容创作者而言,核心问题不在于”是否使用AI”,而在于”如何界定AI参与的程度”——从全自动生成、人工润色到模型辅助个别句子,不同使用方式在检测工具上很难区分。Open Pangram等检测模型目前只能给出粗略的”机器写还是人写”判断,无法准确反映AI参与的比例或阶段,误判依然频繁。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者来说,如果正在构建依赖公开网页数据的应用或微调模型,需要警惕语料中AI文本比例过高带来的同质化风险。对普通用户,这项研究也提醒:网上越来越多的内容可能出自AI,评估信息时需关注来源域名的可信度(如.edu、.gov相对可靠),而非仅看文本是否通顺。

值得关注的后续

第一,AI文本检测工具能否从”粗判”走向”精判”,区分完全自动生成与AI辅助改写,这直接影响学术诚信和内容审核的落地。第二,Anthropic计划为Claude输出添加水印一事引发的争议仍在发酵,若主流大模型厂商跟进,AI文本的可追溯性将改变当前生态。第三,随着生成式AI进一步渗透,公共网页数据中AI文本占比是否会突破50%,以及这对下一代大模型训练可能造成什么影响,值得持续观察。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 20058

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注