AI 研究
Pew 研究发现,新近网页中 AI 写作痕迹已大范围出现
Pew Research Center 分析近 50 万个英文网页后发现,ChatGPT 发布后创建的页面中,AI 写作痕迹明显增加。
Pew Research Center 的一项新研究,为 AI 写作进入公开网络的规模提供了迄今较清晰的测量。该研究于 8 月 20 日发布,分析了 Common Crawl 在五年中收集的近 50 万个英文网页,并使用名为 Open Pangram 的检测方法估计网页是否呈现出显著的 AI 写作特征。Pew 称,在 2026 年 7 月随机抽取的 1 万个网页样本中,约 10% 显示出有意义的 AI 生成写作证据。
新近内容中的比例更高。Pew 发现,在发布日期晚于 ChatGPT 推出的网页中,超过三分之一显示出 AI 写作迹象。这并不意味着这些页面的每句话都由模型写成,也不能证明没有人工编辑参与。它说明的是,在大型语言模型变得易用后的短短几年里,生成式 AI 已经成为网络出版中常见的一部分,尤其是在 ChatGPT 之后创建的内容中。
研究还显示,不同域名类型之间差异明显。商业 dot-com 域名网页出现 AI 信号的比例高于非营利、教育和政府域名。Pew 报告称,在 2026 年 7 月样本中,大约每十个 dot-com 页面就有一个显示 AI 写作迹象,而 dot-org 页面比例较低,dot-edu 和 dot-gov 页面则很少。这与网络出版经济相符,商业网站往往更有动力生产大量面向搜索的文本、产品页、营销文案和低成本信息内容。
Pew 对不确定性保持谨慎。AI 检测并不完美,研究也没有声称能识别每一次 AI 使用或所有人机混合编辑流程。它使用的是语言中的重复模式来估计大规模变化。研究还追踪了 ChatGPT 发布后更常见的语言变化,包括标点、风格、部分词语和句式结构的变化。这些线索适合在网页规模上观察趋势,但不应被当作判定单篇文档来源的绝对证据。
这项发现重要,是因为网络既是出版平台,也是未来 AI 系统训练数据的重要来源。如果越来越多网页由 AI 参与写作,搜索引擎、研究者和模型开发者都必须认真考虑反馈循环。AI 生成内容可以有价值,例如帮助解释复杂主题、本地化信息,或让小组织更容易发布内容。它也可能用重复、单薄或合成化文本淹没搜索结果,让用户更难找到原创报道、专家分析和第一手文档。
对出版者而言,研究提出了一个不舒服但现实的问题:当 AI 辅助变得普通,什么才算高质量?用模型编辑、翻译或整理材料,并不等同于自动化内容农场。问题不在于是否使用 AI,而在于是否缺少人的判断、来源和责任。读者通常不会反对让好作品更清晰的工具,但会反感主要为了占据搜索流量而不增加知识的页面。
更大的含义是,AI 素养已经包括来源素养。用户不仅要问页面是否准确,还要问它如何产生、是否引用证据、是否体现真实专业知识。Pew 的研究并不是宣布网络已经坏掉,而是显示网络质地正在快速改变。搜索、新闻、教育和 AI 训练管线都需要更好的方式,区分有用的辅助写作和只是看起来像信息的合成内容规模。