AI研究

Pew調査、新しいウェブページの広い範囲でAI執筆の兆候を確認

Pew Research Centerは約50万の英語ウェブページを分析し、ChatGPT後に公開されたページでAI執筆の兆候が大きく増えたと報告した。

公開日 更新日
Pew Research CenterAI執筆ウェブコンテンツ

Pew Research Centerの新しい調査は、AIで書かれた文章が公開ウェブにどれほど入り込んだかを測る手がかりを示した。8月20日に公開された分析は、Common Crawlから集められた約50万の英語ページを5年分調べ、Open Pangramという検出手法でページにAI執筆の有意な兆候があるかを推定した。Pewによると、2026年7月のランダムな1万ページのサンプルでは、約10%がAI生成文の意味ある証拠を示した。

新しいコンテンツでは比率がはるかに高い。Pewは、ChatGPTの公開後に発行日を持つページのうち、三分の一を超えるものにAI執筆の兆候があったと報告した。これはページ上のすべての文がモデルによって書かれたという意味ではなく、人間の編集者がいなかったことを証明するものでもない。大規模言語モデルが広く使えるようになってから数年で、生成AIがウェブ出版の一般的な一部になったことを示している。

ドメインの種類による差も大きい。商業的なドットコムのページは、非営利、教育、政府ドメインよりAIシグナルが多かった。Pewは、2026年7月サンプルではドットコムページのおよそ10分の1にAI執筆の兆候があり、ドットオーグでは少なく、ドットエデュやドットガブでは非常に低いと報告した。この傾向は、検索向けの大量テキスト、商品ページ、マーケティングコピー、低コストの情報ページを作る動機が強い商業サイトの経済性と一致する。

Pewは不確実性にも慎重だ。AI検出は完全ではなく、すべてのAI利用や人間と機械の混合編集を特定できるわけではない。同調査は、言語に現れる繰り返しパターンを使って大規模な変化を推定している。ChatGPT以後に増えた句読点、文体、語彙、構文の変化も追跡している。これらの手がかりはウェブ全体の傾向を見るには有用だが、単独の文書の出所を断定する証拠として扱うべきではない。

この結果が重要なのは、ウェブが出版の場であると同時に将来のAIシステムの訓練データでもあるからだ。AIで書かれたページが増えれば、検索エンジン、研究者、モデル開発者はフィードバックループを慎重に考える必要がある。AI生成コンテンツは、難しい話題を分かりやすく説明したり、情報をローカライズしたり、小さな組織の発信を助けたりする時には有益だ。一方で、反復的で薄い合成テキストが検索結果を埋めれば、独自報道、専門家の分析、一次資料を見つけにくくなる。

出版社にとって、この調査は質とは何かという問いを鋭くする。AIを使って編集、翻訳、構成を整えることは、自動コンテンツファームを運営することと同じではない。問題はAIの利用そのものではなく、人間の判断、出典、説明責任の欠如だ。読者は良い仕事を明確にする道具には反発しにくいが、検索流入を取るためだけに作られ知識を増やさないページには不信感を持つ。

より大きな意味では、AIリテラシーはソースリテラシーを含むようになった。ユーザーはページが正確かだけでなく、どのように作られ、証拠を引用し、実際の専門性を反映しているかを問う必要がある。Pewの調査はウェブが壊れたと宣言しているのではない。ウェブの質感が急速に変わったことを示している。検索、報道、教育、AI訓練パイプラインは、有用な支援執筆と単に情報らしく見える合成量産物を分ける方法を必要としている。