AI 연구

Pew 연구, 최신 웹페이지 상당수에서 AI 작성 흔적 확인

Pew Research Center는 영어 웹페이지 약 50만 개를 분석해 ChatGPT 출시 이후 공개된 페이지에서 AI 작성 신호가 크게 늘었다고 밝혔다.

게시일 업데이트
Pew Research CenterAI 글쓰기웹 콘텐츠

Pew Research Center의 새 연구는 AI가 쓴 텍스트가 공개 웹에 얼마나 들어왔는지에 대해 비교적 분명한 측정치를 제시했다. 8월 20일 공개된 이 분석은 Common Crawl에서 5년에 걸쳐 수집한 영어 웹페이지 약 50만 개를 조사하고, Open Pangram이라는 탐지 방법으로 페이지에 의미 있는 AI 작성 징후가 있는지 추정했다. Pew는 2026년 7월 무작위로 뽑은 1만 개 페이지 표본에서 약 10%가 AI 생성 글쓰기의 유의미한 증거를 보였다고 밝혔다.

새로운 콘텐츠에서는 비율이 훨씬 높았다. Pew는 ChatGPT 출시 이후 발행일을 가진 페이지 중 3분의 1이 넘는 페이지에서 AI 작성 징후가 나타났다고 분석했다. 이는 해당 페이지의 모든 문장이 모델이 쓴 것이라는 뜻도 아니고 인간 편집자가 없었다는 증거도 아니다. 다만 대규모 언어 모델이 널리 접근 가능해진 지 몇 년 만에 생성형 AI가 웹 출판의 일반적인 일부가 됐다는 점을 보여준다.

도메인 유형별 차이도 컸다. 상업적 dot-com 도메인의 페이지는 비영리, 교육, 정부 도메인보다 AI 신호가 더 자주 나타났다. Pew는 2026년 7월 표본에서 dot-com 페이지 약 열 개 중 하나가 AI 작성 징후를 보인 반면, dot-org는 더 낮았고 dot-edu와 dot-gov는 매우 낮은 수준이었다고 밝혔다. 이는 검색 친화적 텍스트, 제품 페이지, 마케팅 문구, 저비용 정보 콘텐츠를 대량으로 만들 유인이 큰 상업 웹의 경제성과 맞아떨어진다.

Pew는 불확실성에도 신중하다. AI 탐지는 완벽하지 않으며 모든 AI 사용이나 인간과 기계의 혼합 편집 과정을 식별할 수 없다. 이 연구는 언어에서 반복되는 패턴을 사용해 대규모 변화를 추정한다. 또한 ChatGPT 출시 이후 더 흔해진 구두점, 문체, 특정 단어와 문장 구조의 변화를 추적했다. 이런 단서는 웹 규모의 추세를 보는 데 유용하지만, 개별 문서의 출처를 단정하는 증거로 쓰기에는 적절하지 않다.

이 발견이 중요한 이유는 웹이 출판 플랫폼이자 미래 AI 시스템의 훈련 데이터이기 때문이다. AI로 작성된 페이지가 늘어나면 검색 엔진, 연구자, 모델 개발자는 피드백 루프를 신중히 고민해야 한다. AI 생성 콘텐츠는 복잡한 주제를 쉽게 설명하거나 정보를 현지화하거나 작은 조직이 글을 내는 데 도움을 줄 때 유용할 수 있다. 그러나 반복적이고 얇은 합성 텍스트가 검색 결과를 뒤덮으면 독창적 보도, 전문가 분석, 1차 문서를 찾기 어려워진다.

출판자에게 이 연구는 품질이 무엇인지라는 불편한 질문을 던진다. 모델을 사용해 편집, 번역, 구조화를 돕는 것은 자동 콘텐츠 농장을 운영하는 것과 같지 않다. 문제는 AI 사용 자체가 아니라 인간의 판단, 출처, 책임성이 빠지는 것이다. 독자들은 좋은 작업을 더 명확하게 만드는 도구에는 크게 반발하지 않는다. 그러나 검색 트래픽만 얻기 위해 만들어지고 지식을 더하지 않는 페이지에는 불신을 느낀다.

더 큰 의미에서 AI 리터러시는 이제 출처 리터러시를 포함한다. 사용자는 페이지가 정확한지뿐 아니라 어떻게 만들어졌는지, 증거를 인용하는지, 실제 전문성을 반영하는지 물어야 한다. Pew의 연구는 웹이 망가졌다고 선언하지 않는다. 웹의 질감이 빠르게 바뀌었다는 점을 보여준다. 검색, 저널리즘, 교육, AI 훈련 파이프라인은 유용한 보조 글쓰기와 그저 정보처럼 보이는 합성 규모를 구분하는 더 나은 방법이 필요하다.