Pesquisa em IA

Estudo da Pew encontra sinais de autoria por IA em grande parcela de páginas web recentes

A Pew Research Center analisou quase 500 mil páginas em inglês e encontrou aumento de sinais de texto escrito com IA em páginas publicadas após o ChatGPT.

Publicado Atualizado
Pew Research CenterEscrita com IAConteúdo web

Um novo estudo da Pew Research Center oferece uma das medições mais claras até agora sobre quanto texto escrito com IA entrou na web pública. Publicada em 20 de agosto, a análise examinou quase 500 mil páginas em inglês coletadas pelo Common Crawl ao longo de cinco anos e usou uma abordagem de detecção chamada Open Pangram para estimar se as páginas mostravam sinais significativos de autoria por IA. A Pew informou que, em uma amostra aleatória de 10 mil páginas de julho de 2026, cerca de 10% apresentavam evidência relevante de escrita gerada por IA.

A proporção é muito maior no material mais recente. A Pew encontrou que, entre páginas com data de publicação posterior ao lançamento do ChatGPT, mais de um terço mostrava indícios de autoria por IA. Isso não significa que cada frase dessas páginas tenha sido escrita por um modelo, nem prova que editores humanos estavam ausentes. Sugere, porém, que a IA generativa se tornou uma parte comum da publicação na web em poucos anos, especialmente em páginas criadas depois que grandes modelos de linguagem ficaram amplamente acessíveis.

O estudo também encontrou diferenças grandes por tipo de domínio. Páginas em domínios comerciais dot-com exibiram sinais de IA com mais frequência do que domínios sem fins lucrativos, educacionais ou governamentais. A Pew relatou que cerca de uma em cada dez páginas dot-com na amostra de julho de 2026 mostrava sinais de autoria por IA, contra uma parcela menor em dot-org e níveis muito baixos em dot-edu e dot-gov. Esse padrão combina com a economia da publicação na web, na qual sites comerciais têm incentivos mais fortes para produzir grandes volumes de texto voltado a buscas, páginas de produto, marketing e conteúdo informativo barato.

A Pew trata a incerteza com cautela. A detecção de IA não é perfeita, e o centro não afirma identificar todo uso de IA ou todo processo de edição misto entre humanos e máquinas. Em vez disso, o estudo usa padrões recorrentes de linguagem para estimar uma mudança em grande escala. Ele também acompanha mudanças linguísticas que se tornaram mais comuns após o lançamento do ChatGPT, incluindo alterações em pontuação, estilo e determinadas palavras ou estruturas de frase. Essas pistas são úteis em escala web, mas não devem ser tratadas como prova definitiva em um documento individual.

As descobertas importam porque a web é ao mesmo tempo plataforma de publicação e fonte de dados de treinamento para futuros sistemas de IA. Se mais páginas são escritas com IA, mecanismos de busca, pesquisadores e desenvolvedores de modelos precisam pensar cuidadosamente sobre ciclos de retroalimentação. Conteúdo gerado por IA pode ser útil quando explica um tema com clareza, localiza informação ou ajuda pequenas organizações a publicar. Também pode inundar resultados de busca com texto repetitivo, raso ou sintético, dificultando encontrar reportagem original, análise especializada e documentação de primeira mão.

Para publishers, o estudo torna mais urgente uma pergunta desconfortável: o que conta como qualidade quando a assistência de IA se torna comum? Usar um modelo para editar, traduzir ou estruturar material não é o mesmo que operar fazendas automáticas de conteúdo. O problema não é o uso de IA por si só, mas a ausência de julgamento humano, fontes e responsabilidade. Leitores raramente rejeitam ferramentas que tornam um bom trabalho mais claro. Eles rejeitam páginas desenhadas principalmente para capturar tráfego de busca sem acrescentar conhecimento.

A implicação mais ampla é que alfabetização em IA agora inclui alfabetização de fontes. Usuários precisam perguntar não apenas se uma página é precisa, mas como ela foi feita, se cita evidências e se reflete conhecimento real. O estudo da Pew não declara que a web está quebrada. Ele mostra que a textura da web mudou rapidamente. Busca, jornalismo, educação e pipelines de treinamento de IA precisarão de formas melhores de distinguir escrita assistida útil de volume sintético que apenas parece informação.