Um estudo inédito conduzido por pesquisadores do Imperial College de Londres, da Universidade Stanford e do Internet Archive revelou que aproximadamente 35% de todos os sites criados entre 2022 e 2025 contam com conteúdo gerado ou assistido por inteligência artificial. A análise, que utilizou ferramentas da Pangram Labs após testar quatro métodos diferentes de detecção, representa um dos primeiros esforços sistemáticos para quantificar a presença de texto produzido por máquinas na web. Os pesquisadores empregaram a Wayback Machine do Internet Archive para montar uma amostra representativa de páginas online e chegaram a um número que confirma o que muitos especialistas já suspeitavam: a escrita na internet está passando por uma transformação profunda, tornando-se “cada vez mais higienizada e artificialmente alegre”.
O boom da IA desde o ChatGPT
A escalada do problema coincide com o lançamento do ChatGPT, em novembro de 2022. Desde então, plataformas sociais e sites de todos os tipos foram inundados por textos gerados por grandes modelos de linguagem. Até agora, grande parte da percepção sobre esse fenômeno era baseada em evidências anedóticas — impressões dispersas de leitores e editores que notavam uma mudança no tom e na diversidade do conteúdo online. O novo estudo oferece dados concretos para substituir essas impressões por métricas sólidas.
Antes de realizar a análise técnica propriamente dita, a equipe encomendou uma pesquisa de opinião pública sobre as percepções em relação à inteligência artificial. Ao cruzar os resultados, os pesquisadores descobriram que não foram os únicos a ter suas expectativas frustradas pelos achados.
O exagero da positividade artificial
Um dos resultados mais chamativos do estudo diz respeito ao tom emocional dos textos. A pontuação média de sentimento positivo em sites gerados ou assistidos por IA foi 107% superior à registrada em páginas produzidas exclusivamente por humanos. Os pesquisadores interpretam esse excesso de felicidade artificial como um “sintoma” da “natureza bajuladora e excessivamente otimista dos LLMs existentes”. Em outras palavras, os modelos de linguagem tendem a evitar posicionamentos negativos ou neutros, produzindo um discurso que soa constantemente entusiasmado, mesmo quando o assunto não pede tal tom.
Além disso, sites gerados por IA apresentaram uma pontuação aproximadamente 33% maior em testes de “similaridade semântica” quando comparados a sites feitos por humanos. Isso significa que o vocabulário, as construções frasais e as ideias expressas por texto de máquina são muito mais parecidos entre si do que o esperado em uma produção humana diversa. O resultado prático é uma redução na diversidade ideológica da internet — um estreitamento da “gama de ideias únicas e pontos de vista diversos” disponíveis para o leitor.
Vale destacar que a análise constatou que as ideias expressas por textos de IA eram mais homogêneas e consistentemente mais alegres, mas o estilo de escrita em si — a estrutura das frases, o uso de pontuação, o ritmo narrativo — não foi confirmado como mais uniforme. Isso sugere que a perda de diversidade ocorre mais no plano conceitual do que no estilístico.
Expectativas do público que não se confirmaram
A pesquisa de opinião conduzida paralelamente revelou que a maioria dos respondentes compartilhava expectativas negativas sobre o impacto da IA na produção de conteúdo online. Os participantes assumiam, por exemplo, que haveria um aumento significativo de notícias falsas à medida que crescesse o volume de sites gerados por inteligência artificial. Também esperavam que a escrita produzida por IA deixasse de incluir links para fontes externas e que o conteúdo apresentasse uma voz cada vez mais genérica e uniforme.
Surpreendentemente, nenhuma dessas quatro hipóteses foi confirmada pela análise das evidências. A equipe suspeitava que a IA levaria a um aumento de desinformação — os dados não sustentaram a ideia. Os textos gerados por máquina continuaram, em sua maioria, a incluir links para fontes externas. E, ao contrário do que todos esperavam, o estilo de escrita não se mostrou significativamente mais genérico que o humano.
“Todos na equipe esperavam que isso fosse verdade”, afirmou Maty Bohacek, pesquisador de Stanford, referindo-se à expectativa de que o estilo de escrita se tornaria mais genérico. “Mas simplesmente não temos evidências significativas para isso.” Bohacek também comentou sobre a divergência entre o que o público esperava e o que os dados mostraram: “É interessante ver que as pessoas tendiam a esperar os piores resultados”.
Limitações e próximos passos
Os próprios pesquisadores reconhecem que o estudo tem limitações importantes. Todas as ferramentas de detecção de inteligência artificial são imperfeitas, e a ferramenta escolhida — da Pangram Labs —, embora tenha apresentado o desempenho mais consistente durante os testes, não é infalível. O estudo também não oferece informações sobre a extensão completa dos impactos da IA na internet, funcionando mais como uma investigação inicial sobre o tema.
“Nós apenas queríamos abrir caminho”, declarou Bohacek, posicionando o trabalho como um primeiro passo para compreensões mais profundas. A pesquisa fornece, afinal, dados concretos para sustentar evidências anedóticas que há muito circulam entre profissionais da comunicação e do marketing digital. Mais importante ainda, ao derrubar algumas crenças comuns sobre a escrita por IA, o estudo aponta que o fenômeno é mais sutil e complexo do que muitos supunham. O futuro da produção de conteúdo na web, sugere a pesquisa, não será definido apenas pelo volume de texto gerado por máquinas, mas pela qualidade da diversidade de ideias que conseguirmos preservar.
Um estudo inédito conduzido por pesquisadores do Imperial College de Londres, da Universidade Stanford e do Internet Archive revelou que aproximadamente 35% de todos os sites criados entre 2022 e 2025 contam com conteúdo gerado ou assistido por inteligência artificial. A análise, que utilizou ferramentas da Pangram Labs após testar quatro métodos diferentes de detecção, representa um dos primeiros esforços sistemáticos para quantificar a presença de texto produzido por máquinas na web. Os pesquisadores empregaram a Wayback Machine do Internet Archive para montar uma amostra representativa de páginas online e chegaram a um número que confirma o que muitos especialistas já suspeitavam: a escrita na internet está passando por uma transformação profunda, tornando-se “cada vez mais higienizada e artificialmente alegre”.
O boom da IA desde o ChatGPT
A escalada do problema coincide com o lançamento do ChatGPT, em novembro de 2022. Desde então, plataformas sociais e sites de todos os tipos foram inundados por textos gerados por grandes modelos de linguagem. Até agora, grande parte da percepção sobre esse fenômeno era baseada em evidências anedóticas — impressões dispersas de leitores e editores que notavam uma mudança no tom e na diversidade do conteúdo online. O novo estudo oferece dados concretos para substituir essas impressões por métricas sólidas.
Antes de realizar a análise técnica propriamente dita, a equipe encomendou uma pesquisa de opinião pública sobre as percepções em relação à inteligência artificial. Ao cruzar os resultados, os pesquisadores descobriram que não foram os únicos a ter suas expectativas frustradas pelos achados.
O exagero da positividade artificial
Um dos resultados mais chamativos do estudo diz respeito ao tom emocional dos textos. A pontuação média de sentimento positivo em sites gerados ou assistidos por IA foi 107% superior à registrada em páginas produzidas exclusivamente por humanos. Os pesquisadores interpretam esse excesso de felicidade artificial como um “sintoma” da “natureza bajuladora e excessivamente otimista dos LLMs existentes”. Em outras palavras, os modelos de linguagem tendem a evitar posicionamentos negativos ou neutros, produzindo um discurso que soa constantemente entusiasmado, mesmo quando o assunto não pede tal tom.
Além disso, sites gerados por IA apresentaram uma pontuação aproximadamente 33% maior em testes de “similaridade semântica” quando comparados a sites feitos por humanos. Isso significa que o vocabulário, as construções frasais e as ideias expressas por texto de máquina são muito mais parecidos entre si do que o esperado em uma produção humana diversa. O resultado prático é uma redução na diversidade ideológica da internet — um estreitamento da “gama de ideias únicas e pontos de vista diversos” disponíveis para o leitor.
Vale destacar que a análise constatou que as ideias expressas por textos de IA eram mais homogêneas e consistentemente mais alegres, mas o estilo de escrita em si — a estrutura das frases, o uso de pontuação, o ritmo narrativo — não foi confirmado como mais uniforme. Isso sugere que a perda de diversidade ocorre mais no plano conceitual do que no estilístico.
Expectativas do público que não se confirmaram
A pesquisa de opinião conduzida paralelamente revelou que a maioria dos respondentes compartilhava expectativas negativas sobre o impacto da IA na produção de conteúdo online. Os participantes assumiam, por exemplo, que haveria um aumento significativo de notícias falsas à medida que crescesse o volume de sites gerados por inteligência artificial. Também esperavam que a escrita produzida por IA deixasse de incluir links para fontes externas e que o conteúdo apresentasse uma voz cada vez mais genérica e uniforme.
Surpreendentemente, nenhuma dessas quatro hipóteses foi confirmada pela análise das evidências. A equipe suspeitava que a IA levaria a um aumento de desinformação — os dados não sustentaram a ideia. Os textos gerados por máquina continuaram, em sua maioria, a incluir links para fontes externas. E, ao contrário do que todos esperavam, o estilo de escrita não se mostrou significativamente mais genérico que o humano.
“Todos na equipe esperavam que isso fosse verdade”, afirmou Maty Bohacek, pesquisador de Stanford, referindo-se à expectativa de que o estilo de escrita se tornaria mais genérico. “Mas simplesmente não temos evidências significativas para isso.” Bohacek também comentou sobre a divergência entre o que o público esperava e o que os dados mostraram: “É interessante ver que as pessoas tendiam a esperar os piores resultados”.
Limitações e próximos passos
Os próprios pesquisadores reconhecem que o estudo tem limitações importantes. Todas as ferramentas de detecção de inteligência artificial são imperfeitas, e a ferramenta escolhida — da Pangram Labs —, embora tenha apresentado o desempenho mais consistente durante os testes, não é infalível. O estudo também não oferece informações sobre a extensão completa dos impactos da IA na internet, funcionando mais como uma investigação inicial sobre o tema.
“Nós apenas queríamos abrir caminho”, declarou Bohacek, posicionando o trabalho como um primeiro passo para compreensões mais profundas. A pesquisa fornece, afinal, dados concretos para sustentar evidências anedóticas que há muito circulam entre profissionais da comunicação e do marketing digital. Mais importante ainda, ao derrubar algumas crenças comuns sobre a escrita por IA, o estudo aponta que o fenômeno é mais sutil e complexo do que muitos supunham. O futuro da produção de conteúdo na web, sugere a pesquisa, não será definido apenas pelo volume de texto gerado por máquinas, mas pela qualidade da diversidade de ideias que conseguirmos preservar.
