AI padroniza a linguagem do jornalismo

Descubra como a inteligência artificial generativa está homogeneizando a linguagem jornalística e os riscos do colapso do modelo para a diversidade linguística.

Estudo da Ahrefs revela que 74,2% das novas páginas web contêm conteúdo gerado ou auxiliado por IA.
Destaques
  • LLMs favorecem expressões estatisticamente dominantes, podando figuras raras e neologismos.
  • O colapso do modelo ocorre quando IA é treinada recursivamente com seus próprios dados, reduzindo diversidade.
  • Manter dados orgânicos e humanos é essencial para evitar a homogeneização linguística no jornalismo.

A inteligência artificial generativa já não é apenas uma ferramenta de apoio na redação jornalística, a ponto de começar a padronizar o próprio idioma utilizado nas notícias. Com a adoção em massa de Large Language Models (LLMs) nas redações, um fenômeno sutil, porém profundo, está em curso: as expressões, os ritmos de frase e até o vocabulário utilizado nos artigos estão se tornando estatisticamente mais previsíveis e homogêneos. Mais do que uma questão estilística, isso representa um risco real de empobrecimento da linguagem e, por consequência, do pensamento crítico dos leitores.

Como a previsão da “próxima palavra” cria um viés linguístico

Para entender o problema, é preciso olhar para o mecanismo central dos LLMs. Eles operam calculando a probabilidade de uma sequência de tokens (pedaços de palavras) e escolhendo o caminho mais provável a cada novo passo. Esse processo gera textos fluidos e gramaticalmente corretos, mas introduz um viés estrutural inerente: expressões estatisticamente dominantes são sempre favorecidas. Figuras de linguagem raras, ironias sutis, ambiguidades propositais e neologismos criativos são naturalmente “podados” por serem menos prováveis no conjunto de dados de treinamento.

Isoladamente, um artigo com “sotaque de IA” pode passar despercebido. O problema se agrava com a escala. Uma análise da Ahrefs, realizada em abril de 2025, examinou cerca de 900 mil novas páginas web e revelou que impressionantes 74,2% delas continham conteúdo gerado ou auxiliado por inteligência artificial. Deste total, 71,7% eram híbridos (humano + IA) e 2,5% eram inteiramente produzidos por máquinas. Apenas um quarto das páginas analisadas era puramente humano.

Um LLM não “escreve” no sentido humano; ele calcula a trajetória mais segura entre uma palavra e outra. O resultado é uma prosa que converge para uma média estatística, eliminando as variações que formam a riqueza de um idioma.

blockquoteblockquoteblockquoteblockquoteblockquote

O jornalismo, historicamente, não apenas reporta fatos. Ele é uma fábrica de linguagem: introduz novos termos, populariza gírias, adapta jargões técnicos para o grande público e, em última análise, oxigena o vocabulário de uma sociedade. Quando a “voz” média de uma redação passa a ser a voz de um LLM, a taxa de inovação lexical inevitavelmente cai.

O efeito bumerangue: o colapso do modelo já atinge a linguagem

O conceito de colapso do modelo (model collapse) é central para compreender a gravidade do ciclo vicioso que se formou. Pesquisadores da Universidade de Oxford e Cambridge, em um estudo publicado na Nature em 2024, demonstraram experimentalmente o que acontece quando uma IA é treinada recursivamente com seus próprios dados. A diversidade das saídas cai drasticamente, e o sistema pode começar a gerar nonsense.

No experimento, um modelo treinado com textos sobre arquitetura medieval começou, após nove gerações de treinamento recursivo, a produzir listas aleatórias de lebres. O dado original se perdeu em meio à cópia da cópia.

O colapso do modelo é um fenômeno interno aos sistemas de IA. O que estamos vendo no jornalismo é sua manifestação “externa”: a IA escreve um texto, humanos o leem e se inspiram, a IA lê esses textos humanos (agora influenciados) e escreve novamente. O loop está fechado e o feedback é cada vez mais pobre.

blockquoteblockquoteblockquoteblockquoteblockquote

Na prática, as redações que utilizam IA para gerar grandes volumes de conteúdo (como notícias de última hora, boletins financeiros ou resumos esportivos) estão, sem querer, contaminando o próprio “alimento” das próximas gerações de modelos. O conteúdo gerado por IA se acumula na web; o próximo modelo a ser treinado vai varrer esses dados, aprender com aquela prosa padronizada e, no ciclo seguinte, produzir um texto ainda mais pasteurizado.

O que se perde quando a linguagem jornalística se homogeneíza

Um vocabulário pobre leva a um debate pobre

A linguagem é a matéria-prima do pensamento. Quanto menor o número de ferramentas conceituais à disposição, mais grosseira será a capacidade de análise e distinção de problemas complexos. Pesquisadores de jornalismo da Universidade de Santiago de Compostela, em artigo publicado no The Conversation, alertam que a função do jornalismo de traduzir o conhecimento especializado para o público geral e de cunhar novas expressões está sendo corroída.

Se a IA se tornar o “primeiro rascunho” padrão e a revisão humana for superficial, o resultado será uma enxurrada de artigos com abertura e conclusão previsíveis, um ritmo narrativo idêntico e uma ausência de marcas autorais. O leitor deixa de ser exposto à diversidade estilística que o ajuda a refinar seu próprio senso crítico.

A fixação de preconceitos como efeito colateral silencioso

Modelos de linguagem absorvem e replicam os vieses presentes em seus dados de treinamento. Ao gerar textos “neutros” e padronizados, a IA não elimina o preconceito; ela o reproduz e o amplifica, mas sob uma roupagem de objetividade robótica. Quanto mais o ciclo recursivo avança, mais esses vieses se cristalizam como “a norma”, tornando ainda mais difícil para leitores e jornalistas identificarem e contestarem perspectivas tendenciosas.

A advertência dos pesquisadores é clara: se a internet for dominada por textos de IA, a diversidade linguística com a qual leitores, educadores e jornalistas interagem irá encolher. E com ela, a amplitude de perspectivas sobre o mundo.

blockquoteblockquoteblockquoteblockquoteblockquote

Não é um cenário apocalíptico, mas há uma condição essencial

É crucial evitar o alarmismo. A pesquisa sobre colapso de modelo também indica que o problema pode ser mitigado. A chave está em manter um fluxo de dados orgânicos e diversos. Se os dados sintéticos (gerados por IA) forem usados em conjunto com dados genuinamente humanos, a degeneração do modelo é drasticamente reduzida.

O ponto crítico é que não há garantia de que esse equilíbrio será mantido. A pressão por eficiência e redução de custos é imensa. Uma pesquisa de mercado aponta que a introdução de IA generativa já reduziu o custo de produção de artigos em 44%. A racionalidade econômica e a saúde do ecossistema linguístico estão em rota de colisão.

O futuro da linguagem no jornalismo dependerá de uma decisão editorial consciente: usar a IA para “escrever” o texto final ou usá-la como uma ferramenta para “auxiliar” na pesquisa e nacuradoria, mantendo o jornalista como o autor final e responsável pelo estilo. A diferença entre essas duas abordagens definirá se a língua portuguesa continuará a evoluir com a vitalidade de um organismo vivo ou se iniciará um processo lento e silencioso de homogeneização.

Compartilhar este artigo
Canal oficial de conteúdo do portal Overcentral. A Equipe Central produz notícias, guias e análises com foco em credibilidade e relevância, garantindo que você receba o melhor conteúdo editorial diariamente.