Ângulo de Anderson

IA cita os mesmos artigos repetidamente – assim como os humanos

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT e outras ferramentas de escrita de IA podem estar silenciosamente transformando a ciência em um concurso de popularidade, direcionando repetidamente os pesquisadores para os mesmos artigos enquanto ignoram trabalhos novos e inovadores que realmente poderiam avançar a área.

 

Monocultura, em termos de frequência e estatísticas, é onde o mesmo conjunto limitado de fontes ou recursos se repete continuamente, abafando vozes novas e perspectivas frescas: o mesmo conjunto limitado de músicas na programação de rádio; o mesmo conjunto de autores e livros nas bancas de aeroportos; e a mesma seleção restrita de frutas e vegetais nos supermercados:

Sim, temos essas bananas – e somente essas bananas. A homogeneidade de frutas e vegetais nas cadeias alimentares ocidentais ignora as centenas de outras possibilidades de espécies em cada caso, porque as diversas cadeias de geração e transporte são caras demais para industrializar tipos diversos de frutas ou vegetais.

Sim, temos essas bananas – e somente essas bananas. A homogeneidade de frutas e vegetais nas cadeias alimentares ocidentais ignora as centenas de outras possibilidades de espécies em cada caso, porque as diversas cadeias de geração e transporte são caras demais para industrializar tipos diversos de frutas ou vegetais. Fonte

Isso também ocorre nas citações que aparecem em novas pesquisas científicas, onde os pesquisadores, talvez por preguiça, recorrem a um conjunto ‘confiável’ de fontes que ganha impulso até começar a dominar ramos da pesquisa.

Isso é conhecido como o Efeito Mateus – uma teoria sociológica que sugere que os incumbentes sempre se beneficiam; a síndrome tem sido comparada à promessa feita em Mateus 13:12, que afirma ‘Quem tem, receberá mais, e terá abundância. Quem não tem, até o que tem será tirado dele’.

O Grupo Interno

Uma das grandes esperanças da pesquisa aumentada por IA tem sido que novos métodos de aprendizado de máquina poderiam romper o efeito Mateus – também conhecido como viés de popularidade – e começar a citar trabalhos menos conhecidos que poderiam ser mais incisivos ou mais adequados ao ponto que está sendo defendido em um artigo.

No entanto, com base na forma como as rotinas de treinamento de IA interpretam os conjuntos de dados, nunca houve um motivo sólido para esse otimismo; e tem sido constatado repetidamente que, quando a IA não está inventando citações de forma direta – um problema crônico até hoje – ela está, de fato, perpetuando o efeito Mateus, assim como os humanos – embora talvez não pelos mesmos motivos.

Durante o treinamento, um modelo aprenderá a classificar altamente os artigos mais citados (ou ‘mais frequentemente repetidos’) em um conjunto de treinamento, porque as rotinas de treinamento são projetadas para extrair padrões significativos e desconsiderar outliers como ‘ruído’, ou anomalias estatísticas.

Sob esse regime, o equivalente à teoria da relatividade de Einstein nunca receberia atenção da máquina, que, uma vez treinada, sente que já encontrou seus princípios e referentes, e só pode ajustar levemente essa postura ao buscar publicações mais recentes através de RAG, ou por outros meios que ampliem o alcance do modelo além de sua matriz treinada.

O problema é que ela não creditará esses novos trabalhos da mesma forma que os ‘favoritos antigos’ que já conhecia, ou sequer os creditará, porque seus vieses estatísticos já estão bastante enraizados.

Assim, a IA não está realmente observando e imitando o comportamento humano ao perpetuar o Efeito Mateus – ela apenas conta quantas vezes os pesquisadores, por preguiça, recorrem aos mesmos artigos antigos, e os classifica de forma semelhante. Nesse sentido, o problema da repetição de citações está relacionado ao desafio de escolher um artigo científico genuinamente interessante dentre a nevasca cada vez maior de publicações de pesquisa em IA, já que o trabalho mais forte frequentemente terá o sinal mais fraco.

Diagnóstico da Monocultura

Esta questão é abordada em um interessante artigo novo dos EUA intitulado When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. O novo trabalho – uma colaboração entre a University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University e a University of Notre Dame – busca provar de forma definitiva a existência de monocultura de citações em aprendizado de máquina, de modo que suas variáveis possam ser potencialmente abordadas diretamente no futuro, juntamente com o próprio problema.

Nos testes, os autores descobriram que onze modelos da OpenAI, Google e Anthropic favoreciam repetidamente o mesmo pequeno grupo de artigos – mesmo após os sinais óbvios de popularidade terem sido removidos.

Para testar isso, 120 artigos reais foram despojados de contagens de citações e locais de publicação, enquanto os nomes dos autores foram substituídos e os anos de publicação reatribuídos aleatoriamente. Conjuntos aleatórios de trinta artigos foram então mostrados a cada modelo, que pôde citar no máximo dez.

Oito especialistas humanos nas áreas relevantes receberam os mesmos artigos cegos, mas não convergiram para os mesmos favoritos das IAs, indicando que o viés era específico aos modelos de IA e não aos próprios artigos:

Do novo artigo, resultados de teste comparando escolhas de citação por modelos de IA e especialistas humanos. Em todos os onze modelos, as citações se concentraram em um grupo menor de artigos, enquanto alguns artigos foram repetidamente ignorados completamente. Especialistas humanos não mostraram essa tendência. Source - https://arxiv.org/pdf/2608.19230

Do novo artigo, resultados de teste comparando escolhas de citação por modelos de IA e especialistas humanos. Em todos os onze modelos, as citações se concentraram em um grupo menor de artigos, enquanto alguns artigos foram repetidamente ignorados completamente. Especialistas humanos não mostraram essa tendência. Fonte

Os mesmos artigos permaneceram populares mesmo quando os modelos foram solicitados apenas a escolher referências, mostrando que escrever a revisão em si não causou o viés.

O experimento foi então estendido por onze rodadas, com 120 artigos escritos por IA adicionados após cada rodada, para testar o que acontece quando essas preferências compartilhadas operam em um pool crescente de pesquisas geradas por IA.

À medida que mais artigos escritos por IA foram adicionados, os modelos concentraram cada vez mais suas citações em um número reduzido dos artigos humanos originais.

‘À medida que os modelos de linguagem passam de redigir textos para operar agentes de busca bibliográfica com chamadas de ferramentas, referências fabricadas estão se tornando mais fáceis de detectar e limitar.

‘A falha mais difícil começa depois que cada candidato é real: diferentes modelos ainda podem selecionar o mesmo subconjunto estreito, produzindo monocultura de citações sem que nenhuma citação individual esteja errada.’

Como forma de remediar o problema, o artigo argumenta que simplesmente misturar modelos de diferentes fornecedores ou dar exposição igual aos artigos não será suficiente, pois grande parte da preferência é compartilhada entre os modelos. Em vez disso, a preferência subjacente por determinados artigos precisaria mudar – potencialmente ao conceder deliberadamente maior destaque aos artigos negligenciados. Contudo, os autores enfatizam que essa abordagem ainda não foi testada.

Abordagens de Teste

O benchmark foi construído a partir de 120 artigos reais de destilação de conhecimento coletados do arXiv e publicados entre 2015 e 2022. Cada um tinha entre 50 e 500 citações no momento da coleta, intervalo escolhido para excluir tanto trabalhos obscuros quanto excepcionalmente influentes.

O experimento começou selecionando trinta artigos aleatoriamente da coleção disponível, com nomes de autores, anos de publicação e contagens de citações ocultos. Cada modelo produziu uma breve revisão ou texto de posicionamento citando no máximo dez artigos, e essas escolhas foram comparadas com seleções aleatórias do mesmo material:

Método usado para testar preferências de citação. Trinta artigos selecionados aleatoriamente foram mostrados a um modelo com informações de identificação ocultas, após o qual ele poderia citar até dez. Suas escolhas foram comparadas com seleção aleatória, enquanto cada rodada adicionava 120 artigos escritos por IA à coleção da rodada seguinte.

Método usado para testar preferências de citação. Trinta artigos selecionados aleatoriamente foram mostrados a um modelo com informações de identificação ocultas, após o qual ele poderia citar até dez. Suas escolhas foram comparadas com seleção aleatória, enquanto cada rodada adicionava 120 artigos escritos por IA à coleção da rodada seguinte.

No experimento estendido, 120 novos artigos gerados foram inseridos na coleção após cada rodada, aumentando gradualmente a proporção de pesquisas escritas por IA.

Nos testes preliminares, os modelos tendiam a citar a maioria dos artigos que lhes eram mostrados, tipicamente selecionando de 22 a 27 dos 30. Os pesquisadores, portanto, estabeleceram um máximo de dez citações para o experimento principal, forçando os modelos a fazer escolhas mais seletivas.

A seguir, vemos um resumo do desenho experimental resultante:

Configuração experimental usada para testar preferências de citação. O estudo começou com 120 artigos reais e testou onze modelos de três fornecedores, usando conjuntos aleatórios de 30 artigos e um máximo de dez citações. Rodadas posteriores adicionaram artigos gerados por IA, expandindo a coleção para 1.440 artigos.

Configuração experimental usada para testar preferências de citação. O estudo começou com 120 artigos reais e testou onze modelos de três fornecedores, usando conjuntos aleatórios de 30 artigos e um máximo de dez citações. Rodadas posteriores adicionaram artigos gerados por IA, expandindo a coleção para 1.440 artigos.

O experimento inicial usou onze modelos dos três principais provedores: a OpenAI foi representada por GPT-5, GPT-5 mini, GPT-4.1 e GPT-4.1 mini; a Google por Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro e Gemini 3.1 Flash-Lite; e a Anthropic por Claude Opus 4.8, Claude Sonnet 4.6 e Claude Haiku 4.5.

Nos resultados de teste mostrados abaixo, vemos o quanto cada modelo concentrou suas citações em um pequeno grupo de artigos; quantos artigos ignorou completamente; e quão consistentemente fez as mesmas escolhas quando o experimento foi repetido:

Resultados de teste mostrando o quão fortemente cada modelo concentrou suas citações em artigos específicos e quantos artigos ignorou completamente. 'Participação dos 10% superiores' mostra quantas citações foram para os 12 artigos mais favorecidos, enquanto 'HHI' mede o quão concentradas as citações foram no geral. 'Confiabilidade' mostra quão consistentemente cada modelo favoreceu os mesmos artigos nos testes, e ρ mostra quão semelhantes essas preferências foram entre os modelos. A linha 'Nulo correspondido' indica o que seria esperado se os artigos fossem escolhidos aleatoriamente.

Resultados de teste mostrando o quão fortemente cada modelo concentrou suas citações em artigos específicos e quantos artigos ignorou completamente. ‘Participação dos 10% superiores’ mostra quantas citações foram para os 12 artigos mais favorecidos, enquanto ‘HHI’ mede o quão concentradas as citações foram no geral. ‘Confiabilidade’ mostra quão consistentemente cada modelo favoreceu os mesmos artigos nos testes, e ρ mostra quão semelhantes essas preferências foram entre os modelos. A linha ‘Nulo correspondido’ indica o que seria esperado se os artigos fossem escolhidos aleatoriamente.

O Que os Modelos Realmente Favorecem?

A preferência foi encontrada como predominantemente impulsionada pelo conteúdo dos próprios artigos. Por exemplo, para o GPT-5 mini, cerca de 90% da variação nos artigos favorecidos era atribuível ao conteúdo, e não a fatores como ordem da lista, ruído de geração ou os metadados fabricados anexados a cada artigo. O mesmo efeito de ‘conteúdo dominante’ foi reproduzido com o GPT-4.1 mini.

O mapa de preferência (veja abaixo) também mudou muito pouco quando títulos e resumos foram substancialmente reescritos enquanto seu significado foi preservado. Em quatro testes de paráfrase bem-sucedidos, foram obtidas correlações de 0,95–0,99, apesar de diferentes modelos de três fornecedores terem sido usados para a reescrita.

Alterações no mapa de preferência foram observadas apenas quando o significado subjacente foi alterado de forma mensurável:

Resultados de teste comparando preferências de citação entre os onze modelos. Os números mostram o quão próximo cada par de modelos favoreceu os mesmos artigos, com valores mais altos indicando maior concordância. Apesar das diferenças entre modelos e fornecedores, preferências amplamente semelhantes foram encontradas em todo o grupo

Resultados de teste comparando preferências de citação entre os onze modelos. Os números mostram o quão próximo cada par de modelos favoreceu os mesmos artigos, com valores mais altos indicando maior concordância. Apesar das diferenças entre modelos e fornecedores, preferências amplamente semelhantes foram encontradas em todo o grupo

Portanto, os modelos parecem responder principalmente ao conteúdo semântico em vez de formulações específicas. Contudo, a razão para sua forte concordância não pôde ser determinada de forma conclusiva.

É possível, afirmam os autores, que um consenso de citação comum tenha sido absorvido durante o treinamento. Uma possibilidade alternativa é que julgamentos semelhantes sobre o que constitui um artigo ‘citável’ possam ser alcançados independentemente.

Portanto, a existência da preferência compartilhada foi estabelecida, mas sua origem final permanece desconhecida.

Os autores sugerem que o uso generalizado de IA na pesquisa pode estreitar a variedade de trabalhos que recebem atenção, porque diferentes modelos tendem a favorecer muitos dos mesmos artigos; e à medida que a literatura gerada por IA se acumula, essas preferências compartilhadas podem ser ainda mais reforçadas por citações repetidas, tornando a pesquisa menos favorecida progressivamente mais difícil de descobrir. Diversidade de citações e monitoramento da concentração de citações são, portanto, propostos como possíveis salvaguardas.

O benchmark do estudo para concentração recursiva de citações está agora disponível no GitHub.

Conclusão

Opinião Como alguém que lê um número excessivo de artigos de pesquisa em IA semanalmente, tenho visto ‘ondas de citação’ surgirem e desaparecerem. Um pilar perene é o Attention Is All You Need da Google, o artigo original dos Transformers, que agora deve estar codificado nos modelos de submissão.

Outro reincidente, por muito tempo, foi o trabalho de 2014 Generative Adversarial Networks, embora tenha sido eventualmente substituído em frequência por Denoising Diffusion Probabilistic Models e outros estudos de base baseados em difusão.

Em quase todos os casos, essas citações ‘recorrentes’ não são erradas, por si só; mas frequentemente são abrangentes demais para ser um apoio útil ao artigo em que são citadas; e nesse sentido, representam algo semelhante a ‘lavagem de citações’ – a inclusão de citações de fontes ‘confiáveis’ mas principalmente decorativas, para conferir uma aparência de credibilidade com baixo esforço.

 

Primeira publicação segunda‑feira, 24 de agosto de 2026. Alterado às 23:07 EET para acrescentar o plural ausente.

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai