Ângulo de Anderson

Combatendo a Falha de IA em Artigos Científicos

mm
Adicione Unite.AI às suas fontes preferidas no Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

A IA faz tudo em escala, desde raspagem de web em nível de ataque DOS até a produção, ou habilitação, de volumes tão vastos de submissões de pesquisas científicas, de modo que o resultado está se tornando tanto uma crise logística quanto uma crise de qualidade, à medida que a relação sinal-ruído continua a se tornar intransponível.

Na semana passada, o servidor de pré-impressões arXiv anunciou que implementará uma nova política de limitação de taxa para os autores, que agora serão limitados a duas submissões por mês. A medida foi tomada, sugere o anúncio, diante de um aumento vertiginoso nas taxas de submissão em um curto período de tempo:

Submissões mensais à categoria cs.AI do arXiv de janeiro de 2024 a setembro de 2026, mostrando um aumento de mais de seis vezes no período. Fonte - https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Submissões mensais à categoria cs.AI do arXiv de janeiro de 2024 a setembro de 2026, mostrando um aumento de mais de seis vezes no período. Fonte

A postagem de blog de Kat Boboris anunciando a mudança, que gerou comentários no Hacker News na última quinta-feira, afirmou que o arXiv recebeu 40,363 submissões em setembro de 2026 – quase o dobro das 20,569 recebidas em setembro de 2024, e mais de quatro vezes as 9,869 recebidas em setembro de 2016.

As submissões do mês mais recente, observou Boboris, também geraram quase 9,000 tickets de suporte para a equipe e moderadores do arXiv:

‘Nossos moderadores estão observando um aumento de artigos finos de escopo estreito, bem como artigos ‘salame’, onde um único trabalho é dividido e submetido como um conjunto de artigos menores.

‘Há também um aumento significativo em artigos densos escritos por IA. Ferramentas de IA estão facilitando para os autores inundarem o arXiv e outros repositórios com esses artigos de baixo valor.’

Já, em maio deste ano, o arXiv tomou a medida de implementar uma proibição de um ano para conteúdo de IA não verificado; e em outubro do ano passado, informou aos autores de artigos de pesquisa e artigos de posição (ambos podem ser gerados com menos esforço que um estudo acadêmico completo) que precisariam de apoio de pares para serem publicados no arXiv.

Por enquanto, a limitação frequentemente obstrutiva de solicitações http no domínio arXiv não está muito evidente, e só se pode esperar que seus feeds RSS muito úteis sobrevivam a esse recuo contínuo. Na semana passada, o Reddit anunciou a temida eliminação total de seus feeds RSS, que ocorrerá a partir da metade do próximo mês. Contudo, o status sem fins lucrativos do arXiv significa que há pouco capital semelhante a ser obtido ao conduzir leitores a visitas obrigatórias ao site, ou logins forçados – pelo menos, por enquanto.

Contra a Maré Crescente

Diante de tais problemas graves e crescentes sobre o efeito negativo do uso de IA na pesquisa científica – especialmente no que se refere à pesquisa relacionada à IA, que eclipsou todas as outras categorias, e ascendeu da obscuridade para se tornar um sinalizador político e econômico, recentemente – surgiu um ramo de pesquisa que examina maneiras de combater o declínio na qualidade das submissões de artigos relacionados à IA.

A mais recente iniciativa para enfrentar o problema surge na forma de uma colaboração entre a Seoul National University da Coreia e a University of Minnesota nos EUA. O artigo, intitulado Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, propõe medir a ‘falha científica’ por meio de falhas nas conexões entre as reivindicações, evidências, citações e estrutura de um artigo:

Do novo artigo, uma visão geral da abordagem do trabalho à 'falha científica', mostrando como falhas na estrutura, argumento e artefatos de apoio podem revelar fraquezas que detectores convencionais de texto de IA não detectam. Fonte - https://arxiv.org/pdf/2610.00531

Do novo artigo, uma visão geral da abordagem do trabalho à ‘falha científica’, mostrando como falhas na estrutura, argumento e artefatos de apoio podem revelar fraquezas que detectores convencionais de texto de IA não detectam. Fonte

Ao contrário de abordagens anteriores, o novo sistema olha além do próprio texto para avaliar se as reivindicações do artigo são adequadamente sustentadas por seus argumentos, evidências e citações. Os autores afirmam*:

‘Cada parte de um artigo pode parecer plausível isoladamente, de modo que tais falhas são invisíveis para detectores ao nível de token e só podem ser identificadas ou corrigidas ao nível do artigo inteiro. Para avaliar e mitigar a falha científica, este artigo aborda três desafios.

‘Primeiro, métricas ao nível de token falham em capturar como o raciocínio científico se conecta ao longo de um artigo. Seções, reivindicações, citações, evidências e artefatos podem cada um parecer plausíveis enquanto as relações entre eles se desfazem. Observamos repetidamente tais falhas em artigos gerados por IA de ponta a ponta, e revisores da ICLR já os penalizam mesmo em submissões escritas por humanos.

‘Segundo, a detecção desses padrões permanece não medida. Conjuntos de teste existentes rotulam apenas o texto, de modo que a extensão em que detectores, incluindo LLMs que leem o artigo inteiro, identificam esses padrões nunca foi medida.

‘Terceiro, esses padrões são difíceis de mitigar de forma confiável. Enquanto sinais ao nível de token podem ser removidos por meio de paráfrase, reparar esses padrões requer restaurar as relações ausentes sem alterar a ciência subjacente.’

O novo benchmark dos autores, apelidado de SciSlopBench, foi incorporado ao SciSlopHarness, um framework projetado para detectar e corrigir falhas no raciocínio científico de um artigo, preservando a evidência científica subjacente:

Exemplos comparando trechos defeituosos com revisões feitas pelo SciSlopHarness. Adições não suportadas são rejeitadas, enquanto reivindicações são reordenadas ou reescritas quando necessário para refletir melhor as evidências disponíveis no artigo.

Exemplos comparando trechos defeituosos com revisões feitas pelo SciSlopHarness. Adições não suportadas são rejeitadas, enquanto reivindicações são reordenadas ou reescritas quando necessário para refletir melhor as evidências disponíveis no artigo.

O próprio benchmark SciSlopBench foi construído a partir de 390 artigos gerados por IA, cada um emparelhado com um artigo escrito por humanos que aborda um problema de pesquisa e tipo de contribuição semelhantes.

Nos testes, o SciSlopBench foi usado para distinguir entre 390 pares de artigos, com cada par consistindo do mencionado artigo gerado por IA e de um artigo escrito por humanos correspondido ao problema de pesquisa e ao tipo de contribuição. O benchmark identificou corretamente o artigo gerado por IA em 85,9% dessas comparações, superando substancialmente os detectores convencionais de texto de IA.

Os autores afirmam:

‘Embora revisões padrão deixem slop residual e prompts conscientes de slop acionem manipulação de recompensas, o SciSlopHarness reduz a lacuna remanescente entre IA–humano em 63% em relação à linha de base de revisão mais forte, sem exigir alvos de referência humanos.

‘No geral, demonstramos que artigos científicos gerados por IA deixam rastros fundamentais em seu raciocínio global, e que a mitigação responsável exige fundamentação estrita em evidências, em vez de mera refinamento de prosa.’

Além das contribuições feitas pelo próprio artigo, os autores operacionalizaram os princípios de seu novo trabalho na forma de uma demo ao vivo onde os usuários podem submeter artigos científicos para análise da quantidade de slop de IA que contêm.

Curiosamente, o próprio novo artigo, analisado pela demo, obtém uma pontuação de slop ‘moderada’ de 40/100†:

O novo artigo, analisado por seu próprio algoritmo, sinaliza áreas de 'slop' identificadas pelo novo processo dos autores. Fonte: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

O novo artigo, analisado por seu próprio algoritmo, recebe áreas de ‘slop’ sinalizadas pelo novo processo dos autores. Fonte

Método e Abordagem de Dados

A colaboração de 2025 Why Slop Matters descreveu ‘competência superficial’ como uma característica definidora do slop de IA, onde a qualidade aparente oculta falta de substância. O novo trabalho aplica essa ideia mais especificamente a artigos científicos, definindo ‘slop científico’ como falhas que dificultam acompanhar como um estudo está organizado; como suas reivindicações são sustentadas; e como seus métodos e evidências podem ser examinados, com as falhas agrupadas em estrutura; argumento; e artefatos:

Regras de medição para os seis tipos de slop científico usados no benchmark. A tabela mostra o que é examinado para cada medida, como a pontuação é calculada e o que representa a pontuação máxima de 1, com pontuações mais altas indicando falhas mais extensas.

Regras de medição para os seis tipos de slop científico usados no benchmark. A tabela mostra o que é examinado para cada medida, como a pontuação é calculada e o que representa a pontuação máxima de 1, com pontuações mais altas indicando falhas mais extensas.

As seis medidas de slop científico definidas no artigo são referências entre seções (seções referem-se de forma significativa a material em outra parte do artigo); macro redundância (seções posteriores repetem material anterior); grafo de argumento (as reivindicações são adequadamente sustentadas pelo raciocínio precedente); isolamento de citação (citações são usadas superficialmente, sem explicar como os trabalhos citados se relacionam ao artigo ou entre si); exposição de figuras (as figuras de método realmente explicam o método); e lacuna de evidência (os resultados relatados são sustentados por exemplos concretos).

O benchmark foi construído emparelhando artigos gerados por IA com artigos humanos comparáveis/equivalentes, com os artigos de IA curados a partir de FARS e da competição 2025 Agents4Science.

Para cada artigo gerado por máquina do FARS, os pesquisadores buscaram em suas citações um artigo escrito por humanos do mesmo tipo que havia sido aceito em um local de alto nível e, em seguida, selecionaram a correspondência mais próxima por tópico de pesquisa, produzindo 143 pares. Os artigos do Agents4Science foram igualmente pareados com contrapartes escritas por humanos, gerando mais 247 pares e elevando o benchmark para um total de 390 pares IA‑humano. Os artigos abrangem as ciências da vida, sociais e naturais, embora o conjunto de dados esteja fortemente ponderado em direção à ciência da computação.

Para as métricas, o desempenho foi avaliado usando Precisão de Par, que mede com que frequência o artigo humano é classificado acima de seu equivalente de IA; e AUROC, que mede a separação geral entre artigos humanos e de IA em diferentes limiares. Os autores também relatam o desempenho de detecção quando a taxa de falsos positivos para artigos humanos é fixada em 5%.

Testes

Os testes iniciais compararam o SciSlop com os detectores de texto de IA Binoculars; DetectGPT; e NTS††, bem como com os sistemas de revisão automatizada AI Scientist Reviewer e CycleReviewer.

Para os testes de revisão posteriores, foram usadas quatro linhas de base: prompt base; Claude Code; refinamento baseado em revisor; e revisão consciente de slop. Os três primeiros receberam apenas instruções gerais para melhorar o artigo, enquanto a revisão consciente de slop recebeu adicionalmente as definições e localizações do slop detectado. Todos foram comparados com o SciSlopHarness sob condições de revisão equivalentes.

Para a implementação, os detectores de texto receberam a prosa do artigo, enquanto os demais métodos receberam o código‑fonte do artigo e, quando necessário, acesso ao seu código. Binoculars usou Falcon-7B base e modelos instruídos; DetectGPT usou T5-3B para gerar 100 perturbações; AI Scientist usou Qwen2.5-32B-Instruct; e CycleReviewer usou seu checkpoint de 8B lançado. Para artigos que excedem o limite de 2.048 tokens do Falcon, janelas não sobrepostas foram avaliadas separadamente e a média foi calculada.

Os resultados iniciais de detecção são detalhados nas duas tabelas abaixo: o SciSlop alcançou 85,9% de Precisão de Par, comparado a 68,7% para Binoculars e 68,5% para o revisor automatizado mais forte, reduzindo a taxa de erro em mais da metade:

Resultados de detecção comparando o SciSlop com detectores de texto de IA e revisores automatizados, juntamente com os resultados de suas seis medidas individuais de slop. O SciSlop atinge a maior Precisão de Par geral, enquanto as referências de seção cruzada fornecem o resultado individual mais forte.

Resultados de detecção comparando o SciSlop com detectores de texto de IA e revisores automatizados, juntamente com os resultados de suas seis medidas individuais de slop. O SciSlop atinge a maior Precisão de Par geral, enquanto as referências de seção cruzada fornecem o resultado individual mais forte.

As referências de seção cruzada tiveram desempenho particularmente forte por si só, atingindo 90,5% de Precisão de Par sem exigir um modelo, e detectando 65% dos artigos gerados por IA com uma taxa de falsos positivos de 5%, comparado a 24% para Binoculars.

Os autores argumentam que esses resultados indicam que as relações ao longo do artigo fornecem um sinal mais forte de geração por IA do que a detecção convencional ao nível de texto neste conjunto de dados, ao mesmo tempo em que identificam fraquezas específicas que poderiam ser posteriormente alvo de revisão.

A seguir, foi examinada a relação entre slop científico e as avaliações humanas da qualidade do artigo. Como mostrado na primeira coluna abaixo, maior slop estava associado a pontuações ICLR mais baixas para avaliação geral, solidez, apresentação e contribuição:

Comparação do SciSlop com detectores de texto de IA e revisores automatizados em relação aos resultados de revisão do ICLR. O painel esquerdo mostra a semelhança com IA em relação às pontuações de revisão; o centro compara dimensões individuais de revisão; o direito mostra o desempenho ao distinguir artigos rejeitados de aceitos ao longo de nove anos.

Comparação do SciSlop com detectores de texto de IA e revisores automatizados em relação aos resultados de revisão do ICLR. O painel esquerdo mostra a semelhança com IA em relação às pontuações de revisão; o centro compara dimensões individuais de revisão; o direito mostra o desempenho ao distinguir artigos rejeitados de aceitos ao longo de nove anos.

Artigos rejeitados e aceitos também foram distinguidos acima do acaso em todos os nove anos examinados, enquanto os detectores convencionais ficaram abaixo do acaso na maioria das comparações.

Portanto, constatou‑se que o slop científico reflete fraquezas já penalizadas pelos revisores humanos, em vez de funcionar apenas como um sinal de autoria por IA.

Os testes finais examinaram se o SciSlopHarness poderia remover o slop que permanecia após uma revisão mais geral. Como mostrado abaixo, o harness terminou mais próximo da média humana em todas as seis medidas, enquanto a revisão geral frequentemente deixava slop substancial e a revisão direta consciente de slop às vezes supercorrigia:

Resultados de revisão comparando o SciSlopHarness com quatro métodos de referência nas seis medidas de slop. Valores mais próximos de zero estão mais próximos da média de artigos humanos, com o SciSlopHarness geralmente se aproximando desse nível, enquanto a revisão consciente de slop frequentemente o ultrapassa.

Resultados de revisão comparando SciSlopHarness com quatro métodos de referência nos seis indicadores de slop. Valores mais próximos de zero estão mais próximos da média de artigos humanos, com SciSlopHarness geralmente se aproximando desse nível, enquanto a revisão consciente de slop frequentemente o ultrapassa.

Cada mudança proposta foi verificada em relação ao raciocínio científico do artigo e às evidências de apoio, com edições não suportadas rejeitadas. Nos seis indicadores, a lacuna restante em relação a artigos escritos por humanos foi reduzida em 63% em comparação com Claude Code, a baseline de revisão mais forte.

Conclusão

Foi interessante, ao escrever este texto, notar não apenas o quão mal este artigo pontuou em seu próprio site de demonstração, mas observar ao menos um exemplo de citação ‘preguiçosa’ ou ‘cosmética’††, que recentemente se tornou uma maldição menor, porém crescente, em artigos de pesquisa.

Nesses casos, além deste artigo específico, os pesquisadores parecem basear‑se em seu próprio conhecimento ao invés de se envolverem de forma significativa com a literatura existente. Contudo, limitados pela convenção de ‘mostrar seu trabalho’, as citações são frequentemente fornecidas com o que parece ser impaciência, até desprezo pelo processo, e muitas vezes aparentemente dependem do leitor para aceitar um excesso de referências como uma ‘patina’ suficiente de proveniência, embora não sobreviveria a um escrutínio excessivo.

Arxiv está reagindo contra a industrialização de submissões impulsionada por IA; se haverá restrições semelhantes ao envolvimento direto da IA na pesquisa, na ausência de algum desastre relacionado de magnitude suficiente, ainda está por se ver.

 

* Os ênfases dos autores, não os meus – mas minha conversão, quando necessário, das citações inline dos autores para hyperlinks.

† Os autores não afirmam zero uso de IA em seu próprio artigo, e detalham tal uso.

†† Pode interessar ao leitor saber que tive que procurar um link correto por conta própria para o framework NTS, porque o link fornecido pelos autores não era relevante – uma das próprias métricas que o SciSlop utiliza!

Primeira publicação domingo, 4 de outubro de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai