Ângulo de Anderson

A Língua Gerada por IA Começa a Poluir a Literatura Científica

mm
Adicione Unite.AI às suas fontes preferidas no Google

Pesquisadores da França e da Rússia publicaram um estudo indicando que o uso de geradores de texto probabilísticos baseados em IA, como o GPT-3, está introduzindo ‘linguagem torturada’, citações de literatura inexistente e reutilização de imagens sem créditos em canais respeitáveis para a publicação de nova literatura científica.

Talvez a preocupação mais importante seja que os artigos estudados também contêm conteúdo cientificamente impreciso ou não reprodutível apresentado como fruto de pesquisa objetiva e sistemática, indicando que os modelos de linguagem gerativa estão sendo usados não apenas para melhorar as limitadas habilidades em inglês dos autores dos artigos, mas também para realizar o trabalho difícil envolvido (e, invariavelmente, para fazê-lo mal).

O relatório, intitulado Frases Torturadas: Um Estilo de Escrita Duvidoso que Emergiu na Ciência, foi compilado por pesquisadores do Departamento de Ciência da Computação da Universidade de Toulouse e pelo pesquisador da Yandex, Alexander Magazinov, atualmente na Universidade de Tel Aviv.

O estudo se concentra particularmente no crescimento de publicações científicas nonsense geradas por IA na revista Elsevier Microprocessors and Microsystems.

Por Outro Nome

Modelos de linguagem autoregressivos, como o GPT-3, são treinados em grandes volumes de dados e projetados para parafrasear, resumir, coletar e interpretar esses dados de contribuição em modelos de linguagem gerativa coesos que são capazes de reproduzir padrões de fala e escrita naturais, mantendo a intenção original dos dados de treinamento.

Como esses quadros são frequentemente punidos no estágio de treinamento do modelo por oferecer regurgitação direta e ‘não absorvida’ dos dados originais, eles inevitavelmente buscam sinônimos – mesmo para frases bem estabelecidas.

As submissões científicas aparentemente criadas/auxiliadas por IA descobertas pelos pesquisadores incluem um número extraordinário de tentativas falhas de sinônimos criativos para frases conhecidas no setor de aprendizado de máquina:

rede neural profunda: ‘organização neural profunda’
rede neural artificial: ‘‘(falsa | contrafeita) organização neural’
rede móvel: ‘‘organização versátil’
ataque de rede:‘(organização | emboscada | assalto)’
conexão de rede:‘associação de organização’
big data:‘(enorme | grande | imenso | colossal) informação’
armazenamento de dados: ‘(estoque | centro de distribuição) de informação’
inteligência artificial (IA): ‘(falsa | criada pelo homem) consciência’
computação de alto desempenho: ‘figuração de elite’
computação em névoa/névoa/neblina: ‘figuração nebulosa’
unidade de processamento gráfico (GPU): ‘unidade de preparo de designs’
unidade central de processamento (CPU): ‘unidade de preparo focal’
motor de fluxo de trabalho: ‘motor de processo de trabalho’
reconhecimento facial: ‘reconhecimento facial’
reconhecimento de voz: ‘reconhecimento de discurso’
erro quadrático médio: ‘erro quadrático médio (erro | falha)’
erro absoluto médio: ‘erro absoluto médio (erro | falha)’
sinal para ruído: ‘(movimento | sinal | indicador | sinal) para (ruído | alvoroço | confusão)’
parâmetros globais: ‘parâmetros mundiais’
acesso aleatório: ‘(arbitrário | irregular) acesso a’
floresta aleatória: ‘(arbitrário | irregular) (floresta | território)’
valor aleatório: ‘(arbitrário | irregular) valor’
colônia de formigas: ‘(inseto subterrâneo | formiga) (estado | província | área | região | assentamento)’
colônia de formigas: ‘(inseto subterrâneo | formiga) (estado | província | área | região | assentamento)’
energia restante: ‘vitalidade restante’
energia cinética: ‘vitalidade motora’
Bayes ingênuo: ‘(creduloso | inocente | ingênuo) Bayes’
assistente digital pessoal (PDA): ‘colaborador computadorizado individual’

Em maio de 2021, os pesquisadores consultaram o mecanismo de busca acadêmico Dimensions em busca desse tipo de linguagem automatizada e distorcida, tomando cuidado para excluir frases legítimas, como ‘informação enorme’ (que é uma frase válida e não um sinônimo falho para ‘big data’). Nesse ponto, eles observaram que Microprocessors and Microsystems tinha o maior número de ocorrências de parafraseamento mal manuseado.

Até o momento, ainda é possível recuperar (snapshots de arquivo, 15/07/2021) vários artigos científicos para a frase nonsense ‘organização neural profunda’ (ou seja, ‘rede neural profunda’), e outros na lista acima produzem resultados semelhantes.

Resultados de busca para 'organização neural profunda' ('rede neural profunda') no Dimensions. Fonte: https://app.dimensions.ai/

Resultados de busca para ‘organização neural profunda’ (‘rede neural profunda’) no Dimensions. Fonte: https://app.dimensions.ai/

A revista Microprocessors foi fundada em 1976 e renomeada para Microprocessors and Microsystems dois anos depois.

Crescimento de Linguagem Nonsense

Os pesquisadores estudaram um período que abrange de fevereiro de 2018 a junho de 2021 e observaram um aumento acentuado no volume de submissões nos últimos dois anos, e particularmente nos últimos 6-8 meses;

Correlação ou causalidade? O aumento nas submissões para a revista Microprocessors and Microsystems parece coincidir com o crescimento de 'nonsense' texto e sinônimos em submissões aparentemente respeitáveis. Fonte: https://arxiv.org/pdf/2107.06751.pdf

Correlação ou causalidade? O aumento nas submissões para a revista Microprocessors and Microsystems parece coincidir com o crescimento de ‘nonsense’ texto e sinônimos em submissões aparentemente respeitáveis. Fonte: https://arxiv.org/pdf/2107.06751.pdf

O conjunto de dados final coletado pelos colaboradores contém 1.078 artigos completos obtidos por meio da assinatura da Elsevier da Universidade de Toulouse.

Diminuição da Supervisão Editorial para Artigos Científicos Chineses

O artigo observa que o período de tempo alocado para a avaliação editorial das submissões sinalizadas se reduziu drasticamente em 2021, caindo para menos de 40 dias; uma redução seis vezes maior no tempo padrão para revisão por pares, evidente a partir de fevereiro de 2021.

O maior número de artigos sinalizados origina-se de autores com afiliações à China continental: de 404 artigos aceitos em menos de 30 dias, 97,5% são relacionados à China. Por outro lado, nos casos em que o processo editorial excedeu 40 dias (615 artigos), as submissões afiliadas à China representaram apenas 9,5% desse grupo – um desequilíbrio de dez vezes.

O relatório atribui a infiltração dos artigos sinalizados a deficiências no processo editorial e a uma possível falta de recursos diante do aumento do número de submissões.

Os pesquisadores hipotetizam que os modelos de linguagem gerativa do tipo GPT, e outros tipos de estruturas de geração de linguagem, foram usados para produzir grande parte do texto nos artigos sinalizados; no entanto, a forma como um modelo gerativo abstrai suas fontes torna isso difícil de provar, e a principal evidência reside em uma avaliação comum do uso de sinônimos pobres e desnecessários, e um exame meticuloso da coerência lógica da submissão.

Os pesquisadores observam ainda que os modelos de linguagem gerativa que acreditam estar contribuindo para essa enxurrada de nonsense são capazes não apenas de criar os textos problemáticos, mas também de reconhecê-los e sinalizá-los sistematicamente, da mesma forma que os próprios pesquisadores fizeram manualmente. O trabalho detalha tal implementação, usando o GPT-2, e oferece um quadro para que futuros sistemas identifiquem submissões científicas problemáticas.

A incidência de submissões ‘poluídas’ é muito maior na revista Elsevier (72,1%) em comparação com outras revistas estudadas (13,6% no máximo).

Não Apenas Semântica

Os pesquisadores enfatizam que muitos dos artigos em questão não estão apenas usando a linguagem errada, mas contêm afirmações cientificamente imprecisas, indicando a possibilidade de que os modelos de linguagem gerativa não estejam sendo usados apenas para melhorar as habilidades linguísticas limitadas dos cientistas que contribuem, mas possam estar sendo usados para formular pelo menos alguns dos teoremas e dados centrais no artigo.

Em outros casos, os pesquisadores sugerem uma ‘ressíntese’ ou ‘reelaboração’ eficaz de trabalho anterior abstrato (e superior) para atender às pressões da cultura de pesquisa acadêmica ‘publicar ou perecer’, e possivelmente para melhorar as classificações nacionais para a preeminência global em pesquisa de IA, por meio do volume puro.

Conteúdo nonsense em um artigo submetido. Nesse caso, os pesquisadores encontraram que o texto foi derivado, ad hoc, de um artigo da EDN, de onde a ilustração acompanhante também foi extraída sem atribuição. A reescrita do conteúdo original é tão extrema que o torna sem sentido.

Conteúdo nonsense em um artigo submetido. Nesse caso, os pesquisadores encontraram que o texto foi derivado, ad hoc, de um artigo da EDN, de onde a ilustração acompanhante também foi extraída sem atribuição. A reescrita do conteúdo original é tão extrema que o torna sem sentido.

Ao analisar vários artigos submetidos à Elsevier, os pesquisadores encontraram frases para as quais não conseguiram inferir nenhum significado; referências a literatura inexistente; referências a variáveis e teoremas em fórmulas que não apareciam realmente no material de apoio (sugerindo abstração baseada em linguagem ou ‘alucinação’ de dados aparentemente factuais); e reutilização de imagens sem reconhecimento de suas fontes (o que os pesquisadores criticam não do ponto de vista de direitos autorais, mas como um indicador de rigor científico inadequado).

Falhas de Citação

As citações destinadas a apoiar os argumentos em um artigo científico foram encontradas em muitos dos exemplos sinalizados como ‘quebradas ou levando a publicações não relacionadas’.

Além disso, referências a ‘trabalho relacionado’ aparentemente incluem autores que os pesquisadores acreditam terem sido ‘alucinados’ por um sistema do tipo GPT.

Atenção Vagabunda

Outra limitação mesmo dos modelos de linguagem mais avançados, como o GPT-3, é a tendência a perder o foco ao longo de um discurso longo. Os pesquisadores encontraram que os artigos sinalizados frequentemente abordam um tópico no início do artigo que nunca é retomado após ser inicialmente abordado em notas preliminares ou em outros lugares.

Eles também teorizam que alguns dos piores exemplos ocorrem por meio de múltiplas jornadas de texto de origem através de uma série de motores de tradução, cada um distorcendo o significado ainda mais.

Fontes e Motivos

Ao tentar discernir o que está por trás desse fenômeno, os autores do artigo sugerem uma série de possibilidades: que o conteúdo de ‘fábricas de artigos’ está sendo usado como material de origem, introduzindo imprecisões muito cedo em um processo que inevitavelmente produzirá mais imprecisões; que ferramentas de giro de artigos, como o Spinbot, estão sendo usadas para mascarar plágio; e que a pressão esmagadora para publicar regularmente está levando pesquisadores subfinanciados a usar sistemas do tipo GPT-3 para aumentar ou gerar entirely novos artigos acadêmicos.

Os pesquisadores concluem com um apelo à ação para uma maior supervisão e padrões melhorados em uma área de publicação acadêmica que está se provando, aparentemente, se tornar alimento para seu próprio assunto – sistemas de aprendizado de máquina. Eles também adjuram a Elsevier e outros editores a introduzir procedimentos de triagem e revisão mais rigorosos, e criticam amplamente os padrões e práticas atuais nesse aspecto, sugerindo que ‘a decepção com textos sintéticos ameaça a integridade da literatura científica.’

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai