Ángulo de Anderson

El lenguaje generado por IA comienza a contaminar la literatura científica

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Investigadores de Francia y Rusia han publicado un estudio que indica que el uso de generadores de texto probabilísticos basados en IA, como GPT-3, estÃĄn introduciendo un lenguaje “torturado”, citas de literatura inexistente y reutilizaciÃģn de imÃĄgenes sin crÃĐditos en canales previamente respetables para la publicaciÃģn de nueva literatura científica.

QuizÃĄs lo mÃĄs preocupante es que los artículos estudiados tambiÃĐn contienen contenido científicamente inexacto o no reproducible presentado como el resultado de investigaciÃģn objetiva y sistemÃĄtica, lo que indica que los modelos de lenguaje generativo estÃĄn siendo utilizados no solo para mejorar las limitadas habilidades en inglÃĐs de los autores de los artículos, sino tambiÃĐn para realizar el trabajo duro involucrado (y, inevitablemente, para hacerlo mal).

El informe, titulado Frases torturadas: Un estilo de escritura dudoso que emerge en la ciencia, ha sido compilado por investigadores del Departamento de Ciencias de la ComputaciÃģn de la Universidad de Toulouse y el investigador de Yandex Alexander Magazinov, actualmente en la Universidad de Tel Aviv.

El estudio se centra particularmente en el crecimiento de publicaciones científicas generadas por IA sin sentido en la revista Elsevier Microprocesadores y Microsistemas.

Por otro nombre

Los modelos de lenguaje autoregresivos como GPT-3 se entrenan con grandes cantidades de datos y estÃĄn diseÃąados para parafrasear, resumir, collationar e interpretar esos datos de contribuciÃģn en modelos de lenguaje generativo coherentes que son capaces de reproducir patrones de habla y escritura naturales, manteniendo la intenciÃģn original de los datos de entrenamiento.

Dado que tales marcos son frecuentemente castigados en la etapa de entrenamiento del modelo por ofrecer regurgitaciÃģn directa y “no absorbida” de los datos originales, inevitablemente buscan sinÃģnimos, incluso para frases bien establecidas.

Las presentaciones científicas aparentemente creadas/aidas por IA descubiertas por los investigadores incluyen un nÚmero extraordinario de intentos fallidos de sinÃģnimos creativos para frases conocidas en el sector de aprendizaje automÃĄtico:

red neuronal profunda: ‘organizaciÃģn neuronal profunda’
red neuronal artificial: ‘‘(falsa | falsificada) organizaciÃģn neuronal’
red mÃģvil: ‘‘organizaciÃģn versÃĄtil’
ataque a la red: ‘‘(organizaciÃģn | emboscada | asalto)’
conexiÃģn de red: ‘asociaciÃģn de organizaciÃģn’
datos grandes: ‘‘(enorme | enorme | inmenso | colosal) informaciÃģn’
almacÃĐn de datos: ‘(almacÃĐn | centro de distribuciÃģn) de informaciÃģn’
inteligencia artificial (IA): ‘(falsa | hecha por humanos) conciencia’
cÃģmputo de alto rendimiento: ‘cÃģmputo ÃĐlite’
cÃģmputo en la niebla/nube: ‘cÃģmputo en la niebla’
unidad de procesamiento grÃĄfico (GPU): ‘unidad de preparaciÃģn de diseÃąos’
unidad de procesamiento central (CPU): ‘unidad de preparaciÃģn focal’
motor de flujo de trabajo: ‘motor de proceso de trabajo’
reconocimiento facial: ‘reconocimiento facial’
reconocimiento de voz: ‘reconocimiento de discurso’
error cuadrÃĄtico medio: ‘error cuadrÃĄtico (error | equivocaciÃģn)’
error absoluto medio: ‘error (absoluto | supremo) (error | equivocaciÃģn)’
seÃąal ruido: ‘(movimiento | seÃąal | indicador | seÃąal) a (ruido | alboroto | bullicio)’
parÃĄmetros globales: ‘parÃĄmetros mundiales’
acceso aleatorio: ‘(accidental | irregular) acceso a’
bosque aleatorio: ‘(accidental | irregular) (bosque | tierra de madera | territorio luxuriante)’
valor aleatorio: ‘(accidental | irregular) valor’
colonia de hormigas: ‘(estado | provincia | ÃĄrea | regiÃģn | asentamiento) de insectos subterrÃĄneos’
colonia de hormigas: ‘(estado | provincia | ÃĄrea | regiÃģn | asentamiento) de insectos subterrÃĄneos’
energía restante: ‘vitalidad restante’
energía cinÃĐtica: ‘vitalidad motora’
Bayes ingenuo: ‘(credulo | inocente | ingenuo) Bayes’
asistente digital personal (PDA): ‘colaborador computarizado individual’

En mayo de 2021, los investigadores consultaron el motor de bÚsqueda acadÃĐmico Dimensions en busca de este tipo de lenguaje automatizado y desordenado, teniendo cuidado de excluir frases legítimas como “informaciÃģn enorme” (que es una frase vÃĄlida y no un sinÃģnimo fallido para “datos grandes”). En este punto, observaron que Microprocesadores y Microsistemas tenía el nÚmero mÃĄs alto de ocurrencias de parafraseo mal manejado.

En la actualidad, todavía es posible recuperar (instantÃĄnea de archivo, 15/07/2021) una serie de artículos científicos para la frase sin sentido “organizaciÃģn neuronal profunda” (es decir, “red neuronal profunda”), y otros en la lista anterior producen resultados similares.

Resultados de bÚsqueda para 'organizaciÃģn neuronal profunda' ('red neuronal profunda') en Dimensions. Fuente: https://app.dimensions.ai/

Resultados de bÚsqueda para ‘organizaciÃģn neuronal profunda’ (‘red neuronal profunda’) en Dimensions. Fuente: https://app.dimensions.ai/

La revista Microprocesadores fue fundada en 1976 y renombrada a Microprocesadores y Microsistemas dos aÃąos despuÃĐs.

Crecimiento de lenguaje sin sentido

Los investigadores estudiaron un período que abarca febrero de 2018 a junio de 2021, y observaron un aumento pronunciado en el volumen de presentaciones en los Últimos dos aÃąos, y particularmente en los Últimos 6-8 meses:

CorrelaciÃģn o causalidad? El aumento en las presentaciones a la revista Microprocesadores y Microsistemas parece coincidir con el crecimiento de 'lenguaje sin sentido' y sinÃģnimos en presentaciones aparentemente respetables.

CorrelaciÃģn o causalidad? El aumento en las presentaciones a la revista Microprocesadores y Microsistemas parece coincidir con el crecimiento de ‘lenguaje sin sentido’ y sinÃģnimos en presentaciones aparentemente respetables. Source: https://arxiv.org/pdf/2107.06751.pdf

La base de datos final recopilada por los colaboradores contiene 1,078 artículos completos obtenidos a travÃĐs de la suscripciÃģn de Elsevier de la Universidad de Toulouse.

DisminuciÃģn de la supervisiÃģn editorial para artículos científicos chinos

El artículo observa que el período de tiempo asignado para la evaluaciÃģn editorial de las presentaciones seÃąaladas se reduce drÃĄsticamente en 2021, cayendo a menos de 40 días; una disminuciÃģn seis veces mayor en el tiempo estÃĄndar para la revisiÃģn por pares, evidente desde febrero de 2021.

El mayor nÚmero de artículos seÃąalados proviene de autores con afiliaciones en China continental: de 404 artículos aceptados en menos de 30 días, el 97,5% son relacionados con China. Por el contrario, en casos donde el proceso editorial superÃģ los 40 días (615 artículos), las presentaciones afiliadas a China representaron solo el 9,5% de esa categoría, una desproporciÃģn de diez veces.

El informe atribuye la infiltraciÃģn de los artículos seÃąalados a deficiencias en el proceso editorial y a una posible falta de recursos frente a un creciente nÚmero de presentaciones.

Los investigadores hipotetizan que los modelos de lenguaje generativo de estilo GPT han sido utilizados para producir gran parte del texto en los artículos seÃąalados; sin embargo, la forma en que un modelo generativo abstracta sus fuentes hace que esto sea difícil de probar, y la principal evidencia se encuentra en una evaluaciÃģn comÚn de sinÃģnimos pobres e innecesarios, y un examen minucioso de la coherencia lÃģgica de la presentaciÃģn.

Los investigadores tambiÃĐn observan que los modelos de lenguaje generativo que creen que estÃĄn contribuyendo a esta inundaciÃģn de sinsentidos son capaces no solo de crear los textos problemÃĄticos, sino tambiÃĐn de reconocerlos y seÃąalarizarlos sistemÃĄticamente, de la misma manera que los investigadores mismos han realizado manualmente. El trabajo detalla tal implementaciÃģn, utilizando GPT-2, y ofrece un marco para que futuros sistemas identifiquen presentaciones científicas problemÃĄticas.

La incidencia de presentaciones “contaminadas” es mucho mayor en la revista Elsevier (72,1%) en comparaciÃģn con otras revistas estudiadas (13,6% como mÃĄximo).

No solo semÃĄntica

Los investigadores enfatizan que muchos de los artículos en cuestiÃģn no solo utilizan un lenguaje incorrecto, sino que tambiÃĐn contienen afirmaciones científicamente inexactas, lo que indica la posibilidad de que los modelos de lenguaje generativo no solo se estÃĐn utilizando para mejorar las habilidades lingÞísticas limitadas de los científicos que contribuyen, sino que tambiÃĐn pueden estar siendo utilizados para formular al menos algunos de los teoremas y datos centrales del artículo.

En otros casos, los investigadores plantean una “resíntesis” o “giro” efectivo de trabajo previo abstracto (y superior) para cumplir con las presiones de la cultura de investigaciÃģn acadÃĐmica “publicar o perecer”, y posiblemente para mejorar las clasificaciones nacionales para la preeminencia global en investigaciÃģn de IA, a travÃĐs de la mera cantidad.

Contenido sin sentido en un artículo presentado. En este caso, los investigadores encontraron que el texto se derivÃģ, ad hoc, de un artículo de EDN, de donde tambiÃĐn se tomÃģ la ilustraciÃģn acompaÃąante sin atribuciÃģn. La reescritura del contenido original es tan extrema que lo hace ininteligible.

Contenido sin sentido en un artículo presentado. En este caso, los investigadores encontraron que el texto se derivÃģ, ad hoc, de un artículo de EDN, de donde tambiÃĐn se tomÃģ la ilustraciÃģn acompaÃąante sin atribuciÃģn. La reescritura del contenido original es tan extrema que lo hace ininteligible.

Al analizar varios artículos de Elsevier, los investigadores encontraron oraciones para las que no pudieron inferir ningÚn significado; referencias a literatura inexistente; referencias a variables y teoremas en fÃģrmulas que no aparecían en el material de apoyo (lo que sugiere abstracciÃģn basada en lenguaje o “alucinaciÃģn” de datos aparentemente factuales); y reutilizaciÃģn de imÃĄgenes sin reconocimiento de sus fuentes (lo que los investigadores critican no desde un punto de vista de derechos de autor, sino como indicador de rigor científico inadecuado).

Fallas en las citas

Las citas destinadas a respaldar los argumentos en un artículo científico se encontraron en muchos de los ejemplos seÃąalados que eran “ya sea rotas o que conducen a publicaciones no relacionadas”.

AdemÃĄs, las referencias a “trabajo relacionado” aparentemente incluyen autores que los investigadores creen que han sido “alucinados” por un sistema de estilo GPT.

AtenciÃģn errante

Otra deficiencia de incluso los modelos de lenguaje de Última generaciÃģn como GPT-3 es su tendencia a perder el enfoque a lo largo de un discurso largo. Los investigadores encontraron que los artículos seÃąalados a menudo presentan un tema al principio del artículo que nunca se vuelve a mencionar despuÃĐs de que se introduce en notas preliminares o en otra parte.

TambiÃĐn teorizan que algunos de los peores ejemplos ocurren a travÃĐs de mÚltiples viajes de texto fuente a travÃĐs de una serie de motores de traducciÃģn, cada uno distorsionando aÚn mÃĄs el significado.

Fuentes y razones

Al intentar discernir quÃĐ hay detrÃĄs de este fenÃģmeno, los autores del artículo sugieren una serie de posibilidades: que el contenido de “fÃĄbricas de artículos” se estÃĄ utilizando como material de origen, introduciendo inexactitudes muy temprano en un proceso que inevitablemente producirÃĄ mÃĄs inexactitudes; que las herramientas de “giro de artículos” como Spinbot se estÃĄn utilizando para ocultar el plagio; y que la presiÃģn abrumadora para publicar regularmente estÃĄ llevando a investigadores con pocos recursos a utilizar sistemas de estilo GPT-3 para aumentar o generar completamente nuevos artículos acadÃĐmicos.

Los investigadores concluyen con un llamado a la acciÃģn para una mayor supervisiÃģn y mejores estÃĄndares en un ÃĄrea de publicaciÃģn acadÃĐmica que parece estar demostrando ser, aparentemente, pasto para su propio tema de investigaciÃģn – sistemas de aprendizaje automÃĄtico. TambiÃĐn exhortan a Elsevier y otros editores a introducir procedimientos de revisiÃģn y selecciÃģn mÃĄs rigurosos, y critican ampliamente las normas y prÃĄcticas actuales en este respecto, sugiriendo que “el engaÃąo con textos sintÃĐticos amenaza la integridad de la literatura científica”.

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai