Ángulo de Anderson

El lenguaje generado por IA comienza a contaminar la literatura científica

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de Francia y Rusia han publicado un estudio que indica que el uso de generadores de texto probabilísticos basados en IA, como GPT-3, están introduciendo un lenguaje “torturado”, citas de literatura inexistente y reutilización de imágenes sin créditos en canales previamente respetables para la publicación de nueva literatura científica.

Quizás lo más preocupante es que los artículos estudiados también contienen contenido científicamente inexacto o no reproducible presentado como el resultado de investigación objetiva y sistemática, lo que indica que los modelos de lenguaje generativo están siendo utilizados no solo para mejorar las limitadas habilidades en inglés de los autores de los artículos, sino también para realizar el trabajo duro involucrado (y, inevitablemente, para hacerlo mal).

El informe, titulado Frases torturadas: Un estilo de escritura dudoso que emerge en la ciencia, ha sido compilado por investigadores del Departamento de Ciencias de la Computación de la Universidad de Toulouse y el investigador de Yandex Alexander Magazinov, actualmente en la Universidad de Tel Aviv.

El estudio se centra particularmente en el crecimiento de publicaciones científicas generadas por IA sin sentido en la revista Elsevier Microprocesadores y Microsistemas.

Por otro nombre

Los modelos de lenguaje autoregresivos como GPT-3 se entrenan con grandes cantidades de datos y están diseñados para parafrasear, resumir, collationar e interpretar esos datos de contribución en modelos de lenguaje generativo coherentes que son capaces de reproducir patrones de habla y escritura naturales, manteniendo la intención original de los datos de entrenamiento.

Dado que tales marcos son frecuentemente castigados en la etapa de entrenamiento del modelo por ofrecer regurgitación directa y “no absorbida” de los datos originales, inevitablemente buscan sinónimos, incluso para frases bien establecidas.

Las presentaciones científicas aparentemente creadas/aidas por IA descubiertas por los investigadores incluyen un número extraordinario de intentos fallidos de sinónimos creativos para frases conocidas en el sector de aprendizaje automático:

red neuronal profunda: ‘organización neuronal profunda’
red neuronal artificial: ‘(falsa | falsificada) organización neuronal’
red móvil: ‘organización versátil’
ataque a la red:‘(organización | emboscada | asalto)’
conexión de red: ‘asociación de organización’
datos grandes:‘(enorme | enorme | inmenso | colosal) información’
almacén de datos: ‘(almacén | centro de distribución) de información’
inteligencia artificial (IA): ‘(falsa | hecha por humanos) conciencia’
cómputo de alto rendimiento: ‘cómputo élite’
cómputo en la niebla/nube: ‘cómputo en la niebla’
unidad de procesamiento gráfico (GPU): ‘unidad de preparación de diseños’
unidad de procesamiento central (CPU): ‘unidad de preparación focal’
motor de flujo de trabajo: ‘motor de proceso de trabajo’
reconocimiento facial: ‘reconocimiento facial’
reconocimiento de voz: ‘reconocimiento de discurso’
error cuadrático medio: ‘error cuadrático (error | equivocación)’
error absoluto medio: ‘error (absoluto | supremo) (error | equivocación)’
señal ruido: ‘(movimiento | señal | indicador | señal) a (ruido | alboroto | bullicio)’
parámetros globales: ‘parámetros mundiales’
acceso aleatorio: ‘(accidental | irregular) acceso a’
bosque aleatorio: ‘(accidental | irregular) (bosque | tierra de madera | territorio luxuriante)’
valor aleatorio: ‘(accidental | irregular) valor’
colonia de hormigas: ‘(estado | provincia | área | región | asentamiento) de insectos subterráneos’
colonia de hormigas: ‘(estado | provincia | área | región | asentamiento) de insectos subterráneos’
energía restante: ‘vitalidad restante’
energía cinética: ‘vitalidad motora’
Bayes ingenuo: ‘(credulo | inocente | ingenuo) Bayes’
asistente digital personal (PDA): ‘colaborador computarizado individual’

En mayo de 2021, los investigadores consultaron el motor de búsqueda académico Dimensions en busca de este tipo de lenguaje automatizado y desordenado, teniendo cuidado de excluir frases legítimas como “información enorme” (que es una frase válida y no un sinónimo fallido para “datos grandes”). En este punto, observaron que Microprocesadores y Microsistemas tenía el número más alto de ocurrencias de parafraseo mal manejado.

En la actualidad, todavía es posible recuperar (instantánea de archivo, 15/07/2021) una serie de artículos científicos para la frase sin sentido “organización neuronal profunda” (es decir, “red neuronal profunda”), y otros en la lista anterior producen resultados similares.

Resultados de búsqueda para 'organización neuronal profunda' ('red neuronal profunda') en Dimensions. Fuente: https://app.dimensions.ai/

Resultados de búsqueda para ‘organización neuronal profunda’ (‘red neuronal profunda’) en Dimensions. Fuente: https://app.dimensions.ai/

La revista Microprocesadores fue fundada en 1976 y renombrada a Microprocesadores y Microsistemas dos años después.

Crecimiento de lenguaje sin sentido

Los investigadores estudiaron un período que abarca febrero de 2018 a junio de 2021, y observaron un aumento pronunciado en el volumen de presentaciones en los últimos dos años, y particularmente en los últimos 6-8 meses:

Correlación o causalidad? El aumento en las presentaciones a la revista Microprocesadores y Microsistemas parece coincidir con el crecimiento de 'lenguaje sin sentido' y sinónimos en presentaciones aparentemente respetables.

Correlación o causalidad? El aumento en las presentaciones a la revista Microprocesadores y Microsistemas parece coincidir con el crecimiento de ‘lenguaje sin sentido’ y sinónimos en presentaciones aparentemente respetables. Source: https://arxiv.org/pdf/2107.06751.pdf

La base de datos final recopilada por los colaboradores contiene 1,078 artículos completos obtenidos a través de la suscripción de Elsevier de la Universidad de Toulouse.

Disminución de la supervisión editorial para artículos científicos chinos

El artículo observa que el período de tiempo asignado para la evaluación editorial de las presentaciones señaladas se reduce drásticamente en 2021, cayendo a menos de 40 días; una disminución seis veces mayor en el tiempo estándar para la revisión por pares, evidente desde febrero de 2021.

El mayor número de artículos señalados proviene de autores con afiliaciones en China continental: de 404 artículos aceptados en menos de 30 días, el 97,5% son relacionados con China. Por el contrario, en casos donde el proceso editorial superó los 40 días (615 artículos), las presentaciones afiliadas a China representaron solo el 9,5% de esa categoría, una desproporción de diez veces.

El informe atribuye la infiltración de los artículos señalados a deficiencias en el proceso editorial y a una posible falta de recursos frente a un creciente número de presentaciones.

Los investigadores hipotetizan que los modelos de lenguaje generativo de estilo GPT han sido utilizados para producir gran parte del texto en los artículos señalados; sin embargo, la forma en que un modelo generativo abstracta sus fuentes hace que esto sea difícil de probar, y la principal evidencia se encuentra en una evaluación común de sinónimos pobres e innecesarios, y un examen minucioso de la coherencia lógica de la presentación.

Los investigadores también observan que los modelos de lenguaje generativo que creen que están contribuyendo a esta inundación de sinsentidos son capaces no solo de crear los textos problemáticos, sino también de reconocerlos y señalarizarlos sistemáticamente, de la misma manera que los investigadores mismos han realizado manualmente. El trabajo detalla tal implementación, utilizando GPT-2, y ofrece un marco para que futuros sistemas identifiquen presentaciones científicas problemáticas.

La incidencia de presentaciones “contaminadas” es mucho mayor en la revista Elsevier (72,1%) en comparación con otras revistas estudiadas (13,6% como máximo).

No solo semántica

Los investigadores enfatizan que muchos de los artículos en cuestión no solo utilizan un lenguaje incorrecto, sino que también contienen afirmaciones científicamente inexactas, lo que indica la posibilidad de que los modelos de lenguaje generativo no solo se estén utilizando para mejorar las habilidades lingüísticas limitadas de los científicos que contribuyen, sino que también pueden estar siendo utilizados para formular al menos algunos de los teoremas y datos centrales del artículo.

En otros casos, los investigadores plantean una “resíntesis” o “giro” efectivo de trabajo previo abstracto (y superior) para cumplir con las presiones de la cultura de investigación académica “publicar o perecer”, y posiblemente para mejorar las clasificaciones nacionales para la preeminencia global en investigación de IA, a través de la mera cantidad.

Contenido sin sentido en un artículo presentado. En este caso, los investigadores encontraron que el texto se derivó, ad hoc, de un artículo de EDN, de donde también se tomó la ilustración acompañante sin atribución. La reescritura del contenido original es tan extrema que lo hace ininteligible.

Contenido sin sentido en un artículo presentado. En este caso, los investigadores encontraron que el texto se derivó, ad hoc, de un artículo de EDN, de donde también se tomó la ilustración acompañante sin atribución. La reescritura del contenido original es tan extrema que lo hace ininteligible.

Al analizar varios artículos de Elsevier, los investigadores encontraron oraciones para las que no pudieron inferir ningún significado; referencias a literatura inexistente; referencias a variables y teoremas en fórmulas que no aparecían en el material de apoyo (lo que sugiere abstracción basada en lenguaje o “alucinación” de datos aparentemente factuales); y reutilización de imágenes sin reconocimiento de sus fuentes (lo que los investigadores critican no desde un punto de vista de derechos de autor, sino como indicador de rigor científico inadecuado).

Fallas en las citas

Las citas destinadas a respaldar los argumentos en un artículo científico se encontraron en muchos de los ejemplos señalados que eran “ya sea rotas o que conducen a publicaciones no relacionadas”.

Además, las referencias a “trabajo relacionado” aparentemente incluyen autores que los investigadores creen que han sido “alucinados” por un sistema de estilo GPT.

Atención errante

Otra deficiencia de incluso los modelos de lenguaje de última generación como GPT-3 es su tendencia a perder el enfoque a lo largo de un discurso largo. Los investigadores encontraron que los artículos señalados a menudo presentan un tema al principio del artículo que nunca se vuelve a mencionar después de que se introduce en notas preliminares o en otra parte.

También teorizan que algunos de los peores ejemplos ocurren a través de múltiples viajes de texto fuente a través de una serie de motores de traducción, cada uno distorsionando aún más el significado.

Fuentes y razones

Al intentar discernir qué hay detrás de este fenómeno, los autores del artículo sugieren una serie de posibilidades: que el contenido de “fábricas de artículos” se está utilizando como material de origen, introduciendo inexactitudes muy temprano en un proceso que inevitablemente producirá más inexactitudes; que las herramientas de “giro de artículos” como Spinbot se están utilizando para ocultar el plagio; y que la presión abrumadora para publicar regularmente está llevando a investigadores con pocos recursos a utilizar sistemas de estilo GPT-3 para aumentar o generar completamente nuevos artículos académicos.

Los investigadores concluyen con un llamado a la acción para una mayor supervisión y mejores estándares en un área de publicación académica que parece estar demostrando ser, aparentemente, pasto para su propio tema de investigación – sistemas de aprendizaje automático. También exhortan a Elsevier y otros editores a introducir procedimientos de revisión y selección más rigurosos, y critican ampliamente las normas y prácticas actuales en este respecto, sugiriendo que “el engaño con textos sintéticos amenaza la integridad de la literatura científica”.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai