Ãngulo de Anderson
El lenguaje generado por IA comienza a contaminar la literatura cientÃfica

Investigadores de Francia y Rusia han publicado un estudio que indica que el uso de generadores de texto probabilÃsticos basados en IA, como GPT-3, estÃĄn introduciendo un lenguaje âtorturadoâ, citas de literatura inexistente y reutilizaciÃģn de imÃĄgenes sin crÃĐditos en canales previamente respetables para la publicaciÃģn de nueva literatura cientÃfica.
QuizÃĄs lo mÃĄs preocupante es que los artÃculos estudiados tambiÃĐn contienen contenido cientÃficamente inexacto o no reproducible presentado como el resultado de investigaciÃģn objetiva y sistemÃĄtica, lo que indica que los modelos de lenguaje generativo estÃĄn siendo utilizados no solo para mejorar las limitadas habilidades en inglÃĐs de los autores de los artÃculos, sino tambiÃĐn para realizar el trabajo duro involucrado (y, inevitablemente, para hacerlo mal).
El informe, titulado Frases torturadas: Un estilo de escritura dudoso que emerge en la ciencia, ha sido compilado por investigadores del Departamento de Ciencias de la ComputaciÃģn de la Universidad de Toulouse y el investigador de Yandex Alexander Magazinov, actualmente en la Universidad de Tel Aviv.
El estudio se centra particularmente en el crecimiento de publicaciones cientÃficas generadas por IA sin sentido en la revista Elsevier Microprocesadores y Microsistemas.
Por otro nombre
Los modelos de lenguaje autoregresivos como GPT-3 se entrenan con grandes cantidades de datos y estÃĄn diseÃąados para parafrasear, resumir, collationar e interpretar esos datos de contribuciÃģn en modelos de lenguaje generativo coherentes que son capaces de reproducir patrones de habla y escritura naturales, manteniendo la intenciÃģn original de los datos de entrenamiento.
Dado que tales marcos son frecuentemente castigados en la etapa de entrenamiento del modelo por ofrecer regurgitaciÃģn directa y âno absorbidaâ de los datos originales, inevitablemente buscan sinÃģnimos, incluso para frases bien establecidas.
Las presentaciones cientÃficas aparentemente creadas/aidas por IA descubiertas por los investigadores incluyen un nÚmero extraordinario de intentos fallidos de sinÃģnimos creativos para frases conocidas en el sector de aprendizaje automÃĄtico:
red neuronal profunda: âorganizaciÃģn neuronal profundaâ
red neuronal artificial: ââ(falsa | falsificada) organizaciÃģn neuronalâ
red mÃģvil: ââorganizaciÃģn versÃĄtilâ
ataque a la red: ââ(organizaciÃģn | emboscada | asalto)â
conexiÃģn de red: âasociaciÃģn de organizaciÃģnâ
datos grandes: ââ(enorme | enorme | inmenso | colosal) informaciÃģnâ
almacÃĐn de datos: â(almacÃĐn | centro de distribuciÃģn) de informaciÃģnâ
inteligencia artificial (IA): â(falsa | hecha por humanos) concienciaâ
cÃģmputo de alto rendimiento: âcÃģmputo ÃĐliteâ
cÃģmputo en la niebla/nube: âcÃģmputo en la nieblaâ
unidad de procesamiento grÃĄfico (GPU): âunidad de preparaciÃģn de diseÃąosâ
unidad de procesamiento central (CPU): âunidad de preparaciÃģn focalâ
motor de flujo de trabajo: âmotor de proceso de trabajoâ
reconocimiento facial: âreconocimiento facialâ
reconocimiento de voz: âreconocimiento de discursoâ
error cuadrÃĄtico medio: âerror cuadrÃĄtico (error | equivocaciÃģn)â
error absoluto medio: âerror (absoluto | supremo) (error | equivocaciÃģn)â
seÃąal ruido: â(movimiento | seÃąal | indicador | seÃąal) a (ruido | alboroto | bullicio)â
parÃĄmetros globales: âparÃĄmetros mundialesâ
acceso aleatorio: â(accidental | irregular) acceso aâ
bosque aleatorio: â(accidental | irregular) (bosque | tierra de madera | territorio luxuriante)â
valor aleatorio: â(accidental | irregular) valorâ
colonia de hormigas: â(estado | provincia | ÃĄrea | regiÃģn | asentamiento) de insectos subterrÃĄneosâ
colonia de hormigas: â(estado | provincia | ÃĄrea | regiÃģn | asentamiento) de insectos subterrÃĄneosâ
energÃa restante: âvitalidad restanteâ
energÃa cinÃĐtica: âvitalidad motoraâ
Bayes ingenuo: â(credulo | inocente | ingenuo) Bayesâ
asistente digital personal (PDA): âcolaborador computarizado individualâ
En mayo de 2021, los investigadores consultaron el motor de bÚsqueda acadÃĐmico Dimensions en busca de este tipo de lenguaje automatizado y desordenado, teniendo cuidado de excluir frases legÃtimas como âinformaciÃģn enormeâ (que es una frase vÃĄlida y no un sinÃģnimo fallido para âdatos grandesâ). En este punto, observaron que Microprocesadores y Microsistemas tenÃa el nÚmero mÃĄs alto de ocurrencias de parafraseo mal manejado.
En la actualidad, todavÃa es posible recuperar (instantÃĄnea de archivo, 15/07/2021) una serie de artÃculos cientÃficos para la frase sin sentido âorganizaciÃģn neuronal profundaâ (es decir, âred neuronal profundaâ), y otros en la lista anterior producen resultados similares.

Resultados de bÚsqueda para âorganizaciÃģn neuronal profundaâ (âred neuronal profundaâ) en Dimensions. Fuente: https://app.dimensions.ai/
La revista Microprocesadores fue fundada en 1976 y renombrada a Microprocesadores y Microsistemas dos aÃąos despuÃĐs.
Crecimiento de lenguaje sin sentido
Los investigadores estudiaron un perÃodo que abarca febrero de 2018 a junio de 2021, y observaron un aumento pronunciado en el volumen de presentaciones en los Últimos dos aÃąos, y particularmente en los Últimos 6-8 meses:

CorrelaciÃģn o causalidad? El aumento en las presentaciones a la revista Microprocesadores y Microsistemas parece coincidir con el crecimiento de âlenguaje sin sentidoâ y sinÃģnimos en presentaciones aparentemente respetables. Source: https://arxiv.org/pdf/2107.06751.pdf
La base de datos final recopilada por los colaboradores contiene 1,078 artÃculos completos obtenidos a travÃĐs de la suscripciÃģn de Elsevier de la Universidad de Toulouse.
DisminuciÃģn de la supervisiÃģn editorial para artÃculos cientÃficos chinos
El artÃculo observa que el perÃodo de tiempo asignado para la evaluaciÃģn editorial de las presentaciones seÃąaladas se reduce drÃĄsticamente en 2021, cayendo a menos de 40 dÃas; una disminuciÃģn seis veces mayor en el tiempo estÃĄndar para la revisiÃģn por pares, evidente desde febrero de 2021.
El mayor nÚmero de artÃculos seÃąalados proviene de autores con afiliaciones en China continental: de 404 artÃculos aceptados en menos de 30 dÃas, el 97,5% son relacionados con China. Por el contrario, en casos donde el proceso editorial superÃģ los 40 dÃas (615 artÃculos), las presentaciones afiliadas a China representaron solo el 9,5% de esa categorÃa, una desproporciÃģn de diez veces.
El informe atribuye la infiltraciÃģn de los artÃculos seÃąalados a deficiencias en el proceso editorial y a una posible falta de recursos frente a un creciente nÚmero de presentaciones.
Los investigadores hipotetizan que los modelos de lenguaje generativo de estilo GPT han sido utilizados para producir gran parte del texto en los artÃculos seÃąalados; sin embargo, la forma en que un modelo generativo abstracta sus fuentes hace que esto sea difÃcil de probar, y la principal evidencia se encuentra en una evaluaciÃģn comÚn de sinÃģnimos pobres e innecesarios, y un examen minucioso de la coherencia lÃģgica de la presentaciÃģn.
Los investigadores tambiÃĐn observan que los modelos de lenguaje generativo que creen que estÃĄn contribuyendo a esta inundaciÃģn de sinsentidos son capaces no solo de crear los textos problemÃĄticos, sino tambiÃĐn de reconocerlos y seÃąalarizarlos sistemÃĄticamente, de la misma manera que los investigadores mismos han realizado manualmente. El trabajo detalla tal implementaciÃģn, utilizando GPT-2, y ofrece un marco para que futuros sistemas identifiquen presentaciones cientÃficas problemÃĄticas.
La incidencia de presentaciones âcontaminadasâ es mucho mayor en la revista Elsevier (72,1%) en comparaciÃģn con otras revistas estudiadas (13,6% como mÃĄximo).
No solo semÃĄntica
Los investigadores enfatizan que muchos de los artÃculos en cuestiÃģn no solo utilizan un lenguaje incorrecto, sino que tambiÃĐn contienen afirmaciones cientÃficamente inexactas, lo que indica la posibilidad de que los modelos de lenguaje generativo no solo se estÃĐn utilizando para mejorar las habilidades lingÞÃsticas limitadas de los cientÃficos que contribuyen, sino que tambiÃĐn pueden estar siendo utilizados para formular al menos algunos de los teoremas y datos centrales del artÃculo.
En otros casos, los investigadores plantean una âresÃntesisâ o âgiroâ efectivo de trabajo previo abstracto (y superior) para cumplir con las presiones de la cultura de investigaciÃģn acadÃĐmica âpublicar o perecerâ, y posiblemente para mejorar las clasificaciones nacionales para la preeminencia global en investigaciÃģn de IA, a travÃĐs de la mera cantidad.

Contenido sin sentido en un artÃculo presentado. En este caso, los investigadores encontraron que el texto se derivÃģ, ad hoc, de un artÃculo de EDN, de donde tambiÃĐn se tomÃģ la ilustraciÃģn acompaÃąante sin atribuciÃģn. La reescritura del contenido original es tan extrema que lo hace ininteligible.
Al analizar varios artÃculos de Elsevier, los investigadores encontraron oraciones para las que no pudieron inferir ningÚn significado; referencias a literatura inexistente; referencias a variables y teoremas en fÃģrmulas que no aparecÃan en el material de apoyo (lo que sugiere abstracciÃģn basada en lenguaje o âalucinaciÃģnâ de datos aparentemente factuales); y reutilizaciÃģn de imÃĄgenes sin reconocimiento de sus fuentes (lo que los investigadores critican no desde un punto de vista de derechos de autor, sino como indicador de rigor cientÃfico inadecuado).
Fallas en las citas
Las citas destinadas a respaldar los argumentos en un artÃculo cientÃfico se encontraron en muchos de los ejemplos seÃąalados que eran âya sea rotas o que conducen a publicaciones no relacionadasâ.
AdemÃĄs, las referencias a âtrabajo relacionadoâ aparentemente incluyen autores que los investigadores creen que han sido âalucinadosâ por un sistema de estilo GPT.
AtenciÃģn errante
Otra deficiencia de incluso los modelos de lenguaje de Última generaciÃģn como GPT-3 es su tendencia a perder el enfoque a lo largo de un discurso largo. Los investigadores encontraron que los artÃculos seÃąalados a menudo presentan un tema al principio del artÃculo que nunca se vuelve a mencionar despuÃĐs de que se introduce en notas preliminares o en otra parte.
TambiÃĐn teorizan que algunos de los peores ejemplos ocurren a travÃĐs de mÚltiples viajes de texto fuente a travÃĐs de una serie de motores de traducciÃģn, cada uno distorsionando aÚn mÃĄs el significado.
Fuentes y razones
Al intentar discernir quÃĐ hay detrÃĄs de este fenÃģmeno, los autores del artÃculo sugieren una serie de posibilidades: que el contenido de âfÃĄbricas de artÃculosâ se estÃĄ utilizando como material de origen, introduciendo inexactitudes muy temprano en un proceso que inevitablemente producirÃĄ mÃĄs inexactitudes; que las herramientas de âgiro de artÃculosâ como Spinbot se estÃĄn utilizando para ocultar el plagio; y que la presiÃģn abrumadora para publicar regularmente estÃĄ llevando a investigadores con pocos recursos a utilizar sistemas de estilo GPT-3 para aumentar o generar completamente nuevos artÃculos acadÃĐmicos.
Los investigadores concluyen con un llamado a la acciÃģn para una mayor supervisiÃģn y mejores estÃĄndares en un ÃĄrea de publicaciÃģn acadÃĐmica que parece estar demostrando ser, aparentemente, pasto para su propio tema de investigaciÃģn â sistemas de aprendizaje automÃĄtico. TambiÃĐn exhortan a Elsevier y otros editores a introducir procedimientos de revisiÃģn y selecciÃģn mÃĄs rigurosos, y critican ampliamente las normas y prÃĄcticas actuales en este respecto, sugiriendo que âel engaÃąo con textos sintÃĐticos amenaza la integridad de la literatura cientÃficaâ.












