Ángulo de Anderson

La IA cita los mismos artículos una y otra vez – Igual que los humanos

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT y otras herramientas de escritura con IA pueden estar convirtiendo silenciosamente la ciencia en un concurso de popularidad, dirigiendo repetidamente a los investigadores hacia los mismos artículos mientras pasan por alto trabajos nuevos y novedosos que podrían realmente avanzar el campo.

 

Monocultura, en términos de frecuencia y estadísticas, es cuando el mismo conjunto limitado de fuentes o recursos se repite una y otra vez, ahogando voces novedosas y perspectivas frescas: el mismo conjunto limitado de canciones en la programación de radio; el mismo conjunto de autores y libros en los estantes de los aeropuertos; y la selección restringida de frutas y verduras en los supermercados:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Sí, tenemos estos plátanos – y solo estos plátanos. La homogeneidad de frutas y verduras en las cadenas alimentarias occidentales ignora las cientos de otras posibilidades de especies en cada caso, porque las diversas cadenas de generación y transporte son demasiado caras para industrializar tipos diversos de frutas o verduras.  Fuente

Esto también ocurre en las citas que aparecen en nuevas investigaciones científicas, donde los investigadores, quizá perezosamente, recurren a un conjunto ‘fiable’ de fuentes que gana impulso hasta que comienza a dominar ramas de investigación.

Esto se conoce como el Efecto Mateo – una teoría sociológica que sugiere que los incumbentes siempre se beneficiarán; el síndrome se ha comparado con la promesa hecha en Mateo 13:12, que dice ‘Quien tiene, se le dará más, y tendrá abundancia. Quien no tiene, aun lo que tiene le será quitado’.

Los de moda

Una de las grandes esperanzas de la investigación potenciada por IA ha sido que los nuevos métodos de aprendizaje automático pudieran romper el Efecto Mateo – también conocido como sesgo de popularidad – y comenzar a citar trabajos menos conocidos que podrían ser más incisivos, o más apropiados al punto que se está haciendo en un artículo.

Sin embargo, basándose en la forma en que las rutinas de entrenamiento de IA interpretan los conjuntos de datos, nunca hubo una buena razón para este optimismo; y se ha encontrado repetidamente que cuando la IA no está inventando citas de forma directa – un problema crónico hasta la fecha – está, de hecho, perpetuando el Efecto Mateo, al igual que los humanos – aunque quizá no por la misma razón.

Durante el entrenamiento, un modelo aprenderá a clasificar altamente el artículo más citado (o ‘más repetido’) en un conjunto de entrenamiento, porque las rutinas de entrenamiento están diseñadas para extraer patrones significativos, y para descontar los valores atípicos como ‘ruido’, o anomalías estadísticas.

Bajo este régimen, el equivalente a la teoría de la relatividad de Einstein nunca recibiría atención por parte de la máquina, que, una vez entrenada, siente que ya ha encontrado sus principios y referentes, y solo puede ajustar ligeramente esa postura al acudir a publicaciones más recientes mediante RAG, o por otros medios que amplían el alcance del modelo más allá de su matriz entrenada.

El problema es que no acreditará dichos trabajos nuevos de la misma manera que los ‘favoritos antiguos’ que ya conocía, o en absoluto, porque sus sesgos estadísticos ya están bastante arraigados.

Así, la IA no está realmente observando e imitando el comportamiento humano cuando perpetúa el Efecto Mateo – simplemente está contando cuántas veces los investigadores, perezosamente, recurren a los mismos artículos antiguos, y clasificándolos de forma alta de manera similar. En este sentido, el problema de la repetición de citas está relacionado con el desafío de seleccionar un artículo científico genuinamente interesante dentro de la tormenta creciente de publicaciones de investigación en IA, en que el trabajo más sólido a menudo tendrá la señal más débil.

Diagnóstico de la monocultura

Este problema se aborda en un interesante nuevo artículo de EE. UU. titulado When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. El nuevo trabajo – una colaboración entre la University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University y la University of Notre Dame – busca demostrar de forma definitiva la existencia de monocultura de citas en el aprendizaje automático, de modo que sus variables puedan potencialmente abordarse directamente en el futuro, junto con el propio problema.

En pruebas, los autores encontraron que once modelos de OpenAI, Google y Anthropic favorecían repetidamente el mismo pequeño grupo de artículos – incluso después de que se eliminaron las señales evidentes de popularidad.

Para probar esto, se eliminaron los recuentos de citas y los lugares de publicación de 120 artículos reales, mientras se reemplazaron los nombres de los autores y se reasignaron aleatoriamente los años de publicación. Conjuntos aleatorios de treinta artículos se mostraron a cada modelo, al que se le permitió citar no más de diez.

Ocho expertos humanos en los campos relevantes recibieron los mismos artículos ciegos, pero no convergieron en los mismos favoritos que las IAs, lo que indica que el sesgo era específico de los modelos de IA y no de los propios artículos:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

Desde el nuevo artículo, resultados de pruebas que comparan las elecciones de citas de los modelos de IA y los expertos humanos. En los once modelos, las citas se concentraron en un grupo más pequeño de artículos, mientras que algunos artículos fueron pasados por alto repetidamente. Los expertos humanos no mostraron esa tendencia. Fuente

Los mismos artículos siguieron siendo populares incluso cuando a los modelos se les pidió solo elegir referencias, mostrando que la redacción de la reseña en sí no provocaba el sesgo.

El experimento se extendió luego a once rondas, añadiendo 120 artículos escritos por IA después de cada ronda, para probar qué ocurre cuando estas preferencias compartidas operan en un conjunto creciente de investigación generada por IA.

A medida que se añadieron más artículos escritos por IA, los modelos concentraron cada vez más sus citas en un número decreciente de los artículos humanos originales.

Los autores afirman:

‘A medida que los modelos de lenguaje pasan de redactar prosa a ejecutar agentes de búsqueda bibliográfica con llamadas a herramientas, las referencias fabricadas se están volviendo más fáciles de detectar y restringir.

‘El fallo más grave comienza después de que cada candidato es real: diferentes modelos pueden aún seleccionar el mismo subconjunto estrecho, produciendo monocultura de citas sin que ninguna cita individual sea incorrecta.’

Como forma de remediar el problema, el artículo argumenta que simplemente mezclar modelos de diferentes proveedores o dar a los artículos una exposición igual no será suficiente, ya que gran parte de la preferencia se comparte entre los modelos. Más bien, la preferencia subyacente por ciertos artículos tendría que cambiar – potencialmente dando deliberadamente mayor prominencia a los artículos descuidados. Sin embargo, los autores enfatizan que este enfoque sigue sin ser probado.

Enfoques de prueba

El punto de referencia se construyó a partir de 120 artículos reales de destilación de conocimiento recopilados de arXiv y publicados entre 2015 y 2022. Cada uno tenía entre 50 y 500 citas al momento de la recopilación, un rango elegido para excluir tanto trabajos oscuros como excepcionalmente influyentes.

El experimento comenzó seleccionando al azar treinta artículos de la colección disponible, con los nombres de los autores, años de publicación y recuentos de citas ocultos. Cada modelo produjo una breve reseña o pieza de posición citando no más de diez artículos, y estas elecciones se compararon con selecciones aleatorias del mismo material:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Método utilizado para probar las preferencias de citación. Treinta artículos seleccionados aleatoriamente se mostraron a un modelo con la información identificativa oculta, tras lo cual pudo citar hasta diez. Sus elecciones se compararon con la selección aleatoria, mientras cada ronda añadía 120 artículos escritos por IA a la colección de la siguiente ronda.

En el experimento extendido, 120 artículos recién generados ingresaron a la colección después de cada ronda, aumentando gradualmente la proporción de investigación escrita por IA.

En pruebas preliminares, los modelos tendían a citar la mayoría de los artículos que se les mostraban, seleccionando típicamente de 22 a 27 de los 30. Por ello, los investigadores establecieron un máximo de diez citas para el experimento principal, obligando a los modelos a hacer elecciones más selectivas.

A continuación vemos un resumen del diseño experimental resultante:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Configuración experimental utilizada para probar las preferencias de citación. El estudio comenzó con 120 artículos reales y probó once modelos de tres proveedores, usando conjuntos aleatorios de 30 artículos y un máximo de diez citas. Rondas posteriores añadieron artículos generados por IA, ampliando la colección a 1.440 artículos.

El experimento inicial utilizó once modelos de los tres principales proveedores: OpenAI estuvo representado por GPT-5, GPT-5 mini, GPT-4.1 y GPT-4.1 mini; Google por Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro y Gemini 3.1 Flash-Lite; y Anthropic por Claude Opus 4.8, Claude Sonnet 4.6 y Claude Haiku 4.5.

En los resultados de prueba mostrados a continuación, vemos cuánto cada modelo concentró sus citas entre un pequeño grupo de artículos; cuántos artículos ignoró por completo; y cuán consistentemente hizo las mismas elecciones cuando se repitió el experimento:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Resultados de prueba que muestran cuán fuertemente cada modelo concentró sus citas en determinados artículos y cuántos artículos ignoró por completo. ‘Participación del 10% superior’ muestra cuántas citas fueron a los 12 artículos más favorecidos, mientras que ‘HHI’ mide cuán concentradas fueron las citas en general. ‘Confiabilidad’ muestra cuán consistentemente cada modelo favoreció los mismos artículos a lo largo de las pruebas, y ρ muestra cuán similares fueron esas preferencias entre los modelos. La fila ‘Nulo emparejado’ indica lo que se esperaría si los artículos se eligieran al azar.

¿Qué están favoreciendo realmente los modelos?

La preferencia se encontró impulsada abrumadoramente por el contenido de los propios artículos. Por ejemplo, para GPT-5 mini, alrededor del 90 % de la variación en los artículos favorecidos se atribuía al contenido, más que a factores como el orden de la lista, el ruido de generación o los metadatos fabricados adjuntos a cada artículo. El mismo efecto de ‘contenido dominante’ se reprodujo con GPT-4.1 mini.

El mapa de preferencias (ver abajo) también cambió apenas cuando los títulos y resúmenes se reescribieron sustancialmente mientras se preservaba su significado. En cuatro pruebas exitosas de paráfrasis, se obtuvieron correlaciones de 0,95–0,99, a pesar de que se usaron diferentes modelos de tres proveedores para la reescritura.

Se observaron cambios en el mapa de preferencias solo cuando el significado subyacente se alteró de manera medible:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Resultados de prueba que comparan las preferencias de citación entre los once modelos. Los números muestran cuán estrechamente cada par de modelos favoreció los mismos artículos, con valores más altos indicando mayor acuerdo. A pesar de las diferencias entre modelos y proveedores, se encontraron preferencias bastante similares en todo el grupo

Por lo tanto, los modelos parecen responder principalmente al contenido semántico más que a la redacción específica. Sin embargo, la razón de su fuerte acuerdo no pudo determinarse de forma concluyente.

Es posible, afirman los autores, que un consenso de citación común se haya absorbido durante el entrenamiento. Una posibilidad alternativa es que juicios similares sobre lo que constituye un artículo ‘citable’ se alcancen de forma independiente.

Por lo tanto, se estableció la existencia de la preferencia compartida, pero su origen último sigue sin conocerse.

Los autores sugieren que el uso generalizado de IA en la investigación podría estrechar el rango de trabajos que reciben atención, porque diferentes modelos tienden a favorecer muchos de los mismos artículos; y a medida que la literatura generada por IA se acumula, estas preferencias compartidas pueden reforzarse aún más mediante citaciones repetidas, haciendo que la investigación menos favorecida sea progresivamente más difícil de descubrir. Por ello, se proponen la diversidad de citaciones y la monitorización de la concentración de citas como posibles salvaguardas.

El punto de referencia del estudio para la concentración recursiva de citas ya está disponible en GitHub.

Conclusión

Opinión Como alguien que lee una cantidad desmesurada de artículos de investigación sobre IA cada semana, he visto ‘olas de citas’ ir y venir. Un pilar perenne es el Attention Is All You Need de Google, el artículo original de Transformers, que ahora debe estar codificado en las plantillas de envío.

Otro infractor recurrente, durante mucho tiempo, fue la oferta de 2014 Generative Adversarial Networks, aunque finalmente fue reemplazado en frecuencia por Denoising Diffusion Probabilistic Models y otros estudios basados en difusión como pilares.

En casi todos los casos, estas citas ‘recurrentes’ no son incorrectas, per se; pero a menudo son demasiado amplias para ser un apoyo útil al artículo en el que se citan; y en ese sentido, representan algo parecido al ‘lavado de citas’ – la inclusión de citas ‘fiables’ pero principalmente decorativas, para dar una apariencia de credibilidad con poco esfuerzo.

 

Publicado por primera vez el lunes, 24 de agosto de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai