Ángulo de Anderson
La IA cita los mismos artículos una y otra vez – Al igual que los humanos

ChatGPT y otras herramientas de escritura con IA pueden estar convirtiendo silenciosamente la ciencia en un concurso de popularidad, dirigiendo repetidamente a los investigadores hacia los mismos artículos mientras pasan por alto trabajos nuevos y novedosos que podrían realmente avanzar el campo.
Monocultura, en términos de frecuencia y estadísticas, es cuando el mismo conjunto limitado de fuentes o recursos se repite una y otra vez, ahogando voces novedosas y perspectivas frescas: el mismo conjunto limitado de canciones en la programación de radio; el mismo conjunto de autores y libros en los estantes de los aeropuertos; y la misma selección restringida de frutas y verduras en los supermercados:

Esto también ocurre en las citas que aparecen en la nueva investigación científica, donde los investigadores, quizás por pereza, recurren a un conjunto ‘confiable’ de fuentes que gana impulso hasta que comienza a dominar ramas de la investigación.
Esto se conoce como el Efecto Mateo – una teoría sociológica que sugiere que los incumbentes siempre se benefician; el síndrome se ha comparado con la promesa hecha en Mateo 13:12, que afirma ‘A quien tiene se le dará más, y tendrá abundancia. A quien no tiene, incluso lo que tiene le será quitado’.
Los de moda
Una de las grandes esperanzas de la investigación potenciada por IA ha sido que los nuevos métodos de aprendizaje automático pudieran romper el Efecto Mateo – también conocido como sesgo de popularidad – y comenzar a citar trabajos menos conocidos que podrían ser más incisivos o más apropiados al punto que se está exponiendo en un artículo.
Sin embargo, basándose en la forma en que las rutinas de entrenamiento de IA interpretan los conjuntos de datos, nunca hubo una razón sólida para este optimismo; y se ha constatado repetidamente que cuando la IA no está inventando citas de forma directa – un problema crónico hasta la fecha – en realidad está perpetuando el Efecto Mateo, al igual que los humanos – aunque quizás no por la misma razón.
Durante el entrenamiento, un modelo aprenderá a clasificar altamente los artículos más citados (o ‘más frecuentemente repetidos’) en un conjunto de entrenamiento, porque las rutinas de entrenamiento están diseñadas para extraer patrones significativos, y para desestimar los valores atípicos como ‘ruido’ o anomalías estadísticas.
Bajo este régimen, el equivalente a la teoría de la relatividad de Einstein nunca recibiría atención por parte de la máquina, que, una vez entrenada, considera que ya ha encontrado sus principios y referentes, y solo puede ajustar ligeramente esa postura al acceder a publicaciones más recientes mediante RAG, o por otros medios que amplían el alcance del modelo más allá de su matriz entrenada.
El problema es que no acreditará esas obras nuevas de la misma forma que los ‘favoritos antiguos’ que ya conocía, o incluso no las acreditará en absoluto, porque sus sesgos estadísticos ya están bastante arraigados.
Así, la IA no está realmente observando e imitando el comportamiento humano cuando perpetúa el Efecto Mateo – simplemente está contabilizando cuántas veces los investigadores, por pereza, recurren a los mismos artículos antiguos, y de manera similar los clasifica en lo alto. En este sentido, el problema de la repetición de citas está relacionado con el desafío de seleccionar un artículo científico verdaderamente interesante entre la creciente avalancha de publicaciones de investigación en IA, ya que el trabajo más sólido a menudo tendrá la señal más débil.
Diagnóstico de la Monocultura
Este problema se aborda en un interesante nuevo artículo de EE. UU. titulado When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. El nuevo trabajo – una colaboración entre la Universidad de Texas en Austin, el Stevens Institute of Technology, la Washington University en St. Louis, la Rice University y la University of Notre Dame – busca demostrar de manera definitiva la existencia de la monocultura de citas en el aprendizaje automático, de modo que sus variables puedan abordarse directamente en el futuro, junto con el propio problema.
En las pruebas, los autores descubrieron que once modelos de OpenAI, Google y Anthropic favorecían repetidamente el mismo pequeño grupo de artículos – incluso después de haber eliminado las señales obvias de popularidad.
Para probar esto, se eliminaron los recuentos de citas y los lugares de publicación de 120 artículos reales, mientras se sustituyeron los nombres de los autores y se reasignaron aleatoriamente los años de publicación. Luego se mostraron conjuntos aleatorios de treinta artículos a cada modelo, al que se le permitió citar no más de diez.
Ocho expertos humanos en los campos relevantes recibieron los mismos artículos ciegos, pero no convergieron en los mismos favoritos que las IA, lo que indica que el sesgo era específico de los modelos de IA y no de los propios artículos:

Los mismos artículos siguieron siendo populares incluso cuando a los modelos solo se les pidió elegir referencias, demostrando que redactar la reseña en sí no provocaba el sesgo.
El experimento se extendió luego a lo largo de once rondas, añadiendo 120 artículos escritos por IA después de cada ronda, para probar qué ocurre cuando estas preferencias compartidas operan en un conjunto creciente de investigaciones generadas por IA.
A medida que se añadieron más artículos escritos por IA, los modelos concentraron cada vez más sus citas en un número reducido de los artículos humanos originales.
Los autores afirman:
‘A medida que los modelos de lenguaje pasan de redactar prosa a ejecutar agentes de búsqueda bibliográfica con llamadas a herramientas, las referencias fabricadas se están volviendo más fáciles de detectar y limitar.
‘El fallo más grave comienza después de que cada candidato es real: diferentes modelos pueden seguir seleccionando el mismo subconjunto estrecho, produciendo una monocultura de citas sin que ninguna cita individual sea incorrecta.’
Como forma de remediar el problema, el artículo sostiene que simplemente mezclar modelos de diferentes proveedores o dar a los artículos una exposición equitativa no será suficiente, ya que gran parte de la preferencia se comparte entre los modelos. Más bien, la preferencia subyacente por artículos particulares tendría que cambiar – potencialmente otorgando deliberadamente mayor prominencia a los artículos descuidados. Sin embargo, los autores enfatizan que este enfoque aún no ha sido probado.
Métodos de prueba
El benchmark se construyó a partir de 120 artículos reales de destilación de conocimiento recopilados de arXiv y publicados entre 2015 y 2022. Cada uno tenía entre 50 y 500 citas en el momento de la recopilación, un rango elegido para excluir tanto trabajos oscuros como excepcionalmente influyentes.
El experimento comenzó seleccionando al azar treinta artículos de la colección disponible, ocultando los nombres de los autores, los años de publicación y los recuentos de citas. Cada modelo produjo una breve reseña o artículo de posición citando no más de diez artículos, y estas elecciones se compararon con selecciones aleatorias del mismo material:

En el experimento ampliado, 120 artículos recién generados ingresaron a la colección después de cada ronda, aumentando gradualmente la proporción de investigación escrita por IA.
En pruebas preliminares, los modelos tendían a citar la mayoría de los artículos que se les mostraban, seleccionando típicamente entre 22 y 27 de los 30. Por ello, los investigadores establecieron un máximo de diez citas para el experimento principal, obligando a los modelos a hacer elecciones más selectivas.
A continuación vemos un resumen del diseño experimental resultante:

El experimento inicial utilizó once modelos de los tres principales proveedores: OpenAI estuvo representado por GPT-5, GPT-5 mini, GPT-4.1 y GPT-4.1 mini; Google por Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro y Gemini 3.1 Flash-Lite; y Anthropic por Claude Opus 4.8, Claude Sonnet 4.6 y Claude Haiku 4.5.
En los resultados de la prueba mostrados a continuación, vemos cuánto concentró cada modelo sus citas en un pequeño grupo de artículos; cuántos artículos ignoró por completo; y cuán consistentemente hizo las mismas elecciones cuando se repitió el experimento:

¿Qué están favoreciendo realmente los modelos?
Se descubrió que la preferencia estaba impulsada abrumadoramente por el contenido de los propios artículos. Por ejemplo, para GPT-5 mini, aproximadamente el 90 % de la variación en los artículos favorecidos se atribuía al contenido, más que a factores como el orden de la lista, el ruido de generación o los metadatos fabricados adjuntos a cada artículo. El mismo efecto de ‘contenido dominante’ se reprodujo con GPT-4.1 mini.
El mapa de preferencias (ver abajo) también cambió apenas cuando los títulos y resúmenes fueron reescritos sustancialmente manteniendo su significado. En cuatro pruebas de paráfrasis exitosas, se obtuvieron correlaciones de 0,95–0,99, a pesar de que se utilizaron diferentes modelos de tres proveedores para la reescritura.
Los cambios en el mapa de preferencias se observaron solo cuando el significado subyacente se alteró de manera medible:

Por lo tanto, los modelos parecen responder principalmente al contenido semántico más que a la redacción específica. Sin embargo, la razón de su fuerte acuerdo no pudo determinarse de manera concluyente.
Es posible, afirman los autores, que un consenso común de citas haya sido absorbido durante el entrenamiento. Otra posibilidad es que se lleguen a juicios similares sobre lo que constituye un artículo ‘citable’ de forma independiente.
Por lo tanto, se estableció la existencia de la preferencia compartida, pero su origen definitivo sigue siendo desconocido.
Los autores sugieren que el uso generalizado de la IA en la investigación podría estrechar el abanico de trabajos que reciben atención, porque diferentes modelos tienden a favorecer muchos de los mismos artículos; y a medida que la literatura generada por IA se acumula, estas preferencias compartidas pueden reforzarse aún más mediante citas repetidas, haciendo que la investigación menos favorecida sea progresivamente más difícil de descubrir. Por ello, se proponen la diversidad de citas y el monitoreo de la concentración de citas como posibles salvaguardas.
El benchmark del estudio para la concentración recursiva de citas está ahora disponible en GitHub.
Conclusión
Opinión Como alguien que lee una cantidad desmesurada de artículos de investigación de IA cada semana, he visto ‘olas de citas’ ir y venir. Un pilar perenne es el artículo de Google Attention Is All You Need, el artículo original de Transformers, que ya debe estar codificado de forma rígida en las plantillas de envío.
Otro infractor recurrente, durante mucho tiempo, fue la propuesta de 2014 Generative Adversarial Networks, aunque finalmente fue superada en frecuencia por Denoising Diffusion Probabilistic Models y otros estudios emblemáticos basados en difusión.
En casi todos los casos, estas citas ‘recurrentes’ no son incorrectas, per se; pero a menudo son demasiado amplias como para ser un apoyo útil al artículo en el que se citan; y en ese sentido, representan algo parecido a la ‘lavado de citas’ – la inclusión de citas de fuentes ‘confiables’ pero principalmente decorativas, para dar una apariencia de credibilidad con poco esfuerzo.
Primera publicación lunes, 24 de agosto de 2026. Enmendada a las 23:07 EET para añadir el plural faltante.












