Ángulo de Anderson
Los grandes modelos de lenguaje están memorizando los conjuntos de datos destinados a probarlos

Si confías en la IA para recomendarte qué ver, leer o comprar, una nueva investigación indica que algunos sistemas pueden basar estos resultados en memoria en lugar de habilidad: en lugar de aprender a hacer sugerencias útiles, los modelos a menudo recuerdan elementos de los conjuntos de datos utilizados para evaluarlos, lo que lleva a un rendimiento sobreestimado y recomendaciones que pueden estar desactualizadas o mal adaptadas al usuario.
En el aprendizaje automático, una división de datos se utiliza para ver si un modelo entrenado ha aprendido a resolver problemas que son similares, pero no idénticos a los materiales en los que se entrenó.
Así, si un nuevo modelo de reconocimiento de razas de perros se entrena con un conjunto de datos de 100.000 imágenes de perros, generalmente tendrá una división de 80/20: 80.000 imágenes para entrenar el modelo y 20.000 imágenes retenidas y utilizadas como material para probar el modelo terminado.
Es obvio decir que, si los datos de entrenamiento del modelo incluyen inadvertidamente la sección “secreta” del 20% de la división de prueba, el modelo aprobará estas pruebas, porque ya conoce las respuestas (ya ha visto el 100% de los datos del dominio). Por supuesto, esto no refleja con precisión cómo se desempeñará el modelo más adelante, con nuevos datos “en vivo” en un contexto de producción.
Pósters de películas
El problema de que la IA haga trampa en sus exámenes ha crecido al mismo ritmo que la escala de los modelos en sí. Debido a que los sistemas de hoy se entrenan con vastos corpus web raspados indiscriminadamente, como Common Crawl, la posibilidad de que los conjuntos de datos de referencia (es decir, el 20% retenido) se filtre en la mezcla de entrenamiento ya no es un caso de borde, sino el valor predeterminado: un síndrome conocido como contaminación de datos; y a esta escala, la curación manual que podría detectar estos errores es logisticamente imposible.
Este caso se explora en un nuevo documento de la Politécnica de Bari, Italia, donde los investigadores se centran en el papel desproporcionado de un conjunto de datos de recomendación de películas, MovieLens-1M, que argumentan que ha sido parcialmente memorizado por varios modelos de IA líderes durante el entrenamiento.
Debido a que este conjunto de datos en particular se utiliza ampliamente en la prueba de sistemas de recomendación, su presencia en la memoria de los modelos potencialmente hace que esas pruebas sean insignificantes: lo que parece ser inteligencia puede en realidad ser simple recuerdo, y lo que parece ser una habilidad de recomendación intuitiva puede ser solo un eco estadístico que refleja una exposición anterior.
Los autores afirman:
‘Nuestros hallazgos demuestran que los LLM poseen un conocimiento extenso del conjunto de datos MovieLens-1M, que cubre elementos, atributos de usuario e historias de interacción. Notablemente, una simple llamada permite a GPT-4o recuperar casi el 80% de los registros de ID de película: título.
‘Ninguno de los modelos examinados está libre de este conocimiento, lo que sugiere que los datos de MovieLens-1M probablemente estén incluidos en sus conjuntos de entrenamiento. Observamos tendencias similares al recuperar atributos de usuario e historias de interacción.’
El breve nuevo documento se titula ¿Memorizan los LLM los conjuntos de datos de recomendación? Un estudio preliminar sobre MovieLens-1M, y proviene de seis investigadores de la Politécnica. El pipeline para reproducir su trabajo ha sido hecho disponible en GitHub.
Método
Para entender si los modelos en cuestión realmente estaban aprendiendo o simplemente recordando, los investigadores comenzaron definiendo qué significa la memorización en este contexto, y comenzaron probando si un modelo podía recuperar piezas específicas de información del conjunto de datos MovieLens-1M cuando se le hacía una llamada de la manera correcta.
Si un modelo se le mostraba un número de ID de película y podía producir su título y género, eso contaba como memorizar un elemento; si podía generar detalles sobre un usuario (como edad, ocupación o código postal) a partir de un ID de usuario, eso también contaba como memorización de usuario; y si podía reproducir la calificación de película de un usuario a partir de una secuencia conocida de calificaciones anteriores, se consideraba como evidencia de que el modelo podría estar recordando datos de interacción específicos en lugar de aprender patrones generales.
Cada una de estas formas de recuerdo se probó utilizando llamadas cuidadosamente escritas, diseñadas para empujar al modelo sin darle nueva información. Cuanto más precisa era la respuesta, más probable era que el modelo ya hubiera encontrado esos datos durante el entrenamiento:

Llamada de zero-shot para el protocolo de evaluación utilizado en el nuevo documento. Fuente: https://arxiv.org/pdf/2505.10212
Datos y pruebas
Para curar un conjunto de datos adecuado, los autores encuestaron documentos recientes de dos de las principales conferencias del campo, ACM RecSys 2024 y ACM SIGIR 2024. MovieLens-1M apareció con más frecuencia, citado en más de una de cada cinco presentaciones. Dado que estudios anteriores habían llegado a conclusiones similares, esto no fue un resultado sorprendente, sino más bien una confirmación de la dominancia del conjunto de datos.
MovieLens-1M consta de tres archivos: Movies.dat, que enumera películas por ID, título y género; Users.dat, que asigna IDs de usuario a campos biográficos básicos; y Ratings.dat, que registra quién calificó qué y cuándo.
Para descubrir si estos datos habían sido memorizados por los grandes modelos de lenguaje, los investigadores recurrieron a técnicas de llamada que se introdujeron por primera vez en el documento Extraer datos de entrenamiento de grandes modelos de lenguaje, y más tarde se adaptaron en el trabajo posterior Bolsa de trucos para la extracción de datos de entrenamiento de modelos de lenguaje.
El método es directo: se formula una pregunta que refleja el formato del conjunto de datos y se ve si el modelo responde correctamente. Zero-shot, Chain-of-Thought y few-shot prompting se probaron, y se encontró que el último método, en el que el modelo se le muestran algunos ejemplos, fue el más efectivo; incluso si los enfoques más elaborados podrían producir un mayor recuerdo, esto se consideró suficiente para revelar qué se había recordado.

Llamada de few-shot para probar si un modelo puede reproducir valores específicos de MovieLens-1M cuando se le hace una pregunta con un contexto mínimo.
Para medir la memorización, los investigadores definieron tres formas de recuerdo: elemento, usuario y interacción. Estas pruebas examinaron si un modelo podía recuperar el título de una película a partir de su ID, generar detalles de usuario a partir de un ID de usuario o predecir la calificación de un usuario basándose en calificaciones anteriores. Cada una se puntuó utilizando una métrica de cobertura* que reflejaba cuánto del conjunto de datos podía reconstruirse mediante llamadas.
Los modelos probados fueron GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; y Llama-3.1 8B. Todos se ejecutaron con temperatura establecida en cero, top_p establecido en uno, y ambas penalización de frecuencia y presencia deshabilitadas. Una semilla de aleatoriedad fija garantizó una salida coherente en todas las ejecuciones.

Proporción de entradas de MovieLens-1M recuperadas de movies.dat, users.dat y ratings.dat, con modelos agrupados por versión y ordenados por recuento de parámetros.
Para probar cuán profundamente se había absorbido MovieLens-1M, los investigadores llamaron a cada modelo para obtener entradas exactas de los tres archivos (mencionados anteriormente) del conjunto de datos: Movies.dat, Users.dat y Ratings.dat.
Los resultados de las pruebas iniciales, que se muestran arriba, revelan diferencias agudas no solo entre las familias GPT y Llama, sino también entre los tamaños de los modelos. Mientras que GPT-4o y GPT-3.5 turbo recuperan grandes porciones del conjunto de datos con facilidad, la mayoría de los modelos de código abierto solo recuerdan una fracción del mismo material, lo que sugiere una exposición desigual a este benchmark en el entrenamiento previo.
Estas no son márgenes pequeñas. A través de los tres archivos, los modelos más fuertes no solo superaron a los más débiles, sino que recordaron porciones enteras de MovieLens-1M.
En el caso de GPT-4o, la cobertura fue lo suficientemente alta como para sugerir que una parte no trivial del conjunto de datos había sido memorizada directamente.
Los autores afirman:
‘Nuestros hallazgos demuestran que los LLM poseen un conocimiento extenso del conjunto de datos MovieLens-1M, que cubre elementos, atributos de usuario e historias de interacción.
‘Notablemente, una simple llamada permite a GPT-4o recuperar casi el 80% de los registros de ID de película: título. Ninguno de los modelos examinados está libre de este conocimiento, lo que sugiere que los datos de MovieLens-1M probablemente estén incluidos en sus conjuntos de entrenamiento.
‘Observamos tendencias similares al recuperar atributos de usuario e historias de interacción.’
A continuación, los autores probaron el impacto de la memorización en tareas de recomendación llamando a cada modelo para que actuara como un sistema de recomendación. Para medir el rendimiento, compararon la salida con siete métodos estándar: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; y Aleatorio.
El conjunto de datos MovieLens-1M se dividió en 80/20 en conjuntos de entrenamiento y prueba, utilizando una estrategia de muestreo de leave-one-out para simular el uso en el mundo real. Las métricas utilizadas fueron Tasa de acierto (HR@[n]); y nDCG(@[n]):

Precisión de recomendación en métodos estándar y métodos basados en LLM. Los modelos se agrupan por familia y se ordenan por recuento de parámetros, con valores en negrita que indican la puntuación más alta dentro de cada grupo.
Aquí, varios grandes modelos de lenguaje superaron a los métodos tradicionales en todas las métricas, con GPT-4o estableciendo una gran ventaja en cada columna, y incluso modelos de tamaño medio como GPT-3.5 turbo y Llama-3.1 405B superaron consistentemente a los métodos de referencia como BPRMF y LightGCN.
Entre las variantes de Llama más pequeñas, el rendimiento varió notablemente, pero Llama-3.2 3B se destaca, con la tasa de acierto más alta en su grupo.
Los resultados, sugieren los autores, indican que los datos memorizados pueden traducirse en ventajas medibles en tareas de recomendación, particularmente para los modelos más fuertes.
En una observación adicional, los investigadores continúan:
‘Aunque el rendimiento de recomendación parece destacado, comparar la Tabla 2 con la Tabla 1 revela un patrón interesante. Dentro de cada grupo, el modelo con una mayor memorización también demuestra un rendimiento superior en la tarea de recomendación.
‘Por ejemplo, GPT-4o supera a GPT-4o mini, y Llama-3.1 405B supera a Llama-3.1 70B y 8B.
‘Estos resultados resaltan que evaluar LLM en conjuntos de datos filtrados en sus conjuntos de entrenamiento puede llevar a un rendimiento sobreoptimista, impulsado por la memorización en lugar de la generalización.’
En cuanto al impacto del tamaño del modelo en este problema, los autores observaron una correlación clara entre el tamaño, la memorización y el rendimiento de recomendación, con modelos más grandes que no solo retienen más del conjunto de datos MovieLens-1M, sino que también se desempeñan más fuerte en tareas posteriores.
Llama-3.1 405B, por ejemplo, mostró una tasa de memorización promedio del 12,9%, mientras que Llama-3.1 8B retuvo solo el 5,82%. Esta reducción del 55% en la recuperación se correspondió con una caída del 54,23% en nDCG y del 47,36% en HR en los cortes de evaluación.
El patrón se mantuvo en todo: donde disminuía la memorización, también disminuía el rendimiento aparente:
‘Estos hallazgos sugieren que aumentar la escala del modelo conduce a una mayor memorización del conjunto de datos, lo que resulta en un mejor rendimiento.
‘En consecuencia, aunque los modelos más grandes exhiben un mejor rendimiento de recomendación, también plantean riesgos relacionados con la posible fuga de datos de entrenamiento.’
La última prueba examinó si la memorización refleja el sesgo de popularidad incorporado en MovieLens-1M. Los elementos se agruparon por frecuencia de interacción, y el gráfico a continuación muestra que los modelos más grandes consistentemente favorecieron las entradas más populares:

Cobertura de elementos por modelo en tres niveles de popularidad: 20% más populares; 20% moderadamente populares; y 20% menos interactuados.
GPT-4o recuperó el 89,06% de los elementos de mayor clasificación, pero solo el 63,97% de los menos populares. GPT-4o mini y los modelos Llama más pequeños mostraron una cobertura mucho menor en todas las bandas. Los investigadores afirman que esta tendencia sugiere que la memorización no solo se escala con el tamaño del modelo, sino que también amplifica los desequilibrios preexistentes en los datos de entrenamiento.
Continúan:
‘Nuestros hallazgos revelan un sesgo de popularidad pronunciado en los LLM, con el 20% superior de elementos populares siendo significativamente más fáciles de recuperar que el 20% inferior.
‘Este patrón destaca la influencia de la distribución de los datos de entrenamiento, donde las películas populares están sobrerepresentadas, lo que lleva a su memorización desproporcionada por los modelos.’
Conclusión
El dilema ya no es nuevo: a medida que crecen los conjuntos de entrenamiento, la perspectiva de curarlos disminuye en proporción inversa. MovieLens-1M, quizás entre muchos otros, entra en estos vastos corpus sin supervisión, anónimo entre el volumen de datos.
El problema se repite a todas las escalas y resiste la automatización. Cualquier solución requiere no solo esfuerzo, sino también juicio humano: el lento y falible que las máquinas no pueden suministrar. En este sentido, el nuevo documento no ofrece una forma de avanzar.
* Una métrica de cobertura en este contexto es un porcentaje que muestra cuánto del conjunto de datos original un modelo de lenguaje puede reproducir cuando se le hace la pregunta adecuada. Si un modelo se le hace una llamada con un ID de película y responde con el título y género correctos, eso cuenta como un recuerdo exitoso. El número total de recuerdos exitosos se divide entonces por el número total de entradas en el conjunto de datos para producir una puntuación de cobertura. Por ejemplo, si un modelo devuelve información correcta para 800 de 1.000 elementos, su cobertura sería del 80%.
Publicado por primera vez el viernes 16 de mayo de 2025












