Ángulo de Anderson
Los datos ‘desordenados’ que contaminan el rendimiento de los modelos de inteligencia artificial generativa

Un nuevo estudio encuentra que muchos conjuntos de datos de imágenes populares utilizados para entrenar modelos de inteligencia artificial están contaminados con imágenes de prueba o casi duplicados, lo que permite a los modelos hacer trampa al memorizar respuestas en lugar de aprender. La fuga es generalizada pero generalmente no detectada, inflando silenciosamente las puntuaciones y dando ventajas injustas a los modelos entrenados con datos a escala web.
Cuando tomas un examen de conducción, normalmente no se te dice con anticipación exactamente qué rutas se utilizarán para el examen. Si lo supieras (y tuvieras una falta de integridad), podrías “optimizar” para el examen practicando repetidamente en esa ruta, en lugar de desarrollar habilidades de conducción más amplias que puedan manejar cualquier ruta de manera razonable.
En el entrenamiento de modelos de aprendizaje automático, esta es una analogía razonable para una división de datos – una división de los datos del conjunto de entrenamiento entre (generalmente) una división del 70% para los datos que se utilizarán para entrenar el modelo, con el 30% restante utilizado como datos “en el mundo real”.
Dado que los datos “en el mundo real” nunca han sido vistos por el modelo, si el modelo se desempeña bien en esos datos, se puede asumir que es efectivo y performante; si no, el modelo puede haber sobreajustado en un conjunto equilibrado – o el dato necesitaba una curación y definición adicionales.
De cualquier manera, no evaluar modelos en sus datos de entrenamiento es la piedra angular del método actual en la investigación y el desarrollo de la inteligencia artificial.
Otra vez, por favor
Según un nuevo artículo de investigación de Japón, el sector de la investigación de visión por computadora y la inteligencia artificial generativa no ha igualado en absoluto los esfuerzos de los investigadores de LLM para garantizar que los datos de prueba no contaminen los datos de entrenamiento; en las pruebas, los investigadores encontraron que cada conjunto de datos de visión a gran escala que estudiaron, incluidos los que alimentan algunos de los sistemas de inteligencia artificial generativa más grandes actuales, ha permitido en cierta medida que sus datos de prueba se crucen con sus datos de entrenamiento – lo que significa que las mediciones de rendimiento y los informes de los modelos entrenados en estas divisiones no serán más precisos que un resultado de examen de alguien que se coló un apunte en el salón de exámenes, y no reflejarán el rendimiento en el mundo real en datos genuinamente nuevos.

Ejemplos de contaminación de datos encontrados por los investigadores, donde existen puntos de datos duplicados o casi duplicados en los datos de entrenamiento y de prueba. Fuente: https://arxiv.org/pdf/2508.17416
En la imagen de arriba, del nuevo artículo, vemos ejemplos de puntos de datos duplicados o casi duplicados encontrados en los datos de entrenamiento y de prueba de una variedad de modelos – lo suficiente como para invalidar el rendimiento del modelo en esos datos y, ligeramente, inflar sus puntuaciones generales en todo el conjunto, facilitando la apariencia de un nivel de generalización que el modelo puede no haber alcanzado realmente.
Para complicar aún más las cosas, la contaminación parece ocurrir en una variedad de escenarios posibles, incluyendo ‘pre-entrenamiento‘, donde se utilizan los pesos de modelos ancestrales más antiguos para “iniciar” un nuevo modelo. Si el modelo ancestral aguas arriba tiene algunos de los mismos datos que el conjunto de datos más nuevo que se está pre-entrenando, entonces la contaminación cruzada puede ocurrir incluso si la división 70/30 o 80/20 es limpia.
Cumulative Effect
Esto es casi seguro que ocurra incluso en los conjuntos de datos más recientes: el alcance de los conjuntos de datos de visión/lenguaje ha crecido enormemente en los últimos cinco años, abarcando no solo los nuevos datos de imágenes de la web, sino también la recolección de mucha de la misma data que poblaba esos conjuntos de datos más antiguos y históricos.
Además, las rutinas automatizadas diseñadas para buscar y filtrar miles de millones de imágenes para detectar duplicados y casi duplicados ahora se enfrentan a una tarea tan onerosa que la curación en sí – su costo en términos de tiempo y dinero – debe considerarse dentro del contexto de las limitaciones presupuestarias
Mientras tanto, la duplicación de imágenes es una consecuencia inevitable del tipo de ad hoc de búsqueda en la web detrás de colecciones masivas como Common Crawl, debido a la práctica común de republicar y recomprimir imágenes, y aplicar ediciones como recortes, y incluso voltear (para evadir la detección, cuando la imagen puede haber sido utilizada sin permiso, por ejemplo).
Los autores observan*:
‘La fuga de datos es un problema generalizado, prevalente en la mayoría de los conjuntos de datos visuales. La fuga puede ocultar la capacidad de generalización de los modelos, lo que es particularmente problemático cuando se comparan modelos entrenados en diferentes conjuntos de datos, lo que lleva a comparaciones injustas.
‘Instamos a los diseñadores de conjuntos de datos a considerar cuidadosamente las implicaciones de estas evaluaciones. Para una evaluación de modelos más justa, recomendamos el uso de detectores de duplicados que considere tanto la fuga dura como la suave.
‘Idealmente, las imágenes filtradas deberían eliminarse del conjunto de entrenamiento, y si no es posible, al menos deberían eliminarse del conjunto de prueba.’
El artículo elabora sobre una serie de pruebas que los investigadores realizaron en conjuntos de datos masivos y populares – cada uno de los cuales demostró algún nivel de contaminación.
El nuevo artículo se titula Fuga de datos en conjuntos de datos visuales, y proviene de tres investigadores de la Universidad de Osaka.
Método
Los autores del artículo definen la fuga en términos de tres dimensiones: modalidad, cobertura y grado.
Modalidad distingue si solo se filtran imágenes o si se exponen tanto imágenes como etiquetas; cobertura identifica si el solapamiento ocurre dentro del mismo conjunto de datos o entre diferentes conjuntos de datos; y grado define si el contenido duplicado es exactamente el mismo o solo ligeramente diferente.
En cuanto a la fuga, los dos escenarios considerados en el trabajo son fuga intra-conjunto de datos (donde las imágenes de evaluación reaparecen en la división de entrenamiento del mismo conjunto de datos), y fuga inter-conjunto de datos (donde las imágenes de evaluación de un conjunto de datos están presentes en un diferente conjunto de datos utilizado para entrenamiento).
En cuanto al grado, los dos niveles definidos son fuga suave (donde las imágenes no son idénticas pero exhiben variaciones menores), y fuga dura (donde las imágenes son exactamente las mismas en los conjuntos de entrenamiento y evaluación).
Los investigadores abordan la detección de fuga en términos de recuperación de imágenes, utilizando codificadores de imágenes para representar cada imagen como un vector de características. El conjunto de consulta es el conjunto de datos de evaluación, mientras que el conjunto de colección es el conjunto de entrenamiento.
Para conjuntos de datos más pequeños, cada vector de consulta se comparó directamente con todos los vectores de entrenamiento utilizando similitud coseno. Para conjuntos de datos más grandes, se creó un índice Faiss para permitir una búsqueda más rápida, K-Nearest Neighbors (KNN) búsqueda.
Dado que el codificador necesita capturar suficiente información visual para detectar similitudes sutiles, pero aún así permanecer eficiente ante volúmenes de datos muy grandes, los autores confiaron en características precalculadas CLIP puestas a disposición por los creadores de los conjuntos de datos, en el caso de la colección LAION que subyace a la difusión estable y proyectos posteriores.
Los autores observan que permitir que CLIP utilice su comprensión destilada del conjunto de datos (en lugar de sondear los archivos reales a escala) aceleró significativamente el proceso y ofreció una mayor coherencia en las comparaciones.
Datos y pruebas
El codificador de imágenes CLIP utilizado en las pruebas para el nuevo trabajo fue el CLIP ViT-B/32 originalmente utilizado para cribar LAION. Para establecer si las imágenes diversas estaban relacionadas entre sí, se utilizó KNN bajo AutoFaiss.
Los conjuntos de datos se agruparon en tres tipos: pre-entrenamiento conjuntos de datos – grandes colecciones extraídas de la web utilizadas para entrenar modelos generalistas; entrenamiento conjuntos de datos – colecciones más pequeñas, a menudo anotadas, destinadas a la afinación directa del modelo; y benchmark conjuntos de datos – anotados manualmente, y utilizados exclusivamente para evaluación.
El análisis cubrió veinte divisiones en siete conjuntos de datos: Microsoft COCO se utilizó como conjunto de entrenamiento y evaluación, incorporando las divisiones de entrenamiento, validación, prueba y no etiquetadas; Flickr30k sirvió exclusivamente como benchmark; y la colección de Conceptual Captions de Google (GCC) se trató como una fuente de pre-entrenamiento, con su parte de validación también utilizada para evaluación.
Además, ImageNet se utilizó para entrenamiento y evaluación, mientras que el conjunto de datos LAION-400M se utilizó solo para pre-entrenamiento.
OpenImages v4 contribuyó con datos de entrenamiento y benchmark, y TextCaps proporcionó divisiones de entrenamiento y prueba para evaluación.

Ejemplos de anotaciones de imágenes de la colección Open Images de Google, examinada en el nuevo trabajo. Fuente: https://arxiv.org/pdf/1811.00982
Para evaluar cómo bien el método puede detectar la fuga cuando las imágenes han sido sutilmente alteradas a través del cambio de tamaño, recorte o transformaciones no semánticas similares, los autores probaron en Flickr30k, seleccionando aleatoriamente 5,000 imágenes como consultas, y utilizando todo el conjunto de datos como la colección de referencia.
Cada imagen de consulta se transformó antes de ser codificada (es decir, se sometió a una modificación no semántica como el cambio de tamaño o el recorte), y luego se emparejó con el elemento más similar en la colección utilizando similitud coseno; un emparejamiento se contó solo si la imagen original se recuperó como el resultado superior.
Los tres codificadores comparados fueron ResNet-152; DINOv2 ViT-B/14; y CLIP ViT-B/32.
Se utilizaron cuatro tipos de transformaciones de imágenes no semánticas: geométricas (volteos y rotaciones); recorte (eliminación de 20, 50 o 100 píxeles de cada borde); pixelización (desenfoque gaussiano, ruido agregado o muestreo a 128 o 256 píxeles); y color (gris, inversión o capas de rojo, verde o azul).

Del material suplementario, ejemplos de las transformaciones aplicadas a los datos – rutinas típicas también en la preprocesamiento de aumento de datos.
Luego, los autores probaron la detección de fuga en la recuperación de imágenes:

Precisión de detección de fuga en 5,000 imágenes de consulta de Flickr30k sometidas a varias transformaciones no semánticas.
Todos los tres codificadores lograron un rendimiento perfecto en imágenes no alteradas, y CLIP permaneció confiable en el recorte, los volteos horizontales, el ruido y el cambio de tamaño, superando a ResNet en cambios de nivel de píxel y de color.
DINOv2 mostró una gran resistencia a las transformaciones de color (probablemente debido a su diseño de auto-supervisión, opinan los autores), pero fue notablemente más débil en ediciones geométricas y recorte – ambas comunes en conjuntos de datos duplicados.
Dado que LAION ya incluye características precalculadas de CLIP, y dada su robustez y velocidad consistentes, CLIP se eligió como el codificador predeterminado para el análisis principal.
Fuga dura y suave
El rendimiento se evaluó en diferentes umbrales de similitud coseno para distinguir entre imágenes idénticas y casi idénticas (fuga dura y suave).
Se seleccionó un umbral de 0,98 para definir la fuga dura, lo que resultó en cero falsos positivos y una detección perfecta de imágenes idénticas.
Para la fuga suave, se eligió un umbral de 0,95, lo que permitió recuperar más casi duplicados mientras mantenía una tasa de falsos positivos casi cero. Se priorizó la precisión sobre la cobertura, y los hallazgos se estimaron de manera conservadora:

Curvas de características de operación del receptor se utilizaron para guiar la selección de umbrales duros y suaves para la detección de fuga. Las altas puntuaciones de AUC en condiciones transformadas y no transformadas demuestran que los casi duplicados se pueden distinguir de manera confiable de las imágenes no relacionadas, incluso cuando se realizan alteraciones mínimas.
Fuga intra-conjunto de datos
La fuga intra-conjunto de datos se calculó identificando el solapamiento de imágenes entre las divisiones de entrenamiento y evaluación dentro del mismo conjunto de datos. Solo se consideraron conjuntos de datos con divisiones de benchmark y entrenamiento o pre-entrenamiento, lo que redujo el análisis a COCO, GCC, ImageNet, OpenImages y TextCaps.
Para COCO, el conjunto de prueba se comparó con el conjunto de entrenamiento, el conjunto de evaluación y los subconjuntos no etiquetados, y el conjunto de validación se comparó con el conjunto de entrenamiento y los subconjuntos no etiquetados.
Las tasas más altas de fuga intra-conjunto de datos se observaron en las divisiones de prueba y validación de ImageNet, con fuga dura que alcanzó hasta el 1,58% y fuga suave apenas por debajo del 2%. GCC y COCO siguieron, con COCO val2017 mostrando una fuga suave del 3% y sus divisiones de prueba que variaban entre 1,35% y 1,38%. OpenImages exhibió una fuga dura baja en 0,05%, pero la fuga suave superó el 1,3% en ambos conjuntos de prueba y validación. TextCaps mostró la fuga general más baja, en 0,69%, con ninguna fuga dura detectada:

Tasas de fuga intra-conjunto de datos, que muestran la proporción de cada división de evaluación que se superpone con sus datos de entrenamiento asociados.
Con respecto a estos resultados, los autores declaran†:
‘Estos resultados muestran que la fuga intra-conjunto de datos ocurre en todos los conjuntos de datos analizados, ya sea en su grado duro o suave.
‘Dado que la fuga de datos puede comprometer la evaluación del modelo y que los conjuntos de datos están diseñados específicamente para este propósito, la fuga intra-conjunto de datos es un riesgo que por diseño no debería existir.
‘Sin embargo, hemos identificado múltiples instancias en todos los conjuntos de datos.’
Fuga inter-conjunto de datos
Para medir la fuga inter-conjunto de datos (donde un modelo se entrena en un conjunto de datos y se evalúa en otro), se utilizaron cuatro conjuntos de datos como fuentes de datos de entrenamiento: conjunto de entrenamiento de GCC, conjunto de entrenamiento de ImageNet, conjunto de entrenamiento de OpenImages y LAION.
Estos se emparejaron con datos de evaluación extraídos de la división de prueba y validación de COCO 2014, Flickr30K, TextCaps prueba, la división de prueba y validación de OpenImages y la división de prueba y validación de ImageNet.
Se extrajeron características de CLIP ViT-B/32 para todos los conjuntos de datos, excepto LAION, que proporciona sus propias características precalculadas. Sin embargo, dado que esas características difieren ligeramente de las generadas utilizando la implementación oficial de CLIP, las imágenes de consulta se escalonaron según el método utilizado en el repositorio clip-retrieval para garantizar la compatibilidad.
La recuperación se realizó utilizando una búsqueda KNN, aunque la escala de LAION requirió la partición en bloques de un millón de imágenes, con cada uno indexado por separado:

Fuga inter-conjunto de datos entre conjuntos de datos de benchmark (columnas) y conjuntos de datos de pre-entrenamiento (filas). En el lado izquierdo vemos la ‘fuga dura’ (imágenes idénticas), y en el lado derecho la ‘fuga suave’ (casi duplicados).
Se observó la fuga entre conjuntos de datos en todos los conjuntos de datos de benchmark, con diferentes grados de gravedad. LAION mostró las tasas más altas de fuga dura (imágenes idénticas), particularmente para los conjuntos de datos de prueba de OpenImages y TextCaps, cada uno superando el 3%. OpenImages también contribuyó con una pequeña cantidad de fuga dura a COCO.
Aunque menos grave, ImageNet aún contenía duplicados duros de cada conjunto de datos de benchmark examinado; y GCC mostró la fuga dura general más baja, por debajo del 1%.
La fuga suave (casi duplicados) fue más generalizada: LAION produjo las tasas más altas, con hasta un 7,9% de superposición para ciertos benchmarks; OpenImages y TextCaps fueron los conjuntos de datos de benchmark más afectados en general; y Flickr30k mostró la menor fuga.
Aunque estas superposiciones pueden representar solo una pequeña parte de los conjuntos de evaluación, los autores observan que su presencia puede permitir la memorización y comprometer la validez de la prueba:

Ejemplos de imágenes filtradas. A la izquierda, casos de ‘fuga dura’, donde las imágenes son idénticas dentro de un conjunto de datos (arriba) o entre conjuntos de datos (abajo); a la derecha, casos de ‘fuga suave’, donde las imágenes son visualmente casi idénticas.
Efecto en la evaluación descendente
El artículo considera a continuación cómo la fuga de datos afecta las evaluaciones descendentes (es decir, el rendimiento en tareas estándar cuando los modelos pre-entrenados se prueban en benchmarks que contienen datos de entrenamiento duplicados).
Se consideraron tres tareas: clasificación de cero disparos; clasificación supervisada; y recuperación de imagen a texto.
Para cada tarea, se evaluó el rendimiento del modelo en un conjunto de datos de benchmark para el cual ya se habían identificado muestras filtradas en los datos de pre-entrenamiento. Los resultados se compararon en cuatro subconjuntos: el conjunto de benchmark completo; un subconjunto de muestras filtradas; un subconjunto de muestras no filtradas; y un subconjunto aleatorio del mismo tamaño que el grupo filtrado (utilizado como control).
El efecto de la fuga de datos en tres tareas descendentes se midió utilizando subconjuntos de benchmark que ya contenían muestras filtradas. En la clasificación de cero disparos, un modelo pre-entrenado en LAION logró una precisión notablemente mayor en las imágenes filtradas del conjunto de evaluación de ImageNet, confirmando que la exposición a incluso casi duplicados durante el entrenamiento proporciona una ventaja medible:

Precisión de clasificación de cero disparos en el conjunto de evaluación de ImageNet en subconjuntos con y sin fuga. La última columna informa las ganancias de precisión relativas al conjunto completo, y las filas resaltadas corresponden a subconjuntos filtrados.
Para la clasificación supervisada, la fuga en ImageNet causó una caída dramática en el rendimiento – a menos que la imagen filtrada tuviera la misma etiqueta en ambas divisiones, en cuyo caso el modelo logró una precisión casi perfecta, revelando un fuerte efecto de memorización:

Precisión de clasificación supervisada en el conjunto de evaluación de ImageNet para subconjuntos, con y sin fuga. Las columnas de ganancia muestran el cambio relativo al conjunto completo. Los subconjuntos filtrados están resaltados.
En la recuperación de imagen a texto, el rendimiento volvió a mejorar para las muestras filtradas, con tanto la fuga dura como la suave que conducen a una mayor recuperación, y con los subconjuntos filtrados que también produjeron resultados más consistentes en las ejecuciones:

Rendimiento de recuperación de imagen a texto en Flickr30k en subconjuntos con y sin fuga, con subconjuntos filtrados resaltados.
Los autores concluyen:
‘En general, demostramos evidencia consistente de que la fuga plantea una amenaza grave para la evaluación justa de modelos en conjuntos de datos visuales, comprometiendo uno de los principios de aprendizaje automático más fundamentales: no evaluar modelos en sus datos de entrenamiento.’
Conclusión
Un aspecto impactante del artículo, aunque no es novedad, es la cuenta de necesidad de utilizar CLIP para obtener características para la gran montaña de datos de imágenes en LAION, representando una escala que ya no se puede abordar de ninguna otra manera que no sea agregada, tratando la metadata tokenizada en lugar de las características más detalladas que se pueden inspeccionar cuando un conjunto de datos es más manejable.
Es una ilustración impactante de la medida en que el entrenamiento de modelos de visión-lenguaje ha superado definitivamente los límites y las capacidades de la supervisión humana, o cualquier tipo de curación manual más allá de submuestras representativas.
* Quizás de manera algo confusa, el problema de la duplicación se define en el artículo como ‘fuga’.
† Énfasis de los autores.
Publicado por primera vez el martes 26 de agosto de 2025












