Ángulo de Anderson

Los datos ‘desordenados’ que contaminan el rendimiento de los modelos de inteligencia artificial generativa

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
Flux Dev, Firefly.

Un nuevo estudio encuentra que muchos conjuntos de datos de imÃĄgenes populares utilizados para entrenar modelos de inteligencia artificial estÃĄn contaminados con imÃĄgenes de prueba o casi duplicados, lo que permite a los modelos hacer trampa al memorizar respuestas en lugar de aprender. La fuga es generalizada pero generalmente no detectada, inflando silenciosamente las puntuaciones y dando ventajas injustas a los modelos entrenados con datos a escala web.

 

Cuando tomas un examen de conducciÃģn, normalmente no se te dice con anticipaciÃģn exactamente quÃĐ rutas se utilizarÃĄn para el examen. Si lo supieras (y tuvieras una falta de integridad), podrías “optimizar” para el examen practicando repetidamente en esa ruta, en lugar de desarrollar habilidades de conducciÃģn mÃĄs amplias que puedan manejar cualquier ruta de manera razonable.

En el entrenamiento de modelos de aprendizaje automÃĄtico, esta es una analogía razonable para una divisiÃģn de datos – una divisiÃģn de los datos del conjunto de entrenamiento entre (generalmente) una divisiÃģn del 70% para los datos que se utilizarÃĄn para entrenar el modelo, con el 30% restante utilizado como datos “en el mundo real”.

Dado que los datos “en el mundo real” nunca han sido vistos por el modelo, si el modelo se desempeÃąa bien en esos datos, se puede asumir que es efectivo y performante; si no, el modelo puede haber sobreajustado en un conjunto equilibrado – o el dato necesitaba una curaciÃģn y definiciÃģn adicionales.

De cualquier manera, no evaluar modelos en sus datos de entrenamiento es la piedra angular del mÃĐtodo actual en la investigaciÃģn y el desarrollo de la inteligencia artificial.

Otra vez, por favor

SegÚn un nuevo artículo de investigaciÃģn de JapÃģn, el sector de la investigaciÃģn de visiÃģn por computadora y la inteligencia artificial generativa no ha igualado en absoluto los esfuerzos de los investigadores de LLM para garantizar que los datos de prueba no contaminen los datos de entrenamiento; en las pruebas, los investigadores encontraron que cada conjunto de datos de visiÃģn a gran escala que estudiaron, incluidos los que alimentan algunos de los sistemas de inteligencia artificial generativa mÃĄs grandes actuales, ha permitido en cierta medida que sus datos de prueba se crucen con sus datos de entrenamiento – lo que significa que las mediciones de rendimiento y los informes de los modelos entrenados en estas divisiones no serÃĄn mÃĄs precisos que un resultado de examen de alguien que se colÃģ un apunte en el salÃģn de exÃĄmenes, y no reflejarÃĄn el rendimiento en el mundo real en datos genuinamente nuevos.

Ejemplos de contaminaciÃģn de datos encontrados por los investigadores, donde existen puntos de datos duplicados o casi duplicados en los datos de entrenamiento y de prueba.

Ejemplos de contaminaciÃģn de datos encontrados por los investigadores, donde existen puntos de datos duplicados o casi duplicados en los datos de entrenamiento y de prueba. Fuente: https://arxiv.org/pdf/2508.17416

En la imagen de arriba, del nuevo artículo, vemos ejemplos de puntos de datos duplicados o casi duplicados encontrados en los datos de entrenamiento y de prueba de una variedad de modelos – lo suficiente como para invalidar el rendimiento del modelo en esos datos y, ligeramente, inflar sus puntuaciones generales en todo el conjunto, facilitando la apariencia de un nivel de generalizaciÃģn que el modelo puede no haber alcanzado realmente.

Para complicar aÚn mÃĄs las cosas, la contaminaciÃģn parece ocurrir en una variedad de escenarios posibles, incluyendo ‘pre-entrenamiento‘, donde se utilizan los pesos de modelos ancestrales mÃĄs antiguos para “iniciar” un nuevo modelo. Si el modelo ancestral aguas arriba tiene algunos de los mismos datos que el conjunto de datos mÃĄs nuevo que se estÃĄ pre-entrenando, entonces la contaminaciÃģn cruzada puede ocurrir incluso si la divisiÃģn 70/30 o 80/20 es limpia.

Cumulative Effect

Esto es casi seguro que ocurra incluso en los conjuntos de datos mÃĄs recientes: el alcance de los conjuntos de datos de visiÃģn/lenguaje ha crecido enormemente en los Últimos cinco aÃąos, abarcando no solo los nuevos datos de imÃĄgenes de la web, sino tambiÃĐn la recolecciÃģn de mucha de la misma data que poblaba esos conjuntos de datos mÃĄs antiguos y histÃģricos.

AdemÃĄs, las rutinas automatizadas diseÃąadas para buscar y filtrar miles de millones de imÃĄgenes para detectar duplicados y casi duplicados ahora se enfrentan a una tarea tan onerosa que la curaciÃģn en sí – su costo en tÃĐrminos de tiempo y dinero – debe considerarse dentro del contexto de las limitaciones presupuestarias

Mientras tanto, la duplicaciÃģn de imÃĄgenes es una consecuencia inevitable del tipo de ad hoc de bÚsqueda en la web detrÃĄs de colecciones masivas como Common Crawl, debido a la prÃĄctica comÚn de republicar y recomprimir imÃĄgenes, y aplicar ediciones como recortes, y incluso voltear (para evadir la detecciÃģn, cuando la imagen puede haber sido utilizada sin permiso, por ejemplo).

Los autores observan*:

‘La fuga de datos es un problema generalizado, prevalente en la mayoría de los conjuntos de datos visuales. La fuga puede ocultar la capacidad de generalizaciÃģn de los modelos, lo que es particularmente problemÃĄtico cuando se comparan modelos entrenados en diferentes conjuntos de datos, lo que lleva a comparaciones injustas.

‘Instamos a los diseÃąadores de conjuntos de datos a considerar cuidadosamente las implicaciones de estas evaluaciones. Para una evaluaciÃģn de modelos mÃĄs justa, recomendamos el uso de detectores de duplicados que considere tanto la fuga dura como la suave.

‘Idealmente, las imÃĄgenes filtradas deberían eliminarse del conjunto de entrenamiento, y si no es posible, al menos deberían eliminarse del conjunto de prueba.’

El artículo elabora sobre una serie de pruebas que los investigadores realizaron en conjuntos de datos masivos y populares – cada uno de los cuales demostrÃģ algÚn nivel de contaminaciÃģn.

El nuevo artículo se titula Fuga de datos en conjuntos de datos visuales, y proviene de tres investigadores de la Universidad de Osaka.

MÃĐtodo

Los autores del artículo definen la fuga en tÃĐrminos de tres dimensiones: modalidad, cobertura y grado.

Modalidad distingue si solo se filtran imÃĄgenes o si se exponen tanto imÃĄgenes como etiquetas; cobertura identifica si el solapamiento ocurre dentro del mismo conjunto de datos o entre diferentes conjuntos de datos; y grado define si el contenido duplicado es exactamente el mismo o solo ligeramente diferente.

En cuanto a la fuga, los dos escenarios considerados en el trabajo son fuga intra-conjunto de datos (donde las imÃĄgenes de evaluaciÃģn reaparecen en la divisiÃģn de entrenamiento del mismo conjunto de datos), y fuga inter-conjunto de datos (donde las imÃĄgenes de evaluaciÃģn de un conjunto de datos estÃĄn presentes en un diferente conjunto de datos utilizado para entrenamiento).

En cuanto al grado, los dos niveles definidos son fuga suave (donde las imÃĄgenes no son idÃĐnticas pero exhiben variaciones menores), y fuga dura (donde las imÃĄgenes son exactamente las mismas en los conjuntos de entrenamiento y evaluaciÃģn).

Los investigadores abordan la detecciÃģn de fuga en tÃĐrminos de recuperaciÃģn de imÃĄgenes, utilizando codificadores de imÃĄgenes para representar cada imagen como un vector de características. El conjunto de consulta es el conjunto de datos de evaluaciÃģn, mientras que el conjunto de colecciÃģn es el conjunto de entrenamiento.

Para conjuntos de datos mÃĄs pequeÃąos, cada vector de consulta se comparÃģ directamente con todos los vectores de entrenamiento utilizando similitud coseno. Para conjuntos de datos mÃĄs grandes, se creÃģ un índice Faiss para permitir una bÚsqueda mÃĄs rÃĄpida, K-Nearest Neighbors (KNN) bÚsqueda.

Dado que el codificador necesita capturar suficiente informaciÃģn visual para detectar similitudes sutiles, pero aÚn así permanecer eficiente ante volÚmenes de datos muy grandes, los autores confiaron en características precalculadas CLIP puestas a disposiciÃģn por los creadores de los conjuntos de datos, en el caso de la colecciÃģn LAION que subyace a la difusiÃģn estable y proyectos posteriores.

Los autores observan que permitir que CLIP utilice su comprensiÃģn destilada del conjunto de datos (en lugar de sondear los archivos reales a escala) acelerÃģ significativamente el proceso y ofreciÃģ una mayor coherencia en las comparaciones.

Datos y pruebas

El codificador de imÃĄgenes CLIP utilizado en las pruebas para el nuevo trabajo fue el CLIP ViT-B/32 originalmente utilizado para cribar LAION. Para establecer si las imÃĄgenes diversas estaban relacionadas entre sí, se utilizÃģ KNN bajo AutoFaiss.

Los conjuntos de datos se agruparon en tres tipos: pre-entrenamiento conjuntos de datos – grandes colecciones extraídas de la web utilizadas para entrenar modelos generalistas; entrenamiento conjuntos de datos – colecciones mÃĄs pequeÃąas, a menudo anotadas, destinadas a la afinaciÃģn directa del modelo; y benchmark conjuntos de datos – anotados manualmente, y utilizados exclusivamente para evaluaciÃģn.

El anÃĄlisis cubriÃģ veinte divisiones en siete conjuntos de datos: Microsoft COCO se utilizÃģ como conjunto de entrenamiento y evaluaciÃģn, incorporando las divisiones de entrenamiento, validaciÃģn, prueba y no etiquetadas; Flickr30k sirviÃģ exclusivamente como benchmark; y la colecciÃģn de Conceptual Captions de Google (GCC) se tratÃģ como una fuente de pre-entrenamiento, con su parte de validaciÃģn tambiÃĐn utilizada para evaluaciÃģn.

AdemÃĄs, ImageNet se utilizÃģ para entrenamiento y evaluaciÃģn, mientras que el conjunto de datos LAION-400M se utilizÃģ solo para pre-entrenamiento.

OpenImages v4 contribuyÃģ con datos de entrenamiento y benchmark, y TextCaps proporcionÃģ divisiones de entrenamiento y prueba para evaluaciÃģn.

Ejemplos de anotaciones de imÃĄgenes de la colecciÃģn Open Images de Google, examinada en el nuevo trabajo. Fuente: https://arxiv.org/pdf/1811.00982

Ejemplos de anotaciones de imÃĄgenes de la colecciÃģn Open Images de Google, examinada en el nuevo trabajo. Fuente: https://arxiv.org/pdf/1811.00982

Para evaluar cÃģmo bien el mÃĐtodo puede detectar la fuga cuando las imÃĄgenes han sido sutilmente alteradas a travÃĐs del cambio de tamaÃąo, recorte o transformaciones no semÃĄnticas similares, los autores probaron en Flickr30k, seleccionando aleatoriamente 5,000 imÃĄgenes como consultas, y utilizando todo el conjunto de datos como la colecciÃģn de referencia.

Cada imagen de consulta se transformÃģ antes de ser codificada (es decir, se sometiÃģ a una modificaciÃģn no semÃĄntica como el cambio de tamaÃąo o el recorte), y luego se emparejÃģ con el elemento mÃĄs similar en la colecciÃģn utilizando similitud coseno; un emparejamiento se contÃģ solo si la imagen original se recuperÃģ como el resultado superior.

Los tres codificadores comparados fueron ResNet-152; DINOv2 ViT-B/14; y CLIP ViT-B/32.

Se utilizaron cuatro tipos de transformaciones de imÃĄgenes no semÃĄnticas: geomÃĐtricas (volteos y rotaciones); recorte (eliminaciÃģn de 20, 50 o 100 píxeles de cada borde); pixelizaciÃģn (desenfoque gaussiano, ruido agregado o muestreo a 128 o 256 píxeles); y color (gris, inversiÃģn o capas de rojo, verde o azul).

Del material suplementario, ejemplos de las transformaciones aplicadas a los datos – rutinas típicas tambiÃĐn en la preprocesamiento de aumento de datos.

Del material suplementario, ejemplos de las transformaciones aplicadas a los datos – rutinas típicas tambiÃĐn en la preprocesamiento de aumento de datos.

Luego, los autores probaron la detecciÃģn de fuga en la recuperaciÃģn de imÃĄgenes:

PrecisiÃģn de detecciÃģn de fuga en 5,000 imÃĄgenes de consulta de Flickr30k sometidas a varias transformaciones no semÃĄnticas.

PrecisiÃģn de detecciÃģn de fuga en 5,000 imÃĄgenes de consulta de Flickr30k sometidas a varias transformaciones no semÃĄnticas.

Todos los tres codificadores lograron un rendimiento perfecto en imÃĄgenes no alteradas, y CLIP permaneciÃģ confiable en el recorte, los volteos horizontales, el ruido y el cambio de tamaÃąo, superando a ResNet en cambios de nivel de píxel y de color.

DINOv2 mostrÃģ una gran resistencia a las transformaciones de color (probablemente debido a su diseÃąo de auto-supervisiÃģn, opinan los autores), pero fue notablemente mÃĄs dÃĐbil en ediciones geomÃĐtricas y recorte – ambas comunes en conjuntos de datos duplicados.

Dado que LAION ya incluye características precalculadas de CLIP, y dada su robustez y velocidad consistentes, CLIP se eligiÃģ como el codificador predeterminado para el anÃĄlisis principal.

Fuga dura y suave

El rendimiento se evaluÃģ en diferentes umbrales de similitud coseno para distinguir entre imÃĄgenes idÃĐnticas y casi idÃĐnticas (fuga dura y suave).

Se seleccionÃģ un umbral de 0,98 para definir la fuga dura, lo que resultÃģ en cero falsos positivos y una detecciÃģn perfecta de imÃĄgenes idÃĐnticas.

Para la fuga suave, se eligiÃģ un umbral de 0,95, lo que permitiÃģ recuperar mÃĄs casi duplicados mientras mantenía una tasa de falsos positivos casi cero. Se priorizÃģ la precisiÃģn sobre la cobertura, y los hallazgos se estimaron de manera conservadora:

Curvas de características de operaciÃģn del receptor se utilizaron para guiar la selecciÃģn de umbrales duros y suaves para la detecciÃģn de fuga. Las altas puntuaciones de AUC en condiciones transformadas y no transformadas demuestran que los casi duplicados se pueden distinguir de manera confiable de las imÃĄgenes no relacionadas, incluso cuando se realizan alteraciones mínimas.

Curvas de características de operaciÃģn del receptor se utilizaron para guiar la selecciÃģn de umbrales duros y suaves para la detecciÃģn de fuga. Las altas puntuaciones de AUC en condiciones transformadas y no transformadas demuestran que los casi duplicados se pueden distinguir de manera confiable de las imÃĄgenes no relacionadas, incluso cuando se realizan alteraciones mínimas.

Fuga intra-conjunto de datos

La fuga intra-conjunto de datos se calculÃģ identificando el solapamiento de imÃĄgenes entre las divisiones de entrenamiento y evaluaciÃģn dentro del mismo conjunto de datos. Solo se consideraron conjuntos de datos con divisiones de benchmark y entrenamiento o pre-entrenamiento, lo que redujo el anÃĄlisis a COCO, GCC, ImageNet, OpenImages y TextCaps.

Para COCO, el conjunto de prueba se comparÃģ con el conjunto de entrenamiento, el conjunto de evaluaciÃģn y los subconjuntos no etiquetados, y el conjunto de validaciÃģn se comparÃģ con el conjunto de entrenamiento y los subconjuntos no etiquetados.

Las tasas mÃĄs altas de fuga intra-conjunto de datos se observaron en las divisiones de prueba y validaciÃģn de ImageNet, con fuga dura que alcanzÃģ hasta el 1,58% y fuga suave apenas por debajo del 2%. GCC y COCO siguieron, con COCO val2017 mostrando una fuga suave del 3% y sus divisiones de prueba que variaban entre 1,35% y 1,38%. OpenImages exhibiÃģ una fuga dura baja en 0,05%, pero la fuga suave superÃģ el 1,3% en ambos conjuntos de prueba y validaciÃģn. TextCaps mostrÃģ la fuga general mÃĄs baja, en 0,69%, con ninguna fuga dura detectada:

Tasas de fuga intra-conjunto de datos, que muestran la proporciÃģn de cada divisiÃģn de evaluaciÃģn que se superpone con sus datos de entrenamiento asociados.

Tasas de fuga intra-conjunto de datos, que muestran la proporciÃģn de cada divisiÃģn de evaluaciÃģn que se superpone con sus datos de entrenamiento asociados.

Con respecto a estos resultados, los autores declaran†:

‘Estos resultados muestran que la fuga intra-conjunto de datos ocurre en todos los conjuntos de datos analizados, ya sea en su grado duro o suave.

‘Dado que la fuga de datos puede comprometer la evaluaciÃģn del modelo y que los conjuntos de datos estÃĄn diseÃąados específicamente para este propÃģsito, la fuga intra-conjunto de datos es un riesgo que por diseÃąo no debería existir.

‘Sin embargo, hemos identificado mÚltiples instancias en todos los conjuntos de datos.’

Fuga inter-conjunto de datos

Para medir la fuga inter-conjunto de datos (donde un modelo se entrena en un conjunto de datos y se evalÚa en otro), se utilizaron cuatro conjuntos de datos como fuentes de datos de entrenamiento: conjunto de entrenamiento de GCC, conjunto de entrenamiento de ImageNet, conjunto de entrenamiento de OpenImages y LAION.

Estos se emparejaron con datos de evaluaciÃģn extraídos de la divisiÃģn de prueba y validaciÃģn de COCO 2014, Flickr30K, TextCaps prueba, la divisiÃģn de prueba y validaciÃģn de OpenImages y la divisiÃģn de prueba y validaciÃģn de ImageNet.

Se extrajeron características de CLIP ViT-B/32 para todos los conjuntos de datos, excepto LAION, que proporciona sus propias características precalculadas. Sin embargo, dado que esas características difieren ligeramente de las generadas utilizando la implementaciÃģn oficial de CLIP, las imÃĄgenes de consulta se escalonaron segÚn el mÃĐtodo utilizado en el repositorio clip-retrieval para garantizar la compatibilidad.

La recuperaciÃģn se realizÃģ utilizando una bÚsqueda KNN, aunque la escala de LAION requiriÃģ la particiÃģn en bloques de un millÃģn de imÃĄgenes, con cada uno indexado por separado:

Fuga inter-conjunto de datos entre conjuntos de datos de benchmark (columnas) y conjuntos de datos de pre-entrenamiento (filas). En el lado izquierdo vemos la 'fuga dura' (imÃĄgenes idÃĐnticas), y en el lado derecho la 'fuga suave' (casi duplicados).

Fuga inter-conjunto de datos entre conjuntos de datos de benchmark (columnas) y conjuntos de datos de pre-entrenamiento (filas). En el lado izquierdo vemos la ‘fuga dura’ (imÃĄgenes idÃĐnticas), y en el lado derecho la ‘fuga suave’ (casi duplicados).

Se observÃģ la fuga entre conjuntos de datos en todos los conjuntos de datos de benchmark, con diferentes grados de gravedad. LAION mostrÃģ las tasas mÃĄs altas de fuga dura (imÃĄgenes idÃĐnticas), particularmente para los conjuntos de datos de prueba de OpenImages y TextCaps, cada uno superando el 3%. OpenImages tambiÃĐn contribuyÃģ con una pequeÃąa cantidad de fuga dura a COCO.

Aunque menos grave, ImageNet aÚn contenía duplicados duros de cada conjunto de datos de benchmark examinado; y GCC mostrÃģ la fuga dura general mÃĄs baja, por debajo del 1%.

La fuga suave (casi duplicados) fue mÃĄs generalizada: LAION produjo las tasas mÃĄs altas, con hasta un 7,9% de superposiciÃģn para ciertos benchmarks; OpenImages y TextCaps fueron los conjuntos de datos de benchmark mÃĄs afectados en general; y Flickr30k mostrÃģ la menor fuga.

Aunque estas superposiciones pueden representar solo una pequeÃąa parte de los conjuntos de evaluaciÃģn, los autores observan que su presencia puede permitir la memorizaciÃģn y comprometer la validez de la prueba:

Ejemplos de imÃĄgenes filtradas. A la izquierda, casos de 'fuga dura', donde las imÃĄgenes son idÃĐnticas dentro de un conjunto de datos (arriba) o entre conjuntos de datos (abajo); a la derecha, casos de 'fuga suave', donde las imÃĄgenes son visualmente casi idÃĐnticas.

Ejemplos de imÃĄgenes filtradas. A la izquierda, casos de ‘fuga dura’, donde las imÃĄgenes son idÃĐnticas dentro de un conjunto de datos (arriba) o entre conjuntos de datos (abajo); a la derecha, casos de ‘fuga suave’, donde las imÃĄgenes son visualmente casi idÃĐnticas.

Efecto en la evaluaciÃģn descendente

El artículo considera a continuaciÃģn cÃģmo la fuga de datos afecta las evaluaciones descendentes (es decir, el rendimiento en tareas estÃĄndar cuando los modelos pre-entrenados se prueban en benchmarks que contienen datos de entrenamiento duplicados).

Se consideraron tres tareas: clasificaciÃģn de cero disparos; clasificaciÃģn supervisada; y recuperaciÃģn de imagen a texto.

Para cada tarea, se evaluÃģ el rendimiento del modelo en un conjunto de datos de benchmark para el cual ya se habían identificado muestras filtradas en los datos de pre-entrenamiento. Los resultados se compararon en cuatro subconjuntos: el conjunto de benchmark completo; un subconjunto de muestras filtradas; un subconjunto de muestras no filtradas; y un subconjunto aleatorio del mismo tamaÃąo que el grupo filtrado (utilizado como control).

El efecto de la fuga de datos en tres tareas descendentes se midiÃģ utilizando subconjuntos de benchmark que ya contenían muestras filtradas. En la clasificaciÃģn de cero disparos, un modelo pre-entrenado en LAION logrÃģ una precisiÃģn notablemente mayor en las imÃĄgenes filtradas del conjunto de evaluaciÃģn de ImageNet, confirmando que la exposiciÃģn a incluso casi duplicados durante el entrenamiento proporciona una ventaja medible:

PrecisiÃģn de clasificaciÃģn de cero disparos en el conjunto de evaluaciÃģn de ImageNet en subconjuntos con y sin fuga. La Última columna informa las ganancias de precisiÃģn relativas al conjunto completo, y las filas resaltadas corresponden a subconjuntos filtrados.

PrecisiÃģn de clasificaciÃģn de cero disparos en el conjunto de evaluaciÃģn de ImageNet en subconjuntos con y sin fuga. La Última columna informa las ganancias de precisiÃģn relativas al conjunto completo, y las filas resaltadas corresponden a subconjuntos filtrados.

Para la clasificaciÃģn supervisada, la fuga en ImageNet causÃģ una caída dramÃĄtica en el rendimiento – a menos que la imagen filtrada tuviera la misma etiqueta en ambas divisiones, en cuyo caso el modelo logrÃģ una precisiÃģn casi perfecta, revelando un fuerte efecto de memorizaciÃģn:

PrecisiÃģn de clasificaciÃģn supervisada en el conjunto de evaluaciÃģn de ImageNet para subconjuntos, con y sin fuga. Las columnas de ganancia muestran el cambio relativo al conjunto completo. Los subconjuntos filtrados estÃĄn resaltados.

PrecisiÃģn de clasificaciÃģn supervisada en el conjunto de evaluaciÃģn de ImageNet para subconjuntos, con y sin fuga. Las columnas de ganancia muestran el cambio relativo al conjunto completo. Los subconjuntos filtrados estÃĄn resaltados.

En la recuperaciÃģn de imagen a texto, el rendimiento volviÃģ a mejorar para las muestras filtradas, con tanto la fuga dura como la suave que conducen a una mayor recuperaciÃģn, y con los subconjuntos filtrados que tambiÃĐn produjeron resultados mÃĄs consistentes en las ejecuciones:

Rendimiento de recuperaciÃģn de imagen a texto en Flickr30k en subconjuntos con y sin fuga, con subconjuntos filtrados resaltados.

Rendimiento de recuperaciÃģn de imagen a texto en Flickr30k en subconjuntos con y sin fuga, con subconjuntos filtrados resaltados.

Los autores concluyen:

‘En general, demostramos evidencia consistente de que la fuga plantea una amenaza grave para la evaluaciÃģn justa de modelos en conjuntos de datos visuales, comprometiendo uno de los principios de aprendizaje automÃĄtico mÃĄs fundamentales: no evaluar modelos en sus datos de entrenamiento.’

ConclusiÃģn

Un aspecto impactante del artículo, aunque no es novedad, es la cuenta de necesidad de utilizar CLIP para obtener características para la gran montaÃąa de datos de imÃĄgenes en LAION, representando una escala que ya no se puede abordar de ninguna otra manera que no sea agregada, tratando la metadata tokenizada en lugar de las características mÃĄs detalladas que se pueden inspeccionar cuando un conjunto de datos es mÃĄs manejable.

Es una ilustraciÃģn impactante de la medida en que el entrenamiento de modelos de visiÃģn-lenguaje ha superado definitivamente los límites y las capacidades de la supervisiÃģn humana, o cualquier tipo de curaciÃģn manual mÃĄs allÃĄ de submuestras representativas.

 

* QuizÃĄs de manera algo confusa, el problema de la duplicaciÃģn se define en el artículo como ‘fuga’.

† Énfasis de los autores.

Publicado por primera vez el martes 26 de agosto de 2025

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]