Ángulo de Anderson

Evaluación de la precisión histórica de ImageNet

mm
Añade Unite.AI a tus fuentes preferidas en Google

Un nuevo estudio de Google Research y UC Berkeley suma a la crítica de larga data respecto a la dependencia del sector de investigación de visión por computadora (CV) en el venerable conjunto de datos ImageNet y sus muchas derivadas. Después de una gran cantidad de evaluación manual laboriosa, los autores concluyen que casi el 50% de los supuestos errores que cometen los mejores modelos en la evaluación de subconjuntos de multi-etiquetas de ImageNet (donde los modelos de mejor desempeño actual logran más del 97% de precisión en la parte superior 1) no son en realidad errores.

Del papel:

‘Nuestro análisis revela que casi la mitad de los supuestos errores no son errores en absoluto, y descubrimos nuevas etiquetas multi-válidas, demostrando que, sin una revisión cuidadosa, estamos subestimando significativamente el desempeño de estos modelos.

‘Por otro lado, también encontramos que los mejores modelos de hoy en día aún cometen un número significativo de errores (40%) que son obviamente incorrectos para los revisores humanos.’

El alcance de la mala etiquetado de conjuntos de datos – particularmente por trabajadores de multitud no calificados – puede estar sesgando el sector, se reveló por el enfoque minucioso del estudio para la evaluación de los pares de imagen/texto a través de una gran parte de la historia de ImageNet.

En la fila superior, ejemplos de gravedad de errores: en los dos primeros ejemplos, el nuevo modelo simplemente obtiene la etiqueta predicha incorrecta; en el tercer ejemplo, el nuevo modelo identifica una etiqueta multi previamente faltante (una etiqueta que aborda una nueva categorización de la imagen); en la última imagen de la fila superior, la predicción del modelo es ambigua, porque la imagen es una mosca-bee y no una mosca. Sin embargo, la abeja promedio pertenece al orden de insectos Diptera, y así esta excepción sería casi imposible de detectar, incluso para un annotador experto. En la fila debajo hay cuatro categorías de errores, con ejemplos. Fuente: https://arxiv.org/pdf/2205.04596.pdf

En la fila superior, ejemplos de gravedad de errores: en los dos primeros ejemplos, el nuevo modelo simplemente obtiene la etiqueta predicha incorrecta; en el tercer ejemplo, el nuevo modelo identifica una etiqueta multi previamente faltante (una etiqueta que aborda una nueva categorización de la imagen); en la última imagen de la fila superior, la predicción del modelo es ambigua, porque la imagen es una mosca-bee y no una mosca. Sin embargo, la abeja promedio pertenece al orden de insectos Diptera, y así esta excepción sería casi imposible de detectar, incluso para un annotador experto. En la fila debajo hay cuatro categorías de errores, con ejemplos. Fuente: https://arxiv.org/pdf/2205.04596.pdf

Los investigadores emplearon a un pequeño número de evaluadores dedicados para revisar minuciosamente los registros de errores históricos en la evaluación del conjunto de datos ImageNet, encontrando que muchos de los juicios de error son en sí mismos erróneos – un descubrimiento que potencialmente revisa algunos de los malos resultados que muchos proyectos han obtenido en las pruebas de ImageNet a lo largo de los años.

Como ImageNet se arraiga en la cultura CV, los investigadores sostienen que las mejoras en la precisión se consideran que rinden dividendos decrecientes, y que los nuevos modelos que superan la precisión de etiqueta establecida, y que sugieren nuevas etiquetas (es decir, etiquetas adicionales) pueden estar siendo castigados, esencialmente, por no conformidad.

‘Por ejemplo,’ los autores observan. ‘¿Debemos castigar a los modelos por ser los primeros en predecir que un bagel pre-horneado puede ser un bagel, como lo hace uno de los modelos que revisamos en este trabajo?’

Del papel, un modelo más nuevo desafía la predicción previa de que el objeto en la foto es masa y sugiere que el objeto es en realidad un bagel).

Del papel, un modelo más nuevo desafía la predicción previa de que el objeto en la foto es masa y sugiere que el objeto es en realidad un bagel).

Desde el punto de vista de un trabajador de multitud encargado de identificar dicho objeto, esto es un dilema semántico y filosófico que solo puede resolverse mediante la multi-etiquetado (como ocurre en subconjuntos posteriores y en iteraciones posteriores de ImageNet); en el caso anterior, el objeto es en realidad tanto masa como un bagel en ciernes.

Errores importantes (arriba) y menores (abajo) que surgieron al probar modelos personalizados en la investigación. Las etiquetas originales de ImageNet son las primeras imágenes de la izquierda.

Errores importantes (arriba) y menores (abajo) que surgieron al probar modelos personalizados en la investigación. Las etiquetas originales de ImageNet son las primeras imágenes de la izquierda.

Las dos soluciones obvias son asignar más recursos a la etiquetado (lo que es un desafío, dentro de las limitaciones presupuestarias de la mayoría de los proyectos de investigación de visión por computadora); y, como enfatizan los autores, actualizar regularmente los conjuntos de datos y los subconjuntos de evaluación de etiquetas (lo que, entre otros obstáculos, arriesga romper la continuidad histórica de las pruebas y sembrar nuevos artículos de investigación con calificaciones y descargos con respecto a la equivalencia).

Como un paso para remediar la situación, los investigadores han desarrollado un nuevo subconjunto de ImageNet llamado ImageNet-Major (ImageNet-M), que describen como ‘un rebanada de 68 ejemplos de “error importante” de los errores obvios cometidos por los modelos de hoy en día – un rebanada donde los modelos deberían lograr casi la perfección, pero que hoy están lejos de hacerlo.’

El papel se titula ¿Cuándo se convierte la masa en un bagel? Analizando los errores restantes en ImageNet, y está escrito por cuatro autores de Google Research, junto con Sara Fridovich-Keil de UC Berkeley.

Deuda técnica

Los hallazgos son importantes porque los errores restantes identificados (o mal identificados) en ImageNet, en los 16 años desde su creación, el estudio central de la investigación, pueden representar la diferencia entre un modelo desplegable y uno que es propenso a errores y no puede ser utilizado con datos en vivo. Como siempre, el último kilómetro es crítico.

El sector de investigación de visión por computadora y síntesis de imágenes ha ‘auto-seleccionado’ efectivamente a ImageNet como una métrica de referencia, por una serie de razones – no menos porque una racha de adoptantes tempranos, en un momento en que los conjuntos de datos de alta volumen y bien etiquetados eran más raros de lo que son ahora, produjeron tantas iniciativas de investigación que probar contra ImageNet rápidamente se convirtió en el único estándar histórico ampliamente aplicable para la evaluación de nuevos marcos.

Método

Buscando los ‘errores restantes’ en ImageNet, los investigadores utilizaron un modelo ViT estándar (capaz de lograr una precisión del 89,5%) con 3 mil millones de parámetros, Vit-3B, pre-entrenado en JFT-3B y ajustado en ImageNet-1K.

Utilizando el conjunto de datos ImageNet2012_multilabel, los investigadores registraron la precisión multi-etiqueta inicial (MLA) de ViT-3B como 96,3%, durante el cual el modelo cometió 676 errores aparentes. Fueron estos errores (y también errores producidos por un modelo Greedy Soups) los que los autores buscaron investigar.

Para evaluar los 676 errores restantes, los autores evitaron a los trabajadores de multitud, observando que los errores de este tipo pueden ser difíciles para los annotadores promedio detectar, pero reunieron un panel de cinco revisores expertos, y crearon una herramienta dedicada para permitir que cada revisor viera de un vistazo la clase predicha; la puntuación predicha; las etiquetas de verdad fundamentales; y la imagen en sí.

La interfaz de usuario construida para el proyecto.

La interfaz de usuario construida para el proyecto.

En algunos casos, se necesitó más investigación para resolver disputas entre el panel, y se utilizó Google Image search como una herramienta auxiliar.

‘[En] un caso interesante pero no aislado, una predicción de un taxi (con ningún indicador de taxi obvio más allá del color amarillo) estaba presente en la imagen; determinamos que la predicción era en realidad un taxi y no solo un vehículo estándar al identificar un puente de referencia en el fondo para localizar la ciudad, y una búsqueda de imágenes de Google posterior para taxis en esa ciudad produjo imágenes del mismo modelo de taxi y diseño de matrícula, validando la predicción correcta del modelo.’

Después de la revisión inicial de los errores encontrados a lo largo de varias fases de la investigación, los autores formularon cuatro nuevos tipos de errores: error de grano fino, donde la clase predicha es similar a una etiqueta de verdad fundamental; error de grano fino con fuera del vocabulario (OOV), donde el modelo identifica un objeto cuya clase es correcta pero no está presente en ImageNet; correlación espuria, donde la etiqueta predicha se lee fuera del contexto de la imagen; y no prototípico, donde el objeto de verdad fundamental es un ejemplo especioso de la clase que se asemeja a la etiqueta predicha.

En ciertos casos, la verdad fundamental no era en sí misma ‘verdadera’:

‘Después de la revisión de los 676 errores originales [encontrados en ImageNet], encontramos que 298 eran correctos o poco claros, o determinamos que la verdad fundamental original era incorrecta o problemática.’

Después de una ronda exhaustiva y compleja de experimentos a través de una serie de conjuntos de datos, subconjuntos y conjuntos de validación, los autores encontraron que los dos modelos bajo estudio fueron en realidad considerados correctos (por los revisores humanos) para la mitad de los ‘errores’ que cometieron bajo técnicas convencionales.

El papel concluye:

‘En este papel, analizamos cada error restante que los modelos ViT-3B y Greedy Soups cometen en el conjunto de validación de multi-etiquetas de ImageNet.

‘En general, encontramos que: 1) cuando un modelo grande y de alta precisión hace una predicción novedosa que no hace ningún otro modelo, resulta ser una nueva etiqueta multi correcta casi la mitad de las veces; 2) los modelos de mayor precisión no demuestran un patrón obvio en nuestras categorías y gravedad de errores que resuelven; 3) los modelos SOTA de hoy en día están empatando o superando el desempeño del mejor experto humano en el subconjunto de multi-etiquetas evaluado por humanos; 4) los datos de entrenamiento ruidosos y las clases subespecificadas pueden ser un factor que limita la medición efectiva de las mejoras en la clasificación de imágenes.’

 

Publicado por primera vez el 15 de mayo de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai