Ángulo de Anderson
La sobreinterpretación puede ser una amenaza mayor y más intratable que el sobreajuste

Si tu buen amigo Alice gusta de usar suéteres amarillos, vas a ver muchos más suéteres amarillos que la persona promedio. Después de un tiempo, es posible que cuando veas a una mujer diferente usando un suéter amarillo, el concepto básico Alice te venga a la mente.
Si ves a una mujer usando un suéter amarillo que se parece a Alice un poco, puedes incluso confundirla con tu amiga momentáneamente.
Pero no es Alice. Eventualmente, te darás cuenta de que suéter amarillo no es una clave útil para identificar a Alice, ya que ella nunca los usa en verano y no siempre los usa en invierno. Algun tiempo después de la amistad, empezarás a descartar suéter amarillo como un posible identificador de Alice, porque tu experiencia con él ha sido insatisfactoria, y la energía cognitiva utilizada en mantener este atajo no es frecuentemente recompensada.
Si eres un sistema de reconocimiento de visión por computadora, sin embargo, es posible que veas a Alice en todas partes donde veas un suéter amarillo.
No es tu culpa; has sido encargado de identificar a Alice a toda costa, desde la información mínima disponible, y no hay escasez de recursos cognitivos para mantener este atajo reductor de Alice.
Discernimiento inquietante
Según un reciente artículo del Laboratorio de Ciencias de la Computación y Inteligencia Artificial del MIT (CSAIL) y Amazon Web Services, este síndrome, llamado sobreinterpretación, es común en el campo de investigación de visión por computadora (CV); no puede ser mitigado abordando el sobreajuste (ya que no es un adjunto directo del sobreajuste); se manifiesta comúnmente en investigaciones que utilizan los dos conjuntos de datos más influyentes en reconocimiento y transformación de imágenes, CIFAR-10 y ImageNet; y no tiene remedios fáciles – ciertamente no baratos remedios.
Los investigadores encontraron que cuando se reducen las imágenes de entrenamiento de entrada a solo un 5% de su contenido coherente, una amplia gama de marcos populares continuaron clasificando correctamente las imágenes, que parecen, en la mayoría de los casos, como “dislate” visual para cualquier observador humano:

Imágenes de entrenamiento originales de CIFAR-10, reducidas a solo un 5% del contenido de píxeles original, y clasificadas correctamente por una gama de marcos de visión por computadora muy populares con una precisión de entre 90-99%. Fuente: https://arxiv.org/pdf/2003.08907.pdf
En algunos casos, los marcos de clasificación encontraron que estas imágenes reducidas eran más fáciles de clasificar correctamente que los cuadros completos en los datos de entrenamiento originales, con los autores observando ‘[CNNs] son más confiados en estos subconjuntos de píxeles que en las imágenes completas’.
Esto indica un posible tipo de “engaño” que ocurre como práctica común para los sistemas de visión por computadora que utilizan conjuntos de datos de referencia como CIFAR-10 y ImageNet, y marcos de referencia como VGG16, ResNet20 y ResNet18.
La sobreinterpretación tiene ramificaciones notables para los sistemas de vehículos autónomos basados en visión por computadora, que han estado en el centro de atención últimamente con la decisión de Tesla de favorecer la interpretación de imágenes sobre LiDAR y otros sistemas de detección de rayos para algoritmos de conducción autónoma.
Aunque el “aprendizaje de atajos” es un desafío conocido, y un campo de investigación activa en visión por computadora, los autores del artículo comentan que la investigación alemana-canadiense que enmarcó el problema en 2019 no reconoce que los subconjuntos de píxeles “espurios” que caracterizan la sobreinterpretación son “datos estadísticamente válidos”, que pueden necesitar ser abordados en términos de arquitectura y enfoques de más alto nivel, en lugar de a través de una curación más cuidadosa de los conjuntos de datos.
El artículo se titula La sobreinterpretación revela patologías del modelo de clasificación de imágenes, y proviene de Brandon Carter, Siddhartha Jain y David Gifford en CSAIL, en colaboración con Jonas Mueller de Amazon Web Services. El código para el artículo está disponible en https://github.com/gifford-lab/overinterpretation.
Reducir los datos
Las imágenes con datos reducidos que los investigadores han utilizado se denominan Subconjuntos de entrada suficientes (SIS) – en efecto, una imagen SIS contiene el “chasis exterior” mínimo posible que puede delinear una imagen lo suficientemente bien como para permitir que un sistema de visión por computadora identifique el sujeto original de la imagen (es decir, perro, barco, etc.).

En la fila superior, vemos imágenes de validación de ImageNet completas; debajo, los subconjuntos SIS, clasificados correctamente por un modelo Inception V3 con una confianza del 90%, basado, aparentemente, en todo lo que queda de la imagen – contexto de fondo. Naturalmente, la columna final tiene implicaciones notables para el reconocimiento de señales en algoritmos de vehículos autónomos.
Comentando sobre los resultados obtenidos en la imagen anterior, los investigadores observan:
‘Encontramos que los píxeles SIS se concentran fuera del objeto real que determina la etiqueta de clase. Por ejemplo, en la imagen “pizza”, el SIS se concentra en la forma del plato y la mesa de fondo, en lugar de la pizza en sí, lo que sugiere que el modelo podría generalizar mal en imágenes que contienen objetos circulares diferentes en una mesa. En la imagen “panda gigante”, el SIS contiene bambú, que probablemente apareció en la colección de fotos de ImageNet para esta clase.
‘En las imágenes “semáforo” y “señal de tráfico”, el SIS consiste en píxeles en el cielo, lo que sugiere que los sistemas de vehículos autónomos que dependen de estos modelos deben ser evaluados cuidadosamente para detectar patologías de sobreinterpretación.’
Las imágenes SIS no se reducen al azar, sino que se crearon para el proyecto mediante un proceso de selección de gradientes por lotes en Inception V3 y ResNet50 a través de PyTorch. Las imágenes se derivan de una rutina de ablación que tiene en cuenta la relación entre la capacidad del modelo para clasificar con precisión una imagen y las áreas en las que los datos originales se eliminan iterativamente.
Para confirmar la validez de SIS, los autores probaron un proceso de eliminación de píxeles aleatorios, y encontraron que los resultados fueron ‘significativamente menos informativos’ en las pruebas, lo que indica que las imágenes SIS representan genuinamente los datos mínimos que los modelos y conjuntos de datos populares necesitan para hacer predicciones aceptables.
Un vistazo a cualquiera de las imágenes reducidas sugiere que estos modelos deberían fallar en línea con los niveles humanos de discernimiento visual, lo que llevaría a una precisión mediana de menos del 20%.

Con imágenes SIS reducidas a solo un 5% de sus píxeles originales, los humanos apenas logran una tasa de clasificación ‘mayor que aleatoria’, en comparación con la tasa de éxito del 90-99% de los conjuntos de datos y marcos populares estudiados en el artículo.
Más allá del sobreajuste
El sobreajuste ocurre cuando un modelo de aprendizaje automático se entrena tan extensamente en un conjunto de datos que se vuelve experto en hacer predicciones para esos datos específicos, pero es mucho menos efectivo (o incluso totalmente ineficaz) en datos frescos que se le presentan después del entrenamiento (datos fuera de la distribución).
Los investigadores señalan que el interés actual en la academia y la industria por combatir el sobreajuste no va a resolver simultáneamente la sobreinterpretación, porque los subconjuntos de píxeles reducidos que representan imágenes identificables para las computadoras y “garabatos” sin sentido para los humanos son en realidad datos genuinamente aplicables, en lugar de una “obsesión” por datos mal curados o anémicos:
‘La sobreinterpretación está relacionada con el sobreajuste, pero el sobreajuste se puede diagnosticar mediante una precisión de prueba reducida. La sobreinterpretación puede provenir de señales estadísticas verdaderas en la distribución subyacente del conjunto de datos que surgen de propiedades particulares de la fuente de datos (por ejemplo, reglas de dermatólogos).
‘Por lo tanto, la sobreinterpretación puede ser más difícil de diagnosticar, ya que admite decisiones que se toman según criterios estadísticamente válidos, y los modelos que utilizan dichos criterios pueden destacar en las pruebas.’
Soluciones posibles
Los autores sugieren que el conjunto de modelos, donde múltiples arquitecturas contribuyen al proceso de evaluación y entrenamiento, podría ayudar a mitigar la sobreinterpretación. También encontraron que aplicar abandono de entrada, originalmente diseñado para impedir el sobreajuste, llevó a ‘una pequeña disminución’ en la precisión de la prueba CIFAR-10 (lo que probablemente sea deseable), pero a un ‘aumento significativo’ (∼ 6%) en la precisión de los modelos en datos no vistos. Sin embargo, las cifras bajas sugieren que cualquier cura posterior para el sobreajuste es poco probable que aborde completamente la sobreinterpretación.
Los autores conceden la posibilidad de utilizar mapas de saliencia para indicar qué áreas de una imagen son pertinentes para la extracción de características, pero observan que esto derrota el objetivo de la parsing de imágenes automatizada, y requiere anotación humana que es inviable a gran escala. También observan que los mapas de saliencia han sido encontrados como estimadores crudos en términos de comprensión de las operaciones del modelo.
El artículo concluye:
‘Dada la existencia de subconjuntos de píxeles no salientes que solos bastan para la clasificación correcta, un modelo puede confiar únicamente en esos patrones. En este caso, un método de interpretación que describe fielmente el modelo debe producir estas razones sin sentido, mientras que los métodos de interpretación que sesgan las razones hacia los prejuicios humanos pueden producir resultados que engañan a los usuarios para que crean que sus modelos se comportan como se pretendía.’
Publicado por primera vez el 13 de enero de 2022.












