Ángulo de Anderson
Utilizando la compresión JPEG para mejorar el entrenamiento de las redes neuronales

Un nuevo artículo de investigación de Canadá ha propuesto un marco que introduce deliberadamente la compresión JPEG en el esquema de entrenamiento de una red neuronal, y logra obtener mejores resultados – y una mejor resistencia a los ataques adversarios.
Esta es una idea bastante radical, ya que la sabiduría general actual es que los artefactos JPEG, que están optimizados para la visualización humana y no para el aprendizaje automático, generalmente tienen un efecto perjudicial en las redes neuronales entrenadas con datos JPEG.

Un ejemplo de la diferencia en claridad entre imágenes JPEG comprimidas a diferentes valores de pérdida (una mayor pérdida permite un tamaño de archivo más pequeño, a costa de la delineación y la banda en gradientes de color, entre otros tipos de artefactos). Fuente: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937
Un informe de 2022 de la Universidad de Maryland y Facebook AI afirmó que la compresión JPEG “incurre en una penalización significativa en el rendimiento” en el entrenamiento de las redes neuronales, a pesar de trabajos previos que afirmaban que las redes neuronales son relativamente resistentes a los artefactos de compresión de imágenes.
Un año antes de esto, un nuevo hilo de pensamiento había surgido en la literatura: que la compresión JPEG podría ser aprovechada para obtener mejores resultados en el entrenamiento de modelos.
Sin embargo, aunque los autores de ese artículo pudieron obtener mejores resultados en el entrenamiento de imágenes JPEG de diferentes niveles de calidad, el modelo que propusieron era tan complejo y oneroso que no era práctico. Además, el uso del sistema de configuraciones de optimización JPEG predeterminadas (cuantificación) resultó ser un obstáculo para la eficacia del entrenamiento.
Un proyecto posterior (2023’s JPEG Compliant Compression for DNN Vision) experimentó con un sistema que obtuvo resultados ligeramente mejores a partir de imágenes JPEG comprimidas con el uso de un modelo de red neuronal profunda (DNN) congelado. Sin embargo, congelar partes de un modelo durante el entrenamiento tiende a reducir la versatilidad del modelo, así como su resistencia general a datos nuevos.
JPEG-DL
En lugar de eso, el nuevo trabajo, titulado JPEG Inspired Deep Learning, ofrece una arquitectura mucho más simple, que incluso puede ser impuesta sobre modelos existentes.
Los investigadores, de la Universidad de Waterloo, afirman:
‘Los resultados muestran que JPEG-DL supera significativa y consistentemente al DL estándar en diversas arquitecturas de DNN, con un aumento insignificante en la complejidad del modelo.
En particular, JPEG-DL mejora la precisión de clasificación en un 20,9% en algunos conjuntos de datos de clasificación de grano fino, mientras que solo agrega 128 parámetros entrenables a la tubería de DL. Además, la superioridad de JPEG-DL sobre el DL estándar se demuestra aún más con la robustez adversaria mejorada de los modelos aprendidos y los tamaños de archivo reducidos de las imágenes de entrada.’
Los autores sostienen que un nivel óptimo de calidad de compresión JPEG puede ayudar a una red neuronal a distinguir el sujeto central de una imagen. En el ejemplo a continuación, vemos resultados de referencia (izquierda) que fusionan el pájaro con el fondo cuando las características se obtienen de la red neuronal. En contraste, JPEG-DL (derecha) logra distinguir y delinear el sujeto de la foto.

Pruebas contra métodos de referencia para JPEG-DL. Fuente: https://arxiv.org/pdf/2410.07081
‘Este fenómeno,’ explican, ‘denominado “compresión ayuda” en el artículo de 2021, se justifica por el hecho de que la compresión puede eliminar ruido y características de fondo perturbadoras, resaltando así el objeto principal en una imagen, lo que ayuda a las DNN a hacer mejores predicciones.’
Método
JPEG-DL introduce un cuantificador suave diferenciable, que reemplaza la operación de cuantificación no diferenciable en una rutina de optimización JPEG estándar.
Esto permite la optimización basada en gradientes de las imágenes. Esto no es posible en la codificación JPEG convencional, que utiliza un cuantificador uniforme con una operación de redondeo que aproxima el coeficiente más cercano.
La diferenciabilidad del esquema de JPEG-DL permite la optimización conjunta de los parámetros del modelo de entrenamiento y la cuantificación JPEG (compresión). La optimización conjunta significa que tanto el modelo como los datos de entrenamiento se adaptan entre sí en el proceso de extremo a extremo, y no se requiere la congelación de capas.
En esencia, el sistema personaliza la compresión JPEG de un conjunto de datos (bruto) para adaptarse a la lógica del proceso de generalización.

Esquema conceptual para JPEG-DL.
Podría suponerse que los datos brutos serían el alimento ideal para el entrenamiento; después de todo, las imágenes se descomprimen completamente en un espacio de color de longitud completa adecuado cuando se ejecutan en lotes; así que, ¿qué diferencia hace el formato original?
Bueno, como la compresión JPEG está optimizada para la visualización humana, elimina áreas de detalle o color de una manera acorde con este objetivo. Dado un cuadro de un lago bajo un cielo azul, se aplicarán niveles de compresión más altos al cielo, porque no contiene detalles “esenciales”.
Por otro lado, una red neuronal carece de los filtros excéntricos que nos permiten centrarnos en los sujetos centrales. En cambio, es probable que considere cualquier artefacto de bandas en el cielo como datos válidos para ser asimilados en su espacio latente.

Aunque un ser humano descartaría la banda en el cielo, en una imagen comprimida con mucha fuerza (izquierda), una red neuronal no tiene idea de que este contenido debe ser descartado, y necesitará una imagen de mayor calidad (derecha). Fuente: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/
Por lo tanto, un nivel de compresión JPEG es poco probable que se adapte a todo el contenido de un conjunto de datos de entrenamiento, a menos que represente un dominio muy específico. Las imágenes de multitudes requerirán mucha menos compresión que una imagen de enfoque estrecho de un pájaro, por ejemplo.
Los autores observan que aquellos que no están familiarizados con los desafíos de la cuantificación, pero que están familiarizados con los conceptos básicos de la arquitectura de transformadores, pueden considerar estos procesos como una operación de atención, en general.
Datos y pruebas
JPEG-DL se evaluó contra arquitecturas basadas en transformadores y redes neuronales convolucionales (CNN). Las arquitecturas utilizadas fueron EfficientFormer-L1; ResNet; VGG; MobileNet; y ShuffleNet.
Las versiones de ResNet utilizadas fueron específicas del conjunto de datos CIFAR: ResNet32, ResNet56 y ResNet110. Se eligieron VGG8 y VGG13 para las pruebas basadas en VGG.
Para la CNN, la metodología de entrenamiento se derivó del trabajo de 2020 Contrastive Representation Distillation (CRD). Para EfficientFormer-L1 (basado en transformadores), se utilizó el método de entrenamiento del artículo de 2023 Initializing Models with Larger Ones.
Para las tareas de grano fino presentadas en las pruebas, se utilizaron cuatro conjuntos de datos: Stanford Dogs; el conjunto de datos de Flores de la Universidad de Oxford; CUB-200-2011 (CalTech Birds); y Mascotas (‘Gatos y perros’, una colaboración entre la Universidad de Oxford y Hyderabad en la India).
Para las tareas de grano fino en las CNN, los autores utilizaron PreAct ResNet-18 y DenseNet-BC. Para EfficientFormer-L1, se utilizó la metodología descrita en el artículo mencionado anteriormente Initializing Models with Larger Ones.
A lo largo de las tareas CIFAR-100 y de grano fino, las magnitudes variables de frecuencias de transformada de coseno discreta (DCT) en el enfoque de compresión JPEG se manejaron con el optimizador Adam, con el fin de adaptar la tasa de aprendizaje para la capa JPEG en los modelos que se probaron.
En las pruebas en ImageNet-1K, en todos los experimentos, los autores utilizaron PyTorch, con SqueezeNet, ResNet-18 y ResNet-34 como los modelos principales.
Para la evaluación de la optimización de la capa JPEG, los investigadores utilizaron gradiente descendente estocástico (SGD) en lugar de Adam, para un rendimiento más estable. Sin embargo, para las pruebas de ImageNet-1K, se empleó el método del artículo de 2019 Learned Step Size Quantization.

Arriba, la precisión de validación de la parte superior para la referencia frente a JPEG-DL en CIFAR-100, con desviaciones estándar y medias promediadas en tres ejecuciones. Debajo, la precisión de validación de la parte superior en diversas tareas de clasificación de imágenes de grano fino, en varias arquitecturas de modelos, nuevamente promediadas en tres pasadas.
Comentando sobre la primera ronda de resultados ilustrados anteriormente, los autores afirman:
‘En todos los siete modelos probados para CIFAR-100, JPEG-DL proporciona mejoras consistentes, con ganancias de hasta un 1,53% en la precisión de la parte superior. En las tareas de grano fino, JPEG-DL ofrece un aumento significativo en el rendimiento, con mejoras de hasta un 20,90% en todos los conjuntos de datos utilizando dos modelos diferentes.’
Los resultados para las pruebas de ImageNet-1K se muestran a continuación:

Resultados de precisión de validación de la parte superior en ImageNet en diversos marcos.
Aquí el artículo establece:
‘Con un aumento insignificante en la complejidad (añadiendo 128 parámetros), JPEG-DL logra una ganancia del 0,31% en la precisión de la parte superior para SqueezeNetV1.1 en comparación con la referencia utilizando una sola ronda de operación de cuantificación.
‘Al aumentar el número de rondas de cuantificación a cinco, observamos una mejora adicional del 0,20%, lo que lleva a una ganancia total del 0,51% sobre la referencia.’
Los investigadores también probaron el sistema utilizando datos comprometidos por los enfoques de ataques adversarios Método de gradiente rápido firmado (FGSM) y Gradiente descendente proyectado (PGD).
Los ataques se llevaron a cabo en CIFAR-100 en dos de los modelos:

Resultados de pruebas para JPEG-DL, contra dos marcos de ataque adversario estándar.
Los autores afirman:
‘Los modelos JPEG-DL mejoran significativamente la robustez adversaria en comparación con los modelos DNN estándar, con mejoras de hasta un 15% para FGSM y un 6% para PGD.’
Además, como se ilustró anteriormente en el artículo, los autores realizaron una comparación de mapas de características extraídas utilizando GradCAM++ – un marco que puede resaltar las características extraídas de manera visual.

Ilustración GradCAM++ para clasificación de imágenes de referencia y JPEG-DL, con características extraídas resaltadas.
El artículo señala que JPEG-DL produce un resultado mejorado, y que en un caso incluso pudo clasificar una imagen que la referencia no logró identificar. Con respecto a la imagen anterior que presenta pájaros, los autores afirman:
‘Es evidente que los mapas de características del modelo JPEG-DL muestran un contraste significativamente mejor entre la información del primer plano (el pájaro) y el fondo en comparación con los mapas de características generados por el modelo de referencia.
‘En particular, el objeto del primer plano en los mapas de características de JPEG-DL está encerrado dentro de un contorno bien definido, lo que lo hace visualmente distinguible del fondo.
‘En contraste, los mapas de características del modelo de referencia muestran una estructura más mezclada, donde el objeto del primer plano contiene una energía más alta en frecuencias bajas, lo que hace que se mezcle más suavemente con el fondo.’
Conclusión
JPEG-DL está destinado a ser utilizado en situaciones donde los datos brutos están disponibles – pero sería interesante ver si algunos de los principios presentados en este proyecto podrían aplicarse al entrenamiento de conjuntos de datos convencionales, donde el contenido puede ser de menor calidad (como ocurre con frecuencia en conjuntos de datos de hipercala extraídos de Internet).
Como está, eso sigue siendo en gran medida un problema de anotación, aunque se ha abordado en reconocimiento de imágenes basado en tráfico y en otros lugares.
Publicado por primera vez el jueves 10 de octubre de 2024












