Ãngulo de Anderson
Resolviendo el problema de los artefactos JPEG en conjuntos de datos de visiÃģn por computadora

Un nuevo estudio de la Universidad de Maryland y Facebook AI ha encontrado una âpenalizaciÃģn significativa del rendimientoâ para los sistemas de aprendizaje profundo que utilizan imÃĄgenes JPEG altamente comprimidas en sus conjuntos de datos, y ofrece algunos nuevos mÃĐtodos para mitigar los efectos de esto.
El informe, titulado AnÃĄlisis y mitigaciÃģn de defectos de compresiÃģn JPEG en aprendizaje profundo, afirma ser âsignificativamente mÃĄs completoâ que los estudios anteriores sobre los efectos de los artefactos en los conjuntos de datos de visiÃģn por computadora. El papel encuentra que â[la compresiÃģn JPEG pesada] a moderada incurre una penalizaciÃģn significativa del rendimiento en mÃĐtricas estÃĄndarâ, y que las redes neuronales pueden no ser tan resistentes a tales perturbaciones como sugiere el trabajo anterior anterior.

Una foto de un perro del conjunto de datos MobileNetV2 de 2018. En calidad 10 (izquierda), un sistema de clasificaciÃģn no logra identificar la raza correcta âPembroke Welsh Corgiâ, en su lugar adivina âNorwich terrierâ (el sistema ya sabe que es una foto de un perro, pero no la raza); segundo desde la izquierda, una versiÃģn corregida de artefactos JPEG de la imagen tambiÃĐn no logra identificar la raza correcta; segundo desde la derecha, la correcciÃģn de artefactos dirigida restaura la clasificaciÃģn correcta; y derecha, la foto original, clasificada correctamente. Fuente: https://arxiv.org/pdf/2011.08932.pdf
Artefactos de compresiÃģn como âdatosâ
La compresiÃģn JPEG extrema probablemente cree bordes visibles o semivisibles alrededor de los bloques de 8Ã8 a partir de los cuales se ensambla una cuadrÃcula de pÃxeles JPEG. Una vez que aparecen estos artefactos de bloqueo o âringingâ, es probable que sean malinterpretados por los sistemas de aprendizaje automÃĄtico como elementos del mundo real del sujeto de la imagen, a menos que se realice alguna compensaciÃģn por esto.

Arriba, un sistema de aprendizaje automÃĄtico de visiÃģn por computadora extrae una imagen de gradiente âlimpioâ de una buena calidad de imagen. Abajo, los artefactos de âbloqueoâ en una imagen de menor calidad ocultan las caracterÃsticas del sujeto y pueden terminar âinfectandoâ las caracterÃsticas derivadas de un conjunto de imÃĄgenes, particularmente en casos donde imÃĄgenes de alta y baja calidad ocurren en el conjunto de datos, como en colecciones de web-scraping a las que solo se ha aplicado una limpieza de datos genÃĐrica. Fuente: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
Como se ve en la primera imagen de arriba, tales artefactos pueden afectar las tareas de clasificaciÃģn de imÃĄgenes, con implicaciones tambiÃĐn para los algoritmos de reconocimiento de texto, que pueden no identificar correctamente los caracteres afectados por artefactos.
En el caso de los sistemas de entrenamiento de sÃntesis de imÃĄgenes (como software de deepfake o sistemas de generaciÃģn de imÃĄgenes basados en GAN), un bloque ârenegadoâ de imÃĄgenes de baja calidad y altamente comprimidas en un conjunto de datos puede arrastrar la calidad media de reproducciÃģn hacia abajo, o ser subsumido y esencialmente anulado por un mayor nÚmero de caracterÃsticas de alta calidad extraÃdas de mejores imÃĄgenes en el conjunto. En cualquier caso, se desea mejores datos, o al menos datos consistentes.
JPEG â Generalmente âBastante buenoâ
La compresiÃģn JPEG es un cÃģdec de pÃĐrdida irreversible que se puede aplicar a varios formatos de imagen, aunque se aplica principalmente al formato de archivo de imagen JFIF. A pesar de esto, el formato JPEG (.jpg) se nombrÃģ despuÃĐs de su mÃĐtodo de compresiÃģn asociado, y no del contenedor JFIF para los datos de la imagen.
Arquitecturas de aprendizaje automÃĄtico enteras han surgido en los Últimos aÃąos que incluyen la mitigaciÃģn de artefactos JPEG como parte de las rutinas de escalado/restauraciÃģn impulsadas por IA, y la eliminaciÃģn de artefactos de compresiÃģn basada en IA ahora se incorpora en una serie de productos comerciales, como la suite de imagen/video Topaz, y las caracterÃsticas neuronales de las versiones recientes de Adobe Photoshop.
Desde que el esquema JPEG de 1986 actualmente en uso comÚn se cerrÃģ en la dÃĐcada de 1990, no es posible agregar metadatos a una imagen que indique quÃĐ nivel de calidad (1-100) se utilizÃģ para guardar una imagen JPEG â al menos, no sin modificar mÃĄs de treinta aÃąos de software de consumidor, profesional y acadÃĐmico que no esperaban que dichos metadatos estuvieran disponibles.
En consecuencia, no es inusual adaptar las rutinas de entrenamiento de aprendizaje automÃĄtico a la calidad evaluada o conocida de los datos de imagen JPEG, como han hecho los investigadores para el nuevo papel (ver abajo). En ausencia de una entrada de metadatos de âcalidadâ, actualmente es necesario conocer los detalles de cÃģmo se comprimiÃģ la imagen (es decir, se comprimiÃģ a partir de una fuente sin pÃĐrdida), o estimar la calidad a travÃĐs de algoritmos perceptuales o clasificaciÃģn manual.
Un compromiso econÃģmico
JPEG no es el Único mÃĐtodo de compresiÃģn con pÃĐrdida que puede afectar la calidad de los conjuntos de datos de aprendizaje automÃĄtico; los ajustes de compresiÃģn en los archivos PDF tambiÃĐn pueden descartar informaciÃģn de esta manera, y se pueden configurar para niveles de calidad muy bajos con el fin de ahorrar espacio en disco para fines de archivo local o de red.
Esto se puede ver al muestrear varios PDF en archive.org, algunos de los cuales se han comprimido tanto que son un desafÃo notable para los sistemas de reconocimiento de imÃĄgenes o texto. En muchos casos, como los libros con derechos de autor, esta compresiÃģn intensa parece haberse aplicado como una forma de DRM barata, de manera similar a como los titulares de derechos de autor pueden optar por reducir la resoluciÃģn de los videos subidos por los usuarios a YouTube en los que poseen la propiedad intelectual, dejando los videos âblockyâ como tokens promocionales para inspirar compras de âalta resoluciÃģnâ, en lugar de eliminarlos.
En muchos otros casos, la resoluciÃģn o la calidad de la imagen es baja simplemente porque los datos son muy antiguos y provienen de una ÃĐpoca en la que el almacenamiento local y de red era mÃĄs caro, y cuando las velocidades de red limitadas favorecÃan imÃĄgenes altamente optimizadas y portÃĄtiles sobre la reproducciÃģn de alta calidad.
Se ha argumentado que JPEG, aunque no sea la mejor soluciÃģn ahora, ha sido âconsagradoâ como infraestructura de legado irremovable que estÃĄ esencialmente entretejida con los cimientos de Internet.
Carga de legado
Aunque las innovaciones posteriores como JPEG 2000, PNG y (mÃĄs recientemente) el formato.webp ofrecen una calidad superior, volver a muestrear conjuntos de datos de aprendizaje automÃĄtico mÃĄs antiguos y muy populares probablemente âreiniciarÃaâ la continuidad y la historia de los desafÃos anuales de visiÃģn por computadora en la comunidad acadÃĐmica â un impedimento que tambiÃĐn se aplicarÃa en el caso de volver a guardar imÃĄgenes de conjunto de datos PNG a ajustes de calidad mÃĄs altos. Esto podrÃa considerarse como una especie de deuda tÃĐcnica.
Mientras que las bibliotecas de procesamiento de imÃĄgenes impulsadas por servidor como ImageMagick admiten mejores formatos, incluido.webp, los requisitos de transformaciÃģn de imÃĄgenes a menudo ocurren en sistemas de legado que no estÃĄn configurados para nada mÃĄs que JPG o PNG (que ofrece compresiÃģn sin pÃĐrdida, pero a expensas de la latencia y el espacio en disco). Incluso WordPress, el CMS que impulsa casi el 40% de todos los sitios web, solo agregÃģ soporte para.webp hace tres meses.
PNG fue una entrada tardÃa (arguably demasiado tarde) en el sector de formatos de imagen, surgiendo como una soluciÃģn de cÃģdigo abierto en la segunda mitad de la dÃĐcada de 1990 en respuesta a una declaraciÃģn de 1995 por Unisys y CompuServe de que se pagarÃan regalÃas por el formato de compresiÃģn LZW utilizado en los archivos GIF, que se utilizaban comÚnmente en ese momento para logotipos y elementos de color plano, incluso si el resurgimiento de GIF en la dÃĐcada de 2010 se centrÃģ en su capacidad para proporcionar contenido animado de baja banda y snappy (irÃģnicamente, los PNG animados nunca ganaron popularidad o amplio soporte, y fueron prohibidos en Twitter en 2019).
A pesar de sus limitaciones, la compresiÃģn JPEG es rÃĄpida, eficiente en tÃĐrminos de espacio y profundamente integrada en sistemas de todos los tipos â y por lo tanto no es probable que desaparezca completamente de la escena de aprendizaje automÃĄtico en el futuro cercano.
Hacer lo mejor de la tregua AI/JPEG
En cierta medida, la comunidad de aprendizaje automÃĄtico se ha acomodado a las peculiaridades de la compresiÃģn JPEG: en 2011, la Sociedad Europea de RadiologÃa (ESR) publicÃģ un estudio sobre la âusabilidad de la compresiÃģn de imagen irreversible en la imagen radiolÃģgicaâ, que proporciona pautas para la âpÃĐrdida aceptableâ; cuando el venerable conjunto de datos de reconocimiento de texto MNIST (cuyos datos de imagen se proporcionaron originalmente en un formato binario novedoso) se trasladÃģ a un formato de imagen âregularâ, JPEG, no PNG, se eligiÃģ; y una colaboraciÃģn anterior (2020) de los autores del nuevo papel ofreciÃģ una arquitectura novedosa para calibrar los sistemas de aprendizaje automÃĄtico a las limitaciones de la calidad variable de la imagen JPEG, sin la necesidad de que los modelos se entrenen en cada ajuste de calidad JPEG â una caracterÃstica utilizada en el nuevo trabajo.
De hecho, la investigaciÃģn sobre la utilidad de los datos de calidad variable JPEG es un campo relativamente prÃģspero en el aprendizaje automÃĄtico. Un proyecto de 2016 (no relacionado) del Centro de InvestigaciÃģn de AutomatizaciÃģn de la Universidad de Maryland se centra en el dominio DCT (donde ocurren los artefactos JPEG a ajustes de calidad bajos) como una ruta para la extracciÃģn de caracterÃsticas profundas; otro proyecto de 2019 se centra en la lectura a nivel de byte de los datos JPEG sin la necesidad de descomprimir las imÃĄgenes (es decir, abrirlos en algÚn momento de un flujo de trabajo automatizado); y un estudio de Francia en 2019 aprovecha activamente la compresiÃģn JPEG en servicio de las rutinas de reconocimiento de objetos.
Pruebas y conclusiones
Para regresar al estudio mÃĄs reciente de UoM y Facebook, los investigadores buscaron probar la comprensibilidad y utilidad de JPEG en imÃĄgenes comprimidas entre 10-90 (por debajo de las cuales la imagen estÃĄ imposiblemente perturbada, y por encima de las cuales es igual a la compresiÃģn sin pÃĐrdida). Las imÃĄgenes utilizadas en las pruebas se precomprimieron en cada valor dentro del rango de calidad objetivo, lo que implicÃģ al menos ocho sesiones de entrenamiento.
Los modelos se entrenaron en descenso de gradiente estocÃĄstico a travÃĐs de cuatro mÃĐtodos: base, donde no se agregaron mitigaciones adicionales; ajuste fino supervisado, donde el conjunto de entrenamiento tiene la ventaja de pesos preentrenados y datos etiquetados (aunque los investigadores admiten que esto es difÃcil de replicar en aplicaciones de consumidor); correcciÃģn de artefactos, donde se realiza una mejora en las imÃĄgenes comprimidas antes del entrenamiento; y correcciÃģn de artefactos dirigida a tareas, donde la red de correcciÃģn de artefactos se ajusta en errores devueltos.
El entrenamiento se realizÃģ en una amplia variedad de conjuntos de datos aptos, incluyendo mÚltiples variantes de ResNet, FastRCNN, MobileNetV2, MaskRCNN y Kerasâ InceptionV3.
Los resultados de pÃĐrdida de muestra despuÃĐs de la correcciÃģn de artefactos dirigida a tareas se visualizan a continuaciÃģn (menor es mejor).

No es posible profundizar en los detalles de los resultados obtenidos en el estudio, porque los hallazgos de los investigadores se dividen entre el objetivo de evaluar los artefactos JPEG y los nuevos mÃĐtodos para aliviar esto; el entrenamiento se iterÃģ por calidad en tantos conjuntos de datos; y las tareas incluyeron mÚltiples objetivos como la detecciÃģn de objetos, la segmentaciÃģn y la clasificaciÃģn. Esencialmente, el nuevo informe se posiciona como una obra de referencia integral que aborda mÚltiples problemas.
No obstante, el papel concluye en general que âla compresiÃģn JPEG tiene una penalizaciÃģn pronunciada en todo el tablero para la compresiÃģn pesada a moderadaâ. TambiÃĐn afirma que sus estrategias de mitigaciÃģn no supervisadas novedosas logran resultados superiores entre otros enfoques similares; que, para tareas complejas, el mÃĐtodo supervisado de los investigadores tambiÃĐn supera a sus pares, a pesar de no tener acceso a etiquetas de verdad; y que estas metodologÃas novedosas permiten la reutilizaciÃģn de modelos, ya que los pesos obtenidos son transferibles entre tareas.
En cuanto a las tareas de clasificaciÃģn, el papel establece explÃcitamente que âJPEG degrada la calidad del gradiente asà como induce errores de localizaciÃģnâ.
Los autores esperan ampliar estudios futuros para cubrir otros mÃĐtodos de compresiÃģn como el ampliamente descuidado JPEG 2000, asà como WebP, HEIF y BPG. TambiÃĐn sugieren que su metodologÃa podrÃa aplicarse a investigaciones anÃĄlogas sobre algoritmos de compresiÃģn de video.
Como el mÃĐtodo de correcciÃģn de artefactos dirigida a tareas ha demostrado ser tan exitoso en el estudio, los autores tambiÃĐn seÃąalan su intenciÃģn de publicar los pesos entrenados durante el proyecto, anticipando que â[muchas] aplicaciones se beneficiarÃĄn del uso de nuestros pesos TTAC sin modificaciÃģnâ.
Â
n.b. La imagen de origen del artÃculo proviene de thispersondoesnotexist.com












