Ángulo de Anderson

La compresión JPEG aumenta la tasa de error de reconocimiento facial para rostros no caucásicos, según un estudio

mm
Añade Unite.AI a tus fuentes preferidas en Google
Main image: DALL-E 2.

Un nuevo estudio del Reino Unido ha concluido que las técnicas de compresión con pérdida en imágenes JPEG pueden tener una influencia adversa en la efectividad de los sistemas de reconocimiento facial, lo que hace que estos sistemas sean más propensos a identificar incorrectamente a una persona no caucásica.

El papel establece:

‘A través de un amplio conjunto de experimentos, demostramos que los enfoques comunes de compresión de imagen con pérdida tienen un impacto negativo más pronunciado en el rendimiento del reconocimiento facial para categorías de fenotipo racial específicas, como tonos de piel más oscuros (hasta un 34,55%).’

Los resultados también indican que la subsampling de croma, que reduce la información de color (en lugar de la información de brillo) en secciones de una imagen de rostro, aumenta la Tasa de Coincidencia Falsa (FMR) en una serie de conjuntos de datos de prueba, muchos de los cuales son repositorios estándar para la visión por computadora.

Operaciones de subsampling de croma en una imagen de origen, a diferentes tasas, tienen un efecto claro en la medida en que se conservan los detalles y en la medida en que los matices simplemente 'se fusionan' entre sí, sacrificando detalles y determinando características. Tenga en cuenta que esta imagen en sí puede estar sujeta a compresión y consulte el papel de origen para una resolución precisa. Fuente: https://arxiv.org/pdf/2208.07613.pdf

Operaciones de subsampling de croma en una imagen de origen, a diferentes tasas, tienen un efecto claro en la medida en que se conservan los detalles y en la medida en que los matices simplemente ‘se fusionan’ entre sí, sacrificando detalles y determinando características. Tenga en cuenta que esta imagen en sí puede estar sujeta a compresión y consulte el papel de origen para una resolución precisa. Fuente: https://arxiv.org/pdf/2208.07613.pdf

La subsampling de croma se aplica como una medida económica adicional en la compresión JPEG porque las personas son menos capaces de percibir reducciones en la complejidad y el rango de una banda de colores que los sistemas de visión por computadora, que toman estas ‘agregaciones’ de manera más literal que nosotros.

Los investigadores del nuevo estudio han encontrado que eliminar la subsampling de croma del proceso de compresión reduce este efecto negativo en hasta un 15,95%, aunque no elimina completamente el problema.

El estudio también afirma que entrenar en datos no comprimidos (o menos comprimidos) no resolverá el problema si las imágenes de tiempo de inferencia están comprimidas. En efecto, esto significa que entrenar un modelo de reconocimiento facial en imágenes menos comprimidas no resolverá el sesgo si el modelo de producción final se alimenta de imágenes que tienen los problemas de compresión mencionados.

Los autores informan*:

‘[El] uso de la compresión de imagen con pérdida durante la inferencia afecta adversamente el rendimiento de los enfoques actuales de reconocimiento de rostros en un subconjunto de agrupaciones de fenotipos faciales relacionados con la raza (es decir, tonos de piel más oscuros, forma de ojo monolíder) y que su efecto está presente independientemente de si se utiliza la imaginería comprimida para el entrenamiento del modelo.’

El papel subraya las consecuencias de la compresión de imagen en el sector de la investigación de visión por computadora, que se describieron en detalle en un estudio de 2021 de la Universidad de Maryland y Facebook AI.

Es un problema difícil de remediar; incluso si los problemas de almacenamiento y ancho de banda que hacen que la compresión sea necesaria se eliminaran de la noche a la mañana, y si todos los datos de baja calidad que poblaron veinte o más años de conjuntos de datos en el sector se recomprimieran de repente a una mejor tasa desde fuentes de alta calidad, representaría un ‘reinicio’ de la continuidad de las herramientas de benchmarking académicas de las últimas décadas. La comunidad de CV ha llegado a acostumbrarse al problema, hasta el punto de que representa una deuda técnica notable.

El sesgo racial en el reconocimiento facial (FR) se ha convertido en un tema candente en los medios en los últimos años, lo que ha llevado a un esfuerzo concertado en la comunidad de investigación para eliminarlo de los sistemas afectados. Sin embargo, la dependencia del cuerpo de investigación global de un número excesivamente limitado de conjuntos de datos ‘estándar’, muchos de los cuales no están equilibrados racialmente o etiquetados de manera deficiente en este sentido, exacerbando el desafío.

Los investigadores del nuevo papel también señalan una disonancia entre los estándares de adquisición de imágenes y los estándares establecidos por la mayoría de las pruebas de reconocimiento facial, afirmando*:

‘[Los] estándares de adquisición de imágenes para sistemas de reconocimiento facial, como ISO/IEC 19794-5 y ICAO 9303, proponen tanto estándares de calidad basados en la imagen (es decir, iluminación, occlusión) como estándares basados en el sujeto (es decir, pose, expresión, accesorios) para garantizar la calidad de la imagen facial.

‘En consecuencia, las imágenes faciales también deben almacenarse utilizando estándares de compresión de imagen con pérdida, como JPEG o JPEG2000; y ser identificables por género, color de ojos, color de cabello, expresión, propiedades (es decir, gafas), ángulos de pose (giro, inclinación y rotación), y posiciones de puntos de referencia.

‘Sin embargo, las pruebas de reconocimiento facial comunes no se ajustan a los estándares ISO/IEC 19794-5 y ICAO 9303. Además, las muestras in situ a menudo se obtienen bajo condiciones variables de cámara y ambientales para desafiar las soluciones propuestas.

‘Sin embargo, la mayoría de las muestras de imágenes faciales dentro de dichos conjuntos de datos se comprimen mediante compresión JPEG con pérdida.’

Los autores del nuevo trabajo afirman que sus esfuerzos futuros examinarán el impacto de la cuantificación de imagen con pérdida en diversos marcos de reconocimiento facial y ofrecerán posibles métodos para mejorar la equidad de estos sistemas.

El nuevo papel se titula ¿La compresión de imagen con pérdida afecta el sesgo racial dentro del reconocimiento facial?, y proviene de tres investigadores del Imperial College de Londres, junto con uno de la biblioteca de análisis de rostros profundos InsightFace.

Datos y método

Para sus experimentos, los investigadores utilizaron las bibliotecas de código abierto ImageMagick y libjpeg para crear versiones de las imágenes de datos de origen a varios incrementos de compresión.

Para una visión general inicial de los efectos de la compresión, los autores estudiaron los efectos de la relación señal a ruido pico (PSNR) en cuatro niveles diferentes de compresión JPEG en el conjunto de datos Racial Faces in-the-Wild (RFW).

Puntuaciones de PSNR para el conjunto de datos Racial Faces-in-the-Wild, que demuestran la medida en que la compresión puede afectar las capacidades de reconocimiento para imágenes comprimidas.

Puntuaciones de PSNR para el conjunto de datos Racial Faces-in-the-Wild, que demuestran la medida en que la compresión puede afectar las capacidades de reconocimiento para imágenes comprimidas.

Entre otras pruebas, realizaron investigaciones en un conjunto de datos racialmente desequilibrado y otro que estaba racialmente equilibrado. Para el conjunto de datos equilibrado, utilizaron la función de pérdida de margen angular aditivo (ArcFace) con ResNet101v2, en el conjunto de datos de referencia original VGGFace2, que contiene 3,3 millones de imágenes con 8631 sujetos racialmente desequilibrados.

Para la prueba, los investigadores utilizaron el conjunto de datos RFW. El sistema se entrenó cuatro veces, a cuatro niveles diferentes de compresión, lo que resultó en cuatro modelos ArcFace.

Para el conjunto de datos equilibrado, se utilizaron los mismos marcos iniciales en el conjunto de datos de referencia original BUPT-Balanced, que contiene 28.000 caras equilibradas en cuatro grupos africano, asiático, indio y caucásico, cada raza representada por 7000 imágenes. Al igual que con el conjunto de datos desequilibrado, se obtuvieron cuatro modelos ArcFace de esta manera.

Además, los investigadores reprodujeron los efectos de la compresión y la no compresión del entrenamiento al eliminar la subsampling de croma, con el fin de medir su efecto en el rendimiento.

Resultados

La Tasa de Coincidencia Falsa (FMR) en estos conjuntos de datos generados se estudió. Los criterios que los investigadores estaban buscando eran fenotipos predefinidos relacionados con características raciales Tipo de piel (1, 2, 3, 4, 5 o 6), Tipo de párpado (monolíder/otro), Forma de la nariz (ancho/estrecho), Forma de los labios (llenos/pequeños), Tipo de cabello (recto/ondulado/rizado/calvo), y Color del cabello – métricas extraídas del papel de 2019 Medir el sesgo oculto dentro del reconocimiento facial a través de fenotipos raciales.

El papel establece:

‘Observamos que para todos los niveles de compresión seleccionados q = {5, 10, 15, 95}, la FMR aumenta cuando se aplica una compresión con pérdida adicional, demostrando que el nivel de compresión 5 (la tasa de compresión más alta) resulta en la disminución más significativa en el rendimiento de la FMR, mientras que el nivel de compresión 95 (la tasa de compresión más baja) no resulta en diferencias notables en el rendimiento de la FMR.’

Una muestra de las extensas gráficas de resultados del papel, que son demasiado grandes y numerosas para reproducir aquí – consulte el papel de origen para una mejor resolución y resultados completos. Aquí, vemos el rango de rendimiento de la FMR en imágenes faciales comprimidas/degradadas para VGGFace2, en un rango que incluye calidad no comprimida o poco comprimida.

Una muestra de las extensas gráficas de resultados del papel, que son demasiado grandes y numerosas para reproducir aquí – consulte el papel de origen para una mejor resolución y resultados completos. Aquí, vemos el rango de rendimiento de la FMR en imágenes faciales comprimidas/degradadas para VGGFace2, en un rango que incluye calidad no comprimida o poco comprimida.

El papel concluye:

‘En general, nuestra evaluación encuentra que el uso de muestras de imágenes faciales comprimidas con pérdida en el tiempo de inferencia disminuye el rendimiento de manera más significativa en fenotipos específicos, incluyendo tono de piel oscuro, nariz ancha, cabello rizado y ojo monolíder en todos los demás fenotipos.

‘Sin embargo, el uso de imágenes comprimidas durante el entrenamiento hace que los modelos resultantes sean más resistentes y limita la degradación del rendimiento encontrada: el rendimiento más bajo entre subgrupos racialmente alineados específicos sigue siendo. Además, eliminar la subsampling de croma mejora la FMR para categorías de fenotipo específicas más afectadas por la compresión con pérdida.’

 

* Mi conversión de las citas en línea de los autores a hipervínculos.

Publicado por primera vez el 22 de agosto de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai