Ángulo de Anderson

Rostros sintéticos “degradados” podrían ayudar a mejorar el reconocimiento de imágenes faciales

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de la Universidad Estatal de Michigan han ideado una forma de que los rostros sintéticos tomen un descanso de la escena de los deepfakes y hagan algo bueno en el mundo: ayudar a los sistemas de reconocimiento de imágenes a ser más precisos.

El nuevo módulo de síntesis de caras controlable (CFSM) que han diseñado es capaz de regenerar caras en el estilo de las grabaciones de vigilancia de video en tiempo real, en lugar de confiar en las imágenes de mayor calidad utilizadas en los conjuntos de datos de código abierto populares de celebridades, que no reflejan todos los defectos y limitaciones de los sistemas de CCTV genuinos, como el desenfoque facial, la baja resolución y el ruido del sensor: factores que pueden afectar la precisión del reconocimiento.

Arquitectura conceptual para el Módulo de Síntesis de Caras Controlable (CFSM). Fuente: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022.pdf

Arquitectura conceptual para el Módulo de Síntesis de Caras Controlable (CFSM). Fuente: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022.pdf

CFSM no está diseñado específicamente para simular auténticamente poses de cabeza, expresiones o todos los demás rasgos que son el objetivo de los sistemas de deepfakes, sino más bien para generar una serie de vistas alternativas en el estilo del sistema de reconocimiento objetivo, utilizando transferencia de estilo.

El sistema está diseñado para imitar el dominio de estilo del sistema objetivo y adaptar su salida según la resolución y el rango de “excentricidades” en él. El caso de uso incluye sistemas heredados que no es probable que se actualicen debido al costo, pero que actualmente pueden contribuir poco a la nueva generación de tecnologías de reconocimiento facial, debido a la mala calidad de la salida que puede haber sido de vanguardia en el pasado.

Al probar el sistema, los investigadores encontraron que logró avances notables en el estado actual de los sistemas de reconocimiento de imágenes que deben lidiar con este tipo de datos ruidosos y de baja calidad.

Entrenar los modelos de reconocimiento facial para adaptarse a las limitaciones de los sistemas objetivo. Fuente: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf

Entrenar los modelos de reconocimiento facial para adaptarse a las limitaciones de los sistemas objetivo. Fuente: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf

Además, encontraron un subproducto útil del proceso: que los conjuntos de datos objetivo ahora podrían caracterizarse y compararse entre sí, lo que facilita la comparación, la creación de benchmarks y la generación de conjuntos de datos personalizados para varios sistemas de CCTV en el futuro.

Además, el método se puede aplicar a conjuntos de datos existentes, realizando de facto adaptación de dominio y haciéndolos más adecuados para los sistemas de reconocimiento facial.

El nuevo artículo se titula Síntesis de caras controlable y guiada para reconocimiento de caras no restringido, está respaldado en parte por la Oficina del Director de Inteligencia Nacional de EE. UU. (ODNI, en IARPA), y proviene de cuatro investigadores del Departamento de Ciencias de la Computación e Ingeniería de MSU.

Contenido destacado

El reconocimiento de caras de baja calidad (LQFR) se ha convertido en un área de estudio notable en los últimos años. Debido a que las autoridades cívicas y municipales construyeron sistemas de vigilancia de video para ser resistentes y duraderos (no queriendo reallocar recursos al problema periódicamente), muchos sistemas de vigilancia “heredados” se han convertido en víctimas de deuda técnica, en términos de su adaptabilidad como fuentes de datos para el aprendizaje automático.

Niveles variables de resolución facial en una serie de sistemas de vigilancia de video históricos y más recientes. Fuente: https://arxiv.org/pdf/1805.11519.pdf

Niveles variables de resolución facial en una serie de sistemas de vigilancia de video históricos y más recientes. Fuente: https://arxiv.org/pdf/1805.11519.pdf

Afortunadamente, esta es una tarea que los modelos de difusión y otros modelos basados en ruido están inusualmente bien adaptados para resolver. Muchos de los sistemas de síntesis de imágenes más populares y efectivos de los últimos años realizan escalado de imágenes de baja resolución como parte de su flujo de trabajo, mientras que esto también es absolutamente esencial para las técnicas de compresión neural (métodos para guardar imágenes y películas como datos neurales en lugar de datos de mapa de bits).

Parte del desafío del reconocimiento facial es obtener la mayor precisión posible a partir del número mínimo de características que se pueden extraer de las imágenes de baja resolución más pequeñas y menos prometedoras. Esta restricción existe no solo porque es útil poder identificar (o crear) una cara a baja resolución, sino también debido a limitaciones técnicas sobre el tamaño de las imágenes que pueden pasar a través del espacio latente emergente de un modelo que se está entrenando en la VRAM disponible en una GPU local.

En este sentido, el término “características” es confuso, ya que tales características también se pueden obtener a partir de un conjunto de datos de bancos de parques. En el sector de la visión por computadora, “características” se refiere a las características distinguibles obtenidas a partir de imágenes: cualquier imagen, ya sea la línea de un templo, una montaña o la disposición de características faciales en un conjunto de datos de caras.

Desde que los algoritmos de visión por computadora ahora son hábiles para escalar imágenes y metraje de video, varios métodos se han propuesto para “mejorar” el material de vigilancia de baja resolución o degradado, hasta el punto de que podría ser posible utilizar tales mejoras para fines legales, como colocar a una persona en particular en una escena, en relación con una investigación de un delito.

Además de la posibilidad de malidentificación, que ha ocasionalmente reunido titulares, en teoría no debería ser necesario hiper-resolver o transformar de otra manera el metraje de baja resolución para hacer una identificación positiva de un individuo, ya que un sistema de reconocimiento facial que se centra en características de bajo nivel no debería necesitar ese nivel de resolución y claridad. Además, tales transformaciones son costosas en la práctica y plantean preguntas adicionales, recurrentes sobre su posible validez y legalidad.

La necesidad de más “celebridades de bajos fondos”

Sería más útil si un sistema de reconocimiento facial pudiera derivar características (es decir, características de aprendizaje automático de características humanas) de la salida de los sistemas heredados tal como están, entendiendo mejor la relación entre la “alta resolución” de la identidad y las imágenes degradadas que están disponibles en los marcos de vigilancia de video existentes e implacables (y a menudo irremplazables).

El problema aquí es uno de estándares: los conjuntos de datos comunes recopilados en la web, como MS-Celeb-1M y WebFace260M (entre otros), han sido agarrados por la comunidad de investigación porque proporcionan benchmarks consistentes contra los cuales los investigadores pueden medir su progreso incremental o importante con respecto al estado actual de la técnica.

Ejemplos del conjunto de datos popular MS-Celeb1m de Microsoft. Fuente: https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/

Ejemplos del conjunto de datos popular MS-Celeb1m de Microsoft. Fuente: https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/

Sin embargo, los autores argumentan que los algoritmos de reconocimiento facial (FR) entrenados en estos conjuntos de datos no son adecuados para los “dominios” visuales de la salida de muchos sistemas de vigilancia más antiguos.

El artículo establece*:

‘[Estado del arte] (SoTA) Los modelos FR no funcionan bien en la imagen de vigilancia del mundo real (no restringida) debido al problema de cambio de dominio, es decir, los grandes conjuntos de datos de entrenamiento (semi-restringidos) obtenidos a través de caras de celebridades recopiladas en la web carecen de variaciones in situ, como ruido inherente del sensor, baja resolución, desenfoque de movimiento, efecto de turbulencia, etc.

‘Por ejemplo, la precisión de verificación 1:1 informada por uno de los modelos SoTA en el conjunto de datos IJB-S no restringido es aproximadamente un 30% menor que en el conjunto de datos LFW semi-restringido.

‘Una posible solución a esta brecha de rendimiento es ensamblar un conjunto de datos de caras no restringidas a gran escala. Sin embargo, construir dicho conjunto de datos de entrenamiento con decenas de miles de sujetos es prohibitivamente difícil con un alto costo de etiquetado manual.’

El artículo relata varios métodos anteriores que han intentado “hacer coincidir” los diferentes tipos de salidas de los sistemas de vigilancia históricos o de bajo costo, pero observa que estos han tratado con “mejoras ciegas”. Por el contrario, CFSM recibe retroalimentación directa de la salida del mundo real del sistema objetivo durante el entrenamiento y se adapta a sí mismo a través de la transferencia de estilo para imitar ese dominio.

La actriz Natalie Portman, no extraña a la handful de conjuntos de datos que dominan la comunidad de visión por computadora, figura entre las identidades en este ejemplo de CFSM que realiza una adaptación de dominio coincidente con el estilo basada en la retroalimentación del dominio del modelo objetivo real.

La actriz Natalie Portman, no extraña a la handful de conjuntos de datos que dominan la comunidad de visión por computadora, figura entre las identidades en este ejemplo de CFSM que realiza una adaptación de dominio coincidente con el estilo basada en la retroalimentación del dominio del modelo objetivo real.

La arquitectura diseñada por los autores utiliza el método de signo de gradiente rápido (FGSM) para individuar e “importar” los estilos y características obtenidos de la salida real del sistema objetivo. La parte de la canalización dedicada a la generación de imágenes mejorará y se volverá más fiel al sistema objetivo con el entrenamiento. Esta retroalimentación del espacio de estilo de baja dimensionalidad del sistema objetivo es de naturaleza de bajo nivel y corresponde a los descriptores visuales derivados más amplios.

Los autores comentan:

‘Con la retroalimentación del modelo FR, las imágenes sintetizadas son más beneficiosas para el rendimiento del FR, lo que lleva a capacidades de generalización significativamente mejoradas de los modelos FR entrenados con ellas.’

Pruebas

Los investigadores utilizaron el trabajo anterior de MSU como plantilla para probar su sistema. Con base en los mismos protocolos experimentales, utilizaron MS-Celeb-1m, que consiste exclusivamente en fotografías de celebridades recopiladas en la web, como el conjunto de datos de entrenamiento etiquetado. Por equidad, también incluyeron MS1M-V2, que contiene 3,9 millones de imágenes con 85.700 clases.

Los datos objetivo fueron el conjunto de datos WiderFace de la Universidad de Hong Kong. Este es un conjunto de imágenes particularmente diverso diseñado para tareas de detección de caras en situaciones desafiantes. Se utilizaron 70.000 imágenes de este conjunto.

Para la evaluación, el sistema se probó contra cuatro benchmarks de reconocimiento facial: IJB-B, IJB-C, IJB-S y TinyFace.

CFSM se entrenó con ∼10% de los datos de entrenamiento de MS-Celeb-1m, alrededor de 0,4 millones de imágenes, durante 125.000 iteraciones con un tamaño de lote de 32 bajo el optimizador Adam con una tasa de aprendizaje muy baja de 1e-4.

El modelo de reconocimiento facial objetivo utilizó una modificación de ResNet-50 para la columna vertebral, con la función de pérdida ArcFace habilitada durante el entrenamiento. Además, se entrenó un modelo con CFSM como una prueba de ablativa y comparativa (notado como “ArcFace” en la tabla de resultados a continuación).

Resultados de las pruebas principales para CFSM. Los números más altos son mejores.

Resultados de las pruebas principales para CFSM. Los números más altos son mejores.

Los autores comentan sobre los resultados principales:

‘El modelo ArcFace supera a todos los modelos base en tareas de identificación y verificación de caras, y logra un nuevo rendimiento SoTA.’

La capacidad de extraer dominios de las diversas características de los sistemas de vigilancia heredados o subespecificados también permite a los autores comparar y evaluar la similitud de distribución entre estos marcos y presentar cada sistema en términos de un estilo visual que podría aprovecharse en trabajos posteriores.

Ejemplos de varios conjuntos de datos exhiben diferencias claras de estilo.

Ejemplos de varios conjuntos de datos exhiben diferencias claras de estilo.

Los autores observan además que su sistema podría aprovechar algunas tecnologías que, hasta la fecha, se han visto únicamente como problemas a resolver por la comunidad de investigación y visión:

‘[CFSM] muestra que la manipulación adversaria podría ir más allá de ser un atacante y servir para aumentar la precisión del reconocimiento en tareas de visión. Mientras tanto, definimos una métrica de similitud de conjunto de datos basada en las bases de estilo aprendidas, que capturan las diferencias de estilo de una manera agnóstica con respecto a las etiquetas o predictores.’

‘Creemos que nuestra investigación ha presentado el poder de un modelo de síntesis de caras controlable y guiado para el reconocimiento de caras no restringido y proporciona una comprensión de las diferencias de conjunto de datos.’

 

* Mi conversión de las citas en línea de los autores a enlaces.

Publicado por primera vez el 1 de agosto de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai