Ãngulo de Anderson
Identificando deepfakes de celebridades a partir de regiones faciales externas

Una nueva colaboraciÃģn entre Microsoft y una universidad china ha propuesto una nueva forma de identificar deepfakes de celebridades, aprovechando las limitaciones de las tÃĐcnicas de deepfake actuales para reconocer identidades que han sido âproyectadasâ sobre otras personas.
El enfoque se llama Identity Consistency Transformer (ICT), y funciona comparando las partes externas de la cara (mandÃbula, pÃģmulos, lÃnea del cabello y otros contornos marginales externos) con el interior de la cara. El sistema explota los datos de imÃĄgenes pÚblicas de personas famosas, que limita su eficacia a celebridades populares, cuyas imÃĄgenes estÃĄn disponibles en grandes cantidades en conjuntos de datos de visiÃģn por computadora y en Internet.

La cobertura de falsificaciÃģn de caras en siete tÃĐcnicas: DeepFake en FF+; DeepFake en Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; y DF-VAE. Paquetes populares como DeepFaceLab y FaceSwap proporcionan una cobertura similarmente limitada. Fuente: https://arxiv.org/pdf/2203.01318.pdf
Como muestra la imagen anterior, los mÃĐtodos actuales de deepfaking son bastante limitados en cuanto a recursos y dependen de âcaras anfitrionasâ (la imagen o video de una persona que tendrÃĄ su identidad reemplazada por el deepfake) para minimizar la evidencia de sustituciÃģn de cara.
Aunque los mÃĐtodos variables pueden abarcar la frente completa y una gran parte de las ÃĄreas de los pÃģmulos y la mandÃbula, todos estÃĄn mÃĄs o menos limitados dentro del marco de la cara anfitriona.

Un mapa de saliencia que enfatiza las identidades âinteriorâ y âexteriorâ calculadas por ICT. Donde se establece una coincidencia facial interior pero no se corresponde con la identidad exterior, ICT evalÚa la imagen como falsa.
En pruebas, ICT demostrÃģ ser capaz de detectar contenido de deepfake en entornos de video de baja resoluciÃģn, donde el contenido del video completo se degrada por artefactos de compresiÃģn, lo que ayuda a ocultar la evidencia residual del proceso de deepfake â una circunstancia que confunde a muchos mÃĐtodos de detecciÃģn de deepfake competidores.

ICT supera a los competidores en el reconocimiento de contenido de deepfake. Vea el video incrustado al final del artÃculo para mÃĄs ejemplos y mejor resoluciÃģn. Vea el video de fuente incrustado al final del artÃculo para mÃĄs ejemplos. Fuente: https://www.youtube.com/watch?v=zgF50dcymj8
El artÃculo se titula Protegiendo a las celebridades con Identity Consistency Transformer, y proviene de nueve investigadores afiliados a la Universidad de Ciencia y TecnologÃa de China, Microsoft Research Asia y Microsoft Cloud + AI.
La brecha de credibilidad
Hay al menos un par de razones por las que los algoritmos de intercambio de caras populares como DeepFaceLab y FaceSwap descuidan el ÃĄrea mÃĄs externa de las identidades faciales intercambiadas.
En primer lugar, entrenar modelos de deepfake es tiempo-consumidor y crÃtico en cuanto a recursos, y la adopciÃģn de âcaras anfitrionasâ compatibles libera ciclos de GPU y ÃĐpocas para concentrarse en las ÃĄreas relativamente inmutables del interior de la cara que usamos para distinguir la identidad (ya que variables como la fluctuaciÃģn de peso y el envejecimiento son las menos propensas a cambiar estos rasgos faciales bÃĄsicos en el corto plazo).
En segundo lugar, la mayorÃa de los enfoques de deepfake (y esto es ciertamente el caso con DeepFaceLab, el software utilizado por los practicantes mÃĄs populares o notorios) tienen una capacidad limitada para replicar los âmÃĄrgenes finalesâ de la cara, como las ÃĄreas de los pÃģmulos y la mandÃbula, y estÃĄn limitados por el hecho de que su cÃģdigo upstream (2017) no abordÃģ extensivamente este problema.
En los casos en que las identidades no coinciden bien, el algoritmo de deepfake debe âpintarâ ÃĄreas de fondo alrededor de la cara, lo que hace de manera torpe incluso en las manos de los mejores deepfakers, como Ctrl Shift Face, cuyo contenido se utilizÃģ en los estudios del artÃculo.

Lo mejor de lo mejor: fotogramas de un video de deepfake de la aclamada deepfaker Ctrl-Shift-Face, intercambiando a Jim Carrey sobre Gary Oldman. Este trabajo representa probablemente algunos de los mejores resultados actuales disponibles a travÃĐs de DeepFaceLab y tÃĐcnicas de post-procesamiento. Sin embargo, los intercambios siguen limitados a la atenciÃģn relativamente escasa que DFL presta a la cara exterior, lo que requiere un esfuerzo hercÚleo de curaciÃģn de datos y entrenamiento para abordar los contornos mÃĄs externos. Fuente: https://www.youtube.com/watch?v=x8igrh1eyLk
Esta âastuciaâ o desviaciÃģn de la atenciÃģn en gran medida escapa a la atenciÃģn pÚblica en la actual preocupaciÃģn por el creciente realismo de los deepfakes, porque nuestras facultades crÃticas sobre los deepfakes aÚn estÃĄn en desarrollo mÃĄs allÃĄ de la etapa de âshock y asombroâ.
Identidades divididas
El nuevo artÃculo seÃąala que la mayorÃa de los mÃĐtodos anteriores de detecciÃģn de deepfake se basan en artefactos que delatan el proceso de intercambio, como posiciones de cabeza inconsistentes y parpadeo, entre numerosas otras tÃĐcnicas. Solo esta semana, otro nuevo artÃculo de detecciÃģn de deepfake ha propuesto utilizar la âfirmaâ de los diferentes tipos de modelos en el marco de FaceSwap para ayudar a identificar videos falsificados creados con ÃĐl (ver imagen a continuaciÃģn).

Identificando deepfakes caracterizando las firmas de los diferentes tipos de modelos en el marco de FaceSwap. Fuente: https://arxiv.org/pdf/2202.12951.pdf
Por contraste, la arquitectura de ICT crea dos identidades anidadas separadas para una persona, cada una de las cuales debe ser verificada antes de que se concluya que la identidad completa es âverdaderaâ o falsa.

Arquitectura para las fases de entrenamiento y prueba de ICT.
La divisiÃģn de identidades se facilita mediante un Transformer de visiÃģn, que realiza la identificaciÃģn facial antes de dividir las regiones examinadas en tokens que pertenecen a las identidades interior o exterior.

Distribuyendo parches entre los dos significadores de identidad paralelos.
El artÃculo establece:
âDesafortunadamente, los mÃĐtodos de verificaciÃģn de caras existentes tienden a caracterizar la regiÃģn mÃĄs discriminativa, es decir, la cara interior para la verificaciÃģn y no capturan la informaciÃģn de identidad en la cara exterior. Con Identity Consistency Transformer, entrenamos un modelo para aprender un par de vectores de identidad, uno para la cara interior y otro para la cara exterior, diseÃąando un Transformer tal que las identidades interior y exterior puedan aprenderse simultÃĄneamente en un modelo unificado.â
Dado que no existe un modelo existente para este protocolo de identificaciÃģn, los autores han ideado una nueva clase de pÃĐrdida de consistencia que puede actuar como una mÃĐtrica de autenticidad. Los âtokens internosâ y âtokens externosâ que resultan del modelo de extracciÃģn de identidad se agregan a los incrustaciones de parches producidos por marcos de identificaciÃģn facial.
Datos y entrenamiento
La red ICT se entrenÃģ en el conjunto de datos MS-Celeb-1M de Microsoft Research, que contiene 10 millones de imÃĄgenes de caras de celebridades que cubren un millÃģn de identidades, incluyendo actores, polÃticos y muchos otros tipos de figuras prominentes. SegÚn el procedimiento del mÃĐtodo anterior Face X-ray (otra iniciativa de Microsoft Research), la rutina de generaciÃģn de deepfakes de ICT intercambia regiones internas y externas de caras del conjunto de datos para crear material sobre el que probar el algoritmo.
Para realizar estos intercambios internos, ICT identifica dos imÃĄgenes en el conjunto de datos que exhiben posiciones de cabeza y rasgos faciales similares, genera una regiÃģn de mÃĄscara de las caracterÃsticas centrales (en la que se puede realizar un intercambio) y realiza un intercambio de deepfake con correcciÃģn de color RGB.
La razÃģn por la que ICT se limita a la identificaciÃģn de celebridades es que depende (en su variaciÃģn mÃĄs efectiva) de un conjunto de referencia novel que incorpora vectores faciales derivados de un corpus central (en este caso MS-Celeb-1M, aunque la referencia podrÃa extenderse a la imagen de red disponible, lo que solo probablemente existirÃa en calidad y cantidad suficientes para figuras pÚblicas bien conocidas).
Estos pares de vectores derivados actÚan como tokens de autenticidad para verificar las regiones de la cara interior y exterior en conjunto.
Los autores seÃąalan que los tokens obtenidos de estos mÃĐtodos representan âcaracterÃsticas de alto nivelâ, lo que resulta en un proceso de detecciÃģn de deepfake que es mÃĄs probable que sobreviva en entornos desafiantes, como video de baja resoluciÃģn o degradado de otra manera.
Crucialmente, ICT no busca evidencia basada en artefactos, sino que se centra en mÃĐtodos de verificaciÃģn de identidad mÃĄs acordes con tÃĐcnicas de reconocimiento facial â un enfoque que es difÃcil con datos de bajo volumen, como es el caso de la investigaciÃģn de incidentes de deepfake revenge porn contra objetivos no famosos.
Pruebas
Entrenado en MS-Celeb-1M, ICT se dividiÃģ en versiones asistidas por referencia y âciegasâ del algoritmo, y se probÃģ contra una serie de conjuntos de datos y mÃĐtodos competidores. Estos incluyeron FaceForensics++ (FF++), un conjunto de datos de 1000 videos autÃĐnticos y de deepfake creados a travÃĐs de cuatro mÃĐtodos, incluyendo Face2Face y FaceSwap; la detecciÃģn de deepfake de Google Deepfake Detection (DFD), que tambiÃĐn consta de miles de videos de deepfake generados por Google; Celeb-DeepFake v1 (CD1), que cuenta con 408 videos reales y 795 sintetizados de baja artifacto; Celeb-DeepFake v2, una extensiÃģn de V1 que contiene 590 videos reales y 5,639 falsos; y el conjunto de datos Deeper-Forensics (Deeper) de China de 2020.
Esos son los conjuntos de datos; los mÃĐtodos de detecciÃģn en los desafÃos de prueba fueron Multi-task, MesoInc4, Capsule, Xception-c0, c2 (un mÃĐtodo empleado en FF++), FWA/DSP-FW de la Universidad de Albany, Two-Branch, PCL+I2G, y el mÃĐtodo de discrepancia de contexto de Yuval Nirkin.
Los mÃĐtodos de detecciÃģn mencionados anteriormente estÃĄn dirigidos a detectar tipos especÃficos de manipulaciÃģn facial. AdemÃĄs de estos, los autores del nuevo artÃculo probaron ofertas de detecciÃģn de deepfake mÃĄs generales Face X-ray, FFD de la Universidad Estatal de Michigan, CNNDetection y Patch-Forensics de MIT CSAIL.
El resultado mÃĄs evidente de la prueba es que los mÃĐtodos competidores disminuyen drÃĄsticamente en eficacia a medida que la resoluciÃģn y la calidad del video disminuyen. Dado que algunas de las posibles consecuencias mÃĄs graves de la penetraciÃģn de los deepfakes en nuestros poderes discriminatorios se encuentran (no menos en este momento) en video no HD o degradado de otra manera, esto parece ser un resultado significativo.

En el grÃĄfico de resultados anterior, las lÃneas azul y roja indican la resistencia de los mÃĐtodos de ICT a la degradaciÃģn de la imagen en todas las ÃĄreas excepto el obstÃĄculo del ruido gaussiano (no una probabilidad en footage de Zoom y webcam), mientras que la confiabilidad de los mÃĐtodos competidores disminuye.
En la tabla de resultados a continuaciÃģn, vemos la eficacia de los diferentes mÃĐtodos de detecciÃģn de deepfake en los conjuntos de datos no vistos. Los resultados gris y asteriscados indican comparaciones de resultados publicados originalmente en proyectos de cÃģdigo cerrado, que no pueden verificarse externamente. En la mayorÃa de los marcos comparables, ICT supera a los enfoques de detecciÃģn de deepfake rivales (que se muestran en negrita) en los conjuntos de datos probados.

Como prueba adicional, los autores ejecutaron contenido del canal de YouTube del aclamado deepfaker Ctrl Shift Face, y encontraron que los mÃĐtodos competidores lograron puntajes de identificaciÃģn notablemente inferiores:

Es notable que los mÃĐtodos de FF++ (Xception-c23) y FFD, que logran algunos de los puntajes mÃĄs altos en algunos de los datos de prueba en las pruebas generales del nuevo artÃculo, aquà logran un puntaje mucho mÃĄs bajo que ICT en un contexto ârealâ de contenido de deepfake de alto esfuerzo.
Los autores concluyen el artÃculo con la esperanza de que sus resultados orienten a la comunidad de detecciÃģn de deepfake hacia iniciativas similares que se centren en caracterÃsticas de alto nivel mÃĄs fÃĄciles de generalizar, y alejarse de la âguerra frÃaâ de la detecciÃģn de artefactos, en la que los Últimos mÃĐtodos son rutinariamente obviados por desarrollos en marcos de deepfake, o por otros factores que hacen que estos mÃĐtodos sean menos resilientes.
Consulte el video complementario que acompaÃąa a continuaciÃģn para mÃĄs ejemplos de ICT que identifican contenido de deepfake que a menudo supera a los mÃĐtodos alternativos.
Â
Â
Publicado por primera vez el 4 de marzo de 2022.












