Ángulo de Anderson

Nuevo método de Deepfake resuelve el problema del ‘huésped facial’

mm
Añade Unite.AI a tus fuentes preferidas en Google

A pesar de varios años de hiperbolismo mediático sobre el potencial de las imágenes de deepfake para socavar nuestra fe de larga data en la autenticidad de las grabaciones de video, todos los métodos populares actuales dependen de encontrar ‘huéspedes faciales’ que sean ampliamente similares en forma a la cara objetivo.

Cuando el metraje original presenta una cara ancha, pero el sujeto objetivo tiene una cara estrecha, los resultados siempre han sido problemáticos, porque tal transferencia implica cortar parte de la cara original y reconstruir el fondo ahora expuesto. Los paquetes actuales como DeepFaceLab y FaceSwap pueden producir resultados limitados cuando la configuración se invierte (estrecho>ancho), pero no tienen la capacidad de abordar convincentemente este escenario.

Ahora, una colaboración entre Tencent y la Universidad de Xiamen en China ha desarrollado un nuevo enfoque, titulado HifiFace, diseñado para subsanar esta deficiencia.

Dos deepfakes de HifiFace, el primero de Anne Hathaway, donde se obtiene un buen parecido a pesar de la incompatibilidad de la forma de la cara del huésped. HifiFace también funciona bien con objetivos con gafas, tradicionalmente un obstáculo en los deepfakes. Fuente: https://arxiv.org/pdf/2106.09965.pdf

Dos deepfakes de HifiFace, el primero de Anne Hathaway, donde se obtiene un buen parecido a pesar de la incompatibilidad de la forma de la cara del huésped. HifiFace también funciona bien con objetivos con gafas, tradicionalmente un obstáculo en los deepfakes. Fuente: https://arxiv.org/pdf/2106.09965.pdf

Reconstruyendo una cara de Deepfake

Los enfoques anteriores, como Subject Agnostic Face Swapping and Reenactment (FSGAN) de 2019, han dependido de 3DMM fitting (3D Morphable Models) o otras metodologías basadas en el reconocimiento de rasgos faciales o la transformación, donde los rasgos faciales de la cara que se va a ‘sobreescribir’ dictan más o menos los límites del intercambio:

Fuente: https://github.com/Yinghao-Li/3DMM-fitting

Detección de rasgos faciales de 3DMM. Fuente: https://github.com/Yinghao-Li/3DMM-fitting

Aunque los métodos competidores han utilizado características derivadas de redes de reconocimiento facial, estas están principalmente dirigidas a reconstituir la textura en lugar de la estructura, y producen un efecto ‘como una máscara’ en casos donde la cara del huésped no es completamente compatible (es decir, los límites y la forma de la línea del cabello, la mandíbula y los pómulos).

Para abordar estos problemas, los investigadores chinos, con sede en el Laboratorio de Análisis y Computación de Medios de la Universidad, en el Departamento de Inteligencia Artificial, desarrollaron una red de extremo a extremo que regresa los coeficientes de la cara objetivo y la cara fuente utilizando un modelo de reconstrucción 3D, que se combina luego con información de vector de identidad de una red de reconocimiento facial.

Estos datos geométricos se alimentan luego a un modelo codificador-decodificador como información estructural, fusionándose con la expresión y la disposición de la cara objetivo, que se aprovechan como fuentes auxiliares para una transferencia precisa.

Fusión Facial Semántica

Además, HifiFace incluye un componente de Fusión Facial Semántica (SFF), que utiliza una característica de bajo nivel en el codificador para preservar la información espacial y de textura, sin sacrificar la identidad de la imagen objetivo. Las características del codificador y decodificador se integran en una máscara adaptativa aprendida, y la información de fondo se fusiona en la salida mediante la máscara facial aprendida.

HifiFace en acción. Fuente: https://johann.wang/HifiFace/

HifiFace en acción. Fuente: https://johann.wang/HifiFace/

De esta manera, HifiFace se aparta del uso de los límites de la cara original como límite duro, utilizando una segmentación semántica facial dilatada, donde el modelo puede realizar una fusión adaptativa mejor en los límites de la cara.

Dos enfoques anteriores (arriba y abajo a la izquierda), y la nueva arquitectura de HifiFace, que consiste en un codificador, decodificador, extractor de identidad con forma 3D y módulo SFF.

Dos enfoques anteriores (arriba y abajo a la izquierda), y la nueva arquitectura de HifiFace, que consiste en un codificador, decodificador, extractor de identidad con forma 3D y módulo SFF.

En una comparación con los métodos anteriores FSGAN, SimSwap y FaceShifter, HifiFace demuestra una reconstrucción superior de la forma de la cara, ya que no está aproximando elementos ‘fantasma’ donde las delimitaciones faciales confunden el mapeo de identidad, sino que las reconstruye definitivamente.

Pruebas

Los investigadores implementaron el sistema utilizando los conjuntos de datos VGGFace2 y DeepGlint Asian-Celeb. Las caras se alinearon mediante 5 puntos de referencia hacia afuera y se recortaron a 256×256 píxeles. También se utilizó una red de mejora de retrato para generar una versión de 512×512 píxeles, para un modelo de alta resolución adicional. El modelo se entrenó bajo Adam.

Aunque FaceShifter conserva bien la identidad, no puede abordar cuestiones como la expresión, el color y la occlusión de manera tan efectiva como HifiFace, y tiene una estructura de red más compleja. FSGAN tiene problemas para transferir la iluminación de la fuente al objetivo.

Los investigadores utilizan FaceForensics++ para comparaciones cuantitativas, muestreando diez cuadros cada uno en un lote de videos convertidos a través de los métodos competidores, y encontrando que HifiFace logró una puntuación de recuperación de identidad superior. Al probar una serie de otros factores, como la calidad de la imagen, los investigadores también encontraron que su método superó a las metodologías rivales.

Los rasgos faciales de Benedict Cumberbatch se reproducen fielmente.

Los rasgos faciales de Benedict Cumberbatch se reproducen fielmente.

El trabajo representa un paso más hacia la abstracción del material de origen para que sea solo una plantilla aproximada en la que se pueden transferir identidades precisas. Algunos de los paquetes actuales de FOSS, incluyendo DeepFaceLab, presentan funcionalidad incipiente para el reemplazo de toda la cabeza, pero, al igual que HifiFace, no tienen en cuenta el cabello, y son más efectivos para ‘construir’ una cara que para tallarla para que coincida con una fuente objetivo deseada.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai