Ángulo de Anderson
Reestructuración de caras en videos con aprendizaje automático

Una colaboración de investigación entre China y el Reino Unido ha ideado un nuevo método para reestructurar caras en video. La técnica permite un convincente ensanchamiento y estrechamiento de la estructura facial, con alta consistencia y ausencia de artefactos.

De un video de YouTube utilizado como material de origen por los investigadores, la actriz Jennifer Lawrence aparece como una personalidad más demacrada (derecha). Ver el video acompañante incrustado al final del artículo para más ejemplos a mejor resolución. Fuente: https://www.youtube.com/watch?v=tA2BxvrKvjE
Este tipo de transformación suele ser posible solo a través de métodos tradicionales de CGI que necesitarían recrear completamente la cara a través de procedimientos detallados y costosos de captura de movimiento, rigging y texturizado.
En cambio, lo que hay de CGI en la técnica se integra en una canalización neural como información facial paramétrica 3D que se utiliza posteriormente como base para un flujo de trabajo de aprendizaje automático.

Las caras paramétricas tradicionales se utilizan cada vez más como directrices para procesos transformadores que utilizan IA en lugar de CGI. Fuente: https://arxiv.org/pdf/2205.02538.pdf
Los autores afirman:
‘Nuestro objetivo es generar resultados de reestructuración de video de retrato de alta calidad editando la forma general de las caras de los retratos según la deformación facial natural en el mundo real. Esto se puede utilizar para aplicaciones como la generación de caras hermosas para embellecimiento y la exageración de caras para efectos visuales.’
Aunque la distorsión y deformación de caras en 2D ha estado disponible para los consumidores desde la aparición de Photoshop (y ha llevado a extrañas y a menudo inaceptables subculturas alrededor de la distorsión facial y la dismorfia corporal), es un truco difícil de realizar en video sin utilizar CGI.

Las dimensiones faciales de Mark Zuckerberg se expanden y se reducen con la nueva técnica china-británica.
La reestructuración del cuerpo es actualmente un campo de intenso interés en el sector de la visión por computadora, principalmente debido a su potencial en la moda de comercio electrónico, aunque hacer que alguien parezca más alto o diverso esqueléticamente es actualmente un notable desafío.
De manera similar, cambiar la forma de una cabeza en metraje de video de manera coherente y convincente ha sido el tema de trabajos previos de los investigadores del nuevo documento, aunque esa implementación sufrió de artefactos y otras limitaciones. La nueva oferta amplía la capacidad de esa investigación previa de salida estática a salida de video.
El nuevo sistema se entrenó en una PC de escritorio con un AMD Ryzen 9 3950X con 32GB de memoria, y utiliza un algoritmo de flujo óptico de OpenCV para mapas de movimiento, suavizado por el marco StructureFlow; la Red de Alineación Facial (FAN) componente para estimación de puntos de referencia, que también se utiliza en los paquetes de deepfakes populares; y el Ceres Solver para resolver desafíos de optimización.

Un ejemplo extremo de ensanchamiento facial con el nuevo sistema.
El documento se titula Reestructuración paramétrica de retratos en videos, y proviene de tres investigadores de la Universidad de Zhejiang, y uno de la Universidad de Bath.
Sobre la cara
Bajo el nuevo sistema, el video se extrae en una secuencia de imágenes, y se estima primero una pose rígida para cada cara. Luego, un número representativo de marcos posteriores se estima conjuntamente para construir parámetros de identidad consistentes a lo largo de toda la secuencia de imágenes (es decir, los marcos del video).

Arquitectura del flujo del sistema de deformación facial.
Después de esto, se evalúa la expresión, lo que produce un parámetro de reestructuración que se implementa mediante regresión lineal. A continuación, un enfoque de función de distancia firmada (SDF) novedoso construye un mapeo denso 2D de los lineamientos faciales antes y después de la reestructuración.
Finalmente, se realiza una optimización de deformación consciente del contenido en el video de salida.
Caras paramétricas
El proceso utiliza un Modelo de Cara Maleable 3D (3DMM), un adjunto cada vez más popular a sistemas de síntesis facial basados en neuronales y GAN, así como aplicable para sistemas de detección de deepfakes.

No del nuevo documento, pero un ejemplo de un Modelo de Cara Maleable 3D (3DMM) – una cara paramétrica de prototipo utilizada en el nuevo proyecto. Arriba a la izquierda, aplicación de puntos de referencia en un 3DMM. Arriba a la derecha, los vértices de malla 3D de un isomap. Abajo a la izquierda, se muestra la coincidencia de puntos de referencia; abajo en el medio, un isomap de la textura facial extraída; y abajo a la derecha, un ajuste y forma resultantes. Fuente: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
El flujo de trabajo del nuevo sistema debe considerar casos de oclusión, como una instancia en la que el sujeto se aleja. Esto es uno de los mayores desafíos en el software de deepfakes, ya que los puntos de referencia de FAN tienen poca capacidad para dar cuenta de estos casos, y tienden a erosionar en calidad a medida que la cara se aleja o se oculta.
El nuevo sistema puede evitar esta trampa definiendo una energía de contorno que es capaz de coincidir con el límite entre la cara 3D (3DMM) y la cara 2D (definida por los puntos de referencia de FAN).
Optimización
Una implementación útil para tal sistema sería implementar la deformación en tiempo real, por ejemplo, en filtros de videoconferencia. El marco actual no permite esto, y los recursos informáticos necesarios harían que la deformación ‘en vivo’ fuera un desafío notable.
Según el documento, y asumiendo un objetivo de video de 24fps, las operaciones por marco en la canalización representan una latencia de 16,344 segundos por cada segundo de metraje, con golpes adicionales de un solo uso para la estimación de identidad y la deformación facial 3D (321ms y 160ms, respectivamente).
Por lo tanto, la optimización es clave para hacer progresos hacia la reducción de la latencia. Dado que la optimización conjunta en todos los marcos agregaría una sobrecarga severa al proceso, y la optimización de estilo de inicialización (presuponiendo la identidad consistente del hablante desde el primer marco) podría llevar a anomalías, los autores han adoptado un esquema disperso para calcular los coeficientes de los marcos muestreados a intervalos prácticos.
La optimización conjunta se realiza luego en este subconjunto de marcos, lo que lleva a un proceso de reconstrucción más delgado.
Deformación facial
La técnica de deformación utilizada en el proyecto es una adaptación del trabajo de los autores de 2020 Retratos profundos y bien formados (DSP).

Retratos profundos y bien formados, una presentación de 2020 a ACM Multimedia. El documento está liderado por investigadores del ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Fuente: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
Los autores observan ‘Ampliamos este método desde la reestructuración de una sola imagen monocular a la reestructuración de toda la secuencia de imágenes.’
Pruebas
El documento observa que no había material previo comparable con el que evaluar el nuevo método. Por lo tanto, los autores compararon marcos de su salida de video deformada con la salida estática de DSP.

Poniendo a prueba el nuevo sistema contra imágenes estáticas de Retratos profundos y bien formados.
Los autores señalan que los artefactos resultan del método DSP, debido a su uso de mapeo disperso – un problema que el nuevo marco resuelve con mapeo denso. Además, el video producido por DSP, según el documento, demuestra falta de suavidad y coherencia visual.
Los autores afirman:
‘Los resultados muestran que nuestro enfoque puede producir de manera robusta videos de retrato reestructurados coherentes mientras que el método basado en imágenes puede llevar fácilmente a artefactos de parpadeo notables.’
Ver el video acompañante a continuación, para más ejemplos:
Publicado por primera vez el 9 de mayo de 2022. Enmendado a las 18:00 EET, reemplazado ‘campo’ con ‘función’ para SDF.












