Ángulo de Anderson

GAN como renderizador de caras para CGI “tradicional”

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

OpiniÃģn Cuando las Redes Adversarias Generativas (GAN) demostraron por primera vez su capacidad para reproducir caras 3D realistas de manera impresionante, el avance desencadenÃģ una fiebre del oro para el potencial no explotado de las GAN para crear videos temporales consistentes con caras humanas.

En algÚn lugar del espacio latente de la GAN, parecía que debía haber un orden y una lÃģgica racional ocultos – un esquema de lÃģgica semÃĄntica nascente, enterrado en los cÃģdigos latentes, que permitiría a una GAN generar vistas y interpretaciones mÚltiples consistentes (como cambios de expresiÃģn) de la misma cara – y ofrecería un mÃĐtodo de video profundo convincente que dejaría a los autoencoders fuera del agua.

La salida de alta resoluciÃģn sería trivial en comparaciÃģn con los entornos de baja resoluciÃģn en los que las limitaciones de la GPU obligan a DeepFaceLab y FaceSwap a operar, mientras que la “zona de intercambio” de una cara (en flujos de trabajo de autoencoders) se convertiría en la “zona de creaciÃģn” de una GAN, informada por un puÃąado de imÃĄgenes de entrada, o incluso solo una imagen.

No habría mÃĄs discrepancia entre las caras “de intercambio” y “de host”, porque la totalidad de la imagen se generaría desde cero, incluyendo el cabello, las líneas de la mandíbula y las extremidades mÃĄs externas de los rasgos faciales, que a menudo resultan un desafío para los deepfakes “tradicionales” de autoencoders.

El invierno de video facial GAN

ResultÃģ que no iba a ser tan fÃĄcil. En Última instancia, la desentanglement resultÃģ ser el problema central y sigue siendo el desafío principal. ÂŋCÃģmo se puede mantener una identidad facial distinta y cambiar su pose o expresiÃģn sin reunir un corpus de miles de imÃĄgenes de referencia que enseÃąen a una red neuronal quÃĐ sucede cuando se realizan estos cambios, de la misma manera que los sistemas de autoencoders lo hacen de manera laboriosa?

En lugar de eso, el pensamiento posterior en la investigaciÃģn de síntesis y actuaciÃģn facial GAN fue que una identidad de entrada podría ser sometida a transformaciones genÃĐricas, templadas y teleolÃģgicas que no son específicas de la identidad. Un ejemplo de esto sería aplicar una expresiÃģn a una cara GAN que no estuviera presente en ninguna de las imÃĄgenes de esa persona que la GAN conoce.

A partir del artículo de 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space, se aplican expresiones templadas a una cara de entrada del conjunto de datos FFHQ. Fuente: https://arxiv.org/pdf/2205.06102.pdf

A partir del artículo de 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space, se aplican expresiones templadas a una cara de entrada del conjunto de datos FFHQ. Fuente: https://arxiv.org/pdf/2205.06102.pdf

Es obvio que un enfoque “de un tamaÃąo para todos” no puede cubrir la diversidad de expresiones faciales Únicas de un individuo. Nos preguntamos si una sonrisa tan Única como la de Jack Nicholson o Willem Dafoe podría recibir una interpretaciÃģn fiel bajo la influencia de tales cÃģdigos latentes de “promedio de expresiÃģn”.

ÂŋQuiÃĐn es este encantador extraÃąo latino? Aunque el mÃĐtodo GAN produce una cara mÃĄs realista y de mayor resoluciÃģn, la transformaciÃģn no estÃĄ informada por mÚltiples imÃĄgenes del mundo real del actor, como es el caso con DeepFaceLab, que se entrena extensivamente y a menudo a expensas de una base de datos de miles de tales imÃĄgenes. Aquí (fondo) un modelo DeepFaceLab se importa a DeepFaceLive, una implementaciÃģn de streaming del software popular y controvertido. Ejemplos de https://www.youtube.com/watch?v=9tr35y-yQRY (2022) y https://arxiv.org/pdf/2205.06102.pdf.

ÂŋQuiÃĐn es este encantador extraÃąo latino? Aunque el mÃĐtodo GAN produce una cara mÃĄs realista y de mayor resoluciÃģn, la transformaciÃģn no estÃĄ informada por mÚltiples imÃĄgenes del mundo real del actor, como es el caso con DeepFaceLab, que se entrena extensivamente en una base de datos de miles de tales imÃĄgenes, y en consecuencia, la semejanza se ve comprometida. Aquí (fondo) un modelo DeepFaceLab se importa a DeepFaceLive, una implementaciÃģn de streaming del software popular y controvertido. Ejemplos de https://www.youtube.com/watch?v=9tr35y-yQRY (2022) y https://arxiv.org/pdf/2205.06102.pdf.

Se han presentado varios editores de expresiones faciales GAN en los Últimos aÃąos, la mayoría de ellos tratando con identidades desconocidas, donde la fidelidad de las transformaciones es imposible de conocer para el lector casual, ya que estas no son caras familiares.

Identidades oscuras transformadas en la oferta de 2020 Cascade-EF-GAN. Fuente: https://arxiv.org/pdf/2003.05905.pdf

Identidades oscuras transformadas en la oferta de 2020 Cascade-EF-GAN. Fuente: https://arxiv.org/pdf/2003.05905.pdf

QuizÃĄs el editor de caras GAN que ha recibido mÃĄs interÃĐs (y citas) en los Últimos tres aÃąos es InterFaceGAN, que puede realizar travesías en el espacio latente en cÃģdigos latentes relacionados con la pose (ÃĄngulo de la cÃĄmara/cara), expresiÃģn, edad, raza, gÃĐnero y otras cualidades esenciales.

Las capacidades de “morfo” de estilo de los aÃąos 80 de InterFaceGAN y marcos similares son principalmente una forma de ilustrar el camino hacia la transformaciÃģn mientras se reprojeta una imagen a travÃĐs de un cÃģdigo latente apropiado (como “edad”). En tÃĐrminos de producir metraje de video con continuidad temporal, tales esquemas hasta la fecha han calificado como “desastres impresionantes”.

Si se suma a eso la dificultad de crear cabello temporalmente coherente, y el hecho de que la tÃĐcnica de exploraciÃģn/manipulaciÃģn de cÃģdigos latentes no tiene directrices temporales innatas para trabajar (y es difícil saber cÃģmo inyectar tales directrices en un marco diseÃąado para acomodar y generar imÃĄgenes fijas, y que no tiene provisiÃģn nativa para la salida de video), podría ser lÃģgico concluir que GAN no es Todo lo que Necesitas â„Ē para la síntesis de video facial.

Por lo tanto, esfuerzos posteriores han producido mejoras incrementales en la desentanglement, mientras que otros han agregado otras convenciones en visiÃģn por computadora como una “capa de orientaciÃģn”, como el uso de segmentaciÃģn semÃĄntica como mecanismo de control en el artículo de finales de 2021 paper SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing.

SegmentaciÃģn semÃĄntica como mÃĐtodo de instrumentalidad del espacio latente en SemanticStyleGAN. Fuente: https://semanticstylegan.github.io/

SegmentaciÃģn semÃĄntica como mÃĐtodo de instrumentalidad del espacio latente en SemanticStyleGAN. Fuente: https://semanticstylegan.github.io/

OrientaciÃģn paramÃĐtrica

La comunidad de investigaciÃģn de síntesis facial GAN se dirige cada vez mÃĄs hacia el uso de caras CGI paramÃĐtricas “tradicionales” como un mÃĐtodo para guiar y dar orden a los cÃģdigos latentes impresionantes pero indisciplinados en el espacio latente de una GAN.

Aunque los primitivos faciales paramÃĐtricos han sido un elemento bÃĄsico de la investigaciÃģn en visiÃģn por computadora durante mÃĄs de veinte aÃąos, el interÃĐs en este enfoque ha crecido en los Últimos tiempos, con el uso creciente de primitivos CGI Skinned Multi-Person Linear Model (SMPL), un enfoque pionero del Instituto Max Planck y ILM, y desde entonces mejorado con el marco Sparse Trained Articulated Human Body Regressor (STAR).

SMPL (en este caso una variante llamada SMPL-X) puede imponer una malla paramÃĐtrica CGI que se ajusta a la pose estimada (incluyendo expresiones, segÚn sea necesario) de la totalidad del cuerpo humano representado en una imagen, lo que permite realizar nuevas operaciones en la imagen utilizando la malla paramÃĐtrica como una guía volumÃĐtrica o perceptual. Fuente: https://arxiv.org/pdf/1904.05866.pdf

SMPL (en este caso una variante llamada SMPL-X) puede imponer una malla paramÃĐtrica CGI que se ajusta a la pose estimada (incluyendo expresiones, segÚn sea necesario) de la totalidad del cuerpo humano representado en una imagen, lo que permite realizar nuevas operaciones en la imagen utilizando la malla paramÃĐtrica como una guía volumÃĐtrica o perceptual. Fuente: https://arxiv.org/pdf/1904.05866.pdf

El desarrollo mÃĄs aclamado en esta línea ha sido la iniciativa de Disney de 2019 Rendering with Style, que fusionÃģ el uso de mapas de textura tradicionales con imÃĄgenes generadas por GAN, en un intento de crear una salida animada mejorada y de estilo “deepfake”.

Lo antiguo se encuentra con lo nuevo en el enfoque híbrido de Disney para los deepfakes generados por GAN. Fuente: https://www.youtube.com/watch?v=TwpLqTmvqVk

Lo antiguo se encuentra con lo nuevo en el enfoque híbrido de Disney para los deepfakes generados por GAN. Fuente: https://www.youtube.com/watch?v=TwpLqTmvqVk

El enfoque de Disney impone facetas CGI tradicionalmente renderizadas en una red StyleGAN2 para “pintar” sujetos faciales humanos en â€œÃĄreas problemÃĄticas”, donde la coherencia temporal es un problema para la generaciÃģn de video – ÃĄreas como la textura de la piel.

El flujo de trabajo de Rendering with Style.

El flujo de trabajo de Rendering with Style.

Como la cabeza CGI paramÃĐtrica que guía este proceso se puede ajustar y cambiar para adaptarse al usuario, la cara generada por GAN puede reflejar esos cambios, incluyendo cambios de pose y expresiÃģn.

Aunque se diseÃąÃģ para casar la instrumentalidad de CGI con el realismo natural de las caras GAN, al final, los resultados demuestran lo peor de ambos mundos y todavía no logran mantener el cabello y la posiciÃģn de las características bÃĄsicas consistentes:

Un nuevo tipo de valle inquietante surge de Rendering with Style, aunque el principio todavía tiene algÚn potencial.

Un nuevo tipo de valle inquietante surge de Rendering with Style, aunque el principio todavía tiene algÚn potencial.

El artículo de 2020 paper StyleRig: Rigging StyleGAN for 3D Control over Portrait Images sigue un enfoque cada vez mÃĄs popular, con el uso de modelos de cara morfables tridimensionales (3DMM) como proxies para alterar características en un entorno StyleGAN, en este caso a travÃĐs de una red de ajuste llamada RigNet:

Los 3DMM se utilizan como proxies para interpretaciones del espacio latente en StyleRig. Fuente: https://arxiv.org/pdf/2004.00121.pdf

Los 3DMM se utilizan como proxies para interpretaciones del espacio latente en StyleRig. Fuente: https://arxiv.org/pdf/2004.00121.pdf

Sin embargo, como de costumbre con estas iniciativas, los resultados hasta la fecha parecen limitados a manipulaciones mínimas de pose y cambios de expresiÃģn “no informados”.

StyleRig mejora el nivel de control, aunque el cabello temporalmente coherente sigue siendo un desafío sin resolver. Fuente: https://www.youtube.com/watch?v=eaW_P85wQ9k

StyleRig mejora el nivel de control, aunque el cabello temporalmente coherente sigue siendo un desafío sin resolver. Fuente: https://www.youtube.com/watch?v=eaW_P85wQ9k

Salida similar se puede encontrar en el MOST-GAN de Mitsubishi Research, un artículo de 2021 paper que utiliza 3DMM no lineales como una arquitectura de desentanglement, pero que tambiÃĐn lucha por lograr un movimiento dinÃĄmico y coherente.

La investigaciÃģn mÃĄs reciente que intenta la instrumentalidad y la desentanglement es One-Shot Face Reenactment on Megapixels, que nuevamente utiliza cabezas paramÃĐtricas 3DMM como una interfaz amigable para StyleGAN.

En el flujo de trabajo de MegaFR de One-Shot Face Reenactment, la red realiza la síntesis facial combinando una imagen del mundo real invertida con parÃĄmetros tomados de un modelo 3DMM renderizado. Fuente: https://arxiv.org/pdf/2205.13368.pdf

En el flujo de trabajo de MegaFR de One-Shot Face Reenactment, la red realiza la síntesis facial combinando una imagen del mundo real invertida con parÃĄmetros tomados de un modelo 3DMM renderizado. Fuente: https://arxiv.org/pdf/2205.13368.pdf

OSFR pertenece a una clase creciente de editores de caras GAN que buscan desarrollar flujos de trabajo de ediciÃģn lineales al estilo Photoshop/After Effects, donde el usuario puede ingresar una imagen deseada en la que se pueden aplicar transformaciones, en lugar de buscar a travÃĐs del espacio latente para cÃģdigos latentes relacionados con una identidad.

Nuevamente, las expresiones paramÃĐtricas representan un mÃĐtodo general y no personalizado para inyectar expresiones, lo que conduce a manipulaciones que parecen “inquietantes” de una manera no siempre positiva.

Expresiones inyectadas en OSFR.

Expresiones inyectadas en OSFR.

Al igual que el trabajo anterior, OSFR puede inferir poses originales a partir de una sola imagen y tambiÃĐn realizar “frontalizaciÃģn”, donde una imagen con pose descentrada se traduce en una imagen de pasaporte:

Imagen original (arriba) y imÃĄgenes de pasaporte inferidas de una de las implementaciones de OSFR detalladas en el nuevo artículo.

Imagen original (arriba) y imÃĄgenes de pasaporte inferidas de una de las implementaciones de OSFR detalladas en el nuevo artículo.

En la prÃĄctica, este tipo de inferencia es similar a algunos de los principios de fotogrametría que subyacen a Neural Radiance Fields (NeRF), excepto que la geometría aquí debe definirse por una sola foto, en lugar de las 3-4 vistas que permiten a NeRF interpretar las poses intersticiales ausentes y crear escenas neurales 3D explorables que presentan humanos.

(Sin embargo, NeRF no es Todo lo que Necesitas â„Ē tampoco, ya que conlleva un conjunto casi completamente diferente de obstÃĄculos para GAN en tÃĐrminos de producciÃģn de síntesis de video facial)

ÂŋTiene GAN un lugar en la síntesis de video facial?

Lograr expresiones dinÃĄmicas y poses fuera de distribuciÃģn a partir de una sola imagen de origen parece ser una obsesiÃģn alquímica en la investigaciÃģn de síntesis facial GAN en este momento, principalmente porque las GAN son el Único mÃĐtodo actualmente capaz de producir caras neurales de alta resoluciÃģn y alta fidelidad: aunque los marcos de deepfake de autoencoder pueden entrenarse en una multitud de poses y expresiones del mundo real, deben operar en resoluciones de entrada/salida restringidas por VRAM, y requieren un “host”; mientras que NeRF estÃĄ igualmente restringido, y – a diferencia de los otros dos enfoques – actualmente no tiene metodologías establecidas para cambiar expresiones faciales y sufre de una ediciÃģn limitada en general.

Parece que la Única forma de avanzar para un sistema de síntesis de caras CGI/GAN preciso es que una nueva iniciativa encuentre alguna forma de ensamblar una entidad de identidad de mÚltiples fotos dentro del espacio latente, donde un cÃģdigo latente para la identidad de una persona no tenga que viajar todo el camino a travÃĐs del espacio latente para explotar parÃĄmetros de pose no relacionados, sino que pueda referirse a sus propias imÃĄgenes del mundo real como referencias para transformaciones.

Incluso en tal caso, o incluso si una red StyleGAN completa se entrenara en un conjunto de caras de una sola identidad (similar a los conjuntos de entrenamiento que utilizan los autoencoders), la lÃģgica semÃĄntica que falta probablemente aÚn necesitaría ser proporcionada por tecnologías auxiliares como la segmentaciÃģn semÃĄntica o las caras 3DMM paramÃĐtricas, que, en tal escenario, al menos tendrían mÃĄs material con el que trabajar.

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]