Ángulo de Anderson

Disney combina CGI con renderizado neural para abordar el ‘valle inquietante’

mm
Añade Unite.AI a tus fuentes preferidas en Google

La división de investigación de inteligencia artificial de Disney ha desarrollado un método híbrido para la simulación facial de calidad cinematográfica, combinando las fortalezas del renderizado neural facial con la consistencia de un enfoque basado en CGI.

El artículo pendiente se titula Renderizado con estilo: Combinando enfoques tradicionales y neuronales para el renderizado de caras de alta calidad, y se presenta en un nuevo video de 10 minutos en el canal de YouTube de Disney Research (incrustado al final de este artículo*).

Mallas combinadas con renderizados faciales neuronales. Fuente: https://www.youtube.com/watch?v=k-RKSGbWLng

Mallas combinadas con renderizados faciales neuronales. Ver el video incrustado al final del artículo para más detalles y calidad. Fuente: https://www.youtube.com/watch?v=k-RKSGbWLng (sustituido por https://www.youtube.com/watch?v=TwpLqTmvqVk)

Como señala el video, el renderizado neural de caras (incluyendo deepfakes) puede producir ojos y interiores de la boca más realistas que los que puede producir el CGI, mientras que las texturas faciales impulsadas por CGI son más consistentes y adecuadas para la salida de efectos visuales de nivel cinematográfico.

Por lo tanto, Disney está experimentando con dejar que el generador neural StyleGan2 de NVIDIA maneje las características circundantes de una cara y los elementos ‘críticos para la vida’ como los ojos, mientras que superpone texturas faciales de CGI consistentes y elementos relacionados en la salida.

Del video (ver al final del artículo), el concepto arquitectónico detrás del enfoque híbrido de Disney, donde una malla de CGI de estilo antiguo, del tipo utilizado para recrear a 'joven' Carrie Fisher y al fallecido Peter Cushing para Rogue One (2016), se integra en entornos de caras renderizadas neuronalmente.

Del video (ver al final del artículo), el concepto arquitectónico detrás del enfoque híbrido de Disney, donde una malla de CGI de estilo antiguo, del tipo utilizado para recrear a ‘joven’ Carrie Fisher y al fallecido Peter Cushing para Rogue One (2016), se integra en entornos de caras renderizadas neuronalmente.

El video hace una referencia tácita a la frecuente crítica de la falta de autenticidad y el efecto ‘valle inquietante’ de la recreación de CGI del fallecido actor británico Peter Cushing en Rogue One (2016), concediendo:

‘[Hay] aún una gran brecha entre lo que la gente puede capturar y renderizar fácilmente y los dobles digitales fotorealistas finales, completos con cabello, ojos y boca interior. Para cerrar esta brecha, generalmente se requiere mucho trabajo manual de artistas habilidosos.’

En realidad, incluso los sistemas de captura facial más modernos no intentan recrear ojos, interiores de la boca o cabello, que tienen problemas de autenticidad en tales técnicas (ojos) o de consistencia temporal (cabello).

El video ilustra lo que los artistas de efectos visuales obtendrán después de una sesión de captura facial moderna típica. Los ojos, el cabello, el vello facial y los interiores de la boca tendrán que ser manejados por equipos separados en la línea de producción.

El video ilustra lo que los artistas de efectos visuales obtendrán después de una sesión de captura facial moderna típica. Los ojos, el cabello, el vello facial y los interiores de la boca tendrán que ser manejados por equipos separados en la línea de producción, además de la texturización y la iluminación.

Control de iluminación

El enfoque híbrido también es beneficioso con la reiluminación – un desafío notable para el renderizado neural de caras, ya que las superposiciones de piel de CGI pueden ser más fácilmente reiluminadas.

Una versión animada del enfoque CGI/Neural.

Una versión animada del enfoque CGI/Neural.

En entornos más desafiantes, como los rodajes exteriores, los investigadores han desarrollado un método de inpintura alrededor de una especie de zona desmilitarizada que rodea a la persona que se está ‘creando’.

Se genera un margen negro para permitir un 'lienzo' para la inpintura de las partes externas de la identidad y la integración de la piel de CGI en la salida combinada CGI/neural.

Se genera un margen negro para permitir un ‘lienzo’ para la inpintura de las partes externas de la identidad y la integración de la piel de CGI en la salida combinada CGI/neural.

El video señala:

‘[El] renderizado neural no coincide perfectamente con la restricción de fondo. – solo se pretende como una guía, ya que optimizar componentes humanos realistas como el cabello, los ojos y los dientes es el objetivo principal. Más desafiante es intentar mantener una identidad consistente, mientras se cambia la iluminación del entorno.’

Creación de mallas de CGI a partir de renderizados neuronales

El equipo de investigación también ha desarrollado un autoencoder variacional entrenado en una base de datos grande (no especificada) de imágenes de caras 3D, y afirma que puede producir ‘mallas de caras 3D aleatorias pero plausibles’ a partir de datos de verdad.

Hay limitaciones para que esta investigación supere, incluyendo la dificultad para mantener el cabello temporalmente consistente en los renderizados neuronales, y el video (ver más abajo) muestra varios ejemplos de cabello que muta rápidamente en un panorama consistente alrededor de una cara CGI/neural.

La consistencia temporal en el renderizado de video neural es un problema mucho más amplio que el de Disney, y parece probable que las iteraciones posteriores de este sistema puedan recurrir a agregar cabello ‘en post’, o a varios enfoques posibles para la generación de cabello que no confíen en que un enfoque neural novel eventualmente lo resuelva.

Usos para la generación de conjuntos de datos

El método se propone también como un método potencial para generar datos sintéticos y enriquecer el paisaje de conjuntos de imágenes faciales, que en años recientes se ha vuelto peligrosamente monótono.

Disney prevé que la nueva técnica poblará conjuntos de datos de imágenes faciales.

Disney prevé que la nueva técnica poblará conjuntos de datos de imágenes faciales.

‘[Cada] resultado fotorealista que generamos tiene una geometría subyacente y mapas de apariencia correspondientes, renderizados desde puntos de vista de cámara desconocidos con iluminación conocida. Esta información de ‘verdad’ puede ser vital para entrenar aplicaciones posteriores, como la reconstrucción de caras 3D monocular, el reconocimiento facial o la comprensión de escenas. Y así, cada renderizado de resultados podría considerarse una muestra de datos, y podemos generar muchas variaciones de diferentes individuos.

‘Además, incluso para una sola persona renderizada en una sola expresión con un solo punto de vista y iluminación, podemos generar variaciones aleatorias del renderizado fotorealista variando la semilla de randomización durante la optimización.’

Los investigadores señalan que esta diversidad de salida configurable podría ser útil para entrenar aplicaciones de reconocimiento facial, concluyendo:

‘[Nuestro] método puede aprovechar la tecnología actual para la captura, modelado y renderizado de la piel facial, y crear automáticamente renderizados de caras fotorealistas completos que coincidan con la identidad, expresión y configuración de escena deseada. Este enfoque tiene aplicaciones en el renderizado facial para cine y entretenimiento, ahorrando trabajo manual a los artistas y también para la generación de datos en diferentes campos del aprendizaje profundo.’

Para una mirada más profunda al nuevo enfoque, consulte el video de 10 minutos publicado hoy:

* El enlace de video original se sustituyó por otro aparentemente idéntico 8 horas después de que se publicó este artículo. Cambié todos los enlaces relevantes, ya que no hay rastro del video original.

 

8:24 GMT+2 – Reemplacé el video, ya que fue reemplazado por el canal de YouTube de Disney Research por alguna razón.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai