Ángulo de Anderson

Alterando Emociones en Vídeos con IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de Grecia y el Reino Unido han desarrollado un enfoque de aprendizaje profundo novedoso para cambiar las expresiones y el estado de ánimo aparente de las personas en vídeos, mientras preservan la fidelidad de los movimientos de los labios con respecto al audio original de una manera que los intentos anteriores no han podido igualar.

Del vídeo que acompaña al artículo (incrustado al final de este artículo), un breve clip del actor Al Pacino con su expresión alterada sutilmente por NED, basado en conceptos semánticos de alto nivel. Fuente: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Del vídeo que acompaña al artículo (incrustado al final de este artículo), un breve clip del actor Al Pacino con su expresión alterada sutilmente por NED, basado en conceptos semánticos de alto nivel que definen expresiones faciales individuales y sus emociones asociadas. El método ‘Reference-Driven’ de la derecha toma la emoción interpretada de un vídeo fuente y la aplica a toda la secuencia de vídeo. Fuente: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Este campo en particular cae en la categoría en crecimiento de emociones deepfaked, donde se preserva la identidad del hablante original, pero se alteran sus expresiones y microexpresiones. A medida que esta tecnología de IA madura, ofrece la posibilidad de que las producciones de cine y televisión realicen alteraciones sutiles en las expresiones de los actores, pero también abre una categoría bastante nueva de ‘vídeos deepfaked con emociones alteradas’.

Cambiar Rostros

Las expresiones faciales de figuras públicas, como políticos, están rigurosamente curadas; en 2016, las expresiones faciales de Hillary Clinton estuvieron bajo una intensa escrutinio de los medios por su posible impacto negativo en sus perspectivas electorales; las expresiones faciales, resulta, también son un tema de interés para el FBI; y son un indicador crítico en las entrevistas de trabajo, lo que hace que la perspectiva de un filtro de control de expresiones en vivo sea un desarrollo deseable para los solicitantes de empleo que intentan pasar una preselección en Zoom.

Un estudio de 2005 del Reino Unido afirmó que la apariencia facial afecta las decisiones de votación, mientras que una característica de 2019 de The Washington Post examinó el uso de clips de vídeo ‘fuera de contexto’, que es actualmente la cosa más cercana que los defensores de las noticias falsas tienen para cambiar cómo una figura pública parece estar comportándose, respondiendo o sintiendo.

Hacia la Manipulación Neural de la Expresión

En este momento, el estado del arte en la manipulación de la afectividad facial es bastante rudimentario, ya que implica abordar la desentrelazamiento de conceptos de alto nivel (como triste, enojado, feliz, sonriente) de contenido de vídeo real. Aunque las arquitecturas de deepfakes tradicionales parecen lograr este desentrelazamiento bastante bien, reflejar emociones en diferentes identidades aún requiere que dos conjuntos de datos faciales de entrenamiento contengan expresiones coincidentes para cada identidad.

Debido a que las características de identidad facial y pose están actualmente tan entretejidas, se necesita una amplia paridad de expresión, pose de cabeza y (en menor medida) iluminación en dos conjuntos de datos faciales para entrenar un modelo de deepfake efectivo en sistemas como DeepFaceLab. Cuanto menos se presente una configuración particular (como 'vista lateral/sonriente/iluminada') en ambos conjuntos de datos, menos precisamente se renderizará en un vídeo deepfake, si es necesario.

Ejemplos típicos de imágenes faciales en conjuntos de datos utilizados para entrenar deepfakes. Actualmente, solo se puede manipular la expresión facial de una persona creando rutas de expresión a expresión específicas de la identidad en una red neuronal de deepfake. El software de deepfake de 2017 no tiene una comprensión intrínseca, semántica de una ‘sonrisa’ – simplemente asigna y coincide con los cambios percibidos en la geometría facial en los dos sujetos.

Lo que es deseable y no se ha logrado perfectamente es reconocer cómo sonríe el sujeto B (por ejemplo) y simplemente crear un ‘interruptor de sonrisa’ en la arquitectura, sin necesidad de asignarlo a una imagen equivalente del sujeto A sonriendo.

El nuevo artículo se titula Director de Emociones Neurales: control semántico de expresiones faciales en vídeos ‘in-the-wild’, y proviene de investigadores de la Escuela de Ingeniería Eléctrica y Computación de la Universidad Técnica Nacional de Atenas, el Instituto de Ciencias de la Computación de la Fundación para la Investigación y la Tecnología Hellas (FORTH), y la Facultad de Ingeniería, Matemáticas y Ciencias Físicas de la Universidad de Exeter en el Reino Unido.

El equipo ha desarrollado un marco llamado Director de Emociones Neurales (NED), que incorpora una red de traducción de emociones basada en 3D, Manipulador de Emociones Basado en 3D.

NED toma una secuencia recibida de parámetros de expresión y los traduce a un dominio objetivo. Se entrena en datos no pareados, lo que significa que no es necesario entrenar en conjuntos de datos donde cada identidad tenga expresiones faciales coincidentes.

El vídeo, mostrado al final de este artículo, pasa por una serie de pruebas donde NED impone un estado emocional aparente en footage de la base de datos de YouTube.

El vídeo, mostrado al final de este artículo, pasa por una serie de pruebas donde NED impone un estado emocional aparente en footage de la base de datos de YouTube.

Los autores afirman que NED es el primer método basado en vídeo para ‘dirigir’ a actores en situaciones aleatorias e impredecibles, y han hecho que el código esté disponible en la página del proyecto.

Método y Arquitectura

El sistema se entrena en dos grandes conjuntos de datos de vídeo que han sido anotados con etiquetas de ’emoción’.

La salida se habilita a través de un renderizador de caras de vídeo que renderiza la emoción deseada en el vídeo utilizando técnicas tradicionales de síntesis de imágenes faciales, incluyendo segmentación de caras, alineación de puntos de referencia faciales y mezcla, donde solo se sintetiza el área facial y luego se impone sobre el metraje original.

La arquitectura para la canalización del Detector de Emociones Neurales (NED). Fuente: https://arxiv.org/pdf/2112.00585.pdf

La arquitectura para la canalización del Detector de Emociones Neurales (NED). Fuente: https://arxiv.org/pdf/2112.00585.pdf

Inicialmente, el sistema obtiene la recuperación facial en 3D y impone alineaciones de puntos de referencia faciales en los fotogramas de entrada para identificar la expresión. Después de esto, estos parámetros de expresión recuperados se pasan al Manipulador de Emociones Basado en 3D, y un vector de estilo se calcula mediante un etiqueta semántica (como ‘feliz’) o por un archivo de referencia.

Un archivo de referencia es un vídeo que representa una expresión/emoción particular reconocida, que luego se impone en toda la secuencia de vídeo objetivo, intercambiando la expresión original.

Etapa en la canalización de transferencia de emoción, con varios actores muestreados de vídeos de YouTube.

Etapa en la canalización de transferencia de emoción, con varios actores muestreados de vídeos de YouTube.

La forma facial final generada en 3D se concatena con la Coordenada de Cara Normalizada Media (NMFC) y las imágenes de los ojos (los puntos rojos en la imagen de arriba), y se pasa al renderizador neuronal, que realiza la manipulación final.

Resultados

Los investigadores realizaron estudios exhaustivos, incluyendo estudios de usuario y ablación, para evaluar la efectividad del método en comparación con trabajos anteriores, y encontraron que en la mayoría de las categorías, NED supera el estado actual del arte en este subsector de la manipulación facial neural.

Los autores del artículo vislumbran que implementaciones posteriores de este trabajo, y herramientas de naturaleza similar, serán útiles principalmente en las industrias de la televisión y el cine, afirmando:

‘Nuestro método abre una gran cantidad de nuevas posibilidades para aplicaciones útiles de tecnologías de renderizado neural, que van desde la postproducción de películas y videojuegos hasta avatares afectivos fotorealistas.’

Este es un trabajo temprano en el campo, pero uno de los primeros en intentar la reencarnación facial con vídeo en lugar de imágenes fijas. Aunque los vídeos son esencialmente muchas imágenes fijas que se ejecutan muy rápido, hay consideraciones temporales que hacen que las aplicaciones anteriores de la transferencia de emociones sean menos efectivas. En el vídeo que acompaña al artículo y en los ejemplos del artículo, los autores incluyen comparaciones visuales de la salida de NED contra otros métodos comparables recientes.

Se pueden encontrar comparaciones más detalladas y muchos más ejemplos de NED en el vídeo completo a continuación:

 

3 de diciembre de 2021, 18:30 GMT+2 – A petición de uno de los autores del artículo, se realizaron correcciones con respecto al ‘archivo de referencia’, que yo afirmé erróneamente que era una foto fija (cuando en realidad es un clip de vídeo). También se realizó una enmienda al nombre del Instituto de Ciencias de la Computación de la Fundación para la Investigación y la Tecnología.
3 de diciembre de 2021, 20:50 GMT+2 – Una segunda solicitud de uno de los autores del artículo para una enmienda adicional al nombre de la institución mencionada anteriormente.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai