Ángulo de Anderson
El amanecer de las emociones Deepfaked

Los investigadores han desarrollado una nueva técnica de aprendizaje automático para imponer arbitrariamente nuevas emociones en caras en video, adaptando tecnologías existentes que han surgido recientemente como soluciones para hacer coincidir los movimientos de los labios con la doblaje de un idioma extranjero.
La investigación es una colaboración igualitaria entre la Universidad del Noreste en Boston y el Laboratorio de Medios de la MIT, y se titula Frejas Invertibles: Traducción de Emociones Faciales de Video a Video. Aunque los investigadores admiten que la calidad inicial de los resultados debe desarrollarse a través de una investigación adicional, afirman que la técnica, llamada Wav2Lip-Emotion, es la primera de su tipo en abordar directamente la modificación de la expresión de todo el video a través de técnicas de redes neuronales.
El código base ha sido publicado en GitHub, aunque los puntos de control del modelo se agregarán al repositorio de código abierto más adelante, prometen los autores.

A la izquierda, un fotograma ‘triste’ del video de origen. A la derecha, un fotograma ‘feliz’. En el centro están dos enfoques nascentes para sintetizar emociones alternativas – fila superior: una cara completamente enmascarada donde toda la superficie de la expresión ha sido sustituida; fila inferior: un método Wav2Lip más tradicional, que solo sustituye la parte inferior de la cara. Fuente: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf
Un solo video como datos de origen
En teoría, tales manipulaciones son obtenibles ahora a través de un entrenamiento completo en repositorios de deepfakes tradicionales como DeepFaceLab o FaceSwap. Sin embargo, el flujo de trabajo estándar involucraría usar una identidad alternativa a la ‘identidad objetivo’, como un actor que imita a la identidad objetivo, cuyas propias expresiones se transferirían a otra persona, junto con el resto de la actuación. Además, las técnicas de clonación de voz de deepfake generalmente serían necesarias para completar la ilusión.
Además, cambiar realmente la expresión de target1>target1 en un solo video de origen bajo estos marcos populares implicaría cambiar los vectores de alineación facial de una manera que estas arquitecturas no facilitan actualmente.

Wav2Lip-Emotion mantiene la sincronización de los labios del diálogo de audio original del video mientras transforma las expresiones asociadas.
En cambio, Wav2Lip-Emotion busca efectivamente ‘copiar y pegar’ expresiones relacionadas con las emociones de una parte de un video y sustituirlas en otros puntos, con una frugalidad autoimpuesta de datos de origen que pretende ofrecer eventualmente un método de menor esfuerzo para la manipulación de expresiones.
Los modelos fuera de línea podrían desarrollarse más adelante que se entrenen en videos alternativos del hablante, lo que eliminaría la necesidad de que un video contenga un ‘paleta’ de estados de expresión con los que manipular el video.
Propósitos potenciales
Los autores sugieren una serie de aplicaciones para la modificación de expresiones, incluyendo un filtro de video en vivo para compensar los efectos del TEPT y los sufrientes de parálisis facial. El documento observa:
‘Las personas con o sin expresiones faciales inhibidas pueden beneficiarse de ajustar sus propias expresiones para adaptarse mejor a sus circunstancias sociales. Uno puede querer alterar las expresiones en los videos que se les muestran. Los hablantes pueden estar gritando entre sí durante una conferencia de video, pero sin embargo quieren recopilar el contenido de su intercambio sin las expresiones desagradables. O un director de cine puede querer aumentar o disminuir las expresiones de un actor.’
Dado que la expresión facial es un indicador clave y fundamental de la intención, incluso donde puede rozar contra las palabras habladas, la capacidad de alterar la expresión también ofrece, en cierta medida, la capacidad de cambiar cómo se recibe la comunicación.
Trabajo previo
El interés en la alteración de expresiones de aprendizaje automático se remonta al menos a 2012, cuando una colaboración entre Adobe, Facebook y la Universidad de Rutgers propuso un método para alterar expresiones utilizando un enfoque de reconstrucción de geometría 3D basada en tensor, que laboriosamente impuso una malla de CGI sobre cada fotograma de un video objetivo para efectuar el cambio.

La investigación de Adobe/Facebook de 2012 manipuló las expresiones imponiendo cambios tradicionales de CGI en metraje de video. Las expresiones podían ser aumentadas o suprimidas. Fuente: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf
Aunque los resultados fueron prometedores, la técnica era laboriosa y los recursos necesarios eran considerables. En ese momento, CGI estaba muy por delante de los enfoques basados en visión por computadora para la manipulación directa de características y píxeles.
Más relacionado con el nuevo documento es MEAD, un conjunto de datos y un modelo de generación de expresiones lanzado en 2020, capaz de generar videos de ‘cabeza hablante’, aunque sin el nivel de sofisticación que es potencialmente obtenible al modificar directamente el video de origen.

Generación de expresiones con MEAD, una colaboración entre SenseTime Research, Carnegie Mellon y tres universidades chinas. Fuente: https://wywu.github.io/projects/MEAD/MEAD.html
En 2018, otro documento, titulado GANimation: Animación facial anatómicamente consciente a partir de una sola imagen, surgió como una colaboración de investigación académica entre EE. UU. y España, y utilizó Redes Generativas Adversarias para aumentar o cambiar expresiones en imágenes fijas solamente.

Cambiando expresiones en imágenes fijas con GANimation. Fuente: https://arxiv.org/pdf/1807.09251.pdf
Wav2Lip-Emotion
En cambio, el nuevo proyecto se basa en Wav2Lip, que generó publicidad en 2020 al ofrecer un método potencial para re-sincronizar el movimiento de los labios para acomodar entrada de habla (o canción) que nunca se presentó en el video original.
La arquitectura original de Wav2Lip se entrenó en un corpus de oraciones habladas de los archivos de la BBC. Para adaptar Wav2Lip hacia la tarea de alteración de expresiones, los investigadores ‘afinaron’ la arquitectura en el conjunto de datos MEAD mencionado anteriormente.
MEAD consiste en 40 horas de video que presentan a 60 actores leyendo la misma oración mientras realizan una variedad de expresiones faciales. Los actores son de 15 países diferentes y ofrecen una gama de características internacionales destinadas a ayudar al proyecto (y a proyectos derivados) a producir una síntesis de expresiones aplicable y bien generalizada.
En el momento de la investigación, MEAD solo había lanzado la primera parte del conjunto de datos, que presentaba a 47 individuos que realizaban expresiones como ‘enojado’, ‘desdén’, ‘miedo’, ‘desprecio’, ‘feliz’, ‘triste’ y ‘sorprendido’. En este debut en un nuevo enfoque, los investigadores limitaron el alcance del proyecto a superponer o alterar las emociones percibidas ‘feliz’ y ‘triste’, ya que estas son las más fácilmente reconocibles.
Método y resultados
La arquitectura original de Wav2Lip solo reemplaza la sección inferior de la cara, mientras que Wav2Lip-Emotion también experimenta con una máscara de reemplazo facial completa y síntesis de expresiones. Por lo tanto, fue necesario que los investigadores modificaran adicionalmente los métodos de evaluación incorporados, ya que estos no estaban diseñados para una configuración de cara completa.
Los autores mejoran el código original al conservar la entrada de audio original, manteniendo la consistencia del movimiento de los labios.
El elemento generador cuenta con un codificador de identidad, un codificador de habla y un decodificador de cara, de acuerdo con el trabajo anterior. El elemento de habla se codifica adicionalmente como convoluciones 2D apiladas que se concatenan posteriormente a sus fotogramas asociados.
Además del elemento generativo, la arquitectura modificada cuenta con tres componentes principales de discriminadores, que apuntan a la calidad de la sincronización de los labios, un elemento objetivo de emoción y un objetivo de calidad visual entrenado de manera adversaria.
Para la reconstrucción de la cara completa, el trabajo original de Wav2Lip no contenía precedente, y por lo tanto el modelo se entrenó desde cero. Para el entrenamiento de la parte inferior de la cara (media máscara), los investigadores procedieron a partir de los puntos de control incluidos en el código original de Wav2Lip.
Además de la evaluación automática, los investigadores utilizaron opiniones de la multitud suministradas por una plataforma de servicio semiautomatizada. Los trabajadores calificaron generalmente la salida con alta calificación en términos de reconocimiento de las emociones superpuestas, mientras que solo informaron evaluaciones ‘moderadas’ para la calidad de la imagen.
Los autores sugieren que, además de mejorar la calidad del video generado con refinamientos adicionales, las iteraciones futuras del trabajo podrían abarcar una gama más amplia de emociones, y que el trabajo podría aplicarse igualmente en el futuro a datos de origen etiquetados o inferidos automáticamente y conjuntos de datos, lo que llevaría eventualmente a un sistema auténtico en el que las emociones podrían subir o bajar a voluntad del usuario, o sustituirse finalmente por emociones contrastantes con respecto al video de origen.












