Ángulo de Anderson
La tecnología LipSync3D de Google ofrece una mejor sincronización de movimiento de labios ‘deepfaked’

Una colaboración entre investigadores de Google AI y el Instituto Indio de Tecnología de Kharagpur ofrece un nuevo marco para sintetizar cabezas que hablan a partir de contenido de audio. El proyecto tiene como objetivo producir formas optimizadas y razonablemente resourcadas para crear contenido de video de ‘cabeza que habla’ a partir de audio, con el fin de sincronizar los movimientos de los labios con el audio doblado o traducido por máquina, y para su uso en avatares, en aplicaciones interactivas y en otros entornos en tiempo real.

Fuente: https://www.youtube.com/watch?v=L1StbX9OznY
Los modelos de aprendizaje automático entrenados en el proceso – llamados LipSync3D – requieren solo un video de la identidad facial objetivo como datos de entrada. La tubería de preparación de datos separa la extracción de la geometría facial de la evaluación de la iluminación y otros aspectos de un video de entrada, lo que permite un entrenamiento más económico y enfocado.

El flujo de trabajo de dos etapas de LipSync3D. Arriba, la generación de una cara 3D dinámicamente texturizada a partir del ‘audio objetivo’; abajo, la inserción de la malla generada en un video objetivo.
De hecho, la contribución más notable de LipSync3D al cuerpo de esfuerzo de investigación en este área puede ser su algoritmo de normalización de iluminación, que desacopla la iluminación de entrenamiento y la inferencia.

Desacoplar los datos de iluminación de la geometría general ayuda a LipSync3D a producir una salida de movimiento de labios más realista en condiciones desafiantes. Otros enfoques de los últimos años se han limitado a condiciones de iluminación ‘fijas’ que no revelarán su capacidad limitada en este respecto.
Durante el preprocesamiento de los marcos de datos de entrada, el sistema debe identificar y eliminar los puntos especulares, ya que estos son específicos de las condiciones de iluminación bajo las cuales se tomó el video y de lo contrario interferirán con el proceso de reiluminación.

LipSync3D, como su nombre sugiere, no realiza solo un análisis de píxeles en las caras que evalúa, sino que utiliza activamente puntos de referencia faciales identificados para generar mallas CGI en movimiento, junto con las texturas ‘desenrolladas’ que se envuelven alrededor de ellas en una tubería CGI tradicional.

Normalización de pose en LipSync3D. A la izquierda están los marcos de entrada y las características detectadas; en el medio, los vértices normalizados de la evaluación de la malla generada; y a la derecha, el atlas de texturas correspondiente, que proporciona la verdad fundamental para la predicción de texturas. Fuente: https://arxiv.org/pdf/2106.04185.pdf
Además del método de reluminación novedoso, los investigadores afirman que LipSync3D ofrece tres innovaciones principales sobre el trabajo anterior: la separación de la geometría, la iluminación, la pose y la textura en flujos de datos discretos en un espacio normalizado; un modelo de predicción de textura auto-regresivo fácilmente entrenable que produce síntesis de video temporalmente coherente; y un aumento de la realidad, evaluado por calificaciones humanas y métricas objetivas.

Dividir las diversas facetas de la imagen facial de video permite un mayor control en la síntesis de video.
LipSync3D puede derivar la geometría del movimiento de los labios directamente del audio analizando fonemas y otros aspectos del habla, y traducirlos en poses musculares conocidas correspondientes alrededor del área de la boca.

Este proceso utiliza una tubería de predicción conjunta, donde la geometría y la textura inferidas tienen codificadores dedicados en una configuración de autoencoder, pero comparten un codificador de audio con el habla que se pretende imponer en el modelo:
La síntesis de movimiento labial lábil de LipSync3D también está destinada a alimentar avatares CGI estilizados, que en efecto son solo la misma información de malla y textura que la imagen del mundo real:

Un avatar 3D estilizado tiene sus movimientos de labios alimentados en tiempo real por un video de hablante de origen. En tal escenario, los mejores resultados se obtendrían con un pre-entrenamiento personalizado.
Los investigadores también anticipan el uso de avatares con un sentimiento ligeramente más realista:
![]()
Los tiempos de entrenamiento de muestra para los videos van desde 3-5 horas para un video de 2-5 minutos, en una tubería que utiliza TensorFlow, Python y C++ en una GeForce GTX 1080. Las sesiones de entrenamiento utilizaron un tamaño de lote de 128 marcos durante 500-1000 épocas, con cada época representando una evaluación completa del video.
Hacia la re-sincronización dinámica del movimiento de los labios
El campo de la re-sincronización de los labios para acomodar una pista de audio novedosa ha recibido mucha atención en la investigación de visión por computadora en los últimos años (ver abajo), no menos como un subproducto de la tecnología de deepfake controvertida.
En 2017, la Universidad de Washington presentó una investigación capaz de aprender la sincronización de labios a partir del audio, utilizando para cambiar los movimientos de labios del entonces presidente Obama. En 2018, el Instituto Max Planck de Informática lideró otra iniciativa de investigación para habilitar la transferencia de video de identidad a identidad, con la sincronización de labios como un subproducto del proceso; y en mayo de 2021, la startup de IA FlawlessAI reveló su tecnología de sincronización de labios patentada TrueSync, ampliamente recibida en la prensa como un habilitador de tecnologías de doblaje mejoradas para lanzamientos de películas importantes en varios idiomas.
Y, por supuesto, el desarrollo continuo de repositorios de código abierto de deepfake proporciona otra rama de investigación activa de usuarios en esta esfera de síntesis de imágenes faciales.
nc tecnología TrueSync, ampliamente recibida en la prensa como un habilitador de tecnologías de doblaje mejoradas para lanzamientos de películas importantes en varios idiomas. Y, por supuesto, el desarrollo continuo de repositorios de código abierto de deepfake proporciona otra rama de investigación activa de usuarios en esta esfera de síntesis de imágenes faciales.











