Ángulo de Anderson

Agregar diÃĄlogo a video real con IA

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
Montage of subjects from the demonstration video-clips for FacEDiT. Source: https://facedit.github.io/

Un nuevo marco de trabajo de IA puede reescribir, eliminar o agregar las palabras de una persona en un video sin volver a grabar, en un solo sistema de extremo a extremo.

 

Hace tres aÃąos, internet se habría sorprendido con cualquiera de los 20-30 marcos de trabajo de video alterados por IA que se publican semanalmente en portales acadÃĐmicos; como es el caso, esta popular rama de investigaciÃģn ahora se ha vuelto tan prolífica que casi constituye otra rama de ‘basura de IA’, y cubro mucho menos de estos lanzamientos de lo que lo habría hecho hace dos o tres aÃąos.

No obstante, un lanzamiento actual en esta línea llamÃģ mi atenciÃģn: un sistema integrado que puede intervenir en clips de video reales e interponer nuevo diÃĄlogo en el video existente (en lugar de crear un clip generativo completo a partir de una cara o un marco, lo que es mucho mÃĄs comÚn).

En los ejemplos a continuaciÃģn, que editÃĐ juntos a partir de mÚltiples videos de muestra disponibles en el sitio web del proyecto, primero vemos el clip de origen real, y debajo, el discurso de IA impuesto en el medio del clip, incluyendo síntesis de voz y sincronizaciÃģn de labios:

Haz clic para reproducir. EdiciÃģn local con costura – uno de los varios modos ofrecidos por FacEDiT. Por favor, consulte el sitio web de origen para una mejor resoluciÃģn. Fuente – https://facedit.github.io/

Este enfoque es uno de los tres desarrollados para el nuevo mÃĐtodo, este titulado ‘ediciÃģn local con costura’, y el que mÃĄs interesa a los autores (así como a mí). Esencialmente, el clip se extiende utilizando uno de los marcos del medio como punto de partida para la interpretaciÃģn de IA novel, y su marco sucesivo (real) como objetivo que el clip generativo insertado debe tratar de emparejar. En los clips vistos arriba, estos ‘semilla’ y ‘objetivo’ marcos estÃĄn representados por el video superior que se detiene mientras el video modificado debajo proporciona relleno generativo.

Los autores enmarcan este enfoque de síntesis facial y vocal como el primer mÃĐtodo completamente integrado de extremo a extremo para ediciones de video de IA de este tipo, observando el potencial de un marco de trabajo completamente desarrollado como este para la producciÃģn de TV y películas:

‘Los cineastas y productores de medios a menudo necesitan revisar partes específicas de videos grabados – quizÃĄs una palabra se pronunciÃģ mal o el guiÃģn cambiÃģ despuÃĐs de la filmaciÃģn. Por ejemplo, en la escena icÃģnica de Titanic (1997) donde Rose dice, “Nunca te dejarÃĐ ir, Jack,” el director podría decidir mÃĄs tarde que debería ser “Nunca te olvidarÃĐ, Jack”.

‘Tradicionalmente, estos cambios requieren volver a grabar toda la escena, lo que es costoso y consume mucho tiempo. La síntesis de cara hablante ofrece una alternativa prÃĄctica al modificar automÃĄticamente el movimiento facial para que coincida con el discurso revisado, eliminando la necesidad de volver a grabar.’

Aunque las interposiciones de IA de este tipo pueden enfrentar resistencia cultural o de la industria, tambiÃĐn pueden constituir un nuevo tipo de funcionalidad en sistemas y suites de herramientas de efectos visuales dirigidos por humanos. En cualquier caso, por el momento, los desafíos son estrictamente tÃĐcnicos.

AdemÃĄs de extender un clip a travÃĐs de diÃĄlogo de IA adicional, el nuevo sistema tambiÃĐn puede alterar el discurso existente:

Haz clic para reproducir. Un ejemplo de cambiar el diÃĄlogo existente en lugar de interponer diÃĄlogo adicional. Por favor, consulte el sitio web de origen para una mejor resoluciÃģn.

Estado del arte

Actualmente no hay sistemas de extremo a extremo que ofrezcan esta capacidad de síntesis; aunque una creciente cantidad de plataformas de IA generativas como la serie Veo de Google pueden generar audio, y diversas otras arquitecturas pueden crear audio deepfake, actualmente hay que crear una especie de tubería involucrada de diversas arquitecturas y trucos para interferir con metraje real de la manera en que el nuevo sistema – titulado FacEDiT – puede lograr.

El sistema utiliza Transformadores de difusiÃģn (DiT) en combinaciÃģn con Flow Matching para crear movimientos faciales condicionados en movimientos contextuales y contenido de audio de discurso. El sistema aprovecha paquetes populares existentes que tratan con la reconstrucciÃģn facial, incluyendo LivePortrait (recientemente adquirido por Kling).

AdemÃĄs de este mÃĐtodo, dado que su enfoque es el primero en integrar estos desafíos en una sola soluciÃģn, los autores han creado un benchmark novel llamado FacEDiTBench, junto con varias mÃĐtricas de evaluaciÃģn completamente nuevas y apropiadas para esta tarea específica.

El nuevo trabajo se titula FacEDiT: EdiciÃģn y generaciÃģn unificada de cara hablante a travÃĐs del relleno de movimiento facial, y proviene de cuatro investigadores de la Universidad de Ciencia y Tecnología de Pohang (POSTECH), el Instituto Avanzado de Ciencia y Tecnología de Corea (KAIST) y la Universidad de Texas en Austin.

MÃĐtodo

FacEDiT se entrena para reconstruir el movimiento facial aprendiendo a rellenar partes faltantes del rendimiento original de un actor, basÃĄndose en el movimiento circundante y el audio de discurso. Como se muestra en el esquema a continuaciÃģn, este proceso permite que el modelo actÚe como un relleno de brechas durante el entrenamiento, prediciendo movimientos faciales que coinciden con la voz mientras se mantiene coherente con el video original:

VisiÃģn general del sistema FacEDiT, que muestra cÃģmo se aprende el movimiento facial a travÃĐs del relleno auto-supervisado durante el entrenamiento, guiado por el discurso editado en la inferencia, y finalmente se representa en video reutilizando la apariencia del metraje original mientras se reemplaza solo el movimiento objetivo.. Fuente - https://arxiv.org/pdf/2512.14056

VisiÃģn general del sistema FacEDiT, que muestra cÃģmo se aprende el movimiento facial a travÃĐs del relleno auto-supervisado durante el entrenamiento, guiado por el discurso editado en la inferencia, y finalmente se representa en video reutilizando la apariencia del metraje original mientras se reemplaza solo el movimiento objetivo. Fuente

En el momento de la inferencia, la misma arquitectura admite dos salidas diferentes dependiendo de cuÃĄnto del video estÃĐ enmascarado: ediciones parciales, donde solo se altera una frase y el resto se deja intacto; o generaciÃģn de oraciones completas, donde se sintetiza movimiento nuevo enteramente desde cero.

El modelo se entrena a travÃĐs de Flow Matching, que trata las ediciones de video como una especie de camino entre dos versiones de movimiento facial.

En lugar de aprender a adivinar cÃģmo debería verse una cara editada desde cero, el Flow Matching aprende a moverse gradual y suavemente entre un marcador de posiciÃģn ruidoso y el movimiento correcto. Para facilitar esto, el sistema representa el movimiento facial como un conjunto compacto de nÚmeros extraídos de cada cuadro utilizando una versiÃģn del sistema LivePortrait mencionado anteriormente (ver esquema anterior).

Estos vectores de movimiento estÃĄn diseÃąados para describir expresiones y postura de la cabeza sin enredar la identidad, para que los cambios en el discurso puedan localizarse sin afectar la apariencia general de la persona.

Entrenamiento de FacEDiT

Para entrenar a FacEDiT, cada clip de video se dividiÃģ en una serie de instantÃĄneas de movimiento facial, y cada cuadro se emparejÃģ con el trozo correspondiente de audio. Se ocultaron partes aleatorias de los datos de movimiento, y se le pidiÃģ al modelo que adivinara cÃģmo deberían verse esos movimientos faltantes, utilizando tanto el discurso como el movimiento no enmascarado circundante como contexto.

Debido a que los espacios enmascarados y sus posiciones varían de un ejemplo de entrenamiento a otro, el modelo aprende gradualmente a manejar tanto ediciones internas pequeÃąas como brechas mÃĄs largas, para la generaciÃģn de secuencias completas, segÚn la cantidad de informaciÃģn que se le proporcione.

El Transformador de difusiÃģn del sistema aprende a recuperar el movimiento enmascarado refinando las entradas ruidosas con el tiempo. En lugar de alimentar el discurso y el movimiento en el modelo todo a la vez, el audio se introduce en cada bloque de procesamiento a travÃĐs de atenciÃģn cruzada, lo que ayuda al sistema a emparejar los movimientos de los labios con mayor precisiÃģn al discurso.

Para preservar la realidad a lo largo de las ediciones, la atenciÃģn se sesga hacia los cuadros vecinos en lugar de toda la línea de tiempo, lo que fuerza al modelo a centrarse en la continuidad local y evita parpadeos o saltos de movimiento en los bordes de las regiones alteradas. Las incrustaciones posicionales (que le dicen al modelo dÃģnde aparece cada cuadro en la secuencia) tambiÃĐn ayudan al modelo a mantener el flujo temporal y el contexto natural.

During el entrenamiento, el sistema aprende a predecir el movimiento facial faltante reconstruyendo los espacios enmascarados basÃĄndose en el discurso y el movimiento no enmascarado circundante. En el momento de la inferencia, este mismo conjunto se vuelve a utilizar, pero con las mÃĄscaras ahora guiadas por ediciones en el discurso.

Cuando se inserta, elimina o cambia una palabra o frase, el sistema localiza la regiÃģn afectada, la enmascara y regenera el movimiento que coincide con el nuevo audio. La generaciÃģn de secuencias completas se trata como un caso especial, donde toda la regiÃģn se enmascara y se sintetiza desde cero.

Datos y pruebas

La columna vertebral del sistema comprende 22 capas para el Transformador de difusiÃģn, cada una con 16 cabezas de atenciÃģn y dimensiones de alimentaciÃģn directa de 1024 y 2024 píxeles. Las características de movimiento y apariencia se extraen utilizando componentes congelados de LivePortrait, y el discurso se codifica a travÃĐs de WavLM y se modifica utilizando VoiceCraft.

Una capa de proyecciÃģn dedicada asigna las características de discurso de 786 dimensiones al espacio latente de DiT, con solo DiT y los mÃģdulos de proyecciÃģn entrenados desde cero.

El entrenamiento se realizÃģ bajo el optimizador AdamW con una tasa de aprendizaje objetivo de 1e-4, durante un millÃģn de pasos, en dos GPU A6000 (cada una con 48 GB de VRAM), con un tamaÃąo de lote total de ocho.

FacEDiTBench

El conjunto de datos FacEDiTBench contiene 250 ejemplos, cada uno con un clip de video del discurso original y editado, y las transcripciones para ambos. Los videos provienen de tres fuentes, con 100 clips de HDTF, 100 de Hallo3, y 50 de CelebV-Dub. Cada uno se verificÃģ manualmente para confirmar que tanto el audio como el video fueran lo suficientemente claros para la evaluaciÃģn.

GPT-4o se utilizÃģ para revisar cada transcripciÃģn para crear ediciones gramaticalmente vÃĄlidas. Estas transcripciones revisadas, junto con el discurso original, se pasaron a VoiceCraft para producir nuevo audio; y en cada etapa, tanto la transcripciÃģn como el discurso generado se revisaron manualmente para la calidad.

Cada muestra se etiquetÃģ con el tipo de ediciÃģn, el momento del cambio y la longitud del tramo modificado, y las ediciones se clasificaron como inserciones, eliminaciones o sustituciones. El nÚmero de palabras cambiadas variÃģ desde ediciones cortas de 1 a 3 palabras, ediciones medias de 4 a 6 palabras y ediciones mÃĄs largas de 7 a 10 palabras.

Se definieron tres mÃĐtricas personalizadas para evaluar la calidad de ediciÃģn. Continuidad fotomÃĐtrica, para medir cÃģmo se mezcla la iluminaciÃģn y el color de un segmento editado con el video circundante, comparando las diferencias a nivel de píxel en los bordes; continuidad de movimiento, para evaluar la coherencia del movimiento facial, midiendo los cambios en el flujo Ãģptico a travÃĐs de los cuadros editados y no editados; y preservaciÃģn de identidad, para estimar si la apariencia del sujeto permanece coherente despuÃĐs de la ediciÃģn, comparando las incrustaciones faciales del original y las secuencias generadas utilizando el modelo de reconocimiento facial ArcFace.

Pruebas

El modelo de prueba se entrenÃģ con material de los tres conjuntos de datos mencionados anteriormente, totalizando alrededor de 200 horas de contenido de video, incluyendo vlogs y películas, así como videos de YouTube de alta resoluciÃģn.

Para evaluar la ediciÃģn de cara hablante, se utilizÃģ FacEDiTBench, ademÃĄs de la divisiÃģn de prueba de HDTF, que se ha convertido en un estÃĄndar para esta suite de tareas.

Dado que no había sistemas directamente comparables capaces de encapsular esta funcionalidad de extremo a extremo, los autores eligieron una variedad de marcos que reproducían al menos parte de la funcionalidad objetivo, y que podrían operar como líneas de base; a saber, KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; y SadTalker.

Se utilizaron varias mÃĐtricas establecidas para evaluar la calidad de generaciÃģn y ediciÃģn, con la precisiÃģn de sincronizaciÃģn de labios evaluada a travÃĐs de SyncNet, informando tanto el error absoluto entre los movimientos de los labios y el audio (LSE-D) como una puntuaciÃģn de confianza (LSE-C); FrÃĐchet Video Distance (FVD) cuantificando lo realista que parece el video en general; y MÃĐtricas de similitud perceptual aprendidas (LPIPS), midiendo la similitud perceptual entre los cuadros generados y originales.

Para la ediciÃģn, todas las mÃĐtricas excepto LPIPS se aplicaron solo al segmento modificado; para la generaciÃģn, se evaluÃģ todo el video, con la continuidad de los bordes excluida.

Cada modelo se hizo para sintetizar un segmento de video coincidente, que luego se insertÃģ en el clip original (los investigadores seÃąalan que este mÃĐtodo a menudo introdujo discontinuidades visibles, donde el segmento editado se encontraba con el metraje circundante). TambiÃĐn se probÃģ un segundo enfoque, en el que se regenerÃģ todo el video desde el audio modificado – pero esto inevitablemente sobrescribiÃģ las regiones no editadas y no preservÃģ el rendimiento original:

ComparaciÃģn del rendimiento de ediciÃģn en sistemas originalmente diseÃąados para la generaciÃģn de cara hablante, con FacEDiT superando a todas las líneas de base en todas las mÃĐtricas, logrando un error de sincronizaciÃģn de labios mÃĄs bajo (LSE-D), una mayor confianza de sincronizaciÃģn (LSE-C), una mayor preservaciÃģn de identidad (IDSIM), una mayor realismo perceptual (FVD) y transiciones mÃĄs suaves en los bordes de ediciÃģn (Pcontinuidad, Mcontinuidad). Las columnas sombreadas en gris resaltan los criterios clave para evaluar la calidad de los bordes; los valores en negrita y subrayados indican los mejores y segundos mejores resultados, respectivamente

ComparaciÃģn del rendimiento de ediciÃģn en sistemas originalmente diseÃąados para la generaciÃģn de cara hablante, con FacEDiT superando a todas las líneas de base en todas las mÃĐtricas, logrando un error de sincronizaciÃģn de labios mÃĄs bajo (LSE-D), una mayor confianza de sincronizaciÃģn (LSE-C), una mayor preservaciÃģn de identidad (IDSIM), una mayor realismo perceptual (FVD) y transiciones mÃĄs suaves en los bordes de ediciÃģn (Pcontinuidad, Mcontinuidad). Las columnas sombreadas en gris resaltan los criterios clave para evaluar la calidad de los bordes; los valores en negrita y subrayados indican los mejores y segundos mejores resultados, respectivamente

En cuanto a estos resultados, los autores comentan:

‘[Nuestro] modelo supera significativamente a los mÃĐtodos existentes en la tarea de ediciÃģn. Logra una fuerte continuidad de bordes y una alta preservaciÃģn de identidad, demostrando su capacidad para mantener la coherencia temporal y visual durante la ediciÃģn. AdemÃĄs, su precisiÃģn de sincronizaciÃģn de labios superior y su bajo FVD reflejan el realismo del video sintetizado.’

Haz clic para reproducir. Resultados, ensamblados por este autor a partir de los videos publicados en el sitio web del proyecto. Por favor, consulte el sitio web de origen para una mejor resoluciÃģn.

AdemÃĄs, se realizÃģ un estudio humano para evaluar la calidad percibida en ambas ediciÃģn y generaciÃģn.

Para cada comparaciÃģn, los participantes vieron seis videos y los clasificaron por calidad general, considerando la precisiÃģn de sincronizaciÃģn de labios, naturalidad y realismo del movimiento de la cabeza:

Puntuaciones promedio asignadas por los evaluadores humanos, donde menor es mejor. En ambas ediciÃģn y generaciÃģn, los participantes juzgaron quÃĐ tan natural y sincronizado parecía cada video. Para la ediciÃģn, tambiÃĐn calificaron lo suave que era la transiciÃģn entre el discurso editado y no editado.Bold y subrayado indican las dos mejores puntuaciones.

Puntuaciones promedio asignadas por los evaluadores humanos, donde menor es mejor. En ambas ediciÃģn y generaciÃģn, los participantes juzgaron quÃĐ tan natural y sincronizado parecía cada video. Para la ediciÃģn, tambiÃĐn calificaron lo suave que era la transiciÃģn entre el discurso editado y no editado.Bold y subrayado indican las dos mejores puntuaciones.

En el estudio, FacEDiT se clasificÃģ consistentemente como el mÃĄs alto por una ventaja clara, tanto para la calidad de ediciÃģn como para la suavidad de la transiciÃģn, tambiÃĐn recibiendo puntuaciones fuertes en el escenario de generaciÃģn, lo que sugiere que sus ventajas medidas se traducen en salidas perceptualmente preferidas.

Debido a la falta de espacio, remitimos al lector al artículo de origen para obtener mÃĄs detalles sobre los estudios de abstracciÃģn y las pruebas adicionales que se realizaron y se informaron en el nuevo trabajo. En verdad, las ofertas de investigaciÃģn prototípicas de este tipo luchan por generar secciones de resultados de prueba significativos, ya que la oferta central en sí misma es inevitablemente una posible línea de base para trabajos posteriores.

ConclusiÃģn

Incluso para la inferencia, los sistemas como este pueden requerir recursos computacionales significativos en el momento de la inferencia, lo que dificulta que los usuarios posteriores – aquí, presumiblemente, tiendas de efectos visuales – mantengan el trabajo en las instalaciones. Por lo tanto, los enfoques que se pueden adaptar a recursos locales realistas siempre serÃĄn preferidos por los proveedores, que estÃĄn bajo la obligaciÃģn legal de proteger el metraje del cliente y la propiedad intelectual general.

Eso no es para criticar la nueva oferta, que puede funcionar perfectamente bajo pesos cuantizados u otras optimizaciones, y que es la primera oferta de su tipo que me atrae hacia esta avenida de investigaciÃģn en bastante tiempo.

 

Publicado por primera vez el miÃĐrcoles 17 de diciembre de 202. Editado el 20.10 EET, mismo día, para agregar espacio en el primer pÃĄrrafo del cuerpo.

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]