Ângulo de Anderson

Adicionando DiÃĄlogo a Vídeos Reais com IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
Montage of subjects from the demonstration video-clips for FacEDiT. Source: https://facedit.github.io/

Uma nova estrutura de IA pode reescrever, remover ou adicionar as palavras de uma pessoa em um vídeo sem refilmagem, em um sistema de ponta a ponta.

 

HÃĄ trÊs anos, a internet seria chocada por qualquer uma das 20-30 estruturas de vídeo alteradas por IA que sÃĢo publicadas em portais acadÊmicos semanalmente; como ÃĐ, essa popular linha de pesquisa agora se tornou tÃĢo prolífica que quase constitui outro ramo de ‘IA Slop’, e eu cubro muito menos dessas liberaçÃĩes do que faria hÃĄ dois ou trÊs anos.

No entanto, uma liberaçÃĢo atual nessa linha chamou minha atençÃĢo: um sistema integrado que pode intervir em clipes de vídeo reais e interpor novo diÃĄlogo no vídeo existente (em vez de criar um clipe gerado inteiramente a partir de um rosto ou quadro, o que ÃĐ muito mais comum).

Nos exemplos abaixo, que editei juntos a partir de uma multitude de vídeos de amostra disponíveis no site do projeto, primeiro vemos o clipe de origem real, e entÃĢo, abaixo, o diÃĄlogo de IA imposto no meio do clipe, incluindo síntese de voz e sincronizaçÃĢo labial:

Clique para reproduzir.EdiçÃĢo local com costura – uma das vÃĄrias modalidades oferecidas pelo FacEDiT. Por favor, consulte o site de origem para melhor resoluçÃĢo.Fonte – https://facedit.github.io/

Essa abordagem ÃĐ uma das trÊs desenvolvidas para o novo mÃĐtodo, intitulada ‘ediçÃĢo local com costura’, e a que mais interessa aos autores (bem como a mim). Basicamente, o clipe ÃĐ estendido usando um dos quadros do meio como ponto de partida para a interpretaçÃĢo de IA nova, e o quadro real sucessivo como um objetivo que o clipe gerado deve atingir. Nos clipes vistos acima, esses ‘sementes’ e ‘alvos’ de quadros sÃĢo representados pelo vídeo superior que pausa enquanto o vídeo modificado abaixo fornece preenchimento gerado.

Os autores enquadram essa abordagem de síntese facial e vocal como o primeiro mÃĐtodo totalmente integrado de ponta a ponta para ediçÃĢo de vídeo de IA desse tipo, observando o potencial de uma estrutura totalmente desenvolvida como essa para a produçÃĢo de TV e cinema:

‘Os cineastas e produtores de mídia frequentemente precisam revisar partes específicas de vídeos gravados – talvez uma palavra tenha sido pronunciada incorretamente ou o roteiro tenha mudado apÃģs a filmagem. Por exemplo, na cena icÃīnica de Titanic (1997) em que Rose diz, “Eu nunca vou deixar vocÊ, Jack,” o diretor pode decidir mais tarde que deve ser “Eu nunca esquecerei vocÊ, Jack”.

‘Tradicionalmente, essas alteraçÃĩes exigem a refilmagem de toda a cena, o que ÃĐ caro e demorado. A síntese de face falante oferece uma alternativa prÃĄtica, modificando automaticamente a movimentaçÃĢo facial para corresponder ao discurso revisado, eliminando a necessidade de refilmagens.’

Embora as interposiçÃĩes de IA desse tipo possam enfrentar resistÊncia cultural ou de indÚstria, elas tambÃĐm podem constituir um novo tipo de funcionalidade em sistemas e conjuntos de ferramentas de efeitos visuais liderados por humanos. Em qualquer caso, por enquanto, os desafios sÃĢo estritamente tÃĐcnicos.

AlÃĐm de estender um clipe por meio de diÃĄlogo de IA adicional, o novo sistema tambÃĐm pode alterar discurso existente:

Clique para reproduzir.Um exemplo de alteraçÃĢo de discurso existente em vez de interpor discurso adicional. Por favor, consulte o site de origem para melhor resoluçÃĢo.

Estado da Arte

Atualmente, nÃĢo existem sistemas de ponta a ponta que ofereçam essa capacidade de síntese; embora uma crescente nÚmero de plataformas de IA gerativas, como a sÃĐrie Veo da Google, possam gerar ÃĄudio, e diversas outras estruturas possam criar ÃĄudio deepfake, atualmente ÃĐ necessÃĄrio criar uma pipeline bastante envolvida de arquiteturas e truques diversificados para interferir com imagens reais da maneira que o novo sistema – intitulado FacEDiT – pode realizar.

O sistema usa Transformadores de DifusÃĢo (DiT) em combinaçÃĢo com CorrespondÊncia de Fluxo para criar movimentaçÃĩes faciais condicionadas em movimentaçÃĩes contextuais e conteÚdo de ÃĄudio de discurso. O sistema aproveita pacotes populares existentes que lidam com reconstruçÃĢo facial, incluindo LivePortrait (recentemente assumido pela Kling).

AlÃĐm desse mÃĐtodo, dado que a abordagem dos autores ÃĐ a primeira a integrar esses desafios em uma soluçÃĢo Única, os autores criaram um novo benchmark chamado FacEDiTBench, juntamente com vÃĄrias mÃĐtricas de avaliaçÃĢo novas e apropriadas para essa tarefa específica.

O novo trabalho ÃĐ intitulado FacEDiT: EdiçÃĢo e GeraçÃĢo de Face Falante Unificada via Preenchimento de MovimentaçÃĢo Facial, e vem de quatro pesquisadores da Universidade de CiÊncia e Tecnologia de Pohang (POSTECH), do Instituto de CiÊncia e Tecnologia Avançado da Coreia (KAIST), e da Universidade do Texas em Austin.

MÃĐtodo

O FacEDiT ÃĐ treinado para reconstruir a movimentaçÃĢo facial aprendendo a preencher partes faltantes do desempenho original do ator, com base na movimentaçÃĢo circundante e no ÃĄudio de discurso. Como mostrado no esquema abaixo, esse processo permite que o modelo atue como um preenchimento de lacunas durante o treinamento, prevendo movimentaçÃĩes faciais que correspondam à voz enquanto permanecem consistentes com o vídeo original:

VisÃĢo geral do sistema FacEDiT, mostrando como a movimentaçÃĢo facial ÃĐ aprendida por meio de preenchimento auto-supervisionado durante o treinamento, guiada por discurso editado na inferÊncia, e finalmente renderizada de volta ao vídeo reutilizando a aparÊncia do vídeo original enquanto substitui apenas a movimentaçÃĢo alvo.. Fonte - https://arxiv.org/pdf/2512.14056

VisÃĢo geral do sistema FacEDiT, mostrando como a movimentaçÃĢo facial ÃĐ aprendida por meio de preenchimento auto-supervisionado durante o treinamento, guiada por discurso editado na inferÊncia, e finalmente renderizada de volta ao vídeo reutilizando a aparÊncia do vídeo original enquanto substitui apenas a movimentaçÃĢo alvo. Fonte

No momento da inferÊncia, a mesma arquitetura suporta dois resultados diferentes, dependendo de quanto do vídeo ÃĐ mascarado: ediçÃĩes parciais, onde apenas uma frase ÃĐ alterada e o resto ÃĐ deixado intacto; ou geraçÃĢo de frase completa, onde nova movimentaçÃĢo ÃĐ sintetizada inteiramente do zero.

O modelo ÃĐ treinado por meio de correspondÊncia de fluxo, que trata as ediçÃĩes de vídeo como uma espÃĐcie de caminho entre duas versÃĩes de movimentaçÃĢo facial.

Em vez de aprender a adivinhar como uma face editada deve parecer do zero, a correspondÊncia de fluxo aprende a se mover gradualmente e suavemente entre um espaço reservado barulhento e a movimentaçÃĢo correta. Para facilitar isso, o sistema representa a movimentaçÃĢo facial como um conjunto compacto de nÚmeros extraídos de cada quadro usando uma versÃĢo do sistema LivePortrait mencionado anteriormente (ver esquema acima).

Esses vetores de movimentaçÃĢo sÃĢo projetados para descrever expressÃĩes e pose de cabeça sem emaranhar identidade, para que as alteraçÃĩes de discurso possam ser localizadas sem afetar a aparÊncia geral da pessoa.

Treinamento do FacEDiT

Para treinar o FacEDiT, cada clipe de vídeo foi dividido em uma sÃĐrie de instantÃĒneos de movimentaçÃĢo facial, e cada quadro foi emparelhado com o chunk correspondente de ÃĄudio. Partes aleatÃģrias dos dados de movimentaçÃĢo foram entÃĢo ocultadas, e o modelo foi solicitado a adivinhar como essas movimentaçÃĩes faltantes deveriam parecer, usando tanto o discurso quanto a movimentaçÃĢo nÃĢo mascarada circundante como contexto.

Como as extensÃĩes mascaradas e suas posiçÃĩes variam de um exemplo de treinamento para o outro, o modelo gradualmente aprende a lidar com ediçÃĩes internas pequenas e lacunas mais longas, para geraçÃĢo de sequÊncia completa, de acordo com a quantidade de informaçÃĩes que ÃĐ fornecida.

O Transformador de DifusÃĢo do sistema aprende a recuperar a movimentaçÃĢo mascarada refinando entradas barulhentas ao longo do tempo. Em vez de alimentar o discurso e a movimentaçÃĢo no modelo ao mesmo tempo, o ÃĄudio ÃĐ inserido em cada bloco de processamento por meio de atençÃĢo cruzada, ajudando o sistema a corresponder movimentaçÃĩes labiais mais precisamente ao discurso de ÃĄudio.

Para preservar a realidade em ediçÃĩes, a atençÃĢo ÃĐ inclinada em direçÃĢo a quadros vizinhos em vez de toda a linha do tempo, forçando o modelo a se concentrar na continuidade local e prevenindo tremeluz ou saltos de movimentaçÃĢo nas bordas de regiÃĩes alteradas. IncorporaçÃĩes posicionais (que informam o modelo onde cada quadro aparece na sequÊncia) ajudam ainda mais o modelo a manter o fluxo temporal natural e o contexto.

Durante o treinamento, o sistema aprende a prever a movimentaçÃĢo facial faltante reconstruindo extensÃĩes mascaradas com base no discurso e na movimentaçÃĢo nÃĢo mascarada circundante. No momento da inferÊncia, essa mesma configuraçÃĢo ÃĐ reutilizada, mas com as mÃĄscaras agora guiadas por ediçÃĩes no discurso.

Quando uma palavra ou frase ÃĐ inserida, removida ou alterada, o sistema localiza a regiÃĢo afetada, mascara e regenera a movimentaçÃĢo que corresponde ao novo ÃĄudio. A geraçÃĢo de sequÊncia completa ÃĐ tratada como um caso especial, onde a regiÃĢo inteira ÃĐ mascarada e sintetizada do zero.

Dados e Testes

A espinha dorsal do sistema compreende 22 camadas para o Transformador de DifusÃĢo, cada uma com 16 cabeças de atençÃĢo e dimensÃĩes de alimentaçÃĢo direta de 1024 e 2024px. Recursos de movimentaçÃĢo e aparÊncia sÃĢo extraídos usando componentes congelados do LivePortrait, e o discurso ÃĐ codificado por meio de WavLM e modificado usando VoiceCraft.

Uma camada de projeçÃĢo dedicada mapeia os recursos de discurso de 786 dimensÃĩes para o espaço latente do DiT, com apenas o DiT e os mÃģdulos de projeçÃĢo treinados do zero.

O treinamento foi realizado sob o otimizador AdamW com uma taxa de aprendizado alvo de 1e-4, por um milhÃĢo de passos, em dois GPUs A6000 (cada um com 48GB de VRAM), em um tamanho de lote total de oito.

FacEDiTBench

O conjunto de dados FacEDiTBench contÃĐm 250 exemplos, cada um com um clipe de vídeo do discurso original e editado, e as transcriçÃĩes para ambos. Os vídeos vÊm de trÊs fontes, com 100 clipes de HDTF, 100 de Hallo3, e 50 de CelebV-Dub. Cada um foi verificado manualmente para confirmar que tanto o ÃĄudio quanto o vídeo estavam claros o suficiente para avaliaçÃĢo.

GPT-4o foi usado para revisar cada transcriçÃĢo para criar ediçÃĩes gramaticalmente vÃĄlidas. Essas transcriçÃĩes revisadas, juntamente com o discurso original, foram passadas para o VoiceCraft para produzir novo ÃĄudio; e em cada etapa, tanto a transcriçÃĢo quanto o discurso gerado foram revisados manualmente para garantir a qualidade.

Cada amostra foi rotulada com o tipo de ediçÃĢo, o momento da alteraçÃĢo e o comprimento do span modificado, e as ediçÃĩes foram classificadas como inserçÃĩes, exclusÃĩes ou substituiçÃĩes. O nÚmero de palavras alteradas variou de ediçÃĩes curtas de 1 a 3 palavras, ediçÃĩes mÃĐdias de 4 a 6 palavras e ediçÃĩes mais longas de 7 a 10 palavras.

TrÊs mÃĐtricas personalizadas foram definidas para avaliar a qualidade da ediçÃĢo. Continuidade fotomÃĐtrica, para medir como bem a ediçÃĢo se mistura com o vídeo circundante, comparando diferenças de nível de pixel nas bordas; continuidade de movimentaçÃĢo, para avaliar a consistÊncia da movimentaçÃĢo facial, medindo mudanças de fluxo Ãģptico em quadros editados e nÃĢo editados; e preservaçÃĢo de identidade, para estimar se a aparÊncia do sujeito permanece consistente apÃģs a ediçÃĢo, comparando incorporaçÃĩes faciais do original e das sequÊncias geradas usando o modelo de reconhecimento facial ArcFace.

Testes

O modelo de teste foi treinado em material dos trÊs conjuntos de dados mencionados acima, totalizando cerca de 200 horas de conteÚdo de vídeo, incluindo vlogs e filmes, bem como vídeos do YouTube de alta resoluçÃĢo.

Para avaliar a ediçÃĢo de face falante, o FacEDiTBench foi usado, alÃĐm da parte de teste do HDTF, que se tornou um padrÃĢo de benchmarking para essa suíte de tarefas.

Como nÃĢo havia sistemas diretamente comparÃĄveis capazes de encapsular esse tipo de funcionalidade de ponta a ponta, os autores escolheram uma variedade de estruturas que reproduziam pelo menos parte da funcionalidade alvo, e que poderiam operar como linhas de base; nomeadamente, KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; e SadTalker.

VÃĄrias mÃĐtricas estabelecidas tambÃĐm foram usadas para avaliar a qualidade da geraçÃĢo e ediçÃĢo, com a precisÃĢo de sincronizaçÃĢo labial avaliada por meio de SyncNet, relatando tanto o erro absoluto entre movimentaçÃĩes labiais e ÃĄudio (LSE-D) quanto uma pontuaçÃĢo de confiança (LSE-C); DistÃĒncia de Vídeo de FrÃĐchet (FVD) quantificando o quÃĢo realista o vídeo pareceu como um todo; e MÃĐtricas de Semelhança Perceptual Aprendidas (LPIPS), medindo a semelhança perceptual entre quadros gerados e originais.

Para ediçÃĢo, todas as mÃĐtricas, exceto LPIPS, foram aplicadas apenas ao segmento modificado; para geraçÃĢo, o vídeo inteiro foi avaliado, com a continuidade de borda excluída.

Cada modelo foi solicitado a sintetizar um segmento de vídeo correspondente, que foi entÃĢo mesclado no clipe original (os pesquisadores observam que esse mÃĐtodo frequentemente introduziu descontinuidades visíveis, onde o segmento editado encontrava o footage circundante). Uma segunda abordagem tambÃĐm foi testada, na qual o vídeo inteiro foi regenerado a partir do ÃĄudio modificado – mas isso inevitavelmente sobrescreveu regiÃĩes nÃĢo editadas e falhou em preservar o desempenho original:

ComparaçÃĢo do desempenho de ediçÃĢo entre sistemas originalmente projetados para geraçÃĢo de face falante, com o FacEDiT superando todas as linhas de base em todas as mÃĐtricas, alcançando menor erro de sincronizaçÃĢo labial (LSE-D), maior confiança de sincronizaçÃĢo (LSE-C), preservaçÃĢo de identidade mais forte (IDSIM), realismo perceptual maior (FVD) e transiçÃĩes mais suaves nas bordas de ediçÃĢo (Pcontinuidade, Mcontinuidade). Colunas sombreadas em cinza destacam os critÃĐrios-chave para avaliar a qualidade de borda; valores em negrito e sublinhados indicam os melhores e segundos melhores resultados, respectivamente

ComparaçÃĢo do desempenho de ediçÃĢo entre sistemas originalmente projetados para geraçÃĢo de face falante, com o FacEDiT superando todas as linhas de base em todas as mÃĐtricas, alcançando menor erro de sincronizaçÃĢo labial (LSE-D), maior confiança de sincronizaçÃĢo (LSE-C), preservaçÃĢo de identidade mais forte (IDSIM), realismo perceptual maior (FVD) e transiçÃĩes mais suaves nas bordas de ediçÃĢo (Pcontinuidade, Mcontinuidade). Colunas sombreadas em cinza destacam os critÃĐrios-chave para avaliar a qualidade de borda; valores em negrito e sublinhados indicam os melhores e segundos melhores resultados, respectivamente

Quanto a esses resultados, os autores comentam:

‘Nosso modelo supera significativamente os mÃĐtodos existentes na tarefa de ediçÃĢo. Ele alcança forte continuidade de borda e alta preservaçÃĢo de identidade, demonstrando sua capacidade de manter a consistÊncia temporal e visual durante a ediçÃĢo. AlÃĐm disso, sua precisÃĢo de sincronizaçÃĢo labial superior e FVD baixo refletem a realidade do vídeo sintetizado.’

Clique para reproduzir.Resultados, montados por este autor a partir dos vídeos publicados no site do projeto. Por favor, consulte o site de origem para melhor resoluçÃĢo.

AlÃĐm disso, um estudo humano foi realizado para avaliar a qualidade percebida em ambas as ediçÃĩes e geraçÃĢo.

Para cada comparaçÃĢo, os participantes visualizaram seis vídeos e os classificaram por qualidade geral, considerando a precisÃĢo de sincronizaçÃĢo labial, naturalidade e realismo da movimentaçÃĢo da cabeça. Nos testes de ediçÃĢo, os participantes tambÃĐm avaliaram a suavidade das transiçÃĩes entre segmentos editados e nÃĢo editados:

ClassificaçÃĩes mÃĐdias atribuídas pelos avaliadores humanos, onde menor ÃĐ melhor. Em ambas as ediçÃĩes e geraçÃĢo, os participantes julgaram o quÃĢo natural e sincronizado cada vídeo parecia. Para ediçÃĢo, tambÃĐm avaliaram a suavidade da transiçÃĢo entre discurso editado e nÃĢo editado. NÚmeros em negrito e sublinhados mostram as duas melhores pontuaçÃĩes.

ClassificaçÃĩes mÃĐdias atribuídas pelos avaliadores humanos, onde menor ÃĐ melhor. Em ambas as ediçÃĩes e geraçÃĢo, os participantes julgaram o quÃĢo natural e sincronizado cada vídeo parecia. Para ediçÃĢo, tambÃĐm avaliaram a suavidade da transiçÃĢo entre discurso editado e nÃĢo editado. NÚmeros em negrito e sublinhados mostram as duas melhores pontuaçÃĩes.

No estudo, o FacEDiT foi consistentemente classificado como o melhor por uma grande margem, tanto para a qualidade da ediçÃĢo quanto para a suavidade da transiçÃĢo, tambÃĐm recebendo pontuaçÃĩes fortes no cenÃĄrio de geraçÃĢo, sugerindo que suas vantagens medidas se traduzem em saídas perceptualmente preferidas.

Devido à falta de espaço, remetemos o leitor para o artigo de origem para mais detalhes sobre estudos de ablaçÃĢo e testes adicionais que foram realizados e relatados no novo trabalho. Na verdade, ofertas de pesquisa prototípicas desse tipo lutam para gerar seçÃĩes de resultados de teste significativos, pois a prÃģpria oferta central ÃĐ inevitavelmente uma base potencial para trabalhos posteriores.

ConclusÃĢo

Mesmo para inferÊncia, sistemas como esse podem exigir recursos computacionais significativos no momento da inferÊncia, tornando difícil para os usuÃĄrios downstream – aqui, presumivelmente, lojas de efeitos visuais – manter o trabalho local. Portanto, abordagens que possam ser adaptadas para recursos locais realistas sempre serÃĢo preferidas por provedores, que estÃĢo sob obrigaçÃĢo legal de proteger os footages e a propriedade intelectual dos clientes.

Isso nÃĢo ÃĐ para criticar a nova oferta, que pode operar perfeitamente sob pesos quantizados ou outras otimizaçÃĩes, e que ÃĐ a primeira oferta desse tipo a me atrair de volta a essa linha de pesquisa em bastante tempo.

 

Publicado pela primeira vez na quarta-feira, 17 de dezembro de 202. Editado em 20.10 EET, no mesmo dia, para adicionar espaço na primeira seçÃĢo do corpo.

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]