Ângulo de Anderson

O LipSync3D da Google Oferece Sincronização de Movimento de Lábios ‘Deepfaked’ Aprimorada

mm
Adicione Unite.AI às suas fontes preferidas no Google

Uma colaboração entre pesquisadores da Google AI e do Instituto de Tecnologia da Índia em Kharagpur oferece um novo quadro para sintetizar cabeças falantes a partir de conteúdo de áudio. O projeto visa produzir maneiras otimizadas e razoavelmente recursos para criar conteúdo de vídeo de “cabeça falante” a partir de áudio, para os fins de sincronizar movimentos de lábios com áudio dublado ou traduzido por máquina, e para uso em avatares, em aplicações interativas e em outros ambientes em tempo real.

Fonte: https://www.youtube.com/watch?v=L1StbX9OznY

Fonte: https://www.youtube.com/watch?v=L1StbX9OznY

Os modelos de aprendizado de máquina treinados no processo – chamados LipSync3D – requerem apenas um único vídeo da identidade facial alvo como dados de entrada. O pipeline de preparação de dados separa a extração de geometria facial da avaliação de iluminação e outros aspectos de um vídeo de entrada, permitindo um treinamento mais econômico e focado.

O fluxo de trabalho de dois estágios do LipSync3D. Acima, a geração de uma face 3D dinamicamente texturizada a partir do áudio 'alvo'; abaixo, a inserção da malha gerada em um vídeo alvo.

O fluxo de trabalho de dois estágios do LipSync3D. Acima, a geração de uma face 3D dinamicamente texturizada a partir do áudio ‘alvo’; abaixo, a inserção da malha gerada em um vídeo alvo.

Na verdade, a contribuição mais notável do LipSync3D para o corpo de esforço de pesquisa nesta área pode ser seu algoritmo de normalização de iluminação, que desacopla o treinamento e a inferência de iluminação.

Desacoplar dados de iluminação da geometria geral ajuda o LipSync3D a produzir saídas de movimento de lábios mais realistas em condições desafiadoras. Outras abordagens nos últimos anos limitaram-se a condições de iluminação 'fixas' que não revelam sua capacidade limitada neste aspecto.

Desacoplar dados de iluminação da geometria geral ajuda o LipSync3D a produzir saídas de movimento de lábios mais realistas em condições desafiadoras. Outras abordagens nos últimos anos limitaram-se a condições de iluminação ‘fixas’ que não revelam sua capacidade limitada neste aspecto.

Durante o pré-processamento dos quadros de entrada, o sistema deve identificar e remover pontos especulares, pois estes são específicos das condições de iluminação sob as quais o vídeo foi gravado e interferirão no processo de reiluminação.

O LipSync3D, como seu nome sugere, não está realizando apenas análise de pixels nas faces que avalia, mas ativamente usando marcos faciais identificados para gerar malhas CGI-style móveis, juntamente com as texturas ‘desdobradas’ que são embrulhadas ao redor delas em um pipeline CGI tradicional.

Normalização de pose no LipSync3D. À esquerda, os quadros de entrada e recursos detectados; no meio, os vértices normalizados da malha de avaliação gerada; e à direita, o atlas de textura correspondente, que fornece a verdade para a previsão de textura. Fonte: https://arxiv.org/pdf/2106.04185.pdf

Normalização de pose no LipSync3D. À esquerda, os quadros de entrada e recursos detectados; no meio, os vértices normalizados da malha de avaliação gerada; e à direita, o atlas de textura correspondente, que fornece a verdade para a previsão de textura. Fonte: https://arxiv.org/pdf/2106.04185.pdf

Além do método de reluzimento novo, os pesquisadores afirmam que o LipSync3D oferece três principais inovações em relação ao trabalho anterior: a separação de geometria, iluminação, pose e textura em fluxos de dados discretos em um espaço normalizado; um modelo de previsão de textura auto-regressivo facilmente treinável que produz síntese de vídeo temporalmente consistente; e realismo aumentado, avaliado por classificações humanas e métricas objetivas.

Dividir as várias facetas da imagem facial de vídeo permite um controle maior na síntese de vídeo.

Dividir as várias facetas da imagem facial de vídeo permite um controle maior na síntese de vídeo.

O LipSync3D pode derivar a geometria de movimento de lábios apropriada diretamente do áudio, analisando fonemas e outros aspectos da fala, e traduzindo-os em poses musculares conhecidas correspondentes ao redor da área da boca.

Esse processo usa um pipeline de previsão conjunta, onde a geometria e a textura inferidas têm codificadores dedicados em um conjunto autoencoder, mas compartilham um codificador de áudio com a fala que deve ser imposta no modelo:

A síntese de movimento labial do LipSync3D também é destinada a alimentar avatares CGI estilizados, que, na verdade, são apenas o mesmo tipo de malha e informações de textura que as imagens do mundo real:

Um avatar 3D estilizado tem seus movimentos de lábios alimentados em tempo real por um vídeo de orador de origem. Nesse cenário, os melhores resultados seriam obtidos com pré-treinamento personalizado.

Um avatar 3D estilizado tem seus movimentos de lábios alimentados em tempo real por um vídeo de orador de origem. Nesse cenário, os melhores resultados seriam obtidos com pré-treinamento personalizado.

Os pesquisadores também antecipam o uso de avatares com um sentimento ligeiramente mais realista:

Tempos de treinamento de amostra para os vídeos variam de 3 a 5 horas para um vídeo de 2 a 5 minutos, em um pipeline que usa TensorFlow, Python e C++ em um GeForce GTX 1080. As sessões de treinamento usaram um tamanho de lote de 128 quadros sobre 500-1000 épocas, com cada época representando uma avaliação completa do vídeo.

Em Direção à Re-Sincronização Dinâmica do Movimento de Lábios

O campo da re-sincronização de lábios para acomodar uma nova faixa de áudio recebeu muita atenção na pesquisa de visão computacional nos últimos anos (veja abaixo), não menos porque é um subproduto da tecnologia de deepfake controversa.

Em 2017, a Universidade de Washington apresentou uma pesquisa capaz de aprender sincronização de lábios a partir de áudio, usando-a para alterar os movimentos de lábios do então-presidente Obama. Em 2018, o Instituto Max Planck de Informática liderou outra iniciativa de pesquisa para permitir a transferência de vídeo de identidade para identidade, com sincronização de lábios como um subproduto do processo; e em maio de 2021, a startup de IA FlawlessAI revelou sua tecnologia de sincronização de lábios proprietária TrueSync, amplamente recebida na imprensa como um facilitador de tecnologias de dublagem aprimoradas para lançamentos de filmes importantes em várias línguas.

E, claro, o desenvolvimento contínuo de repositórios de código aberto de deepfake fornece outro ramo de pesquisa ativa de contribuição de usuário nesta esfera de síntese de imagem facial.

nc tecnologia TrueSync, amplamente recebida na imprensa como um facilitador de tecnologias de dublagem aprimoradas para lançamentos de filmes importantes em várias línguas. E, claro, o desenvolvimento contínuo de repositórios de código aberto de deepfake fornece outro ramo de pesquisa ativa de contribuição de usuário nesta esfera de síntese de imagem facial.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai