Ângulo de Anderson

EdiçÃĢo de Vídeo Consistente com Entrada Orientada por Texto

mm
Adicione Unite.AI às suas fontes preferidas no Google

Enquanto a comunidade profissional de efeitos visuais estÃĄ intrigada – e ocasionalmente se sente um pouco ameaçada – pelas novas inovaçÃĩes em síntese de imagem e vídeo, a falta de continuidade temporal em muitos projetos de ediçÃĢo de vídeo baseados em IA relega muitos desses esforços à esfera “psicodÃĐlica”, com texturas e estruturas cintilantes e rapidamente alteradas, efeitos inconsistentes e o tipo de tecnologia bruta que lembra a era fotoquímica dos efeitos visuais.

Se vocÊ deseja alterar algo muito específico em um vídeo que nÃĢo se encaixa na categoria de deepfakes (ou seja, impor uma nova identidade em imagens existentes de uma pessoa), a maioria das soluçÃĩes atuais opera sob limitaçÃĩes bastante severas, em termos de precisÃĢo necessÃĄria para efeitos visuais de produçÃĢo de qualidade.

Uma exceçÃĢo ÃĐ o trabalho contínuo de um grupo de acadÊmicos do Instituto de CiÊncia de Weizmann. Em 2021, trÊs de seus pesquisadores, em associaçÃĢo com a Adobe, anunciaram um mÃĐtodo inovador para decompor vídeo e superpor um mapeamento interno consistente – um atlas neural em camadas – em uma saída composta, completa com canais alfa e saída temporalmente coesa.

Do artigo de 2021: uma estimativa da travessia completa da estrada no clipe de origem ÃĐ editada por meio de uma rede neural de maneira que tradicionalmente exigiria rotoscopia e match-moving extensivos. Como os elementos de fundo e primeiro plano sÃĢo tratados por redes diferentes, as mÃĄscaras sÃĢo verdadeiramente 'automÃĄticas'. Fonte: https://layered-neural-atlases.github.io/

Do artigo de 2021: uma estimativa da travessia completa da estrada no clipe de origem ÃĐ editada por meio de uma rede neural de maneira que tradicionalmente exigiria rotoscopia e match-moving extensivos. Como os elementos de fundo e primeiro plano sÃĢo tratados por redes diferentes, as mÃĄscaras sÃĢo verdadeiramente ‘automÃĄticas’. Fonte: https://layered-neural-atlases.github.io/

Embora caia em algum lugar no domínio coberto por fluxo Ãģptico em pipelines de VFX, o atlas em camadas nÃĢo tem um equivalente direto em fluxos de trabalho de CGI tradicionais, pois constitui essencialmente um ‘mapa de textura temporal’ que pode ser produzido e editado por meio de mÃĐtodos de software tradicionais. Na segunda imagem da ilustraçÃĢo acima, o fundo da superfície da estrada ÃĐ representado (figurativamente) ao longo de toda a duraçÃĢo do vídeo. Alterar essa imagem de base (terceira imagem da esquerda na ilustraçÃĢo acima) produz uma mudança consistente no fundo.

As imagens do ‘atlas desdobrado’ acima representam apenas quadros interpretados individualmente; mudanças consistentes em qualquer quadro de vídeo alvo sÃĢo mapeadas de volta para o quadro original, mantendo qualquer oclusÃĢo necessÃĄria e outros efeitos de cena necessÃĄrios, como sombras ou reflexos.

A arquitetura central usa um Perceptron Multicamada (MLP) para representar os atlas desdobrados, canais alfa e mapeamentos, todos otimizados em conjunto e inteiramente em um espaço 2D, dispensando o conhecimento prÃĐvio de pontos de geometria 3D, mapas de profundidade e outros recursos de CGI.

O atlas de referÊncia de objetos individuais tambÃĐm pode ser alterado de forma confiÃĄvel:

Mudança consistente em um objeto em movimento sob o framework de 2021. Fonte: https://www.youtube.com/watch?v=aQhakPFC4oQ

Mudança consistente em um objeto em movimento sob o framework de 2021. Fonte: https://www.youtube.com/watch?v=aQhakPFC4oQ

Essencialmente, o sistema de 2021 combina alinhamento de geometria, match-moving, mapeamento, retexturizaçÃĢo e rotoscopia em um processo neural discreto.

Text2Live

Os trÊs pesquisadores originais do artigo de 2021, juntamente com a NVIDIA Research, estÃĢo entre os contribuintes para uma nova inovaçÃĢo na tÃĐcnica que combina o poder dos atlas em camadas com o tipo de tecnologia CLIP orientada por texto que voltou a ganhar destaque esta semana com o lançamento do framework DALL-E 2 da OpenAI.

A nova arquitetura, intitulada Text2Live, permite que um usuÃĄrio final crie ediçÃĩes localizadas em conteÚdo de vídeo real com base em prompts de texto:

Dois exemplos de ediçÃĢo de primeiro plano. Para melhor resoluçÃĢo e definiçÃĢo, verifique os vídeos originais em https://text2live.github.io/sm/pages/video_results_atlases.html

Dois exemplos de ediçÃĢo de primeiro plano. Para melhor resoluçÃĢo e definiçÃĢo, verifique os vídeos originais em https://text2live.github.io/sm/pages/video_results_atlases.html

Text2Live oferece ediçÃĢo semÃĒntica e altamente localizada sem o uso de um gerador prÃĐ-treinado, utilizando um banco de dados interno específico do clipe de vídeo afetado.

TransformaçÃĩes de fundo e primeiro plano (objeto) sob Text2Live. Fonte: https://text2live.github.io/sm/pages/video_results_atlases.html

TransformaçÃĩes de fundo e primeiro plano (objeto) sob Text2Live. Fonte: https://text2live.github.io/sm/pages/video_results_atlases.html

A tÃĐcnica nÃĢo requer mÃĄscaras fornecidas pelo usuÃĄrio, como um fluxo de trabalho típico de rotoscopia ou chroma key, mas sim estima mapas de relevÃĒncia por meio de uma tÃĐcnica de inicializaçÃĢo baseada em pesquisa de 2021 da Escola de CiÊncia da ComputaçÃĢo da Universidade de Tel Aviv e da Facebook AI Research (FAIR).

Mapas de saída gerados por meio de um modelo de atençÃĢo genÃĐrico baseado em transformador.

Mapas de saída gerados por meio de um modelo de atençÃĢo genÃĐrico baseado em transformador.

O novo artigo ÃĐ intitulado Text2LIVE: EdiçÃĢo de Imagem e Vídeo Orientada por Texto em Camadas. A equipe original de 2021 ÃĐ acompanhada por Omer Bar-Tal, do Weizmann, e Yoni Kasten, da NVIDIA Research.

Arquitetura

Text2Live compreende um gerador treinado em uma Única imagem de entrada e prompts de texto. Um modelo CLIP prÃĐ-treinado em 400 milhÃĩes de pares de texto/imagens fornece material visual associado a partir do qual transformaçÃĩes de entrada do usuÃĄrio podem ser interpretadas.

O gerador aceita uma imagem de entrada (quadro) e produz uma camada RGBA de destino contendo informaçÃĩes de cor e opacidade. Essa camada ÃĐ entÃĢo composta no footage original com aumentos adicionais.

O canal alfa na camada RGBA gerada fornece uma funçÃĢo de composiçÃĢo interna sem recorrer a pipelines tradicionais que envolvem software baseado em pixels, como o After Effects.

O canal alfa na camada RGBA gerada fornece uma funçÃĢo de composiçÃĢo interna sem recorrer a pipelines tradicionais que envolvem software baseado em pixels, como o After Effects.

Ao treinar em imagens internas relevantes para o vídeo ou imagem de destino, Text2Live evita a necessidade de inverter a imagem de entrada no espaço latente de uma Rede AdversÃĄria Generativa (GAN), uma prÃĄtica que atualmente estÃĄ longe de ser exata o suficiente para requisitos de ediçÃĢo de vídeo de produçÃĢo, ou usar um modelo de difusÃĢo que ÃĐ mais preciso e configurÃĄvel, mas nÃĢo pode manter a fidelidade ao vídeo de destino.

Diversas ediçÃĩes de transformaçÃĢo baseadas em prompts do Text2Live.

Diversas ediçÃĩes de transformaçÃĢo baseadas em prompts do Text2Live.

Abordagens anteriores usaram mÃĐtodos baseados em propagaçÃĢo ou abordagens baseadas em fluxo Ãģptico. Como essas tÃĐcnicas sÃĢo, em algum grau, baseadas em quadros, nenhuma delas ÃĐ capaz de criar uma aparÊncia temporal consistente de mudanças no vídeo de saída. Um atlas neural em camadas, por outro lado, fornece um Único espaço para abordar mudanças, que podem entÃĢo permanecer fiÃĐis à mudança comprometida à medida que o vídeo avança.

Sem 'sizzling' ou alucinaçÃĩes aleatÃģrias: Text2Live obtÃĐm uma interpretaçÃĢo do prompt de texto 'jeep enferrujado' e aplica-o uma vez ao atlas neural em camadas do carro no vídeo, em vez de reiniciar a transformaçÃĢo para cada quadro interpretado.

Sem ‘sizzling’ ou alucinaçÃĩes aleatÃģrias: Text2Live obtÃĐm uma interpretaçÃĢo do prompt de texto ‘jeep enferrujado’ e aplica-o uma vez ao atlas neural em camadas do carro no vídeo, em vez de reiniciar a transformaçÃĢo para cada quadro interpretado.

Fluxo de trabalho da transformaçÃĢo consistente do Text2Live de um Jeep em uma relíquia enferrujada.

Fluxo de trabalho da transformaçÃĢo consistente do Text2Live de um Jeep em uma relíquia enferrujada.

Text2Live estÃĄ mais prÃģximo de uma inovaçÃĢo na composiçÃĢo baseada em IA do que no fÃĐrtil espaço de texto para imagem, que atraiu tanta atençÃĢo esta semana com o lançamento da segunda geraçÃĢo do framework DALL-E da OpenAI (que pode incorporar imagens de destino como parte do processo de transformaçÃĢo, mas permanece limitado em sua capacidade de intervir diretamente em uma foto, alÃĐm da censura de dados de treinamento de origem e imposiçÃĢo de filtros projetados para prevenir o abuso do usuÃĄrio).

Em vez disso, Text2Live permite que o usuÃĄrio final extraia um atlas e, em seguida, edite-o em uma Única passagem em ambientes de pixels de alto controle, como o Photoshop (e, argumenta-se, mesmo em frameworks de síntese de imagem mais abstratos, como o NeRF), antes de alimentÃĄ-lo de volta em um ambiente corretamente orientado que, no entanto, nÃĢo depende de estimativa 3D ou abordagens baseadas em CGI.

AlÃĐm disso, Text2Live, segundo os autores, ÃĐ o primeiro framework comparÃĄvel a alcançar mascaramento e composiçÃĢo de forma completamente automÃĄtica.

 

Publicado pela primeira vez em 7 de abril de 2022.

Escritor em aprendizado de mÃĄquina, especialista em síntese de imagem humana. Antigo chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]