Ãngulo de Anderson
EdiçÃĢo de VÃdeo Consistente com Entrada Orientada por Texto

Enquanto a comunidade profissional de efeitos visuais estÃĄ intrigada â e ocasionalmente se sente um pouco ameaçada â pelas novas inovaçÃĩes em sÃntese de imagem e vÃdeo, a falta de continuidade temporal em muitos projetos de ediçÃĢo de vÃdeo baseados em IA relega muitos desses esforços à esfera âpsicodÃĐlicaâ, com texturas e estruturas cintilantes e rapidamente alteradas, efeitos inconsistentes e o tipo de tecnologia bruta que lembra a era fotoquÃmica dos efeitos visuais.
Se vocÊ deseja alterar algo muito especÃfico em um vÃdeo que nÃĢo se encaixa na categoria de deepfakes (ou seja, impor uma nova identidade em imagens existentes de uma pessoa), a maioria das soluçÃĩes atuais opera sob limitaçÃĩes bastante severas, em termos de precisÃĢo necessÃĄria para efeitos visuais de produçÃĢo de qualidade.
Uma exceçÃĢo ÃĐ o trabalho contÃnuo de um grupo de acadÊmicos do Instituto de CiÊncia de Weizmann. Em 2021, trÊs de seus pesquisadores, em associaçÃĢo com a Adobe, anunciaram um mÃĐtodo inovador para decompor vÃdeo e superpor um mapeamento interno consistente â um atlas neural em camadas â em uma saÃda composta, completa com canais alfa e saÃda temporalmente coesa.

Do artigo de 2021: uma estimativa da travessia completa da estrada no clipe de origem ÃĐ editada por meio de uma rede neural de maneira que tradicionalmente exigiria rotoscopia e match-moving extensivos. Como os elementos de fundo e primeiro plano sÃĢo tratados por redes diferentes, as mÃĄscaras sÃĢo verdadeiramente âautomÃĄticasâ. Fonte: https://layered-neural-atlases.github.io/
Embora caia em algum lugar no domÃnio coberto por fluxo Ãģptico em pipelines de VFX, o atlas em camadas nÃĢo tem um equivalente direto em fluxos de trabalho de CGI tradicionais, pois constitui essencialmente um âmapa de textura temporalâ que pode ser produzido e editado por meio de mÃĐtodos de software tradicionais. Na segunda imagem da ilustraçÃĢo acima, o fundo da superfÃcie da estrada ÃĐ representado (figurativamente) ao longo de toda a duraçÃĢo do vÃdeo. Alterar essa imagem de base (terceira imagem da esquerda na ilustraçÃĢo acima) produz uma mudança consistente no fundo.
As imagens do âatlas desdobradoâ acima representam apenas quadros interpretados individualmente; mudanças consistentes em qualquer quadro de vÃdeo alvo sÃĢo mapeadas de volta para o quadro original, mantendo qualquer oclusÃĢo necessÃĄria e outros efeitos de cena necessÃĄrios, como sombras ou reflexos.
A arquitetura central usa um Perceptron Multicamada (MLP) para representar os atlas desdobrados, canais alfa e mapeamentos, todos otimizados em conjunto e inteiramente em um espaço 2D, dispensando o conhecimento prÃĐvio de pontos de geometria 3D, mapas de profundidade e outros recursos de CGI.
O atlas de referÊncia de objetos individuais tambÃĐm pode ser alterado de forma confiÃĄvel:

Mudança consistente em um objeto em movimento sob o framework de 2021. Fonte: https://www.youtube.com/watch?v=aQhakPFC4oQ
Essencialmente, o sistema de 2021 combina alinhamento de geometria, match-moving, mapeamento, retexturizaçÃĢo e rotoscopia em um processo neural discreto.
Text2Live
Os trÊs pesquisadores originais do artigo de 2021, juntamente com a NVIDIA Research, estÃĢo entre os contribuintes para uma nova inovaçÃĢo na tÃĐcnica que combina o poder dos atlas em camadas com o tipo de tecnologia CLIP orientada por texto que voltou a ganhar destaque esta semana com o lançamento do framework DALL-E 2 da OpenAI.
A nova arquitetura, intitulada Text2Live, permite que um usuÃĄrio final crie ediçÃĩes localizadas em conteÚdo de vÃdeo real com base em prompts de texto:


Dois exemplos de ediçÃĢo de primeiro plano. Para melhor resoluçÃĢo e definiçÃĢo, verifique os vÃdeos originais em https://text2live.github.io/sm/pages/video_results_atlases.html
Text2Live oferece ediçÃĢo semÃĒntica e altamente localizada sem o uso de um gerador prÃĐ-treinado, utilizando um banco de dados interno especÃfico do clipe de vÃdeo afetado.

TransformaçÃĩes de fundo e primeiro plano (objeto) sob Text2Live. Fonte: https://text2live.github.io/sm/pages/video_results_atlases.html
A tÃĐcnica nÃĢo requer mÃĄscaras fornecidas pelo usuÃĄrio, como um fluxo de trabalho tÃpico de rotoscopia ou chroma key, mas sim estima mapas de relevÃĒncia por meio de uma tÃĐcnica de inicializaçÃĢo baseada em pesquisa de 2021 da Escola de CiÊncia da ComputaçÃĢo da Universidade de Tel Aviv e da Facebook AI Research (FAIR).

Mapas de saÃda gerados por meio de um modelo de atençÃĢo genÃĐrico baseado em transformador.
O novo artigo ÃĐ intitulado Text2LIVE: EdiçÃĢo de Imagem e VÃdeo Orientada por Texto em Camadas. A equipe original de 2021 ÃĐ acompanhada por Omer Bar-Tal, do Weizmann, e Yoni Kasten, da NVIDIA Research.
Arquitetura
Text2Live compreende um gerador treinado em uma Única imagem de entrada e prompts de texto. Um modelo CLIP prÃĐ-treinado em 400 milhÃĩes de pares de texto/imagens fornece material visual associado a partir do qual transformaçÃĩes de entrada do usuÃĄrio podem ser interpretadas.

O gerador aceita uma imagem de entrada (quadro) e produz uma camada RGBA de destino contendo informaçÃĩes de cor e opacidade. Essa camada ÃĐ entÃĢo composta no footage original com aumentos adicionais.

O canal alfa na camada RGBA gerada fornece uma funçÃĢo de composiçÃĢo interna sem recorrer a pipelines tradicionais que envolvem software baseado em pixels, como o After Effects.
Ao treinar em imagens internas relevantes para o vÃdeo ou imagem de destino, Text2Live evita a necessidade de inverter a imagem de entrada no espaço latente de uma Rede AdversÃĄria Generativa (GAN), uma prÃĄtica que atualmente estÃĄ longe de ser exata o suficiente para requisitos de ediçÃĢo de vÃdeo de produçÃĢo, ou usar um modelo de difusÃĢo que ÃĐ mais preciso e configurÃĄvel, mas nÃĢo pode manter a fidelidade ao vÃdeo de destino.

Diversas ediçÃĩes de transformaçÃĢo baseadas em prompts do Text2Live.
Abordagens anteriores usaram mÃĐtodos baseados em propagaçÃĢo ou abordagens baseadas em fluxo Ãģptico. Como essas tÃĐcnicas sÃĢo, em algum grau, baseadas em quadros, nenhuma delas ÃĐ capaz de criar uma aparÊncia temporal consistente de mudanças no vÃdeo de saÃda. Um atlas neural em camadas, por outro lado, fornece um Único espaço para abordar mudanças, que podem entÃĢo permanecer fiÃĐis à mudança comprometida à medida que o vÃdeo avança.

Sem âsizzlingâ ou alucinaçÃĩes aleatÃģrias: Text2Live obtÃĐm uma interpretaçÃĢo do prompt de texto âjeep enferrujadoâ e aplica-o uma vez ao atlas neural em camadas do carro no vÃdeo, em vez de reiniciar a transformaçÃĢo para cada quadro interpretado.

Fluxo de trabalho da transformaçÃĢo consistente do Text2Live de um Jeep em uma relÃquia enferrujada.
Text2Live estÃĄ mais prÃģximo de uma inovaçÃĢo na composiçÃĢo baseada em IA do que no fÃĐrtil espaço de texto para imagem, que atraiu tanta atençÃĢo esta semana com o lançamento da segunda geraçÃĢo do framework DALL-E da OpenAI (que pode incorporar imagens de destino como parte do processo de transformaçÃĢo, mas permanece limitado em sua capacidade de intervir diretamente em uma foto, alÃĐm da censura de dados de treinamento de origem e imposiçÃĢo de filtros projetados para prevenir o abuso do usuÃĄrio).
Em vez disso, Text2Live permite que o usuÃĄrio final extraia um atlas e, em seguida, edite-o em uma Única passagem em ambientes de pixels de alto controle, como o Photoshop (e, argumenta-se, mesmo em frameworks de sÃntese de imagem mais abstratos, como o NeRF), antes de alimentÃĄ-lo de volta em um ambiente corretamente orientado que, no entanto, nÃĢo depende de estimativa 3D ou abordagens baseadas em CGI.
AlÃĐm disso, Text2Live, segundo os autores, ÃĐ o primeiro framework comparÃĄvel a alcançar mascaramento e composiçÃĢo de forma completamente automÃĄtica.
Â
Publicado pela primeira vez em 7 de abril de 2022.












