Modelos e plataformas de IA

Pontuando a Lacuna entre os Quadros no Vídeo Gerado por IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
Images taken from the FCVG paper and project site, https://arxiv.org/pdf/2412.11755 and https://fcvg-inbetween.github.io/

Nova pesquisa da China está oferecendo um método melhorado para interporlar a lacuna entre dois quadros de vídeo temporalmente distantes – um dos desafios mais cruciais na corrida atual em direção ao realismo para o vídeo gerado por IA, bem como para a compressão de codec de vídeo.

No exemplo de vídeo abaixo, vemos na coluna mais à esquerda um quadro de “início” (acima à esquerda) e um quadro de “fim” (abaixo à esquerda). A tarefa que os sistemas concorrentes devem realizar é adivinhar como o assunto nas duas imagens se moveria do quadro A para o quadro B. Na animação, esse processo é chamado de tweening, e remonta à era do cinema mudo.

Clique para reproduzir. Na primeira coluna, à esquerda, vemos os quadros de início e fim propostos. Na coluna do meio e no topo da terceira coluna (à direita), vemos três abordagens anteriores para esse desafio. Na parte inferior direita, vemos que o novo método obtém um resultado muito mais convincente ao fornecer os quadros intersticiais. Fonte: https://fcvg-inbetween.github.io/

O novo método proposto pelos pesquisadores chineses é chamado de Geração de Vídeo por Condições de Quadro (FCVG), e seus resultados podem ser vistos na parte inferior direita do vídeo acima, fornecendo uma transição suave e lógica de um quadro para o outro.

Em contraste, podemos ver que um dos frameworks mais celebrados para interpolação de vídeo, o projeto Frame Interpolation for Large Motion (FILM) da Google, luta, como muitas outras abordagens semelhantes, para interpretar movimentos grandes e ousados.

As outras duas abordagens rivais visualizadas no vídeo, Fusão de Reversão de Tempo (TRF) e Interpolação Gerativa (GI), fornecem uma interpretação menos enviesada, mas criam movimentos de dança frenéticos e até cômicos, nenhum dos quais respeita a lógica implícita dos dois quadros fornecidos.

Clique para reproduzir. Duas soluções imperfeitas para o problema de tweening. À esquerda, o FILM trata os dois quadros como simples alvos de morfologia. À direita, a TRF sabe que algum tipo de dança precisa ser inserida, mas vem com uma solução impraticável que demonstra anomalias anatômicas.

Ao lado esquerdo, podemos dar uma olhada mais de perto em como o FILM está abordando o problema. Embora o FILM tenha sido projetado para lidar com movimentos grandes, em contraste com abordagens anteriores baseadas em fluxo óptico, ele ainda carece de uma compreensão semântica do que deveria estar acontecendo entre os dois quadros-chave fornecidos e simplesmente executa uma morfologia entre os quadros no estilo dos anos 80/90. O FILM não tem uma arquitetura semântica, como um Modelo de Difusão Latente como o Stable Diffusion, para ajudar a criar uma ponte apropriada entre os quadros.

À direita, no vídeo acima, vemos a tentativa da TRF, onde o Stable Video Diffusion (SVD) é usado para “adivinhar” de forma mais inteligente como um movimento de dança apropriado para os dois quadros fornecidos pelo usuário poderia ser – mas ele fez uma aproximação ousada e implausível.

O FCVG, visto abaixo, faz um trabalho mais credível ao adivinhar o movimento e o conteúdo entre os dois quadros:

Clique para reproduzir. O FCVG melhora as abordagens anteriores, mas está longe de ser perfeito.

Ainda existem artefatos, como morfologia indesejada de mãos e identidade facial, mas essa versão é superficialmente a mais plausível – e qualquer melhoria no estado da arte precisa ser considerada contra a enorme dificuldade que a tarefa propõe; e o grande obstáculo que o desafio apresenta para o futuro do vídeo gerado por IA.

Por Que a Interpolação É Importante

Como apontamos anteriormente, a capacidade de preencher plausivelmente o conteúdo de vídeo entre dois quadros fornecidos pelo usuário é uma das melhores maneiras de manter consistência temporal no vídeo gerado por IA, desde que dois fotos reais e consecutivas da mesma pessoa contenham naturalmente elementos consistentes, como roupas, cabelo e ambiente.

Quando apenas um único quadro de início é usado, a janela de atenção limitada de um sistema gerativo, que muitas vezes considera apenas quadros próximos, tenderá a “evoluir” gradualmente aspectos do assunto, até que (por exemplo) um homem se torne outro homem (ou uma mulher), ou prove ter “morfologia” de roupas – entre muitas outras distrações comumente geradas em sistemas T2V de código aberto e na maioria das soluções pagas, como o Kling:

Clique para reproduzir. Alimentando o novo artigo com os dois quadros de origem do usuário, com o prompt ‘Um homem dançando no telhado’, não resultou em uma solução ideal. Embora o Kling 1.6 estivesse disponível no momento da criação, o V1.5 é o mais recente a suportar quadros de início e fim do usuário. Fonte: https://klingai.com/

O Problema Já Foi Resolvido?

Em contraste, alguns sistemas comerciais, de código fechado e proprietários, parecem estar se saindo melhor com o problema – notadamente o RunwayML, que conseguiu criar interpolações muito plausíveis dos dois quadros de origem:

Clique para reproduzir. A interpolação baseada em difusão do RunwayML é muito eficaz. Fonte: https://app.runwayml.com/

Repetindo o exercício, o RunwayML produziu um segundo resultado igualmente credível:

Clique para reproduzir. A segunda execução da sequência do RunwayML.

Um problema aqui é que não podemos aprender nada sobre os desafios envolvidos, nem avançar o estado da arte de código aberto, a partir de um sistema proprietário. Não podemos saber se essa renderização superior foi alcançada por abordagens arquiteturais únicas, por dados (ou métodos de curação de dados, como filtragem e anotação), ou alguma combinação desses e outras inovações de pesquisa possíveis.

Em segundo lugar, empresas menores, como empresas de efeitos visuais, não podem depender a longo prazo de serviços de API B2B que possam potencialmente comprometer seu planejamento logístico com um único aumento de preço – especialmente se um serviço vier a dominar o mercado e, portanto, estiver mais inclinado a aumentar os preços.

Quando os Direitos Estão Errados

Muito mais importante, se um modelo comercial de alto desempenho for treinado em dados não licenciados, como parece ser o caso do RunwayML, qualquer empresa que use esses serviços pode correr o risco de exposição legal downstream.

Desde que as leis (e alguns processos) duram mais do que presidentes, e desde que o mercado crucial dos EUA é entre os mais litigiosos do mundo, a tendência atual em direção a uma supervisão legislativa maior para dados de treinamento de IA parece provável que sobreviva ao ‘toque leve’ do próximo mandato presidencial de Donald Trump.

Portanto, o setor de pesquisa de visão computacional terá que enfrentar esse problema de forma difícil, para que qualquer solução emergente possa durar a longo prazo.

FCVG

O novo método da China é apresentado em um artigo intitulado Geração de Vídeo por Interpolação Gerativa por Condições de Quadro, e vem de cinco pesquisadores da Harbin Institute of Technology e da Tianjin University.

O FCVG resolve o problema da ambiguidade na tarefa de interpolação ao utilizar condições de quadro, juntamente com um framework que delimita bordas nos quadros de início e fim fornecidos pelo usuário, o que ajuda o processo a manter uma pista mais consistente das transições entre quadros individuais e também do efeito geral.

A condição de quadro envolve quebrar a criação de quadros intersticiais em subtarefas, em vez de tentar preencher um grande vazio semântico entre dois quadros (e quanto maior a saída de vídeo solicitada, maior é a distância semântica).

No gráfico abaixo, do artigo, os autores comparam o método de reversão de tempo (TRF) com o deles. O TRF cria dois caminhos de geração de vídeo usando um modelo de imagem-para-vídeo pré-treinado (SVD). Um é um caminho “para frente” condicionado no quadro de início, e o outro é um caminho “para trás” condicionado no quadro de fim. Ambos os caminhos começam a partir do mesmo ruído aleatório. Isso é ilustrado à esquerda da imagem abaixo:

Comparação de abordagens anteriores ao FCVG. Fonte: https://arxiv.org/pdf/2412.11755

Comparação de abordagens anteriores ao FCVG. Fonte: https://arxiv.org/pdf/2412.11755

Os autores afirmam que o FCVG é uma melhoria sobre os métodos de reversão de tempo porque reduz a ambiguidade na geração de vídeo, fornecendo a cada quadro sua própria condição explícita, levando a uma saída mais estável e consistente.

Os métodos de reversão de tempo, como o TRF, o artigo afirma, podem levar a ambiguidade, pois os caminhos de geração para frente e para trás podem divergir, causando desalinhamento ou inconsistências. O FCVG aborda isso usando condições de quadro derivadas de linhas correspondentes entre os quadros de início e fim (abaixo à direita na imagem acima), que guiam o processo de geração.

Clique para reproduzir. Outra comparação da página do projeto FCVG.

A reversão de tempo permite o uso de modelos de geração de vídeo pré-treinados para interpolação, mas tem algumas desvantagens. O movimento gerado pelos modelos I2V é diverso em vez de estável. Embora isso seja útil para tarefas puras de imagem-para-vídeo (I2V), cria ambiguidade e leva a caminhos de vídeo desalinhados ou inconsistentes.

A reversão de tempo também requer ajustes laboriosos de hiperparâmetros, como a taxa de quadros para cada vídeo gerado. Além disso, algumas das técnicas envolvidas na reversão de tempo para reduzir a ambiguidade desaceleram significativamente a inferência, aumentando os tempos de processamento.

Método

Os autores observam que, se o primeiro desses problemas (diversidade versus estabilidade) puder ser resolvido, todos os outros problemas subsequentes provavelmente se resolverão. Isso foi tentado em ofertas anteriores, como a mencionada GI, e também ViBiDSampler.

O artigo afirma:

‘No entanto, [ainda] existe uma estocasticidade considerável entre esses caminhos, o que limita a eficácia desses métodos em lidar com cenários que envolvem grandes movimentos, como mudanças rápidas em poses humanas. A ambiguidade no caminho de interpolação surge principalmente da falta de condições para quadros intermediários, pois duas imagens de entrada fornecem condições apenas para os quadros de início e fim.’

‘Portanto, [nós] sugerimos oferecer uma condição explícita para cada quadro, o que alivia significativamente a ambiguidade do caminho de interpolação.’

Podemos ver os conceitos centrais do FCVG em ação no esquema abaixo. O FCVG gera uma sequência de quadros de vídeo que começam e terminam consistentemente com dois quadros de entrada. Isso garante que os quadros sejam temporalmente estáveis, fornecendo condições específicas de quadro para o processo de geração de vídeo.

Esquema para inferência do FCVG.

Esquema para inferência do FCVG.

Nessa reinterpretação da abordagem de reversão de tempo, o método combina informações de ambas as direções, para frente e para trás, mesclando-as para criar transições suaves. Por meio de um processo iterativo, o modelo refina gradualmente as entradas ruidosas até que o conjunto final de quadros intersticiais seja produzido.

A próxima etapa envolve o uso do modelo de correspondência de linhas pré-treinado GlueStick, que cria correspondências entre os dois quadros de início e fim calculados, com o uso opcional de poses esqueléticas para guiar o modelo, por meio do modelo de difusão de vídeo estável.

GlueStick deriva linhas de formas interpretadas. Essas linhas fornecem âncoras de correspondência entre os quadros de início e fim no FCVG*.

GlueStick deriva linhas de formas interpretadas. Essas linhas fornecem âncoras de correspondência entre os quadros de início e fim no FCVG*.

Os autores observam:

‘Empiricamente, encontramos que a interpolação linear é suficiente para a maioria dos casos para garantir estabilidade temporal nos vídeos interpolados, e nosso método permite que os usuários especifiquem caminhos de interpolação não lineares para gerar vídeos desejados.’

Fluxo de trabalho para estabelecer condições de quadro para frente e para trás. Podemos ver as cores correspondentes que mantêm o conteúdo consistente à medida que a animação se desenvolve.

Fluxo de trabalho para estabelecer condições de quadro para frente e para trás. Podemos ver as cores correspondentes que mantêm o conteúdo consistente à medida que a animação se desenvolve.

Para injetar as condições de quadro obtidas no SVD, o FCVG usa o método desenvolvido para a iniciativa ControlNeXt de 2024. Nesse processo, as condições de controle são inicialmente codificadas por vários blocos ResNet, antes da normalização cruzada entre os ramos de condição e SVD do fluxo de trabalho.

Um pequeno conjunto de vídeos é usado para ajuste fino do modelo SVD, com a maioria dos parâmetros do modelo congelados.

‘As [mencionadas limitações] foram amplamente resolvidas no FCVG: (i) Ao especificar explicitamente a condição para cada quadro, a ambiguidade entre os caminhos para frente e para trás é significativamente aliviada; (ii) Apenas um parâmetro ajustável é introduzido, enquanto os hiperparâmetros no SVD são mantidos como padrão, o que produz resultados favoráveis na maioria dos cenários; (iii) Uma fusão de média simples, sem re-injeção de ruído, é adequada no FCVG, e as etapas de inferência podem ser substancialmente reduzidas em 50% em comparação com [GI].’

Esquema geral para injetar condições de quadro no Stable Video Diffusion para o FCVG.

Esquema geral para injetar condições de quadro no Stable Video Diffusion para o FCVG.

Dados e Testes

Para testar o sistema, os pesquisadores criaram um conjunto de dados com cenas diversificadas, incluindo ambientes ao ar livre, poses humanas e locais internos, incluindo movimentos como movimento de câmera, ações de dança e expressões faciais, entre outros. Os 524 clipes escolhidos foram tirados dos conjuntos de dados DAVIS e RealEstate10k. Esse conjunto foi suplementado com vídeos de alta taxa de quadros obtidos do Pexels. O conjunto curado foi dividido 4:1 entre ajuste fino e teste.

As métricas usadas foram Métricas de Semelhança Perceptual Aprendidas (LPIPS); Distância de Inception de Fréchet (FID); Distância de Vídeo de Fréchet (FVD); VBench; e Distância de Movimento de Vídeo de Fréchet.

Os autores observam que nenhuma dessas métricas é bem adaptada para estimar estabilidade temporal e nos remetem aos vídeos na página do projeto FCVG.

Além do uso do GlueStick para correspondência de linhas, o DWPose foi usado para estimar poses humanas.

O ajuste fino ocorreu por 70.000 iterações sob o otimizador AdamW em um GPU NVIDIA A800, com uma taxa de aprendizado de 1×10-6, com quadros recortados para patches de 512×320.

As abordagens rivais anteriores testadas foram FILM, GI, TRF e DynamiCrafter.

Para a avaliação quantitativa, as lacunas de quadros abordadas variaram entre 12 e 23.

Resultados quantitativos contra abordagens anteriores.

Resultados quantitativos contra abordagens anteriores.

Quanto a esses resultados, o artigo observa:

‘[Nosso] método alcança o melhor desempenho entre quatro abordagens gerativas em todas as métricas. Quanto à comparação LPIPS com o FILM, nosso FCVG é marginalmente inferior, enquanto demonstra desempenho superior em outras métricas. Considerando a ausência de informações temporais no LPIPS, pode ser mais apropriado priorizar outras métricas e observação visual.

‘Além disso, comparando os resultados sob diferentes lacunas de quadros, o FILM pode funcionar bem quando a lacuna é pequena, enquanto os métodos gerativos são mais adequados para lacunas grandes. Entre esses métodos gerativos, nosso FCVG exibe superioridade significativa devido às suas condições de quadro explícitas.’

Para testes qualitativos, os autores produziram os vídeos vistos na página do projeto (alguns incorporados a este artigo), e resultados estáticos e animados no PDF do artigo,

Resultados estáticos do artigo. Por favor, consulte o PDF de origem para melhor resolução e esteja ciente de que o PDF contém animações que podem ser reproduzidas em aplicativos que suportam essa funcionalidade.

Resultados estáticos do artigo. Por favor, consulte o PDF de origem para melhor resolução e esteja ciente de que o PDF contém animações que podem ser reproduzidas em aplicativos que suportam essa funcionalidade.

Os autores comentam:

‘Enquanto o FILM produz resultados de interpolação suaves para cenários de movimento pequeno, ele luta com movimentos de grande escala devido às limitações inerentes do fluxo óptico, resultando em artefatos notáveis, como movimento de fundo e mãos (no primeiro caso).

‘Modelos gerativos, como TRF e GI, sofrem de ambiguidades nos caminhos de fusão, levando a movimentos intermediários instáveis, particularmente evidentes em cenas complexas que envolvem movimento humano e de objetos.

‘Em contraste, nosso método consistentemente entrega resultados satisfatórios em vários cenários.’ Mesmo quando há oclusão significativa (no segundo e no sexto caso), nosso método ainda consegue capturar movimento razoável. Além disso, nossa abordagem exibe robustez para ações humanas complexas (no último caso).’

Os autores também descobriram que o FCVG se generaliza de forma incomum para vídeos de estilo de animação:

Clique para reproduzir. O FCVG produz resultados muito convincentes para animação de estilo cartoon.

Conclusão

O FCVG representa pelo menos uma melhoria incremental para o estado da arte na interpolação de quadros em um contexto não proprietário. Os autores tornaram o código do trabalho disponível no GitHub, embora o conjunto de dados associado não tenha sido liberado no momento da escrita.

Se as soluções comerciais proprietárias estiverem superando os esforços de código aberto por meio do uso de dados não licenciados da web, parece haver um futuro limitado nessa abordagem, pelo menos para uso comercial; os riscos são simplesmente muito grandes.

Portanto, mesmo que a cena de código aberto esteja atrás dos líderes de mercado atuais, é, argumentativamente, a tartaruga que pode vencer a corrida.

 

* Fonte: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf

Requer o Leitor de PDF Acrobat, Okular ou qualquer outro leitor de PDF que possa reproduzir animações incorporadas.

 

Publicado pela primeira vez na sexta-feira, 20 de dezembro de 2024

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai