Modelos e plataformas de IA
Difusão de Vídeo Estável: Modelos de Difusão de Vídeo Latente para Grandes Conjuntos de Dados
IA Geradora tem sido uma força motriz na comunidade de IA por algum tempo agora, e os avanços feitos no campo de modelagem de imagens geradoras, especialmente com o uso de modelos de difusão, ajudaram os modelos de vídeo geradores a progredir significativamente não apenas em pesquisa, mas também em termos de aplicações do mundo real. Conventionalmente, os modelos de vídeo geradores são treinados do zero ou são parcial ou completamente ajustados de modelos de imagem pré-treinados com camadas temporais extras, em uma mistura de conjuntos de dados de imagem e vídeo.
Avançando com os avanços nos modelos de vídeo geradores, neste artigo, vamos falar sobre o Modelo de Difusão de Vídeo Estável, um modelo de difusão de vídeo latente capaz de gerar conteúdo de vídeo de alta resolução, de imagem para vídeo e de texto para vídeo de última geração. Vamos falar sobre como os modelos de difusão latente treinados para sintetizar imagens 2D melhoraram as habilidades e eficiência dos modelos de vídeo geradores ao adicionar camadas temporais e ajustar os modelos em conjuntos de dados pequenos consistindo em vídeos de alta qualidade. Vamos mergulhar mais fundo na arquitetura e funcionamento do Modelo de Difusão de Vídeo Estável e avaliar seu desempenho em várias métricas e compará-lo com os frameworks atuais de geração de vídeo de última geração. Vamos começar.
Modelo de Difusão de Vídeo Estável e Modelos de Vídeo Geradores: Uma Introdução
Graças ao seu potencial quase ilimitado, a IA Geradora tem sido o assunto principal de pesquisa para os praticantes de IA e ML por um tempo agora, e os últimos anos têm visto avanços rápidos tanto em termos de eficiência quanto de desempenho dos modelos de imagem geradores. Os conhecimentos adquiridos com os modelos de imagem geradores permitiram que os pesquisadores e desenvolvedores fizessem progressos nos modelos de vídeo geradores, resultando em uma maior praticidade e aplicações do mundo real. No entanto, a maioria das pesquisas que tentam melhorar as capacidades dos modelos de vídeo geradores se concentra principalmente na disposição exata das camadas temporais e espaciais, com pouca atenção sendo dada para investigar a influência da seleção dos dados certos no resultado desses modelos geradores.
Graças ao progresso feito pelos modelos de imagem geradores, os pesquisadores observaram que o impacto da distribuição dos dados de treinamento no desempenho dos modelos geradores é de fato significativo e indiscutível. Além disso, os pesquisadores também observaram que pré-treinar um modelo de imagem gerador em um conjunto de dados grande e diverso seguido de ajuste fino em um conjunto de dados menor com melhor qualidade frequentemente resulta em uma melhoria significativa no desempenho. Tradicionalmente, os modelos de vídeo geradores implementam os conhecimentos obtidos a partir de modelos de imagem geradores bem-sucedidos, e os pesquisadores ainda não estudaram o efeito dos dados e das estratégias de treinamento. O Modelo de Difusão de Vídeo Estável é uma tentativa de melhorar as habilidades dos modelos de vídeo geradores ao aventurar-se em territórios inexplorados anteriormente, com foco especial na seleção de dados.

Os modelos de vídeo geradores recentes dependem de modelos de difusão, e abordagens de condicionamento de texto ou imagem para sintetizar várias quadros de vídeo ou imagem consistentes. Os modelos de difusão são conhecidos por sua capacidade de aprender a desdenoizar gradualmente uma amostra a partir de uma distribuição normal, implementando um processo de refinamento iterativo, e eles entregaram resultados desejáveis em vídeo de alta resolução e síntese de texto para imagem. Usando o mesmo princípio em seu núcleo, o Modelo de Difusão de Vídeo Estável treina um modelo de difusão de vídeo latente em seu conjunto de dados de vídeo, juntamente com o uso de Redes Adversárias Gerativas ou GANs, e até mesmo modelos autoregressivos em certa medida.
O Modelo de Difusão de Vídeo Estável segue uma estratégia única nunca implementada por qualquer modelo de vídeo gerador, pois depende de linhas de base de difusão de vídeo latente com uma arquitetura fixa e uma estratégia de treinamento fixa, seguida de avaliação do efeito da curadoria dos dados. O Modelo de Difusão de Vídeo Estável visa fazer as seguintes contribuições no campo de modelagem de vídeo gerador.
- Apresentar um fluxo de trabalho de curadoria de dados sistemático e eficaz, em uma tentativa de transformar uma grande coleção de amostras de vídeo não curadas em um conjunto de dados de alta qualidade que é então usado pelos modelos de vídeo geradores.
- Treinar modelos de imagem para vídeo e texto para vídeo de última geração que superem os frameworks existentes.
- Realizar experimentos específicos de domínio para investigar a compreensão 3D e o forte prior de movimento do modelo.
Agora, o Modelo de Difusão de Vídeo Estável implementa os conhecimentos dos Modelos de Difusão de Vídeo Latente e técnicas de curadoria de dados no núcleo de sua fundação.
Modelos de Difusão de Vídeo Latente
Os Modelos de Difusão de Vídeo Latente ou Video-LDMs seguem a abordagem de treinar o modelo gerador principal em um espaço latente com complexidade computacional reduzida, e a maioria dos Video-LDMs implementa um modelo de imagem para texto pré-treinado acoplado à adição de camadas de mistura temporal na arquitetura de pré-treinamento. Como resultado, a maioria dos Modelos de Difusão de Vídeo Latente treina apenas as camadas temporais ou pula o processo de treinamento inteiramente, ao contrário do Modelo de Difusão de Vídeo Estável, que ajusta fino o conjunto de dados inteiro. Além disso, para sintetizar dados de texto para vídeo, o Modelo de Difusão de Vídeo Estável condiciona-se diretamente em um prompt de texto, e os resultados indicam que o framework resultante pode ser ajustado fino em um modelo de síntese multi-vista ou um modelo de imagem para vídeo facilmente.
Curadoria de Dados
A curadoria de dados é um componente essencial não apenas do Modelo de Difusão de Vídeo Estável, mas também para os modelos geradores como um todo, pois é essencial pré-treinar grandes modelos em conjuntos de dados em larga escala para impulsionar o desempenho em tarefas diferentes, incluindo modelagem de linguagem, geração de texto para imagem discriminativa e muito mais. A curadoria de dados foi implementada com sucesso em modelos de imagem geradores, aproveitando as capacidades de representações de imagem-linguagem eficientes, embora tais discussões nunca tenham sido focadas em modelos de vídeo geradores. Existem vários obstáculos que os desenvolvedores enfrentam ao curar dados para modelos de vídeo geradores, e para abordar esses desafios, o Modelo de Difusão de Vídeo Estável implementa uma estratégia de treinamento em três etapas, resultando em resultados aprimorados e um aumento significativo no desempenho.
Curadoria de Dados para Síntese de Vídeo de Alta Qualidade
Como discutido na seção anterior, o Modelo de Difusão de Vídeo Estável implementa uma estratégia de treinamento em três etapas, resultando em resultados aprimorados e um aumento significativo no desempenho. A Etapa I é uma etapa de pré-treinamento de imagem que utiliza um modelo de difusão de imagem para texto 2D. A Etapa II é para pré-treinamento de vídeo, no qual o framework treina em uma grande quantidade de dados de vídeo. Finalmente, temos a Etapa III para ajuste fino de vídeo, no qual o modelo é refinado em um subconjunto pequeno de vídeos de alta qualidade e alta resolução.
No entanto, antes de o Modelo de Difusão de Vídeo Estável implementar essas três etapas, é vital processar e anotar os dados, pois isso serve como base para a Etapa II ou a etapa de pré-treinamento de vídeo, e desempenha um papel crítico ao garantir a saída ótima. Para garantir a máxima eficiência, o framework primeiro implementa um pipeline de detecção de corte em cascata em três níveis de FPS ou Quadros Por Segundo diferentes, e a necessidade desse pipeline é demonstrada na seguinte imagem.

Em seguida, o Modelo de Difusão de Vídeo Estável anota cada clipe de vídeo usando três métodos de legendagem sintética diferentes. A seguinte tabela compara os conjuntos de dados usados no Framework de Difusão Estável antes e após o processo de filtragem.

Etapa I: Pré-Treinamento de Imagem
A primeira etapa na pipeline de três etapas implementada no Modelo de Difusão de Vídeo Estável é o pré-treinamento de imagem, e para alcançar isso, o framework inicial do Modelo de Difusão de Vídeo Estável é baseado em um modelo de difusão de imagem pré-treinado, nomeadamente o modelo Stable Diffusion 2.1, que o equipa com representações visuais mais fortes.

Etapa II: Pré-Treinamento de Vídeo
A segunda etapa é a Etapa de Pré-Treinamento de Vídeo, e ela se baseia nos conhecimentos de que o uso da curadoria de dados em modelos de imagem geradores multimodais frequentemente resulta em melhores resultados, juntamente com uma geração de imagem discriminativa poderosa. No entanto, devido à falta de representações poderosas prontas para uso para filtrar amostras indesejadas para modelos de vídeo geradores, o Modelo de Difusão de Vídeo Estável depende de preferências humanas como sinais de entrada para a criação de um conjunto de dados apropriado usado para pré-treinar o framework. A seguinte figura demonstra o efeito positivo de pré-treinar o framework em um conjunto de dados curado que ajuda a aumentar o desempenho geral para o pré-treinamento de vídeo em conjuntos de dados menores.

Para ser mais específico, o framework usa diferentes métodos para curar subconjuntos de Difusão de Vídeo Latente e considera o ranking dos modelos LVD treinados nesses conjuntos de dados. Além disso, o framework do Modelo de Difusão de Vídeo Estável também descobre que o uso de conjuntos de dados curados para treinar os frameworks ajuda a aumentar o desempenho do framework e dos modelos de difusão em geral. Além disso, a estratégia de curadoria de dados também funciona em conjuntos de dados maiores, mais relevantes e altamente práticos. A seguinte figura demonstra o efeito positivo de pré-treinar o framework em um conjunto de dados curado que ajuda a aumentar o desempenho geral para o pré-treinamento de vídeo em conjuntos de dados menores.

Etapa III: Ajuste Fino de Alta Qualidade
Até a Etapa II, o framework do Modelo de Difusão de Vídeo Estável se concentra em melhorar o desempenho antes do pré-treinamento de vídeo, e na terceira etapa, o framework se concentra em otimizar ou aumentar ainda mais o desempenho do framework após o ajuste fino de vídeo de alta qualidade, e como a transição da Etapa II para a Etapa III é alcançada no framework. Na Etapa III, o framework se baseia em técnicas de treinamento emprestadas de modelos de difusão de imagem latente e aumenta a resolução dos exemplos de treinamento. Para analisar a eficácia dessa abordagem, o framework compara com três modelos idênticos que diferem apenas em termos de inicialização. O primeiro modelo idêntico tem seus pesos inicializados, e o processo de treinamento de vídeo é pulado, enquanto os dois modelos idênticos restantes são inicializados com os pesos emprestados de outros modelos de vídeo latente.
Resultados e Descobertas
É hora de dar uma olhada em como o framework do Modelo de Difusão de Vídeo Estável se sai em tarefas do mundo real e como ele se compara com os frameworks atuais de geração de vídeo de última geração. O framework do Modelo de Difusão de Vídeo Estável primeiro usa a abordagem ótima de dados para treinar um modelo base, e então realiza ajuste fino para gerar vários modelos de última geração, onde cada modelo realiza uma tarefa específica.

A imagem acima representa as amostras de imagem para vídeo de alta resolução geradas pelo framework, enquanto a seguinte figura demonstra a capacidade do framework de gerar amostras de texto para vídeo de alta qualidade.

Modelo Base Pré-Treinado
Como discutido anteriormente, o modelo do Modelo de Difusão de Vídeo Estável é baseado no framework do Stable Diffusion 2.1, e com base em descobertas recentes, foi crucial para os desenvolvedores adotar o cronograma de ruído e aumentar o ruído para obter imagens com melhor resolução ao treinar modelos de difusão de imagem. Graças a essa abordagem, o modelo base do Modelo de Difusão de Vídeo Estável aprende representações de movimento poderosas e, no processo, supera os modelos base para geração de vídeo de texto em um ambiente de disparo zero, e os resultados são exibidos na seguinte tabela.

Interpolação de Quadros e Geração Multi-Vista
O framework do Modelo de Difusão de Vídeo Estável ajusta fino o modelo de imagem para vídeo em conjuntos de dados multi-vista para obter várias vistas novas de um objeto, e esse modelo é conhecido como SVD-MV ou Modelo de Difusão de Vídeo Estável – Multi-Vista. O modelo SVD original é ajustado fino com a ajuda de dois conjuntos de dados de uma maneira que o framework insere uma imagem única e retorna uma sequência de imagens multi-vista como saída.
Como pode ser visto nas seguintes imagens, o framework do Modelo de Difusão de Vídeo Estável – Multi-Vista entrega um desempenho de alta qualidade comparável ao framework de Multi-Vista Scratch, e os resultados são uma demonstração clara da capacidade do SVD-MV de aproveitar os conhecimentos obtidos do modelo SVD original para geração de imagem multi-vista. Além disso, os resultados também indicam que executar o modelo por um número relativamente menor de iterações ajuda a entregar resultados ótimos, como é o caso da maioria dos modelos ajustados fino a partir do framework do SVD.


Na figura acima, as métricas são indicadas no lado esquerdo e, como pode ser visto, o framework do Modelo de Difusão de Vídeo Estável – Multi-Vista supera o framework Scratch-MV e o framework SD2.1 Multi-Vista por uma margem decente. A segunda imagem demonstra o efeito do número de iterações de treinamento no desempenho geral do framework em termos de Pontuação de Clip, e os frameworks SVD-MV entregam resultados sustentáveis.
Pensamentos Finais
Neste artigo, falamos sobre o Modelo de Difusão de Vídeo Estável, um modelo de difusão de vídeo latente capaz de gerar conteúdo de vídeo de alta resolução, de imagem para vídeo e de texto para vídeo de última geração. O Modelo de Difusão de Vídeo Estável segue uma estratégia única nunca implementada por qualquer modelo de vídeo gerador, pois depende de linhas de base de difusão de vídeo latente com uma arquitetura fixa e uma estratégia de treinamento fixa, seguida de avaliação do efeito da curadoria dos dados.
Falamos sobre como os modelos de difusão latente treinados para sintetizar imagens 2D melhoraram as habilidades e eficiência dos modelos de vídeo geradores ao adicionar camadas temporais e ajustar os modelos em conjuntos de dados pequenos consistindo em vídeos de alta qualidade. Para coletar os dados de pré-treinamento, o framework realiza um estudo de escalabilidade e segue práticas de coleta de dados sistemáticas, e, em última análise, propõe um método para curar uma grande quantidade de dados de vídeo e converter vídeos barulhentos em dados de entrada adequados para modelos de vídeo geradores.
Além disso, o framework do Modelo de Difusão de Vídeo Estável emprega três etapas distintas de treinamento de modelo de vídeo que são analisadas independentemente para avaliar seu impacto no desempenho do framework. O framework, em última análise, produz uma representação de vídeo poderosa o suficiente para ajustar fino os modelos para síntese de vídeo óptima, e os resultados são comparáveis aos modelos de geração de vídeo de última geração já em uso.












