Modelos e plataformas de IA
AnimateLCM: Acelerando a Animação de Modelos de Difusão Personalizados
Nos últimos anos, os modelos de difusão alcançaram um grande sucesso e reconhecimento para tarefas de geração de imagens e vídeos. Os modelos de difusão de vídeo, em particular, têm recebido atenção significativa devido à sua capacidade de produzir vídeos com alta coerência e fidelidade. Esses modelos geram vídeos de alta qualidade empregando um processo de denoising iterativo em sua arquitetura que transforma gradualmente ruído gaussiano de alta dimensionalidade em dados reais.
O Stable Diffusion é um dos modelos mais representativos para tarefas de geração de imagens, confiando em um Variational AutoEncoder (VAE) para mapear entre a imagem real e os recursos latentes subamostrados. Isso permite que o modelo reduza os custos de geração, enquanto o mecanismo de atenção cruzada em sua arquitetura facilita a geração de imagens condicionada por texto. Mais recentemente, o framework Stable Diffusion construiu a base para vários adaptadores plug-and-play para alcançar geração de imagens ou vídeos mais inovadores e eficazes. No entanto, o processo de geração iterativo empregado pela maioria dos modelos de difusão de vídeo torna o processo de geração de imagens demorado e comparativamente caro, limitando suas aplicações.
Neste artigo, vamos falar sobre o AnimateLCM, um modelo de difusão personalizado com adaptadores destinado a gerar vídeos de alta fidelidade com um número mínimo de etapas e custos computacionais. O framework AnimateLCM é inspirado no Modelo de Consistência, que acelera a amostragem com um número mínimo de etapas por meio da destilação de modelos de difusão de imagem pré-treinados. Além disso, a extensão bem-sucedida do Modelo de Consistência, o Modelo de Consistência Latente (LCM), facilita a geração de imagens condicionais. Em vez de realizar o aprendizado de consistência diretamente no conjunto de dados de vídeo bruto, o framework AnimateLCM propõe usar uma estratégia de aprendizado de consistência decouplada. Essa estratégia decoupla a destilação dos priores de geração de movimento e priores de geração de imagem, permitindo que o modelo melhore a qualidade visual do conteúdo gerado e melhore a eficiência de treinamento simultaneamente. Além disso, o modelo AnimateLCM propõe treinar adaptadores a partir do zero ou adaptar adaptadores existentes ao seu modelo de consistência de vídeo destilado. Isso facilita a combinação de adaptadores plug-and-play na família de modelos de difusão estável para alcançar diferentes funções sem prejudicar a velocidade de amostragem.
Este artigo visa cobrir o framework AnimateLCM em profundidade. Exploramos o mecanismo, a metodologia e a arquitetura do framework, juntamente com sua comparação com frameworks de geração de imagens e vídeos de ponta. Então, vamos começar.
AnimateLCM: Animação de Modelos de Difusão Personalizados
Os modelos de difusão têm sido o framework de escolha para tarefas de geração de imagens e vídeos devido à sua eficiência e capacidades em tarefas de geração. A maioria dos modelos de difusão confia em um processo de denoising iterativo para a geração de imagens que transforma ruído gaussiano de alta dimensionalidade em dados reais gradualmente. Embora o método entregue resultados razoavelmente satisfatórios, o processo iterativo e o número de amostras iteradas desacelera o processo de geração e também aumenta os requisitos computacionais dos modelos de difusão, que são muito mais lentos do que outros frameworks de geração, como GAN ou Redes Adversárias Generativas. Nos últimos anos, os Modelos de Consistência ou CMs têm sido propostos como uma alternativa aos modelos de difusão iterativos para acelerar o processo de geração enquanto mantém os requisitos computacionais constantes.
O destaque dos modelos de consistência é que eles aprendem mapeamentos de consistência que mantêm a autoconsistência das trajetórias introduzidas pelos modelos de difusão pré-treinados. O processo de aprendizado dos Modelos de Consistência permite que eles gerem imagens de alta qualidade com um número mínimo de etapas e também elimina a necessidade de iterações computacionalmente intensivas. Além disso, o Modelo de Consistência Latente ou LCM, construído sobre o framework de difusão estável, pode ser integrado à interface do usuário da web com os adaptadores existentes para alcançar uma série de funcionalidades adicionais, como tradução de imagem para imagem em tempo real. Em comparação, embora os modelos de difusão de vídeo existentes entreguem resultados aceitáveis, ainda há progresso a ser feito no campo da aceleração de amostragem de vídeo, e isso é de grande importância devido aos altos custos computacionais de geração de vídeo.
Isso nos leva ao AnimateLCM, um framework de geração de vídeo de alta fidelidade que precisa de um número mínimo de etapas para as tarefas de geração de vídeo. Seguindo o Modelo de Consistência Latente, o framework AnimateLCM trata o processo de difusão reversa como a resolução de um fluxo de probabilidade aumentado por CFG ou Orientação Livre de Classificador, e treina o modelo para prever a solução de tais fluxos de probabilidade diretamente no espaço latente. No entanto, em vez de realizar o aprendizado de consistência diretamente nos dados de vídeo brutos, que exigem altos recursos de treinamento e computacionais e frequentemente levam a uma qualidade ruim, o framework AnimateLCM propõe uma estratégia de aprendizado de consistência decouplada. Essa estratégia decoupla a destilação dos priores de geração de movimento e priores de geração de imagem.
O framework AnimateLCM primeiro realiza a destilação de consistência para adaptar o modelo de difusão de imagem base ao modelo de consistência de imagem, e então realiza a inflação 3D tanto no modelo de consistência de imagem quanto no modelo de difusão de imagem para acomodar recursos 3D. Finalmente, o framework AnimateLCM obtém o modelo de consistência de vídeo realizando a destilação de consistência nos dados de vídeo. Além disso, para aliviar a possível corrupção de recursos como resultado do processo de difusão, o framework AnimateLCM também propõe usar uma estratégia de inicialização. Como o framework AnimateLCM é construído sobre o framework de difusão estável, ele pode substituir os pesos espaciais de seu modelo de consistência de vídeo treinado pelos pesos de difusão de imagem personalizados disponíveis publicamente para alcançar resultados de geração inovadores.

Além disso, para treinar adaptadores específicos a partir do zero ou para adaptar melhor os adaptadores disponíveis publicamente, o framework AnimateLCM propõe uma estratégia de aceleração eficaz para os adaptadores que não exigem o treinamento de modelos de professor específicos.
As contribuições do framework AnimateLCM podem ser muito bem resumidas como: o framework AnimateLCM proposto visa alcançar geração de vídeo de alta qualidade, rápida e de alta fidelidade, e para isso, o framework AnimateLCM propõe uma estratégia de destilação decouplada que decoupla os priores de geração de movimento e imagem, resultando em melhor qualidade de geração e eficiência de treinamento.
InstantID: Metodologia e Arquitetura
No núcleo, o framework InstantID inspira-se fortemente nos modelos de difusão e estratégias de velocidade de amostragem. Os modelos de difusão, também conhecidos como modelos generativos baseados em pontuação, demonstraram capacidades de geração de imagens notáveis. Sob a orientação da direção da pontuação, a estratégia de amostragem iterativa implementada pelos modelos de difusão remove o ruído dos dados corrompidos gradualmente. A eficiência dos modelos de difusão é um dos principais motivos pelos quais eles são empregados pela maioria dos modelos de difusão de vídeo por meio do treinamento em camadas temporais adicionadas.
Em seguida, o framework InstantID é construído sobre o modelo de difusão estável, o que permite que o InstantID aplique noções relevantes. O modelo trata o processo de difusão direta discreto como uma Equação Diferencial Estocástica (SDE) de Variância Preservada no tempo contínuo. Além disso, o modelo de difusão estável é uma extensão do modelo de difusão probabilístico de denoising (DDPM), no qual o ponto de dados de treinamento é perturbado gradualmente por uma cadeia de Markov discreta com um kernel de perturbação, permitindo que a distribuição de dados ruidosos em diferentes etapas de tempo siga a distribuição.
Para alcançar geração de vídeo de alta fidelidade com um número mínimo de etapas, o framework AnimateLCM doma os modelos de difusão de vídeo baseados no modelo de difusão estável para seguir a propriedade de autoconsistência. A estrutura de treinamento geral do framework AnimateLCM consiste em uma estratégia de aprendizado de consistência decouplada para adaptação de professor livre e aprendizado de consistência eficaz.

Transição de Modelos de Difusão para Modelos de Consistência
O framework AnimateLCM introduz sua própria adaptação do Modelo de Difusão Estável (DM) para o Modelo de Consistência (CM), seguindo o design do Modelo de Consistência Latente (LCM). É importante notar que, embora os modelos de difusão estável geralmente prevejam o ruído adicionado às amostras, eles são essencialmente modelos de difusão sigma. Isso contrasta com os modelos de consistência, que visam prever a solução da trajetória do PF-ODE diretamente. Além disso, nos modelos de difusão estável com certos parâmetros, é essencial para o modelo empregar uma estratégia de orientação livre de classificador para gerar imagens de alta qualidade. O framework AnimateLCM, no entanto, emprega um solucionador de ODE aumentado por orientação livre de classificador para amostrar pares adjacentes nas mesmas trajetórias, resultando em melhor eficiência e qualidade. Além disso, modelos existentes indicaram que a qualidade de geração e a eficiência de treinamento são influenciadas fortemente pelo número de pontos discretos na trajetória. Um número menor de pontos discretos acelera o processo de treinamento, enquanto um número maior de pontos discretos resulta em menos viés durante o treinamento.
Aprendizado de Consistência Decouplada
Para o processo de destilação de consistência, os desenvolvedores observaram que os dados usados para o treinamento influenciam fortemente a qualidade da geração final dos modelos de consistência. No entanto, o principal problema com os conjuntos de dados disponíveis publicamente atualmente é que frequentemente consistem em dados com marca d’água, ou são de baixa qualidade, e podem conter legendas excessivamente breves ou ambíguas. Além disso, treinar o modelo diretamente em vídeos de alta resolução é computacionalmente caro e demorado, tornando-se uma opção não viável para a maioria dos pesquisadores.
Dada a disponibilidade de conjuntos de dados de alta qualidade filtrados, o framework AnimateLCM propõe decoupar a destilação dos priores de movimento e priores de geração de imagem. Para ser mais específico, o framework AnimateLCM primeiro destila os modelos de difusão estável em modelos de consistência de imagem com conjuntos de dados de imagem de texto de alta qualidade filtrados e com melhor resolução. O framework então treina os pesos LoRA leves nas camadas do modelo de difusão estável, congelando os pesos do modelo de difusão estável. Uma vez que o modelo ajusta os pesos LoRA, ele funciona como um módulo de aceleração versátil e demonstrou sua compatibilidade com outros modelos personalizados na comunidade de difusão estável. Para inferência, o framework AnimateLCM combina os pesos LoRA com os pesos originais sem corromper a velocidade de inferência. Após o framework AnimateLCM obter o modelo de consistência no nível de geração de imagem, ele congela os pesos do modelo de difusão estável e os pesos LoRA nele. Além disso, o modelo infla os kernels de convolução 2D para kernels pseudo-3D para treinar os modelos de consistência para geração de vídeo. O modelo também adiciona camadas temporais com inicialização zero e uma conexão residual de nível de bloco. A configuração geral ajuda a garantir que a saída do modelo não será influenciada quando for treinado pela primeira vez. O framework AnimateLCM, sob a orientação de modelos de difusão de vídeo de código aberto, treina as camadas temporais estendidas a partir dos modelos de difusão estável.
É importante reconhecer que, embora os pesos LoRA espaciais sejam projetados para acelerar o processo de amostragem sem considerar a modelagem temporal, e os módulos temporais sejam desenvolvidos por meio de técnicas de difusão padrão, sua integração direta tende a corromper a representação no início do treinamento. Isso apresenta desafios significativos para mesclá-los com mínimo conflito. Por meio de pesquisas empíricas, o framework AnimateLCM identificou uma abordagem de inicialização bem-sucedida que não apenas utiliza os priores de consistência dos pesos LoRA espaciais, mas também mitiga os efeitos adversos de sua combinação direta.

No início do treinamento de consistência, os pesos LoRA espaciais pré-treinados são integrados exclusivamente ao modelo de consistência online, poupando o modelo de consistência alvo da inserção. Essa estratégia garante que o modelo alvo, servindo como guia educacional para o modelo online, não gere previsões erradas que poderiam afetar negativamente o processo de aprendizado do modelo online. Durante o período de treinamento, os pesos LoRA são progressivamente incorporados ao modelo de consistência alvo por meio de um processo de média móvel exponencial (EMA), alcançando o equilíbrio ótimo de pesos após várias iterações.
Adaptação Livre de Professor
Os modelos de difusão estável e os adaptadores plug-and-play frequentemente andam de mãos dadas. No entanto, foi observado que, embora os adaptadores plug-and-play funcionem até certo ponto, eles tendem a perder o controle nos detalhes, mesmo quando a maioria desses adaptadores é treinada com modelos de difusão de imagem. Para contrariar esse problema, o framework AnimateLCM opta por uma adaptação livre de professor, uma estratégia simples, mas eficaz, que ou acomoda os adaptadores existentes para melhor compatibilidade ou treina os adaptadores a partir do zero. A abordagem permite que o framework AnimateLCM alcance a geração de vídeo controlável e a geração de imagem para vídeo com um número mínimo de etapas sem exigir modelos de professor.

AnimateLCM: Experimentos e Resultados
O framework AnimateLCM emprega o Stable Diffusion v1-5 como o modelo base e implementa o solucionador de ODE DDIM para fins de treinamento. O framework também aplica o Stable Diffusion v1-5 com pesos de movimento de código aberto como o modelo de difusão de vídeo de professor com os experimentos sendo realizados no conjunto de dados WebVid2M sem dados adicionais ou aumentados. Além disso, o framework emprega o conjunto de dados TikTok com prompts textuais breves captionados por BLIP para geração de vídeo controlável.
Resultados Qualitativos
A figura a seguir demonstra os resultados do método de geração de quatro etapas implementado pelo framework AnimateLCM na geração de texto para vídeo, geração de imagem para vídeo e geração de vídeo controlável.

Como pode ser observado, os resultados entregues por cada um deles são satisfatórios, com os resultados gerados demonstrando a capacidade do framework AnimateLCM de seguir a propriedade de consistência, mesmo com etapas de inferência variadas, mantendo estilo e movimento semelhantes.


Resultados Quantitativos
A figura a seguir ilustra os resultados quantitativos e a comparação do framework AnimateLCM com os métodos DDIM e DPM++ de ponta.

Como pode ser observado, o framework AnimateLCM supera os métodos existentes por uma margem significativa, especialmente no regime de baixo número de etapas, variando de 1 a 4 etapas. Além disso, as métricas do AnimateLCM exibidas nessa comparação são avaliadas sem usar a Orientação Livre de Classificador (CFG) ou o guia de classificador livre, o que permite que o framework economize quase 50% do tempo de inferência e do custo de memória de pico de inferência. Além disso, para validar ainda mais seu desempenho, os pesos espaciais dentro do framework AnimateLCM são substituídos por um modelo realista personalizado disponível publicamente, que equilibra bem a fidelidade e a diversidade, ajudando a melhorar o desempenho ainda mais.
Pensamentos Finais
Neste artigo, falamos sobre o AnimateLCM, um modelo de difusão personalizado com adaptadores que visa gerar vídeos de alta fidelidade com um número mínimo de etapas e custos computacionais. O framework AnimateLCM é inspirado no Modelo de Consistência, que acelera a amostragem com um número mínimo de etapas por meio da destilação de modelos de difusão de imagem pré-treinados, e a extensão bem-sucedida do Modelo de Consistência, o Modelo de Consistência Latente (LCM), que facilita a geração de imagens condicionais. Em vez de realizar o aprendizado de consistência diretamente no conjunto de dados de vídeo bruto, o framework AnimateLCM propõe usar uma estratégia de aprendizado de consistência decouplada que decoupla a destilação dos priores de geração de movimento e priores de geração de imagem, permitindo que o modelo melhore a qualidade visual do conteúdo gerado e melhore a eficiência de treinamento simultaneamente.












