Ângulo de Anderson
Um Novo Sistema para Personagens de Vídeo de Difusão Estável Temporalmente Consistentes

Uma nova iniciativa do Alibaba Group oferece um dos melhores métodos que eu já vi para gerar avatares humanos completos a partir de um modelo de fundação baseado em Difusão Estável.
Intitulado MIMO (MIMicando com Object Interactions), o sistema utiliza uma variedade de tecnologias e módulos populares, incluindo modelos humanos baseados em CGI e AnimateDiff, para permitir a substituição de personagens temporais consistentes em vídeos – ou para dirigir um personagem com uma pose esquelética definida pelo usuário.
Aqui vemos personagens interpolados a partir de uma única fonte de imagem e dirigidos por um movimento pré-definido:
[Clique no vídeo abaixo para reproduzir]
De imagens de fonte única, três personagens diversificados são dirigidos por uma sequência de pose 3D (longe à esquerda) usando o sistema MIMO. Veja o site do projeto e o vídeo do YouTube acompanhante (incorporado no final deste artigo) para mais exemplos e resolução superior. Fonte: https://menyifang.github.io/projects/MIMO/index.html
Personagens gerados, que também podem ser originados a partir de quadros em vídeos e de diversas outras maneiras, podem ser integrados em imagens reais.
MIMO oferece um sistema novo que gera três codificações discretas, cada uma para personagem, cena e ocultação (ou seja, matting, quando algum objeto ou pessoa passa na frente do personagem sendo representado). Essas codificações são integradas no momento da inferência.
[Clique no vídeo abaixo para reproduzir]
MIMO pode substituir personagens originais por personagens fotorealistas ou estilizados que seguem o movimento do vídeo de destino. Veja o site do projeto e o vídeo do YouTube acompanhante (incorporado no final deste artigo) para mais exemplos e resolução superior.
O sistema é treinado sobre o modelo de Difusão Estável V1.5, usando um conjunto de dados personalizado curado pelos pesquisadores, e composto igualmente de vídeos reais e simulados.
O grande problema da difusão de vídeo baseada em difusão é a estabilidade temporal, onde o conteúdo do vídeo ou pisca ou ‘evolui’ de maneiras indesejadas para a representação de personagens consistentes.
MIMO, em vez disso, usa efetivamente uma única imagem como um mapa para orientação consistente, que pode ser orquestrada e limitada pelo modelo de CGI SMPL intersticial SMPL.
Desde que a referência de origem é consistente, e o modelo base sobre o qual o sistema é treinado foi aprimorado com exemplos de movimento adequados, as capacidades do sistema para saída temporalmente consistente estão bem acima do padrão geral para avatares baseados em difusão.
[Clique no vídeo abaixo para reproduzir]
Exemplos adicionais de personagens MIMO dirigidos por pose. Veja o site do projeto e o vídeo do YouTube acompanhante (incorporado no final deste artigo) para mais exemplos e resolução superior.
Está se tornando mais comum que imagens únicas sejam usadas como fonte para representações neurais eficazes, seja por si mesmas ou de forma multimodal, combinadas com prompts de texto. Por exemplo, o popular sistema de transferência facial LivePortrait também pode gerar faces deepfaked altamente plausíveis a partir de imagens de face únicas.
Os pesquisadores acreditam que os princípios usados no sistema MIMO podem ser estendidos a outros tipos de sistemas e estruturas geradoras.
O novo artigo é intitulado MIMO: Síntese de Vídeo de Personagem Controle com Modelagem Decomposta Espacial e vem de quatro pesquisadores do Instituto de Computação Inteligente do Alibaba Group. O trabalho tem uma página do projeto com vídeo e um vídeo do YouTube acompanhante, que também está incorporado no final deste artigo.
Método
MIMO alcança a separação automática e não supervisionada dos três componentes espaciais mencionados, em uma arquitetura de ponta a ponta (ou seja, todos os subprocessos são integrados ao sistema, e o usuário precisa apenas fornecer o material de entrada).

O esquema conceitual para MIMO. Fonte: https://arxiv.org/pdf/2409.16160
Os objetos nos vídeos de origem são traduzidos de 2D para 3D, inicialmente usando o estimador de profundidade monocular Depth Anything. O elemento humano em qualquer quadro é extraído com métodos adaptados do projeto Tune-A-Video.
Esses recursos são então traduzidos em facetas volumétricas baseadas em vídeo por meio da arquitetura Segment Anything 2 da Facebook Research.
A camada da cena em si é obtida removendo objetos detectados nas outras duas camadas, fornecendo efetivamente uma máscara de rotoscopia automática.
Para o movimento, um conjunto de códigos latentes extraídos para o elemento humano são ancorados a um modelo de CGI SMPL padrão, cujos movimentos fornecem o contexto para o conteúdo humano renderizado.
Um mapa de recursos 2D para o conteúdo humano é obtido por um rasterizador diferenciável derivado de uma iniciativa de 2020 da NVIDIA. Combinando os dados 3D obtidos do SMPL com os dados 2D obtidos pelo método da NVIDIA, os códigos latentes que representam a ‘pessoa neural’ têm uma correspondência sólida com seu contexto eventual.
Neste ponto, é necessário estabelecer uma referência comumente necessária em arquiteturas que usam SMPL – uma pose canônica. Isso é amplamente semelhante ao ‘homem vitruviano’ de Da Vinci, na medida em que representa um modelo de pose zero que pode aceitar conteúdo e então ser deformado, trazendo o conteúdo (efetivamente) mapeado de textura com ele.
Essas deformações, ou ‘desvios da norma’, representam o movimento humano, enquanto o modelo SMPL preserva os códigos latentes que constituem a identidade humana que foi extraída, e assim representa o avatar resultante corretamente em termos de pose e textura.

Um exemplo de pose canônica em uma figura SMPL. Fonte: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
Com relação à questão da entrelaçamento (a extensão com que os dados treinados podem se tornar inflexíveis quando você os estende além de seus limites e associações treinados), os autores afirmam*:
‘Para desembaraçar completamente a aparência dos quadros de vídeo com pose, uma solução ideal é aprender a representação humana dinâmica do vídeo monocular e transformá-la do espaço com pose para o espaço canônico.
‘Considerando a eficiência, empregamos um método simplificado que transforma diretamente a imagem humana com pose para o resultado canônico no padrão A-pose usando um modelo de repose humano pré-treinado. A imagem de aparência canônica sintetizada é alimentada com codificadores de ID para obter o código de identidade.
‘Este design simples permite o desembaraçamento completo dos atributos de identidade e movimento. Seguindo [Animate Anyone], os codificadores de ID incluem um codificador de imagem CLIP e uma arquitetura de rede de referência para incorporar os recursos globais e locais, [respectivamente].’
Para os aspectos da cena e ocultação, um Autoencoder Variacional (VAE – neste caso derivado de uma publicação de 2013) compartilhado e fixo é usado para incorporar os elementos da cena e ocultação no espaço latente. Incongruências são tratadas por um método de retoque do projeto ProPainter de 2023.
Uma vez montados e retocados desta forma, tanto o plano de fundo quanto os objetos de ocultação no vídeo fornecerão uma máscara para o avatar humano em movimento.
Esses atributos decompostos são então alimentados em uma estrutura de U-Net baseada na arquitetura de Difusão Estável V1.5. O código de cena completo é concatenado com o ruído latente nativo do sistema. O componente humano é integrado por meio de camadas de autoatenção e atenção cruzada, respectivamente.
Então, o resultado desdenoisado é saída por meio do decodificador VAE.
Dados e Testes
Para o treinamento, os pesquisadores criaram um conjunto de dados de vídeo humano intitulado HUD-7K, que consistia em 5.000 vídeos de personagens reais e 2.000 animações sintéticas criadas pelo sistema En3D. Os vídeos reais não exigiam anotação, devido à natureza não semântica dos procedimentos de extração de figura na arquitetura de MIMO. Os dados sintéticos foram totalmente anotados.
O modelo foi treinado em oito GPUs NVIDIA A100 (embora o artigo não especifique se eram os modelos de 40GB ou 80GB de VRAM), por 50 iterações, usando 24 quadros de vídeo e um tamanho de lote de quatro, até convergência.
O módulo de movimento do sistema foi treinado nos pesos de AnimateDiff. Durante o processo de treinamento, os pesos do codificador/decodificador VAE e do codificador de imagem CLIP foram congelados (em contraste com o ajuste fino completo, que teria um efeito muito mais amplo em um modelo de fundação).
Embora MIMO não tenha sido testado contra sistemas análogos, os pesquisadores o testaram em sequências de movimento difíceis fora do conjunto de dados, originadas de AMASS e Mixamo. Esses movimentos incluíam escalada, jogos e dança.
Eles também testaram o sistema em vídeos humanos in-the-wild. Em ambos os casos, o artigo relata ‘alta robustez’ para esses movimentos 3D não vistos, de diferentes pontos de vista.
Embora o artigo ofereça múltiplos resultados de imagem estática demonstrando a eficácia do sistema, o desempenho real de MIMO é melhor avaliado com os resultados de vídeo extensivos fornecidos na página do projeto e no vídeo do YouTube incorporado abaixo (do qual os vídeos no início deste artigo foram derivados).
Os autores concluem:
‘Os resultados experimentais [demonstram] que nosso método permite não apenas controle de personagem, movimento e cena flexível, mas também escalabilidade avançada para personagens arbitrários, generalidade para novos movimentos 3D e aplicabilidade a cenas interativas.
‘Também [acreditamos] que nossa solução, que considera a natureza 3D inerente e codifica automaticamente o vídeo 2D em componentes espaciais hierárquicos, pode inspirar pesquisas futuras sobre síntese de vídeo 3D consciente.
‘Além disso, nossa estrutura não é apenas adequada para gerar vídeos de personagens, mas também pode ser potencialmente adaptada para outras tarefas de síntese de vídeo controlável.’
Conclusão
É refrescante ver um sistema de avatar baseado em Difusão Estável que parece capaz de tal estabilidade temporal – não menos porque os Avatares Gaussianos parecem estar ganhar terreno nesse setor de pesquisa específico.
Os avatares estilizados representados nos resultados são eficazes, e embora o nível de realismo que MIMO pode produzir não seja atualmente igual ao que o Gaussian Splatting é capaz de fazer, as vantagens diversas de criar humanos temporais consistentes em uma Rede de Difusão Latente semântica (LDM) são consideráveis.
* Minha conversão das citações em linha dos autores para hiperlinks, e onde necessário, hiperlinks explicativos externos.
Publicado pela primeira vez na quarta-feira, 25 de setembro de 2024












