Ângulo de Anderson

Restauração e Edição de Imagens Humanas com IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

Uma nova colaboração entre a Universidade da Califórnia, Merced, e a Adobe oferece um avanço no estado da arte em completude de imagem humana – a tarefa muito estudada de ‘desocultar’ partes ocultas ou escondidas de imagens de pessoas, para fins como virtual try-on, animação e edição de fotos.

Além de reparar imagens danificadas ou alterá-las de acordo com a vontade do usuário, sistemas de completude de imagem humana, como o CompleteMe, podem impor roupas novas (via uma imagem de referência, como na coluna do meio nestes dois exemplos) em imagens existentes. Estes exemplos são do suplemento PDF extenso para o novo artigo. Fonte: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Além de reparar imagens danificadas ou alterá-las de acordo com a vontade do usuário, sistemas de completude de imagem humana, como o CompleteMe, podem impor roupas novas (via uma imagem de referência, como na coluna do meio nestes dois exemplos) em imagens existentes. Estes exemplos são do suplemento PDF extenso para o novo artigo. Fonte: https://liagm.github.io/CompleteMe/pdf/supp.pdf

A nova abordagem, intitulada CompleteMe: Completude de Imagem Humana com Referência, usa imagens de entrada suplementares para ‘sugerir’ ao sistema o que deve substituir a seção oculta ou faltante da representação humana (daí a aplicabilidade a frameworks de try-on baseados em moda):

O sistema CompleteMe pode adaptar o conteúdo de referência à parte oculta ou ocultada de uma imagem humana.

O sistema CompleteMe pode adaptar o conteúdo de referência à parte oculta ou ocultada de uma imagem humana.

O novo sistema usa uma arquitetura dual U-Net e um bloco de Atenção Focada em Região (RFA) que direciona recursos para a área pertinente da instância de restauração de imagem.

Os pesquisadores também oferecem um novo e desafiador sistema de benchmarking projetado para avaliar tarefas de completude de imagem com referência (já que o CompleteMe faz parte de uma linha de pesquisa existente e contínua em visão computacional, embora não tenha havido um esquema de benchmarking até agora).

Nos testes, e em um estudo de usuário bem escalonado, o novo método saiu à frente na maioria das métricas e, em geral, superou os métodos rivais. Em alguns casos, os métodos rivais foram completamente enganados pela abordagem baseada em referência:

Do material suplementar: o método AnyDoor tem particular dificuldade em decidir como interpretar uma imagem de referência.

Do material suplementar: o método AnyDoor tem particular dificuldade em decidir como interpretar uma imagem de referência.

O artigo afirma:

‘Extensos experimentos em nosso benchmark demonstram que o CompleteMe supera os métodos de ponta, tanto baseados em referência quanto não baseados em referência, em termos de métricas quantitativas, resultados qualitativos e estudos de usuário.

‘Particularmente em cenários desafiadores que envolvem poses complexas, padrões de roupas intricados e acessórios distintivos, nosso modelo consistentemente alcança uma fidelidade visual superior e coerência semântica.’

Infelizmente, a presença do projeto no GitHub não contém código, nem promete fornecê-lo, e a iniciativa, que também tem uma página do projeto modesta , parece ser enquadrada como uma arquitetura proprietária.

Outro exemplo do desempenho subjetivo do novo sistema em comparação com métodos anteriores. Mais detalhes mais tarde no artigo.

Outro exemplo do desempenho subjetivo do novo sistema em comparação com métodos anteriores. Mais detalhes mais tarde no artigo.

Método

A estrutura CompleteMe é sustentada por uma U-Net de Referência, que lida com a integração do material auxiliar no processo, e uma U-Net coesa, que acomoda uma gama mais ampla de processos para obter o resultado final, como ilustrado no esquema conceitual abaixo:

O esquema conceitual para o CompleteMe. Fonte: https://arxiv.org/pdf/2504.20042

O esquema conceitual para o CompleteMe. Fonte: https://arxiv.org/pdf/2504.20042

O sistema primeiro codifica a imagem de entrada mascarada em uma representação latente. Ao mesmo tempo, a U-Net de Referência processa múltiplas imagens de referência – cada uma mostrando diferentes regiões do corpo – para extrair recursos espaciais detalhados.

Esses recursos passam por um bloco de Atenção Focada em Região incorporado na U-Net ‘completa’, onde são mascarados seletivamente usando máscaras de região correspondentes, garantindo que o modelo atenda apenas às áreas relevantes nas imagens de referência.

Os recursos mascarados são então integrados com recursos semânticos globais derivados do CLIP por meio de atenção cruzada desacoplada, permitindo que o modelo reconstrua o conteúdo faltante com detalhes finos e coerência semântica.

Para melhorar a realismo e robustez, o processo de mascaramento de entrada combina ocultações baseadas em grade aleatórias com máscaras de forma de corpo humano, cada uma aplicada com probabilidade igual, aumentando a complexidade das regiões faltantes que o modelo deve completar.

Para Referência Apenas

Métodos anteriores para pintura de imagem baseada em referência geralmente confiavam em codificadores de nível semântico. Projetos desse tipo incluem o CLIP em si e o DINOv2, ambos os quais extraem recursos globais de imagens de referência, mas frequentemente perdem os detalhes espaciais finos necessários para a preservação precisa da identidade.

Do artigo de lançamento do método DINOv2 mais antigo, que é incluído nos testes de comparação no novo estudo: As sobreposições coloridas mostram os três primeiros componentes principais da Análise de Componentes Principais (PCA), aplicada a patches de imagem dentro de cada coluna, destacando como o DINOv2 agrupa partes de objetos semelhantes juntos em imagens variadas. Apesar das diferenças de pose, estilo ou renderização, regiões correspondentes (como asas, membros ou rodas) são consistentemente combinadas, ilustrando a capacidade do modelo de aprender estruturas baseadas em partes sem supervisão. Fonte: https://arxiv.org/pdf/2304.07193

Do artigo de lançamento do método DINOv2 mais antigo, que é incluído nos testes de comparação no novo estudo: As sobreposições coloridas mostram os três primeiros componentes principais da Análise de Componentes Principais (PCA), aplicada a patches de imagem dentro de cada coluna, destacando como o DINOv2 agrupa partes de objetos semelhantes juntos em imagens variadas. Apesar das diferenças de pose, estilo ou renderização, regiões correspondentes (como asas, membros ou rodas) são consistentemente combinadas, ilustrando a capacidade do modelo de aprender estruturas baseadas em partes sem supervisão. Fonte: https://arxiv.org/pdf/2304.07193

O CompleteMe aborda esse aspecto por meio de uma U-Net de Referência especializada, inicializada a partir do Stable Diffusion 1.5, mas operando sem o passo de ruído de difusão*.

Cada imagem de referência, cobrindo diferentes regiões do corpo, é codificada em recursos latentes detalhados por meio dessa U-Net. Recursos semânticos globais também são extraídos separadamente usando o CLIP, e ambos os conjuntos de recursos são armazenados para uso eficiente durante a integração baseada em atenção. Assim, o sistema pode acomodar múltiplas entradas de referência de forma flexível, preservando informações de aparência de granulação fina.

Orquestração

A U-Net coesa gerencia as etapas finais do processo de completude. Adaptada da variante de inpintura do Stable Diffusion 1.5, ela recebe como entrada a imagem de origem mascarada em forma latente, ao lado de recursos espaciais detalhados extraídos das imagens de referência e recursos semânticos globais extraídos pelo codificador CLIP.

Essas várias entradas são reunidas por meio do bloco RFA, que desempenha um papel crítico na direção do foco do modelo para as áreas mais relevantes do material de referência.

Antes de entrar no mecanismo de atenção, os recursos de referência são explicitamente mascarados para remover regiões não relacionadas e, em seguida, concatenados com a representação latente da imagem de origem, garantindo que a atenção seja direcionada o mais precisamente possível.

Para melhorar essa integração, o CompleteMe incorpora um mecanismo de atenção cruzada desacoplada adaptado do framework IP-Adapter:

IP-Adapter, parte do qual é incorporado no CompleteMe, é um dos projetos mais bem-sucedidos e frequentemente utilizados dos últimos três anos tumultuosos de desenvolvimento em arquiteturas de modelos de difusão latente. Fonte: https://ip-adapter.github.io/

IP-Adapter, parte do qual é incorporado no CompleteMe, é um dos projetos mais bem-sucedidos e frequentemente utilizados dos últimos três anos tumultuosos de desenvolvimento em arquiteturas de modelos de difusão latente. Fonte: https://ip-adapter.github.io/

Isso permite que o modelo processe recursos visuais espaciais detalhados e contexto semântico amplo por meio de fluxos de atenção separados, que são posteriormente combinados, resultando em uma reconstrução coerente que, segundo os autores, preserva tanto a identidade quanto os detalhes de granulação fina.

Benchmarking

Na ausência de um conjunto de dados apropriado para completude de imagem humana baseada em referência, os pesquisadores propuseram o seu próprio. O benchmark (sem nome) foi construído curando pares de imagens selecionados do conjunto de dados WPose, projetado para o projeto UniHuman da Adobe Research de 2023.

Exemplos de poses do projeto UniHuman da Adobe Research de 2023. Fonte: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Exemplos de poses do projeto UniHuman da Adobe Research de 2023. Fonte: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Os pesquisadores desenharam manualmente máscaras de origem para indicar as áreas de inpintura, obtendo, no final, 417 grupos de imagens tripartites constituídos por uma imagem de origem, máscara e imagem de referência.

Dois exemplos de grupos derivados inicialmente do conjunto de dados WPose de referência e curados extensivamente pelos pesquisadores do novo artigo.

Dois exemplos de grupos derivados inicialmente do conjunto de dados WPose de referência e curados extensivamente pelos pesquisadores do novo artigo.

Os autores usaram o modelo de linguagem grande LLaVA para gerar prompts de texto que descreviam as imagens de origem.

As métricas usadas foram mais extensas do que o usual; além das métricas comuns Peak Signal-to-Noise Ratio (PSNR), Índice de Similaridade Estrutural (SSIM) e Semelhança de Imagem de Patch Perceptual Aprendida (LPIPS, neste caso para avaliar regiões mascaradas), os pesquisadores usaram DINO para pontuações de similaridade; DreamSim para avaliação de resultados de geração; e CLIP.

Dados e Testes

Para testar o trabalho, os autores utilizaram tanto o modelo padrão Stable Diffusion V1.5 quanto o modelo de inpintura 1.5. O codificador de imagem do sistema usou o modelo Vision do CLIP, junto com camadas de projeção – redes neurais modestas que reorganizam ou alinham as saídas do CLIP para corresponder às dimensões de recursos internas usadas pelo modelo.

O treinamento ocorreu por 30.000 iterações sobre oito GPUs NVIDIA A100, supervisionado por Erro Quadrático Médio (MSE), com um tamanho de lote de 64 e uma taxa de aprendizado de 2×10-5. Vários elementos foram aleatoriamente descartados ao longo do treinamento para evitar que o sistema superajustasse os dados.

O conjunto de dados foi modificado a partir do conjunto de dados Parts to Whole, que por sua vez é baseado no conjunto de dados DeepFashion-MultiModal.

Exemplos do conjunto de dados Parts to Whole, usado no desenvolvimento dos dados curados para o CompleteMe. Fonte: https://huanngzh.github.io/Parts2Whole/

Exemplos do conjunto de dados Parts to Whole, usado no desenvolvimento dos dados curados para o CompleteMe. Fonte: https://huanngzh.github.io/Parts2Whole/

Os autores afirmam:

‘Para atender às nossas necessidades, nós [reconstruímos] os pares de treinamento usando imagens ocultadas com múltiplas imagens de referência que capturam vários aspectos da aparência humana, juntamente com suas etiquetas textuais curtas.

‘Cada amostra em nossos dados de treinamento inclui seis tipos de aparência: roupas do corpo superior, roupas do corpo inferior, roupas do corpo inteiro, cabelo ou acessórios para a cabeça, rosto e sapatos. Para a estratégia de mascaramento, aplicamos mascaramento de grade aleatório em 50% dos casos, entre 1 e 30 vezes, enquanto para os outros 50%, usamos uma máscara de forma de corpo humano para aumentar a complexidade do mascaramento.

‘Depois do pipeline de construção, obtivemos 40.000 pares de imagens para treinamento.’

Métodos rivais anteriores não baseados em referência testados foram completude de imagem humana ocultada em grande escala (LOHC) e o modelo de inpintura de imagem plug-and-play BrushNet; modelos baseados em referência testados foram Paint-by-Example; AnyDoor; LeftRefill; e MimicBrush.

Os autores começaram com uma comparação quantitativa nas métricas mencionadas anteriormente:

Resultados da comparação quantitativa inicial.

Resultados da comparação quantitativa inicial.

Com relação à avaliação quantitativa, os autores observam que o CompleteMe alcança as pontuações mais altas na maioria das métricas perceptuais, incluindo CLIP-I, DINO, DreamSim e LPIPS, que visam capturar alinhamento semântico e fidelidade de aparência entre a saída e a imagem de referência.

No entanto, o modelo não supera todas as linhas de base em todos os aspectos. Notavelmente, o BrushNet alcança a pontuação mais alta no CLIP-T, o LeftRefill lidera em SSIM e PSNR, e o MimicBrush supera ligeiramente no CLIP-I.

Embora o CompleteMe mostre resultados consistentemente fortes em geral, as diferenças de desempenho são modestas em alguns casos, e certas métricas permanecem lideradas por métodos rivais anteriores. Talvez não injustamente, os autores enquadram esses resultados como evidência da força equilibrada do CompleteMe em ambas as dimensões estruturais e perceptuais.

Ilustrações para os testes qualitativos realizados no estudo são numerosas demais para serem reproduzidas aqui, e nos referimos o leitor não apenas ao artigo original, mas também ao extenso suplemento PDF, que contém muitos exemplos qualitativos adicionais.

Destacamos os principais exemplos qualitativos apresentados no artigo principal, juntamente com uma seleção de casos adicionais extraídos do conjunto de imagens suplementares introduzido anteriormente neste artigo:

Resultados qualitativos iniciais apresentados no artigo principal. Por favor, consulte o artigo original para melhor resolução.

Resultados qualitativos iniciais apresentados no artigo principal. Por favor, consulte o artigo original para melhor resolução.

Sobre os resultados qualitativos exibidos acima, os autores comentam:

‘Dadas entradas mascaradas, esses métodos não baseados em referência geram conteúdo plausível para as regiões mascaradas usando priors de imagem ou prompts de texto.

‘No entanto, como indicado na caixa vermelha, eles não podem reproduzir detalhes específicos, como tatuagens ou padrões de roupas únicos, pois carecem de imagens de referência para guiar a reconstrução de informações idênticas.’

Uma segunda comparação, parte da qual é mostrada abaixo, se concentra nos quatro métodos baseados em referência Paint-by-Example, AnyDoor, LeftRefill e MimicBrush. Aqui, apenas uma imagem de referência e um prompt de texto foram fornecidos.

Comparações qualitativas com métodos baseados em referência. O CompleteMe produz completudes mais realistas e preserva melhor os detalhes específicos da imagem de referência. As caixas vermelhas destacam áreas de particular interesse.

Comparações qualitativas com métodos baseados em referência. O CompleteMe produz completudes mais realistas e preserva melhor os detalhes específicos da imagem de referência. As caixas vermelhas destacam áreas de particular interesse.

Os autores afirmam:

‘Dada uma imagem humana mascarada e uma imagem de referência, outros métodos podem gerar conteúdo plausível, mas frequentemente falham em preservar informações contextuais da referência com precisão.

‘Em alguns casos, eles geram conteúdo irrelevante ou mapeiam incorretamente partes correspondentes da imagem de referência. Em contraste, o CompleteMe completa efetivamente a região mascarada, preservando informações idênticas e mapeando corretamente partes correspondentes do corpo humano da imagem de referência.’

Para avaliar como os modelos se alinham com a percepção humana, os autores realizaram um estudo de usuário envolvendo 15 anotadores e 2.895 pares de amostras. Cada par comparou a saída do CompleteMe com uma das quatro linhas de base baseadas em referência: Paint-by-Example, AnyDoor, LeftRefill ou MimicBrush.

Os anotadores avaliaram cada resultado com base na qualidade visual da região completada e na extensão com que ela preservava recursos de identidade da referência – e aqui, avaliando a qualidade geral e a identidade, o CompleteMe obteve um resultado mais definitivo:

Resultados do estudo de usuário.

Resultados do estudo de usuário.

Conclusão

Se algo, os resultados qualitativos neste estudo são prejudicados por sua própria quantidade, pois um exame detalhado indica que o novo sistema é uma entrada muito eficaz nesta área de edição de imagem neural relativamente nichada, mas intensamente perseguida.

No entanto, é necessário um pouco de cuidado extra e zoom para apreciar como bem o sistema adapta o material de referência à área ocultada em comparação (em quase todos os casos) com métodos anteriores.

Recomendamos fortemente que o leitor examine cuidadosamente o material suplementar apresentado no artigo original.

Recomendamos fortemente que o leitor examine cuidadosamente o material suplementar apresentado no artigo original.

 

* É interessante notar como a agora severamente ultrapassada versão V1.5 permanece uma favorita dos pesquisadores – em parte devido a testes de like-on-like legado, mas também porque é a menos censurada e possivelmente a mais facilmente treinável de todas as iterações do Stable Diffusion, e não compartilha do censoramento hobbling das versões FOSS Flux.

Especificações de VRAM não fornecidas – seriam 40GB ou 80GB por cartão.

Publicado pela primeira vez na terça-feira, 29 de abril de 2025

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai