Ângulo de Anderson

Apagando Objetos e Pessoas de Vídeos com IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated stylized image depicting a magician robot showing an empty cabinet with a lady's tiara at the bottom. GPT-1.5

Não, a criança não permanece na foto, se a IA tiver algo a ver com isso.

 

Remover pessoas e objetos de imagens e vídeos é uma sub-área de pesquisa popular na literatura de IA centrada em VFX, com um número crescente de conjuntos de dados e estruturas dedicados a abordar o desafio. O mais recente deles, do Instituto de Big Data da Universidade de Fudan, na China, é EffectErase, um sistema de remoção de objetos de vídeo “consciente de efeitos” que, segundo os autores, melhora notavelmente o estado da arte nos testes:

Montado a partir de material do site do projeto, exemplos do método EffectErase (por favor, note que, embora forneçamos um link, o site de origem contém muitos vídeos de alta resolução e não otimizados que podem afetar a estabilidade do seu navegador. O vídeo do YouTube anexado no final do artigo é uma referência mais fácil e completa).  Fonte

O novo trabalho envolveu a criação/curadoria de um conjunto de dados semi-novos, composto por quase 350 cenas reais e sintetizadas (utilizando repositórios públicos*), capturadas com equipamentos dedicados ou coletadas e reutilizadas em um fluxo de trabalho construído em torno do framework de 3D Blender de código aberto.

O conjunto de dados híbrido de Remoção de Objetos de Vídeo (VOR) forma a base para a aplicação EffectErase em si, que é construída sobre o sistema de geração de vídeo Wan2.1. O sistema também define dois novos benchmarks relacionados: VOR Avaliação e VOR Selvagem – respectivamente, para amostras com e sem verdade absoluta.

(Embora o artigo tenha um site de projeto acompanhante, ele está bastante sobrecarregado com vários vídeos de alta resolução e é difícil de carregar; portanto, por favor, consulte os trechos que eu criei no vídeo anexado acima, se você encontrar o site do projeto difícil de usar)

Uma comparação de quantidades em conjuntos de dados comparáveis anteriores, em relação à nova oferta. Fonte - https://arxiv.org/pdf/2603.19224

Uma comparação de quantidades em conjuntos de dados comparáveis anteriores, em relação à nova oferta. Fonte

Os pesquisadores afirmam que sua abordagem produz um desempenho de ponta, tanto em métricas quantitativas quanto em resultados qualitativos, conforme julgados por um estudo humano.

Eles observam que trabalhos anteriores não sempre conseguiram remover efeitos adjacentes de um objeto, como sombras e reflexos, e que seu conjunto de dados foi cuidadosamente criado para corrigir essa falha:

Exemplos de abordagens anteriores que não conseguiram olhar além do objeto procurado para remoção, para indicações secundárias, como reflexos e sombras.

Exemplos de abordagens anteriores que não conseguiram olhar além do objeto procurado para remoção, para indicações secundárias, como reflexos e sombras.

O novo artigo é intitulado EffectErase: Remoção e Inserção Conjunta de Objetos de Vídeo para Remoção de Efeitos de Alta Qualidade e vem de quatro pesquisadores da Faculdade de Ciência da Computação e Inteligência Artificial da Universidade de Fudan.

Método

O conjunto de dados híbrido de VOR foi projetado para abranger um amplo espectro de cenários para cobrir todas as implicações de tentar remover uma pessoa ou objeto de um vídeo:

Quadros emparelhados do conjunto de dados VOR ilustram como a remoção de objetos deve estender-se além do assunto visível para seus efeitos induzidos, com exemplos mostrando oclusão, sombra, mudanças de iluminação, reflexos e deformação física, cada um apresentado como entrada (objeto presente) ao lado do plano de fundo limpo correspondente após a remoção.

Quadros emparelhados do conjunto de dados VOR ilustram como a remoção de objetos deve estender-se além do assunto visível para seus efeitos induzidos, com exemplos mostrando oclusão, sombra, mudanças de iluminação, reflexos e deformação física, cada um apresentado como entrada (objeto presente) ao lado do plano de fundo limpo correspondente após a remoção. Para mais exemplos, consulte o vídeo do YouTube anexado no final do artigo.

Os cinco tipos representativos de “interferência” a serem abordados são definidos pelos autores como ocultação, incluindo vários tipos de oclusão por vidro e fumaça; sombras; iluminação (por exemplo, quando um objeto a ser removido cria ou altera o caminho da luz); reflexo; e deformação (por exemplo, a impressão de um usuário em um travesseiro, que não deve sobreviver à remoção da pessoa).

Pipeline de construção do conjunto de dados VOR, combinando cenas sintéticas geradas por Blender com capturas do mundo real, onde dados sintéticos são construídos a partir de ambientes 3D curados, objetos e trajetórias de câmera, e filmagens reais gravadas em cenas diversas, aumentadas com movimento Ken Burns. A segmentação SAM2 e a refinamento manual produzem tríades de vídeo de primeiro plano e fundo alinhadas com máscaras correspondentes.

Pipeline de construção do conjunto de dados VOR, combinando cenas sintéticas geradas por Blender com capturas do mundo real, onde dados sintéticos são construídos a partir de ambientes 3D curados, objetos e trajetórias de câmera, e filmagens reais gravadas em cenas diversas, aumentadas com movimento Ken Burns. A segmentação SAM2 e a refinamento manual produzem tríades de vídeo de primeiro plano e fundo alinhadas com máscaras correspondentes.

Para os dados reais originais, os pesquisadores usaram câmeras fixas para gravar cenas “com” e “sem” que abrangem uma ampla gama de ambientes, horários do dia e condições climáticas.

Para os dados sintetizados, múltiplos pontos de vista foram renderizados e cenários multi-objeto foram criados, apresentando deliberadamente tipos complexos e desafiadores de movimento de câmera, como pode ocorrer em filmagens do mundo real; e os pesquisadores observam que essa abordagem é mais sofisticada e trabalhosa do que a usada para o conjunto de dados semelhante Remoção de Objetos com Efeitos Laterais em Vídeos (ROSE).

Para aumentar a diversidade de movimento, o efeito Ken Burns foi aplicado a pares de câmeras, adicionando pans controlados, zooms e movimentos leves de mão sob 14 regras pré-definidas, com cinco padrões de movimento amostrados por par enquanto mantinha a colheita dentro da moldura original.

A escala e a diversidade foram ainda mais expandidas combinando objetos sintéticos com múltiplas configurações de câmera, Máscaras foram geradas colocando prompts de ponto manual em quadros-chave, propagando a segmentação com Segment Anything 2 (SAM2), limpando e refinando os resultados e montando tríades de primeiro plano, fundo e máscara validadas para treinamento.

A coleção final tem 145 horas de vídeo em 60.000 pares de vídeos, reais e sintéticos, abrangendo 366 classes de objetos em 443 cenas.

A rede EffectErase em si ingere material por meio de um Codificador Auto-variacional (VAE†), com o ruído de desenoização tratado pelo Wan2.1. Sobre esse backbone, o EffectErase opera Aprendizado Conjunto de Remoção-Inserção, que treina ambas as tarefas juntas nas mesmas regiões; Orientação de Região Consciente da Tarefa (TARG), que usa tokens de objeto e tarefa com atenção cruzada para modelar links espaço-temporais entre objetos e seus efeitos e permitir a troca de tarefas; e Perda de Consistência de Efeitos, que alinha regiões de efeitos alinhadas em tarefas de remoção e inserção:

Esquema do framework EffectErase. Durante o treinamento, vídeos emparelhados são codificados em um espaço latente compartilhado, fundidos com ruído e processados por um transformador de difusão orientado por atenção consciente da tarefa, enquanto uma perda de consistência de efeitos alinha regiões de remoção e inserção para que ambas as tarefas se concentrem na mesma área.

Esquema do framework EffectErase. Durante o treinamento, vídeos emparelhados são codificados em um espaço latente compartilhado, fundidos com ruído e processados por um transformador de difusão orientado por atenção consciente da tarefa, enquanto uma perda de consistência de efeitos alinha regiões de remoção e inserção para que ambas as tarefas se concentrem na mesma área.

Em si, os processos de remoção e inserção são treinados juntos, usando um backbone de difusão compartilhado, para que o modelo aprenda a se concentrar nas mesmas regiões afetadas e nos mesmos sinais estruturais.

Vídeos com objetos, vídeos de fundo apenas e máscaras são primeiro codificados em um espaço latente; ruído é então adicionado para treinamento de difusão, e o modelo aprende a recuperar representações limpas sob orientação específica da tarefa. Um adaptador leve funde os recursos barulhentos com condições de remoção ou inserção, permitindo que ambas as tarefas compartilhem supervisão, enquanto permanecem controláveis.

Orientação de Região Consciente da Tarefa cria um sinal específico da tarefa combinando tokens de linguagem com recursos visuais extraídos do objeto de primeiro plano, usando CLIP, substituindo um token de objeto genérico por uma incorporação derivada do conteúdo real da imagem. Essa representação fundida é injetada no backbone por meio de atenção cruzada, permitindo que o modelo rastreie como um objeto e seus efeitos visuais evoluem no espaço e no tempo, enquanto permite a troca flexível entre remoção e inserção.

Perda de Consistência de Efeitos força os processos de remoção e inserção a se concentrar nas mesmas áreas alteradas, pois ambas as tarefas lidam com o mesmo objeto e seus efeitos visuais. Mapas de atenção de cada ramo são combinados em mapas de região suaves e alinhados com um mapa de diferença computado a partir dos vídeos de objeto e fundo, para que mudanças sutis como iluminação e sombras sejam preservadas. Essa perda extra ajuda a inserção a orientar a remoção e a manter ambas as tarefas consistentes.

Dados e Testes

Os pesquisadores testaram sua abordagem contra vários métodos de inpainting, inpainting de vídeo e remoção de objetos: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; e MiniMax-Remover.

Wan2.1 foi ajustado com LoRA†† usando o conjunto de dados VOR em uma resolução de 832x480px. 81 quadros consecutivos (o limite efetivo para WAN, além do qual erros tendem a ocorrer) foram amostrados aleatoriamente para treinamento, que ocorreu por 129.000 iterações em um tamanho de lote de 8, em oito GPUs H100, cada uma com 80GB de VRAM. A taxa de aprendizado foi definida para 1×102, e o rank LoRA para 256.

A coleta de dados ROSE-Benchmark sintética foi o único conjunto de dados externo testado; os outros dois foram VOR-Avaliação, a divisão de teste do conjunto de dados VOR; e VOR-Selvagem, um conjunto de teste composto por 195 vídeos reais coletados da internet, apresentando “objetos dinâmicos”.

As métricas usadas foram Taxa de Sinal-Ruído de Pico (PSNR); Índice de Similaridade Estrutural (SSIM); Semelhança de Patch de Imagem Perceptual Aprendida (LPIPS); e Distância de Vídeo de Fréchet (FVD). Um estudo de usuário de 195 vídeos gerados a partir do VOR-Selvagem também foi considerado, com classificações médias de 20 voluntários levadas em conta.

Além disso, os autores criaram Pontuação Q, uma métrica que aproveita o modelo multimodal Qwen-VL, para avaliar a qualidade da saída de vídeo com objetos removidos, em termos de artefatos remanescentes ou remoções ambientais perdidas, como sombras e efeitos de iluminação:

Comparações quantitativas nos benchmarks ROSE e VOR, com os melhores e segundos melhores resultados mostrados em negrito e sublinhado, respectivamente.

Comparações quantitativas nos benchmarks ROSE e VOR, com os melhores e segundos melhores resultados mostrados em negrito e sublinhado, respectivamente.

Quanto a esses resultados, os autores observam:

‘[Os] métodos de inpainting de imagem operam em quadros individuais usando modelos 2D sem modelagem temporal, e portanto falham em manter a consistência temporal em vídeos.

Métodos de inpainting de vídeo recentes não modelam explicitamente os efeitos laterais do objeto, resultando em remoções não naturais. As abordagens de remoção de objetos de vídeo existentes carecem de modelagem de correlação espaço-temporal entre o objeto e seus efeitos laterais, e consequentemente produzem frequentemente artefatos e vestígios residuais do objeto removido.

‘No geral, o EffectErase alcança um desempenho de ponta em todos os conjuntos de dados e métricas de avaliação. Ele obtém as melhores pontuações na métrica de qualidade de vídeo FVD, demonstrando suavidade e consistência temporais superiores dos vídeos gerados.

‘Nosso método também alcança a maior Pontuação Q e as classificações de usuário mais altas, demonstrando ainda mais sua eficácia em produzir resultados de remoção visualmente convincentes.’

Para a avaliação qualitativa, resultados estáticos são oferecidos no artigo (mostrados) diretamente abaixo, bem como resultados em movimento disponíveis no site do projeto e no vídeo do YouTube anexado:

Comparações qualitativas no VOR-Avaliação em casos de oclusão, sombra, iluminação, reflexo e deformação. Os métodos de inpainting lutam para remover efeitos fora da máscara, enquanto os modelos de remoção frequentemente deixam artefatos visíveis. O EffectErase remove tanto o objeto-alvo quanto seus efeitos associados de forma mais limpa. Por favor, consulte o artigo de origem para uma melhor resolução e o site do projeto para exemplos de vídeo.

Comparações qualitativas no VOR-Avaliação em casos de oclusão, sombra, iluminação, reflexo e deformação. Os métodos de inpainting lutam para remover efeitos fora da máscara, enquanto os modelos de remoção frequentemente deixam artefatos visíveis. O EffectErase remove tanto o objeto-alvo quanto seus efeitos associados de forma mais limpa. Por favor, consulte o artigo de origem para uma melhor resolução e o site do projeto para exemplos de vídeo.

Nós também nos referimos ao leitor para exemplos relacionados diversos no site do projeto, previstos abaixo, bem como o vídeo oficial do YouTube anexado no final do artigo:

Clique para reproduzir. Uma comparação de amostra do site do projeto EffectErase. Por favor, consulte o site para uma melhor resolução (com as mencionadas limitações) e para mais exemplos.

Os autores comentam:

‘Os métodos de inpainting de vídeo frequentemente produzem artefatos em regiões mascaradas e falham em remover completamente os efeitos laterais causados pelo objeto removido. As abordagens de remoção de objetos anteriores, como [ROSE] e [MinMax-Remover], desempenham bem na remoção do objeto-alvo, mas ainda lutam com efeitos laterais, especialmente em cenários de oclusão, sombra, iluminação, reflexo e deformação.

‘Em contraste, o EffectErase remove efetivamente tanto o objeto-alvo quanto seus efeitos associados, resultando em resultados limpos, coerentes e de alta qualidade.’

Ao concluir, os pesquisadores observam que seu método também pode ser adaptado para tarefas de inserção em vez de remoção, sem a necessidade de treinamento adicional:

Resultados de inserção de objetos de vídeo. O EffectErase insere objetos preservando o conteúdo de fundo e gerando efeitos induzidos por objetos consistentes, como sombras e reflexos, em todo o vídeo.

Resultados de inserção de objetos de vídeo. O EffectErase insere objetos preservando o conteúdo de fundo e gerando efeitos induzidos por objetos consistentes, como sombras e reflexos, em todo o vídeo.

Resultados de vídeo para a tarefa de inserção podem ser vistos no (vídeo do YouTube com tempo específico) exemplos (também anexados sem marcas de tempo no final do artigo).

Conclusão

Um olhar sobre projetos semelhantes na literatura revela que muitos ainda esperam que modelos de VFX de propósito geral eventualmente sejam capazes de incorporar esse tipo de funcionalidade em um “kit de ferramentas” de modelo projetado para uma variedade de efeitos, em vez de apenas essa tarefa específica.

No entanto, com base no princípio de “jack of all trades”, parece razoável supor que sistemas dedicados como o EffectErase continuarão a manter uma vantagem sobre abordagens mais gerais; com a ressalva de que a lacuna pode eventualmente se contrair o suficiente para tornar a diferença não valer a pena o esforço extra de treinar um modelo discreto.

 

* Alguém esperaria, com as crescentes preocupações em torno de questões de proveniência de IP, que todas essas fontes fossem citadas; mas se os materiais disponíveis do novo trabalho listam a fonte dos modelos 3D, eu não consegui localizar essa referência.

† A referência fornecida parece ser um texto explicativo genérico de 2013, com o VAE específico não detalhado.

†† Tirado do artigo, esta é uma descrição semanticamente inclear, pois o ajuste fino e o LoRA são processos diferentes com demandas muito diferentes.

Publicado pela primeira vez no sábado, 21 de março de 2026 

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai