Ãngulo de Anderson
Apagando Objetos e Pessoas de VÃdeos com IA

NÃĢo, a criança nÃĢo permanece na foto, se a IA tiver algo a ver com isso.
Â
Remover pessoas e objetos de imagens e vÃdeos ÃĐ uma sub-ÃĄrea de pesquisa popular na literatura de IA centrada em VFX, com um nÚmero crescente de conjuntos de dados e estruturas dedicados a abordar o desafio. O mais recente deles, do Instituto de Big Data da Universidade de Fudan, na China, ÃĐ EffectErase, um sistema de remoçÃĢo de objetos de vÃdeo âconsciente de efeitosâ que, segundo os autores, melhora notavelmente o estado da arte nos testes:
Montado a partir de material do site do projeto, exemplos do mÃĐtodo EffectErase (por favor, note que, embora forneçamos um link, o site de origem contÃĐm muitos vÃdeos de alta resoluçÃĢo e nÃĢo otimizados que podem afetar a estabilidade do seu navegador. O vÃdeo do YouTube anexado no final do artigo ÃĐ uma referÊncia mais fÃĄcil e completa).  Fonte
O novo trabalho envolveu a criaçÃĢo/curadoria de um conjunto de dados semi-novos, composto por quase 350 cenas reais e sintetizadas (utilizando repositÃģrios pÚblicos*), capturadas com equipamentos dedicados ou coletadas e reutilizadas em um fluxo de trabalho construÃdo em torno do framework de 3D Blender de cÃģdigo aberto.
O conjunto de dados hÃbrido de RemoçÃĢo de Objetos de VÃdeo (VOR) forma a base para a aplicaçÃĢo EffectErase em si, que ÃĐ construÃda sobre o sistema de geraçÃĢo de vÃdeo Wan2.1. O sistema tambÃĐm define dois novos benchmarks relacionados: VOR AvaliaçÃĢo e VOR Selvagem â respectivamente, para amostras com e sem verdade absoluta.
(Embora o artigo tenha um site de projeto acompanhante, ele estÃĄ bastante sobrecarregado com vÃĄrios vÃdeos de alta resoluçÃĢo e ÃĐ difÃcil de carregar; portanto, por favor, consulte os trechos que eu criei no vÃdeo anexado acima, se vocÊ encontrar o site do projeto difÃcil de usar)

Uma comparaçÃĢo de quantidades em conjuntos de dados comparÃĄveis anteriores, em relaçÃĢo à nova oferta. Fonte
Os pesquisadores afirmam que sua abordagem produz um desempenho de ponta, tanto em mÃĐtricas quantitativas quanto em resultados qualitativos, conforme julgados por um estudo humano.
Eles observam que trabalhos anteriores nÃĢo sempre conseguiram remover efeitos adjacentes de um objeto, como sombras e reflexos, e que seu conjunto de dados foi cuidadosamente criado para corrigir essa falha:

Exemplos de abordagens anteriores que nÃĢo conseguiram olhar alÃĐm do objeto procurado para remoçÃĢo, para indicaçÃĩes secundÃĄrias, como reflexos e sombras.
O novo artigo ÃĐ intitulado EffectErase: RemoçÃĢo e InserçÃĢo Conjunta de Objetos de VÃdeo para RemoçÃĢo de Efeitos de Alta Qualidade e vem de quatro pesquisadores da Faculdade de CiÊncia da ComputaçÃĢo e InteligÊncia Artificial da Universidade de Fudan.
MÃĐtodo
O conjunto de dados hÃbrido de VOR foi projetado para abranger um amplo espectro de cenÃĄrios para cobrir todas as implicaçÃĩes de tentar remover uma pessoa ou objeto de um vÃdeo:

Quadros emparelhados do conjunto de dados VOR ilustram como a remoçÃĢo de objetos deve estender-se alÃĐm do assunto visÃvel para seus efeitos induzidos, com exemplos mostrando oclusÃĢo, sombra, mudanças de iluminaçÃĢo, reflexos e deformaçÃĢo fÃsica, cada um apresentado como entrada (objeto presente) ao lado do plano de fundo limpo correspondente apÃģs a remoçÃĢo. Para mais exemplos, consulte o vÃdeo do YouTube anexado no final do artigo.
Os cinco tipos representativos de âinterferÊnciaâ a serem abordados sÃĢo definidos pelos autores como ocultaçÃĢo, incluindo vÃĄrios tipos de oclusÃĢo por vidro e fumaça; sombras; iluminaçÃĢo (por exemplo, quando um objeto a ser removido cria ou altera o caminho da luz); reflexo; e deformaçÃĢo (por exemplo, a impressÃĢo de um usuÃĄrio em um travesseiro, que nÃĢo deve sobreviver à remoçÃĢo da pessoa).

Pipeline de construçÃĢo do conjunto de dados VOR, combinando cenas sintÃĐticas geradas por Blender com capturas do mundo real, onde dados sintÃĐticos sÃĢo construÃdos a partir de ambientes 3D curados, objetos e trajetÃģrias de cÃĒmera, e filmagens reais gravadas em cenas diversas, aumentadas com movimento Ken Burns. A segmentaçÃĢo SAM2 e a refinamento manual produzem trÃades de vÃdeo de primeiro plano e fundo alinhadas com mÃĄscaras correspondentes.
Para os dados reais originais, os pesquisadores usaram cÃĒmeras fixas para gravar cenas âcomâ e âsemâ que abrangem uma ampla gama de ambientes, horÃĄrios do dia e condiçÃĩes climÃĄticas.
Para os dados sintetizados, mÚltiplos pontos de vista foram renderizados e cenÃĄrios multi-objeto foram criados, apresentando deliberadamente tipos complexos e desafiadores de movimento de cÃĒmera, como pode ocorrer em filmagens do mundo real; e os pesquisadores observam que essa abordagem ÃĐ mais sofisticada e trabalhosa do que a usada para o conjunto de dados semelhante RemoçÃĢo de Objetos com Efeitos Laterais em VÃdeos (ROSE).
Para aumentar a diversidade de movimento, o efeito Ken Burns foi aplicado a pares de cÃĒmeras, adicionando pans controlados, zooms e movimentos leves de mÃĢo sob 14 regras prÃĐ-definidas, com cinco padrÃĩes de movimento amostrados por par enquanto mantinha a colheita dentro da moldura original.
A escala e a diversidade foram ainda mais expandidas combinando objetos sintÃĐticos com mÚltiplas configuraçÃĩes de cÃĒmera, MÃĄscaras foram geradas colocando prompts de ponto manual em quadros-chave, propagando a segmentaçÃĢo com Segment Anything 2 (SAM2), limpando e refinando os resultados e montando trÃades de primeiro plano, fundo e mÃĄscara validadas para treinamento.
A coleçÃĢo final tem 145 horas de vÃdeo em 60.000 pares de vÃdeos, reais e sintÃĐticos, abrangendo 366 classes de objetos em 443 cenas.
A rede EffectErase em si ingere material por meio de um Codificador Auto-variacional (VAEâ ), com o ruÃdo de desenoizaçÃĢo tratado pelo Wan2.1. Sobre esse backbone, o EffectErase opera Aprendizado Conjunto de RemoçÃĢo-InserçÃĢo, que treina ambas as tarefas juntas nas mesmas regiÃĩes; OrientaçÃĢo de RegiÃĢo Consciente da Tarefa (TARG), que usa tokens de objeto e tarefa com atençÃĢo cruzada para modelar links espaço-temporais entre objetos e seus efeitos e permitir a troca de tarefas; e Perda de ConsistÊncia de Efeitos, que alinha regiÃĩes de efeitos alinhadas em tarefas de remoçÃĢo e inserçÃĢo:

Esquema do framework EffectErase. Durante o treinamento, vÃdeos emparelhados sÃĢo codificados em um espaço latente compartilhado, fundidos com ruÃdo e processados por um transformador de difusÃĢo orientado por atençÃĢo consciente da tarefa, enquanto uma perda de consistÊncia de efeitos alinha regiÃĩes de remoçÃĢo e inserçÃĢo para que ambas as tarefas se concentrem na mesma ÃĄrea.
Em si, os processos de remoçÃĢo e inserçÃĢo sÃĢo treinados juntos, usando um backbone de difusÃĢo compartilhado, para que o modelo aprenda a se concentrar nas mesmas regiÃĩes afetadas e nos mesmos sinais estruturais.
VÃdeos com objetos, vÃdeos de fundo apenas e mÃĄscaras sÃĢo primeiro codificados em um espaço latente; ruÃdo ÃĐ entÃĢo adicionado para treinamento de difusÃĢo, e o modelo aprende a recuperar representaçÃĩes limpas sob orientaçÃĢo especÃfica da tarefa. Um adaptador leve funde os recursos barulhentos com condiçÃĩes de remoçÃĢo ou inserçÃĢo, permitindo que ambas as tarefas compartilhem supervisÃĢo, enquanto permanecem controlÃĄveis.
OrientaçÃĢo de RegiÃĢo Consciente da Tarefa cria um sinal especÃfico da tarefa combinando tokens de linguagem com recursos visuais extraÃdos do objeto de primeiro plano, usando CLIP, substituindo um token de objeto genÃĐrico por uma incorporaçÃĢo derivada do conteÚdo real da imagem. Essa representaçÃĢo fundida ÃĐ injetada no backbone por meio de atençÃĢo cruzada, permitindo que o modelo rastreie como um objeto e seus efeitos visuais evoluem no espaço e no tempo, enquanto permite a troca flexÃvel entre remoçÃĢo e inserçÃĢo.
Perda de ConsistÊncia de Efeitos força os processos de remoçÃĢo e inserçÃĢo a se concentrar nas mesmas ÃĄreas alteradas, pois ambas as tarefas lidam com o mesmo objeto e seus efeitos visuais. Mapas de atençÃĢo de cada ramo sÃĢo combinados em mapas de regiÃĢo suaves e alinhados com um mapa de diferença computado a partir dos vÃdeos de objeto e fundo, para que mudanças sutis como iluminaçÃĢo e sombras sejam preservadas. Essa perda extra ajuda a inserçÃĢo a orientar a remoçÃĢo e a manter ambas as tarefas consistentes.
Dados e Testes
Os pesquisadores testaram sua abordagem contra vÃĄrios mÃĐtodos de inpainting, inpainting de vÃdeo e remoçÃĢo de objetos: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; e MiniMax-Remover.
Wan2.1 foi ajustado com LoRAâ â usando o conjunto de dados VOR em uma resoluçÃĢo de 832x480px. 81 quadros consecutivos (o limite efetivo para WAN, alÃĐm do qual erros tendem a ocorrer) foram amostrados aleatoriamente para treinamento, que ocorreu por 129.000 iteraçÃĩes em um tamanho de lote de 8, em oito GPUs H100, cada uma com 80GB de VRAM. A taxa de aprendizado foi definida para 1Ã102, e o rank LoRA para 256.
A coleta de dados ROSE-Benchmark sintÃĐtica foi o Único conjunto de dados externo testado; os outros dois foram VOR-AvaliaçÃĢo, a divisÃĢo de teste do conjunto de dados VOR; e VOR-Selvagem, um conjunto de teste composto por 195 vÃdeos reais coletados da internet, apresentando âobjetos dinÃĒmicosâ.
As mÃĐtricas usadas foram Taxa de Sinal-RuÃdo de Pico (PSNR); Ãndice de Similaridade Estrutural (SSIM); Semelhança de Patch de Imagem Perceptual Aprendida (LPIPS); e DistÃĒncia de VÃdeo de FrÃĐchet (FVD). Um estudo de usuÃĄrio de 195 vÃdeos gerados a partir do VOR-Selvagem tambÃĐm foi considerado, com classificaçÃĩes mÃĐdias de 20 voluntÃĄrios levadas em conta.
AlÃĐm disso, os autores criaram PontuaçÃĢo Q, uma mÃĐtrica que aproveita o modelo multimodal Qwen-VL, para avaliar a qualidade da saÃda de vÃdeo com objetos removidos, em termos de artefatos remanescentes ou remoçÃĩes ambientais perdidas, como sombras e efeitos de iluminaçÃĢo:

ComparaçÃĩes quantitativas nos benchmarks ROSE e VOR, com os melhores e segundos melhores resultados mostrados em negrito e sublinhado, respectivamente.
Quanto a esses resultados, os autores observam:
â[Os] mÃĐtodos de inpainting de imagem operam em quadros individuais usando modelos 2D sem modelagem temporal, e portanto falham em manter a consistÊncia temporal em vÃdeos.
MÃĐtodos de inpainting de vÃdeo recentes nÃĢo modelam explicitamente os efeitos laterais do objeto, resultando em remoçÃĩes nÃĢo naturais. As abordagens de remoçÃĢo de objetos de vÃdeo existentes carecem de modelagem de correlaçÃĢo espaço-temporal entre o objeto e seus efeitos laterais, e consequentemente produzem frequentemente artefatos e vestÃgios residuais do objeto removido.
âNo geral, o EffectErase alcança um desempenho de ponta em todos os conjuntos de dados e mÃĐtricas de avaliaçÃĢo. Ele obtÃĐm as melhores pontuaçÃĩes na mÃĐtrica de qualidade de vÃdeo FVD, demonstrando suavidade e consistÊncia temporais superiores dos vÃdeos gerados.
âNosso mÃĐtodo tambÃĐm alcança a maior PontuaçÃĢo Q e as classificaçÃĩes de usuÃĄrio mais altas, demonstrando ainda mais sua eficÃĄcia em produzir resultados de remoçÃĢo visualmente convincentes.â
Para a avaliaçÃĢo qualitativa, resultados estÃĄticos sÃĢo oferecidos no artigo (mostrados) diretamente abaixo, bem como resultados em movimento disponÃveis no site do projeto e no vÃdeo do YouTube anexado:

ComparaçÃĩes qualitativas no VOR-AvaliaçÃĢo em casos de oclusÃĢo, sombra, iluminaçÃĢo, reflexo e deformaçÃĢo. Os mÃĐtodos de inpainting lutam para remover efeitos fora da mÃĄscara, enquanto os modelos de remoçÃĢo frequentemente deixam artefatos visÃveis. O EffectErase remove tanto o objeto-alvo quanto seus efeitos associados de forma mais limpa. Por favor, consulte o artigo de origem para uma melhor resoluçÃĢo e o site do projeto para exemplos de vÃdeo.
NÃģs tambÃĐm nos referimos ao leitor para exemplos relacionados diversos no site do projeto, previstos abaixo, bem como o vÃdeo oficial do YouTube anexado no final do artigo:
Clique para reproduzir. Uma comparaçÃĢo de amostra do site do projeto EffectErase. Por favor, consulte o site para uma melhor resoluçÃĢo (com as mencionadas limitaçÃĩes) e para mais exemplos.
Os autores comentam:
âOs mÃĐtodos de inpainting de vÃdeo frequentemente produzem artefatos em regiÃĩes mascaradas e falham em remover completamente os efeitos laterais causados pelo objeto removido. As abordagens de remoçÃĢo de objetos anteriores, como [ROSE] e [MinMax-Remover], desempenham bem na remoçÃĢo do objeto-alvo, mas ainda lutam com efeitos laterais, especialmente em cenÃĄrios de oclusÃĢo, sombra, iluminaçÃĢo, reflexo e deformaçÃĢo.
âEm contraste, o EffectErase remove efetivamente tanto o objeto-alvo quanto seus efeitos associados, resultando em resultados limpos, coerentes e de alta qualidade.â
Ao concluir, os pesquisadores observam que seu mÃĐtodo tambÃĐm pode ser adaptado para tarefas de inserçÃĢo em vez de remoçÃĢo, sem a necessidade de treinamento adicional:

Resultados de inserçÃĢo de objetos de vÃdeo. O EffectErase insere objetos preservando o conteÚdo de fundo e gerando efeitos induzidos por objetos consistentes, como sombras e reflexos, em todo o vÃdeo.
Resultados de vÃdeo para a tarefa de inserçÃĢo podem ser vistos no (vÃdeo do YouTube com tempo especÃfico) exemplos (tambÃĐm anexados sem marcas de tempo no final do artigo).
ConclusÃĢo
Um olhar sobre projetos semelhantes na literatura revela que muitos ainda esperam que modelos de VFX de propÃģsito geral eventualmente sejam capazes de incorporar esse tipo de funcionalidade em um âkit de ferramentasâ de modelo projetado para uma variedade de efeitos, em vez de apenas essa tarefa especÃfica.
No entanto, com base no princÃpio de âjack of all tradesâ, parece razoÃĄvel supor que sistemas dedicados como o EffectErase continuarÃĢo a manter uma vantagem sobre abordagens mais gerais; com a ressalva de que a lacuna pode eventualmente se contrair o suficiente para tornar a diferença nÃĢo valer a pena o esforço extra de treinar um modelo discreto.
Â
* AlguÃĐm esperaria, com as crescentes preocupaçÃĩes em torno de questÃĩes de proveniÊncia de IP, que todas essas fontes fossem citadas; mas se os materiais disponÃveis do novo trabalho listam a fonte dos modelos 3D, eu nÃĢo consegui localizar essa referÊncia.
â A referÊncia fornecida parece ser um texto explicativo genÃĐrico de 2013, com o VAE especÃfico nÃĢo detalhado.
â â Tirado do artigo, esta ÃĐ uma descriçÃĢo semanticamente inclear, pois o ajuste fino e o LoRA sÃĢo processos diferentes com demandas muito diferentes.
Publicado pela primeira vez no sÃĄbado, 21 de março de 2026Â












