Andersons vinkel

Radera objekt och personer frÃĨn video med AI

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
AI-generated stylized image depicting a magician robot showing an empty cabinet with a lady's tiara at the bottom. GPT-1.5

Nej, barnet stannar inte kvar i bilden, om AI har nÃĨgot att sÃĪga till om.

 

Att ta bort personer och objekt frÃĨn bilder och video ÃĪr en populÃĪr undergren av forskning inom VFX-orienterad AI-litteratur, med ett vÃĪxande antal dedikerade dataset och ramverk som tar itu med utmaningen. Den senaste av dessa, frÃĨn Institute of Big Data vid Kinas Fudan University, ÃĪr EffectErase, ett ‘effektmedvetet’ videosystem fÃķr objektborttagning som, enligt fÃķrfattarna, fÃķrbÃĪttrar betydligt pÃĨ den nuvarande tillstÃĨndet i testerna:

Sammansatt frÃĨn material pÃĨ projektwebbplatsen, exempel pÃĨ EffectErase-metoden ( Observera att medan vi tillhandahÃĨller en lÃĪnk, sÃĨ innehÃĨller kÃĪllwebbplatsen mÃĨnga hÃķgupplÃķsta och icke-optimerade autoplay-videor som kan pÃĨverka webblÃĪsarens stabilitet. Den medfÃķljande YouTube-videon ÃĪr en lÃĪttare och fullstÃĪndigare referens och ÃĪr inbÃĪddad i slutet av den hÃĪr artikeln).  KÃĪlla

Det nya arbetet innebar skapandet/kureringen av ett semi-nytt dataset som bestÃĨr av nÃĪstan 350 originalverkliga och syntetiska scener (med hjÃĪlp av offentliga repositorier*), antingen inspelade med dedikerad utrustning eller hÃĪmtade och ÃĨteranvÃĪnda i en arbetsflÃķde byggd kring det Ãķppna kÃĪllkodsramverket Blender 3D.

Det hybrida Video Object Removal (VOR)-datasetet utgÃķr grunden fÃķr EffectErase-applikationen, som ÃĪr byggd Ãķver Wan2.1-videosystemet. Systemet definierar ocksÃĨ tvÃĨ nya relaterade benchmark: VOR Eval och VOR Wild – fÃķr samples med och utan ground truth.

(Även om artikeln har en tillhÃķrande projektsajt, sÃĨ ÃĪr den ganska Ãķverbelastad med flera hÃķgupplÃķsta videor och svÃĨr att ladda; sÃĨ vÃĪnligen hÃĪnvisa till de utdrag jag har kuraterat i den inbÃĪddade videon ovan, om du hittar projektsajten svÃĨr att anvÃĪnda)

En jÃĪmfÃķrelse av kvantiteter Ãķver jÃĪmfÃķrbara tidigare dataset, med avseende pÃĨ det nya erbjudandet. KÃĪlla - https://arxiv.org/pdf/2603.19224

En jÃĪmfÃķrelse av kvantiteter Ãķver jÃĪmfÃķrbara tidigare dataset, med avseende pÃĨ det nya erbjudandet. KÃĪlla

Forskarna hÃĪvdar att deras tillvÃĪgagÃĨngssÃĪtt ger state-of-the-art-prestanda, bÃĨde i kvantitativa mÃĨtt och i kvalitativa resultat som bedÃķms genom en mÃĪnsklig studie.

De noterar att tidigare arbeten inte alltid har lyckats med att ta bort objektets sekundÃĪra effekter, sÃĨsom skuggor och reflektioner, och att deras dataset har skapats fÃķr att ÃĨtgÃĪrda denna brist:

Exempel pÃĨ tidigare tillvÃĪgagÃĨngssÃĪtts brist pÃĨ att se bortom det objekt som ska tas bort, till sekundÃĪra indikationer, sÃĨsom reflektioner och skuggor.

Exempel pÃĨ tidigare tillvÃĪgagÃĨngssÃĪtts brist pÃĨ att se bortom det objekt som ska tas bort, till sekundÃĪra indikationer, sÃĨsom reflektioner och skuggor.

Den nya artikeln heter EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing, och kommer frÃĨn fyra forskare vid Fudan Universitys College of Computer Science and Artificial Intelligence.

Metod

Det hybrida VOR-datasetet var designat fÃķr att omfatta en tillrÃĪckligt bred uppsÃĪttning scenarier fÃķr att tÃĪcka alla implikationer av att ta bort en person eller ett objekt frÃĨn en video:

Parade ramar frÃĨn VOR-datasetet visar hur objektborttagning mÃĨste gÃĨ utÃķver det synliga fÃķremÃĨlet till dess inducerade effekter, med exempel som visar occlusion, skugga, ljusfÃķrÃĪndringar, reflektioner och fysisk deformation, var och en presenterad som indata (objekt nÃĪrvarande) bredvid den motsvarande rena bakgrunden efter borttagning.

Parade ramar frÃĨn VOR-datasetet visar hur objektborttagning mÃĨste gÃĨ utÃķver det synliga fÃķremÃĨlet till dess inducerade effekter, med exempel som visar occlusion, skugga, ljusfÃķrÃĪndringar, reflektioner och fysisk deformation, var och en presenterad som indata (objekt nÃĪrvarande) bredvid den motsvarande rena bakgrunden efter borttagning. FÃķr ytterligare exempel, se den medfÃķljande YouTube-videon inbÃĪddad i slutet av den hÃĪr artikeln.

De fem representativa typerna av ‘stÃķrning’ som ska hanteras definieras av fÃķrfattarna som occlusion, inklusive olika typer av glas- och rÃķkocclusion; skuggor; ljus (t.ex. nÃĪr ett objekt som ska tas bort skapar eller ÃĪndrar ljusets bana); reflektion; och deformation (t.ex. avtrycket av en anvÃĪndare pÃĨ en kudde, som inte bÃķr Ãķverleva personens borttagning).

Dataset-konstruktionspipeline fÃķr VOR, som kombinerar Blender-genererade syntetiska scener med verkliga inspelningar, dÃĪr syntetisk data byggs frÃĨn kuraterade 3D-miljÃķer, objekt och kamerabanor, och verklig film inspelad Ãķver olika scener, fÃķrstÃĪrkt med Ken Burns-rÃķrelse. SAM2-segmentering och manuell finjustering producerar dÃĨ anpassade fÃķrgrunds- och bakgrunds-videotriplett med motsvarande masker.

Dataset-konstruktionspipeline fÃķr VOR, som kombinerar Blender-genererade syntetiska scener med verkliga inspelningar, dÃĪr syntetisk data byggs frÃĨn kuraterade 3D-miljÃķer, objekt och kamerabanor, och verklig film inspelad Ãķver olika scener, fÃķrstÃĪrkt med Ken Burns-rÃķrelse. SAM2-segmentering och manuell finjustering producerar dÃĨ anpassade fÃķrgrunds- och bakgrunds-videotriplett med motsvarande masker.

FÃķr de verkliga originaldata anvÃĪnde forskarna fasta kameror fÃķr att spela in ‘med’ och ‘utan’ scener som tÃĪckte en bred uppsÃĪttning miljÃķer, tid pÃĨ dagen och vÃĪderfÃķrhÃĨllanden.

FÃķr de syntetiska data renderades flera vyer, och multi-objektscenarier skapades, som medvetet komplexa och utmanande typer av kamerarÃķrelser, som kan fÃķrekomma i verklig film; och forskarna observerar att detta tillvÃĪgagÃĨngssÃĪtt ÃĪr mer sofistikerat och krÃĪvande ÃĪn det som anvÃĪnds fÃķr det annars liknande Remove Objects with Side Effects in Videos (ROSE) dataset.

FÃķr att Ãķka rÃķrelsediversitet applicerades Ken Burns-effekten pÃĨ kamera-inspelade par, lÃĪggande till kontrollerade panoreringar, zoomningar och lÃĪtt handhÃĨllen rÃķrelse under fjorton fÃķrdefinierade regler, med fem rÃķrelsemÃķnster sampade per par medan man hÃĨller grÃķdan inom den ursprungliga ramen.

Skalor och diversitet utvidgades ytterligare genom att kombinera syntetiska objekt med flera kamerainstÃĪllningar, Masker genererades genom att placera manuella punktprompter pÃĨ nyckelramar, propagerande segmentering med Segment Anything 2 (SAM2), rensande och finjusterande resultat, och monterande validerade fÃķrgrunds-, bakgrunds- och mask-tripletter fÃķr trÃĪning.

Den slutliga samlingen bestÃĨr av 145 timmar video Ãķver 60 000 parade videor, verkliga och syntetiska, som tÃĪcker 366 objektklasser i 443 scener.

EffectErase-nÃĪtverket i sig tar emot material via en Variational Auto-Encoder (VAE†), med latenta brusreducering hanterad av Wan2.1. Över denna ryggrad opererar EffectErase Removal-Insertion Joint Learning, som trÃĪnar bÃĨda uppgifterna tillsammans pÃĨ samma omrÃĨden; Task-Aware Region Guidance (TARG), som anvÃĪnder objekttoken och uppgiftstoken med cross-attention fÃķr att modellera rumsliga och tidsmÃĪssiga lÃĪnkar mellan objekt och deras effekter och tillÃĨta uppgiftsvÃĪxling; och Effect Consistency Loss, som justerar effektomrÃĨden justerade Ãķver borttagnings- och infÃķrandetillvÃĪgagÃĨngssÃĪtt:

Schema fÃķr EffectErase-ramverket. Under trÃĪning, parade videor kodas till ett delat latentspace, sammanslagna med brus och bearbetade av en diffusionstransformator styrd av uppgiftsmedveten cross-attention, medan en effektkonsistensfÃķrlust justerar borttagnings- och infÃķranderegioner sÃĨ att bÃĨda uppgifterna fokuserar pÃĨ samma omrÃĨde.

Schema fÃķr EffectErase-ramverket. Under trÃĪning, parade videor kodas till ett delat latentspace, sammanslagna med brus och bearbetade av en diffusionstransformator styrd av uppgiftsmedveten cross-attention, medan en effektkonsistensfÃķrlust justerar borttagnings- och infÃķranderegioner sÃĨ att bÃĨda uppgifterna fokuserar pÃĨ samma omrÃĨde.

I sig sjÃĪlva trÃĪnas borttagnings- och infÃķrandeprocesserna tillsammans, med hjÃĪlp av ett delat diffusion-ryggrad, sÃĨ att modellen lÃĪr sig att fokusera pÃĨ samma berÃķrda omrÃĨden och strukturmÃķnster.

Videor med objekt, bakgrunds-videor och masker, kodas fÃķrst till ett latentspace; brus lÃĪggs sedan till fÃķr diffusionstrÃĪning, och modellen lÃĪr sig att ÃĨterstÃĪlla rena representationer under uppgiftsspecifik vÃĪgledning. En lÃĪtt adapter fuserar sedan de bullriga funktionerna med borttagnings- eller infÃķrandevillkor, vilket tillÃĨter bÃĨda uppgifterna att dela Ãķvervakning, samtidigt som de fÃķrblir kontrollerbara.

Task-Aware Region Guidance skapar en uppgiftsspecifik signal genom att kombinera sprÃĨktoken med visuella funktioner extraherade frÃĨn fÃķrgrundsobjektet, med hjÃĪlp av CLIP, ersÃĪtter en generisk objekttoken med en inbÃĪddning som hÃĪrrÃķr frÃĨn den faktiska bildinnehÃĨllet. Denna fusionerade representation injiceras i ryggraden genom cross-attention, vilket tillÃĨter modellen att spÃĨra hur ett objekt och dess visuella effekter utvecklas Ãķver rum och tid, samtidigt som den mÃķjliggÃķr flexibel vÃĪxling mellan borttagning och infÃķrande.

Effect Consistency Loss tvingar borttagnings- och infÃķrandeprocesser att fokusera pÃĨ samma fÃķrÃĪndrade omrÃĨden, eftersom bÃĨda uppgifterna hanterar samma objekt och dess visuella effekter. UppmÃĪrksamhetskartor frÃĨn varje gren kombineras till mjuka regionkartor, och justeras med en skillnadsruta berÃĪknad frÃĨn objekts- och bakgrunds-videor, sÃĨ att subtila fÃķrÃĪndringar som ljus och skuggor bevaras. Denna extra fÃķrlust hjÃĪlper infÃķrandet att vÃĪgleda borttagning och hÃĨller bÃĨda uppgifterna konsekventa.

Data och tester

Forskarna testade sitt tillvÃĪgagÃĨngssÃĪtt mot olika inpainting-, videoinpainting- och objektborttagningsmetoder: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; och MiniMax-Remover.

Wan2.1 finjusterades med LoRA†† med hjÃĪlp av VOR-datasetet i en upplÃķsning pÃĨ 832x480px. 81 pÃĨ varandra fÃķljande ramar (den effektiva grÃĪnsen fÃķr WAN, bortom vilken fel tenderar att uppstÃĨ) sampades slumpmÃĪssigt fÃķr trÃĪning, som ÃĪgde rum under 129 000 iterationer med en batchstorlek pÃĨ 8, pÃĨ ÃĨtta H100-GPU:er, var och en med 80 GB VRAM. LÃĪrandehastigheten sattes till 1×102, och LoRA-rank till 256.

ROSE-Benchmark-samlingen var den enda externa dataset som testades; de andra tvÃĨ var VOR-Eval, VOR-datasetets test split; och VOR-Wild, en testuppsÃĪttning som bestÃĨr av 195 verkliga videor skrapade frÃĨn internet, som innehÃĨller ‘dynamiska objekt’.

MÃĪtvÃĪrden som anvÃĪndes var Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); och FrÃĐchet Video Distance (FVD). En anvÃĪndarstudie av 195 genererade videor frÃĨn VOR-Wild beaktades ocksÃĨ, med genomsnittliga betyg frÃĨn 20 volontÃĪrer som togs med i berÃĪkningen.

Dessutom utvecklade fÃķrfattarna QScore, en mÃĪtvÃĪrde som utnyttjar Qwen-VL-multimodellmodellen, fÃķr att utvÃĪrdera kvaliteten pÃĨ objektborttagna video-utdata, i termer av kvarvarande artefakter eller missade miljÃķborttagningar, sÃĨsom skuggor och ljuseffekter:

Kvantitativ jÃĪmfÃķrelse pÃĨ ROSE och VOR-benchmark, med bÃĪsta och nÃĪst bÃĪsta resultat markerade i fetstil och understruken, respektive.

Kvantitativ jÃĪmfÃķrelse pÃĨ ROSE och VOR-benchmark, med bÃĪsta och nÃĪst bÃĪsta resultat markerade i fetstil och understruken, respektive.

Med avseende pÃĨ dessa resultat noterar fÃķrfattarna:

‘[Nuvarande] bildinpainting-metoder fungerar pÃĨ enskilda ramar med hjÃĪlp av 2D-modeller utan tidsmÃĪssig modellering, och kan dÃĪrfÃķr inte upprÃĪtthÃĨlla tidsmÃĪssig konsekvens i videor.

Senaste videoinpainting-metoder modellerar inte explicita objektsidoeffekter, vilket resulterar i onaturliga borttagningsresultat. Existerande video-objektborttagningsmetoder saknar rumslig och tidsmÃĪssig korrelationsmodellering mellan objektet och dess sidoeffekter, och producerar dÃĪrfÃķr ofta artefakter och rester av de borttagna objekten.

‘Sammanfattningsvis uppnÃĨr EffectErase state-of-the-art-prestanda Ãķver alla dataset och utvÃĪrderingsmÃĨtt. Det uppnÃĨr de bÃĪsta resultaten pÃĨ video-kvalitetsmÃĨttet FVD, vilket visar pÃĨ ÃķverlÃĪgsen tidsmÃĪssig jÃĪmnhet och konsekvens i de genererade videorna.

‘VÃĨr metod uppnÃĨr ocksÃĨ den hÃķgsta QScore och anvÃĪndarfeedback-betyg, vilket ytterligare visar dess effektivitet i att producera visuellt Ãķvertygande borttagningsresultat.’

FÃķr den kvalitativa utvÃĪrderingen erbjuds statiska resultat i artikeln (visas) direkt nedan, samt rÃķrliga resultat som finns tillgÃĪngliga pÃĨ projektsajten och den medfÃķljande YouTube-videopresentationen:

Kvalitativ jÃĪmfÃķrelse pÃĨ VOR-Eval Ãķver occlusion, skugga, ljus, reflektion och deformationfall. Inpainting-metoder har svÃĨrt att ta bort effekter utanfÃķr masken, medan borttagningsmodeller ofta lÃĪmnar synliga artefakter. EffectErase tar bort bÃĨde mÃĨlobjekt och deras associerade effekter mer renligt. VÃĪnligen hÃĪnvisa till kÃĪllartikeln fÃķr bÃĪttre upplÃķsning, och till projektsajten fÃķr videoexempel.

Kvalitativ jÃĪmfÃķrelse pÃĨ VOR-Eval Ãķver occlusion, skugga, ljus, reflektion och deformationfall. Inpainting-metoder har svÃĨrt att ta bort effekter utanfÃķr masken, medan borttagningsmodeller ofta lÃĪmnar synliga artefakter. EffectErase tar bort bÃĨde mÃĨlobjekt och deras associerade effekter mer renligt. VÃĪnligen hÃĪnvisa till kÃĪllartikeln fÃķr bÃĪttre upplÃķsning, och till projektsajten fÃķr videoexempel.

Vi hÃĪnvisar ocksÃĨ till lÃĪsaren till diverse relaterade exempel pÃĨ projektsajten, som visas nedan, samt den officiella YouTube-videon som ÃĪr inbÃĪddad i slutet av den hÃĪr artikeln:

Klicka fÃķr att spela. En exempeljÃĪmfÃķrelse frÃĨn EffectErase-projektsajten. VÃĪnligen hÃĪnvisa till sajten fÃķr bÃĪttre upplÃķsning (med de ovannÃĪmnda varningarna) och fÃķr ytterligare exempel.

FÃķrfattarna kommenterar:

‘Videoinpainting-metoder producerar ofta artefakter i maskerade omrÃĨden och misslyckas med att helt ta bort sidoeffekterna som orsakas av de borttagna objekten. Tidigare objektborttagningsmetoder, sÃĨsom [ROSE] och [MinMax-Remover], fungerar bra fÃķr att ta bort mÃĨlobjekt men har fortfarande svÃĨrt med sidoeffekter, sÃĪrskilt i occlusion, skugga, ljus, reflektion och deformationsscenario.

‘I kontrast tar EffectErase effektivt bort bÃĨde mÃĨlobjekt och deras associerade effekter, vilket resulterar i rena, sammanhÃĪngande och hÃķgkvalitativa resultat.’

I slutet observerar forskarna att deras metod ocksÃĨ kan anpassas fÃķr infÃķrandet istÃĪllet fÃķr borttagning, utan behov av ytterligare trÃĪning:

VideoobjektinfÃķranderesultat. EffectErase infÃķr objekt medan den bevarar bakgrunds-innehÃĨll och genererar konsekventa objektsinducerade effekter sÃĨsom skuggor och reflektioner Ãķver ramar.

VideoobjektinfÃķranderesultat. EffectErase infÃķr objekt medan den bevarar bakgrunds-innehÃĨll och genererar konsekventa objektsinducerade effekter sÃĨsom skuggor och reflektioner Ãķver ramar.

Videoreultat fÃķr infÃķrandet kan ses i den (tidsbestÃĪmda) YouTube-videosexemplen (ÃĪven inbÃĪddade utan tidsstÃĪmplar i slutet av artikeln).

Slutsats

En titt pÃĨ liknande projekt i litteraturen visar att mÃĨnga fortfarande hoppas att allmÃĪnna VFX-modeller sÃĨ smÃĨningom kommer att kunna infÃķra denna typ av funktionalitet i en allmÃĪn ‘verktygslÃĨda’-modell som ÃĪr utformad fÃķr en rad effekter, snarare ÃĪn bara denna specifika uppgift.

Men, enligt principen “en man som ÃĪr bra pÃĨ allt ÃĪr bra pÃĨ ingenting”, verkar det rimligt att anta att dedikerade system som EffectErase kommer att fortsÃĪtta att ha en fÃķrdel gentemot mer allmÃĪnna tillvÃĪgagÃĨngssÃĪtt; med fÃķrbehÃĨllet att gapet eventuellt kan kontrahera tillrÃĪckligt fÃķr att gÃķra skillnaden inte vÃĪrd den extra anstrÃĪngningen att trÃĪna en diskret modell.

 

* Man skulle hoppas, med Ãķkande bekymmer kring IP-proveniensproblem, att alla sÃĨdana kÃĪllor skulle citeras; men om de tillgÃĪngliga materialen frÃĨn det nya arbetet listar kÃĪllan till de 3D-modellerna, kunde jag inte hitta denna referens.

† Den referens som tillhandahÃĨlls verkar vara en generisk fÃķrklarande text frÃĨn 2013, med den specifika VAE inte detaljerad.

†† Tagen frÃĨn artikeln, detta ÃĪr en semantiskt oklar beskrivning, eftersom finjustering och LoRA ÃĪr olika processer med mycket olika krav.

Publicerad fÃķrsta gÃĨngen lÃķrdag, 21 mars 2026 

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]