Andersons vinkel

Radera objekt och personer från video med AI

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated stylized image depicting a magician robot showing an empty cabinet with a lady's tiara at the bottom. GPT-1.5

Nej, barnet stannar inte kvar i bilden, om AI har något att säga till om.

 

Att ta bort personer och objekt från bilder och video är en populär undergren av forskning inom VFX-orienterad AI-litteratur, med ett växande antal dedikerade dataset och ramverk som tar itu med utmaningen. Den senaste av dessa, från Institute of Big Data vid Kinas Fudan University, är EffectErase, ett ‘effektmedvetet’ videosystem för objektborttagning som, enligt författarna, förbättrar betydligt på den nuvarande tillståndet i testerna:

Sammansatt från material på projektwebbplatsen, exempel på EffectErase-metoden ( Observera att medan vi tillhandahåller en länk, så innehåller källwebbplatsen många högupplösta och icke-optimerade autoplay-videor som kan påverka webbläsarens stabilitet. Den medföljande YouTube-videon är en lättare och fullständigare referens och är inbäddad i slutet av den här artikeln).  Källa

Det nya arbetet innebar skapandet/kureringen av ett semi-nytt dataset som består av nästan 350 originalverkliga och syntetiska scener (med hjälp av offentliga repositorier*), antingen inspelade med dedikerad utrustning eller hämtade och återanvända i en arbetsflöde byggd kring det öppna källkodsramverket Blender 3D.

Det hybrida Video Object Removal (VOR)-datasetet utgör grunden för EffectErase-applikationen, som är byggd över Wan2.1-videosystemet. Systemet definierar också två nya relaterade benchmark: VOR Eval och VOR Wild – för samples med och utan ground truth.

(Även om artikeln har en tillhörande projektsajt, så är den ganska överbelastad med flera högupplösta videor och svår att ladda; så vänligen hänvisa till de utdrag jag har kuraterat i den inbäddade videon ovan, om du hittar projektsajten svår att använda)

En jämförelse av kvantiteter över jämförbara tidigare dataset, med avseende på det nya erbjudandet. Källa - https://arxiv.org/pdf/2603.19224

En jämförelse av kvantiteter över jämförbara tidigare dataset, med avseende på det nya erbjudandet. Källa

Forskarna hävdar att deras tillvägagångssätt ger state-of-the-art-prestanda, både i kvantitativa mått och i kvalitativa resultat som bedöms genom en mänsklig studie.

De noterar att tidigare arbeten inte alltid har lyckats med att ta bort objektets sekundära effekter, såsom skuggor och reflektioner, och att deras dataset har skapats för att åtgärda denna brist:

Exempel på tidigare tillvägagångssätts brist på att se bortom det objekt som ska tas bort, till sekundära indikationer, såsom reflektioner och skuggor.

Exempel på tidigare tillvägagångssätts brist på att se bortom det objekt som ska tas bort, till sekundära indikationer, såsom reflektioner och skuggor.

Den nya artikeln heter EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing, och kommer från fyra forskare vid Fudan Universitys College of Computer Science and Artificial Intelligence.

Metod

Det hybrida VOR-datasetet var designat för att omfatta en tillräckligt bred uppsättning scenarier för att täcka alla implikationer av att ta bort en person eller ett objekt från en video:

Parade ramar från VOR-datasetet visar hur objektborttagning måste gå utöver det synliga föremålet till dess inducerade effekter, med exempel som visar occlusion, skugga, ljusförändringar, reflektioner och fysisk deformation, var och en presenterad som indata (objekt närvarande) bredvid den motsvarande rena bakgrunden efter borttagning.

Parade ramar från VOR-datasetet visar hur objektborttagning måste gå utöver det synliga föremålet till dess inducerade effekter, med exempel som visar occlusion, skugga, ljusförändringar, reflektioner och fysisk deformation, var och en presenterad som indata (objekt närvarande) bredvid den motsvarande rena bakgrunden efter borttagning. För ytterligare exempel, se den medföljande YouTube-videon inbäddad i slutet av den här artikeln.

De fem representativa typerna av ‘störning’ som ska hanteras definieras av författarna som occlusion, inklusive olika typer av glas- och rökocclusion; skuggor; ljus (t.ex. när ett objekt som ska tas bort skapar eller ändrar ljusets bana); reflektion; och deformation (t.ex. avtrycket av en användare på en kudde, som inte bör överleva personens borttagning).

Dataset-konstruktionspipeline för VOR, som kombinerar Blender-genererade syntetiska scener med verkliga inspelningar, där syntetisk data byggs från kuraterade 3D-miljöer, objekt och kamerabanor, och verklig film inspelad över olika scener, förstärkt med Ken Burns-rörelse. SAM2-segmentering och manuell finjustering producerar då anpassade förgrunds- och bakgrunds-videotriplett med motsvarande masker.

Dataset-konstruktionspipeline för VOR, som kombinerar Blender-genererade syntetiska scener med verkliga inspelningar, där syntetisk data byggs från kuraterade 3D-miljöer, objekt och kamerabanor, och verklig film inspelad över olika scener, förstärkt med Ken Burns-rörelse. SAM2-segmentering och manuell finjustering producerar då anpassade förgrunds- och bakgrunds-videotriplett med motsvarande masker.

För de verkliga originaldata använde forskarna fasta kameror för att spela in ‘med’ och ‘utan’ scener som täckte en bred uppsättning miljöer, tid på dagen och väderförhållanden.

För de syntetiska data renderades flera vyer, och multi-objektscenarier skapades, som medvetet komplexa och utmanande typer av kamerarörelser, som kan förekomma i verklig film; och forskarna observerar att detta tillvägagångssätt är mer sofistikerat och krävande än det som används för det annars liknande Remove Objects with Side Effects in Videos (ROSE) dataset.

För att öka rörelsediversitet applicerades Ken Burns-effekten på kamera-inspelade par, läggande till kontrollerade panoreringar, zoomningar och lätt handhållen rörelse under fjorton fördefinierade regler, med fem rörelsemönster sampade per par medan man håller grödan inom den ursprungliga ramen.

Skalor och diversitet utvidgades ytterligare genom att kombinera syntetiska objekt med flera kamerainställningar, Masker genererades genom att placera manuella punktprompter på nyckelramar, propagerande segmentering med Segment Anything 2 (SAM2), rensande och finjusterande resultat, och monterande validerade förgrunds-, bakgrunds- och mask-tripletter för träning.

Den slutliga samlingen består av 145 timmar video över 60 000 parade videor, verkliga och syntetiska, som täcker 366 objektklasser i 443 scener.

EffectErase-nätverket i sig tar emot material via en Variational Auto-Encoder (VAE†), med latenta brusreducering hanterad av Wan2.1. Över denna ryggrad opererar EffectErase Removal-Insertion Joint Learning, som tränar båda uppgifterna tillsammans på samma områden; Task-Aware Region Guidance (TARG), som använder objekttoken och uppgiftstoken med cross-attention för att modellera rumsliga och tidsmässiga länkar mellan objekt och deras effekter och tillåta uppgiftsväxling; och Effect Consistency Loss, som justerar effektområden justerade över borttagnings- och införandetillvägagångssätt:

Schema för EffectErase-ramverket. Under träning, parade videor kodas till ett delat latentspace, sammanslagna med brus och bearbetade av en diffusionstransformator styrd av uppgiftsmedveten cross-attention, medan en effektkonsistensförlust justerar borttagnings- och införanderegioner så att båda uppgifterna fokuserar på samma område.

Schema för EffectErase-ramverket. Under träning, parade videor kodas till ett delat latentspace, sammanslagna med brus och bearbetade av en diffusionstransformator styrd av uppgiftsmedveten cross-attention, medan en effektkonsistensförlust justerar borttagnings- och införanderegioner så att båda uppgifterna fokuserar på samma område.

I sig själva tränas borttagnings- och införandeprocesserna tillsammans, med hjälp av ett delat diffusion-ryggrad, så att modellen lär sig att fokusera på samma berörda områden och strukturmönster.

Videor med objekt, bakgrunds-videor och masker, kodas först till ett latentspace; brus läggs sedan till för diffusionsträning, och modellen lär sig att återställa rena representationer under uppgiftsspecifik vägledning. En lätt adapter fuserar sedan de bullriga funktionerna med borttagnings- eller införandevillkor, vilket tillåter båda uppgifterna att dela övervakning, samtidigt som de förblir kontrollerbara.

Task-Aware Region Guidance skapar en uppgiftsspecifik signal genom att kombinera språktoken med visuella funktioner extraherade från förgrundsobjektet, med hjälp av CLIP, ersätter en generisk objekttoken med en inbäddning som härrör från den faktiska bildinnehållet. Denna fusionerade representation injiceras i ryggraden genom cross-attention, vilket tillåter modellen att spåra hur ett objekt och dess visuella effekter utvecklas över rum och tid, samtidigt som den möjliggör flexibel växling mellan borttagning och införande.

Effect Consistency Loss tvingar borttagnings- och införandeprocesser att fokusera på samma förändrade områden, eftersom båda uppgifterna hanterar samma objekt och dess visuella effekter. Uppmärksamhetskartor från varje gren kombineras till mjuka regionkartor, och justeras med en skillnadsruta beräknad från objekts- och bakgrunds-videor, så att subtila förändringar som ljus och skuggor bevaras. Denna extra förlust hjälper införandet att vägleda borttagning och håller båda uppgifterna konsekventa.

Data och tester

Forskarna testade sitt tillvägagångssätt mot olika inpainting-, videoinpainting- och objektborttagningsmetoder: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; och MiniMax-Remover.

Wan2.1 finjusterades med LoRA†† med hjälp av VOR-datasetet i en upplösning på 832x480px. 81 på varandra följande ramar (den effektiva gränsen för WAN, bortom vilken fel tenderar att uppstå) sampades slumpmässigt för träning, som ägde rum under 129 000 iterationer med en batchstorlek på 8, på åtta H100-GPU:er, var och en med 80 GB VRAM. Lärandehastigheten sattes till 1×102, och LoRA-rank till 256.

ROSE-Benchmark-samlingen var den enda externa dataset som testades; de andra två var VOR-Eval, VOR-datasetets test split; och VOR-Wild, en testuppsättning som består av 195 verkliga videor skrapade från internet, som innehåller ‘dynamiska objekt’.

Mätvärden som användes var Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); och Fréchet Video Distance (FVD). En användarstudie av 195 genererade videor från VOR-Wild beaktades också, med genomsnittliga betyg från 20 volontärer som togs med i beräkningen.

Dessutom utvecklade författarna QScore, en mätvärde som utnyttjar Qwen-VL-multimodellmodellen, för att utvärdera kvaliteten på objektborttagna video-utdata, i termer av kvarvarande artefakter eller missade miljöborttagningar, såsom skuggor och ljuseffekter:

Kvantitativ jämförelse på ROSE och VOR-benchmark, med bästa och näst bästa resultat markerade i fetstil och understruken, respektive.

Kvantitativ jämförelse på ROSE och VOR-benchmark, med bästa och näst bästa resultat markerade i fetstil och understruken, respektive.

Med avseende på dessa resultat noterar författarna:

‘[Nuvarande] bildinpainting-metoder fungerar på enskilda ramar med hjälp av 2D-modeller utan tidsmässig modellering, och kan därför inte upprätthålla tidsmässig konsekvens i videor.

Senaste videoinpainting-metoder modellerar inte explicita objektsidoeffekter, vilket resulterar i onaturliga borttagningsresultat. Existerande video-objektborttagningsmetoder saknar rumslig och tidsmässig korrelationsmodellering mellan objektet och dess sidoeffekter, och producerar därför ofta artefakter och rester av de borttagna objekten.

‘Sammanfattningsvis uppnår EffectErase state-of-the-art-prestanda över alla dataset och utvärderingsmått. Det uppnår de bästa resultaten på video-kvalitetsmåttet FVD, vilket visar på överlägsen tidsmässig jämnhet och konsekvens i de genererade videorna.

‘Vår metod uppnår också den högsta QScore och användarfeedback-betyg, vilket ytterligare visar dess effektivitet i att producera visuellt övertygande borttagningsresultat.’

För den kvalitativa utvärderingen erbjuds statiska resultat i artikeln (visas) direkt nedan, samt rörliga resultat som finns tillgängliga på projektsajten och den medföljande YouTube-videopresentationen:

Kvalitativ jämförelse på VOR-Eval över occlusion, skugga, ljus, reflektion och deformationfall. Inpainting-metoder har svårt att ta bort effekter utanför masken, medan borttagningsmodeller ofta lämnar synliga artefakter. EffectErase tar bort både målobjekt och deras associerade effekter mer renligt. Vänligen hänvisa till källartikeln för bättre upplösning, och till projektsajten för videoexempel.

Kvalitativ jämförelse på VOR-Eval över occlusion, skugga, ljus, reflektion och deformationfall. Inpainting-metoder har svårt att ta bort effekter utanför masken, medan borttagningsmodeller ofta lämnar synliga artefakter. EffectErase tar bort både målobjekt och deras associerade effekter mer renligt. Vänligen hänvisa till källartikeln för bättre upplösning, och till projektsajten för videoexempel.

Vi hänvisar också till läsaren till diverse relaterade exempel på projektsajten, som visas nedan, samt den officiella YouTube-videon som är inbäddad i slutet av den här artikeln:

Klicka för att spela. En exempeljämförelse från EffectErase-projektsajten. Vänligen hänvisa till sajten för bättre upplösning (med de ovannämnda varningarna) och för ytterligare exempel.

Författarna kommenterar:

‘Videoinpainting-metoder producerar ofta artefakter i maskerade områden och misslyckas med att helt ta bort sidoeffekterna som orsakas av de borttagna objekten. Tidigare objektborttagningsmetoder, såsom [ROSE] och [MinMax-Remover], fungerar bra för att ta bort målobjekt men har fortfarande svårt med sidoeffekter, särskilt i occlusion, skugga, ljus, reflektion och deformationsscenario.

‘I kontrast tar EffectErase effektivt bort både målobjekt och deras associerade effekter, vilket resulterar i rena, sammanhängande och högkvalitativa resultat.’

I slutet observerar forskarna att deras metod också kan anpassas för införandet istället för borttagning, utan behov av ytterligare träning:

Videoobjektinföranderesultat. EffectErase inför objekt medan den bevarar bakgrunds-innehåll och genererar konsekventa objektsinducerade effekter såsom skuggor och reflektioner över ramar.

Videoobjektinföranderesultat. EffectErase inför objekt medan den bevarar bakgrunds-innehåll och genererar konsekventa objektsinducerade effekter såsom skuggor och reflektioner över ramar.

Videoreultat för införandet kan ses i den (tidsbestämda) YouTube-videosexemplen (även inbäddade utan tidsstämplar i slutet av artikeln).

Slutsats

En titt på liknande projekt i litteraturen visar att många fortfarande hoppas att allmänna VFX-modeller så småningom kommer att kunna införa denna typ av funktionalitet i en allmän ‘verktygslåda’-modell som är utformad för en rad effekter, snarare än bara denna specifika uppgift.

Men, enligt principen “en man som är bra på allt är bra på ingenting”, verkar det rimligt att anta att dedikerade system som EffectErase kommer att fortsätta att ha en fördel gentemot mer allmänna tillvägagångssätt; med förbehållet att gapet eventuellt kan kontrahera tillräckligt för att göra skillnaden inte värd den extra ansträngningen att träna en diskret modell.

 

* Man skulle hoppas, med ökande bekymmer kring IP-proveniensproblem, att alla sådana källor skulle citeras; men om de tillgängliga materialen från det nya arbetet listar källan till de 3D-modellerna, kunde jag inte hitta denna referens.

† Den referens som tillhandahålls verkar vara en generisk förklarande text från 2013, med den specifika VAE inte detaljerad.

†† Tagen från artikeln, detta är en semantiskt oklar beskrivning, eftersom finjustering och LoRA är olika processer med mycket olika krav.

Publicerad första gången lördag, 21 mars 2026 

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai