Andersonův úhel
Odstranění objektů a lidí z videa pomocí AI

Ne, dítě v obrázku nezůstane, pokud má AI co do činění.
Odstranění lidí a objektů z obrázků a videí je populární směr výzkumu v literatuře VFX-centrické AI, s rostoucím počtem specializovaných datových sad a rámců, které řeší tuto výzvu. Nejnovější z nich, z Institutu velkých dat na Fudan University v Číně, je EffectErase, systém pro odstranění objektů z videa, který, podle autorů, významně zlepšuje stav současného umění v testech:
Příprava z materiálu na projektu, ukázka metody EffectErase (pozor, zatímco poskytujeme odkaz, zdroj stránky obsahuje tolik hi-res a neoptimalizovaných autoplay videí, že to může ovlivnit stabilitu vašeho webového prohlížeče. Připojený YouTube video je snazší a úplnější reference a je vložen na konci tohoto článku). Zdroj
Nová práce zahrnovala vytvoření/kuraci semi-novél datové sady skládající se z téměř 350 původních reálných a také syntetizovaných scén (využívajících veřejné repozitáře*), buď zachycených pomocí specializovaného vybavení nebo získaných a přepracovaných do pracovního postupu postaveného kolem open source Blender 3D framework.
Hybridní Video Object Removal (VOR) datová sada tvoří základ pro aplikaci EffectErase, která je postavena nad systémem Wan2.1 pro generování videa. Systém také definuje dvě nové související benchmarky: VOR Eval a VOR Wild – pro vzorky s a bez ground truth.
(Ačkoli má článek doprovodnou projektovou stránku, je tato stránka poměrně přetížena množstvím hi-res videí a je těžké ji načíst; proto se prosím odkážete na ukázky, které jsem připravil v připojeném videu výše, pokud máte problémy s použitím projektové stránky)

Porovnání množství napříč srovnatelnými předchozími datovými sadami, ve vztahu k novému nabídkám. Zdroj
Vědci prohlašují, že jejich přístup vede k výsledkům na úrovni současného umění, jak z kvantitativních metrik, tak z kvalitativních výsledků, které byly posuzovány prostřednictvím lidské studie.
Poznamenávají, že předchozí práce často nebyly schopny odstranit vedlejší účinky objektu, jako jsou stíny a odrazy, a že jejich datová sada byla pečlivě vytvořena, aby tento nedostatek napravila:

Ukázky předchozích přístupů, které se nezaměřily na vedlejší účinky, jako jsou odrazy a stíny.
Nový článek EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing pochází od čtyř výzkumníků z Fudan University’s College of Computer Science and Artificial Intelligence.
Metoda
Hybridní VOR datová sada byla navržena tak, aby zahrnovala dostatečně širokou škálu scénářů, aby pokryla všechny důsledky pokusu o odstranění osoby nebo objektu z videa:

Spuštěné snímky z VOR datové sady ukazují, jak odstranění objektu musí přesáhnout viditelný předmět a jeho indukované účinky, s ukázkami, které ukazují zakrytí, stín, posuny osvětlení, odrazy a fyzické deformace, každý prezentován jako vstup (přítomnost objektu) vedle odpovídajícího čistého pozadí po odstranění. Pro další ukázky se prosím odkážete na připojené video na konci tohoto článku.
Pět reprezentativních typů “rušení” je definováno autory jako zakrytí, včetně různých typů skla a kouřového zakrytí; stíny; osvětlení (například, když objekt, který má být odstraněn, vytváří nebo mění cestu světla); odraz; a deformace (například, otisk uživatele na polštáři, který by neměl přežít odstranění osoby).

Datová sada konstrukční pipeline pro VOR, kombinující Blender-generované syntetické scény s reálnými záběry, kde syntetická data jsou postavena z kurátorovaných 3D prostředí, objektů a kamerových trajektorií, a reálné záběry jsou zaznamenány napříč různými scénami, doplněné o Ken Burns motion. SAM2 segmentace a manuální úprava pak produkují zarovnané přední a zadní video trojice s odpovídajícími maskami.
Pro reálná původní data vědci použili pevné kamery k zaznamenání scén “s” a “bez” scén, pokrývajících širokou škálu prostředí, denní doby a povětrnostních podmínek.
Pro syntetizovaná data byly vykresleny multiple pohledy a vytvořeny multiobjektové scény, které zahrnovaly záměrně komplexní a náročné typy kamerového pohybu, jako by se vyskytovaly v reálných záběrech; a vědci pozorují, že tento přístup je sofistikovanější a náročnější než ten, který byl použit pro jinak podobnou Remove Objects with Side Effects in Videos (ROSE) datovou sadu.
Pro zvýšení pohybové rozmanitosti byl aplikován Ken Burns efekt na kamerové páry, přidávající kontrolované panoramatické záběry, zoomy a mírné pohyby ruky pod čtrnácti předdefinovanými pravidly, s pěti pohybovými vzory vzorkovanými na pár, zatímco zůstává uvnitř původního rámu.
Škála a rozmanitost byly dále rozšířeny kombinací syntetických objektů s více kamerovými nastaveními, Masky byly generovány umístěním manuálních bodových podnětů na klíčové snímky, propagací segmentace pomocí Segment Anything 2 (SAM2), čištění a úprava výsledků a sestavení validovaných předních, zadních a maskových trojic pro trénink.
Konečná sbírka čítá 145 hodin videa napříč 60 000 párových videí, reálných a syntetických, pokrývajících 366 tříd objektů v 443 scénách.
Síť EffectErase sama přijímá materiál prostřednictvím Variational Auto-Encoder (VAE)†, s latentním odhlučňováním zpracovaným Wan2.1. Nad touto kostrou EffectErase funguje Removal-Insertion Joint Learning, který trénuje obě úkoly společně na stejných oblastech; Task-Aware Region Guidance (TARG), který používá objektové a úkolové tokeny s cross-attention k modelování prostorově-časových vazeb mezi objekty a jejich účinky a umožnění přepínání úkolů; a Effect Consistency Loss, který zarovnává efektivní oblasti napříč odstraněním a vkládáním úkolů:

Schéma pro EffectErase framework. Během trénování jsou párové videa zakódovány do sdíleného latentního prostoru, sloučeny s hlukem a zpracovány difuzním transformátorem řízeným úkolově-aware cross-attention, zatímco efektivní konzistence ztráty zarovnává odstranění a vkládání oblastí, aby se obě úkoly zaměřily na stejnou oblast.
Samy procesy odstranění a vkládání jsou trénovány společně, pomocí sdíleného difuzního kostry, takže model se učí zaměřit se na stejné postižené oblasti a strukturní podněty.
Videa s objekty, videa s pouze pozadím a masky jsou nejprve zakódovány do latentního prostoru; poté je přidán hluk pro difuzní trénink a model se učí obnovit čisté reprezentace pod úkolově-specifickou kontrolou. Lehký adaptér pak spojuje hlukové funkce s odstraněním nebo vkládáním podmínek, umožňující obě úkoly sdílet dohled, zatímco zůstávají ovladatelné.
Task-Aware Region Guidance vytváří úkolově-specifický signál kombinací jazykových tokenů s vizuálními funkcemi extrahovanými z předního objektu, pomocí CLIP, nahrazující generický objektový token embeddingem odvozeným z skutečného obrazového obsahu. Tento fúzovaný reprezentativní je vložen do kostry prostřednictvím cross-attention, umožňující modelu sledovat, jak objekt a jeho vizuální účinky evolují v prostoru a čase, zatímco umožňuje flexibilní přepínání mezi odstraněním a vkládáním.
Effect Consistency Loss nutí odstranění a vkládání procesů zaměřit se na stejné změněné oblasti, protože obě úkoly se zabývají stejným objektem a jeho vizuálními účinky. Pozornostní mapy z každé větve jsou pak kombinovány do měkkých regionálních map a zarovnány s rozdílovou mapou vypočtenou z objektového a pozadí videa, aby byly zachovány jemné změny, jako je osvětlení a stíny. Tato další ztráta pomáhá vkládání vést odstranění a udržuje obě úkoly konzistentní.
Data a testy
Vědci otestovali svůj přístup proti různým metodám inpaintingu, video inpaintingu a odstranění objektů: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; a MiniMax-Remover.
Wan2.1 byl upraven pomocí LoRA†† pomocí VOR datové sady v rozlišení 832x480px. 81 po sobě jdoucích snímků (efektivní limit pro WAN, za kterým se chyby začínají vyskytovat) bylo náhodně vybráno pro trénink, který proběhl po 129 000 iteracích při velikosti batchu 8, na osmi H100 GPU, každém s 80GB VRAM. Velikost batchu byla nastavena na 8, a rychlost učení na 1×102, a LoRA rank na 256.
ROSE-Benchmark syntetická sbírka byla jediným externím datovým sadou, který byl otestován; ostatní dva byly VOR-Eval, testovací split VOR datové sady; a VOR-Wild, testovací sada skládající se z 195 reálných videí stažených z internetu, obsahujících “dynamické objekty”.
Použité metriky byly Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); a Fréchet Video Distance (FVD). Byla také provedena uživatelská studie 195 generovaných videí z VOR-Wild, s průměrnými hodnoceními z 20 dobrovolníků.
<p Navíc autoři vytvořili QScore, metriku, která využívá Qwen-VL multimodální model, aby vyhodnotila kvalitu výstupu videa s odstraněnými objekty, z hlediska zbytkových artefaktů nebo zmeškaných environmentálních odstranění, jako jsou stíny a osvětlovací účinky:

Kvantitativní srovnání na ROSE a VOR benchmarcích, s nejlepšími a druhými nejlepšími výsledky zvýrazněnými tučně a podtrženě.
Ohledně těchto výsledků autoři poznamenávají:
‘[Současné] metody inpaintingu fungují na jednotlivých snímcích pomocí 2D modelů bez časového modelování, a proto selhávají v udržování časové konzistence ve videích.
Novější metody video inpaintingu nedovedou explicitně modelovat vedlejší účinky objektu, což vede k nepřirozeným výsledkům odstranění. Stávající metody odstranění objektů z videa postrádají prostorově-časové korelační modelování mezi objektem a jeho vedlejšími účinky, a proto často produkují artefakty a zbytkové stopy odstraněných objektů.
‘Celkově EffectErase dosahuje výsledků na úrovni současného umění napříč všemi datovými sadami a hodnoceními. Získává nejlepší skóre na metrice kvality videa FVD, což demonstruje jeho lepší časovou plynulost a konzistenci generovaných videí.
‘Naše metoda také dosahuje nejvyššího QScore a uživatelských hodnocení, což dále demonstruje její účinnost při produkci vizuálně přesvědčivých výsledků odstranění.’
Pro kvalitativní hodnocení jsou nabízeny statické výsledky v článku (zobrazeny přímo níže), stejně jako pohyblivé výsledky dostupné na projektové stránce a v připojeném YouTube videu:

Kvalitativní srovnání na VOR-Eval napříč zakrytím, stínem, osvětlením, odrazem a deformací. Metody inpaintingu se potýkají s odstraněním účinků mimo masku, zatímco metody odstranění objektů často zanechávají viditelné artefakty. EffectErase odstraňuje jak cílové objekty, tak jejich asociované účinky čistěji. Prosím, odkážete se na zdroj článku pro lepší rozlišení a na projektovou stránku pro video ukázky.
Autoři také poznamenávají:
‘Video inpainting metody často produkují artefakty v maskovaných oblastech a selhávají v úplném odstranění vedlejších účinků, způsobených odstraněnými objekty. Předchozí přístupy k odstranění objektů, jako je [ROSE] a [MinMax-Remover], fungují dobře při odstranění cílových objektů, ale stále se potýkají s vedlejšími účinky, zejména v případech zakrytí, stínu, osvětlení, odrazu a deformace.
‘Naproti tomu EffectErase účinně odstraňuje jak cílové objekty, tak jejich asociované účinky, vedoucí k čistým, koherentním a vysoce kvalitním výsledkům.’
V závěru autoři pozorují, že jejich metoda může být také přizpůsobena pro vkládání místo odstranění, bez potřeby dalšího tréninku:

Výsledky vkládání objektů do videa. EffectErase vkládá objekty, zatímco zachovává pozadí a generuje konzistentní objektově-indukované účinky, jako stíny a odrazy, napříč snímky.
Video výsledky pro úkol vkládání jsou k dispozici v (časově specifickém) YouTube videu (také vloženém bez časových značek na konci článku).
Závěr
Podíváme-li se na podobné projekty v literatuře, mnoho z nich stále doufá, že obecné VFX modely budou nakonec schopny zahrnout tuto funkčnost do obecného “nástrojového kitu” modelu navrženého pro širokou škálu efektů, spíše než pro tento specifický úkol.
Však na principu “jack of all trades” se zdá rozumné předpokládat, že specializované systémy, jako je EffectErase, budou pokračovat v udržování výhody nad obecnějšími přístupy; s výhradou, že mezera se může nakonec zmenšit natolik, aby rozdíl nebyl Worth dalšího úsilí při trénování samostatného modelu.
* Jedná se o naději, s rostoucími obavami kolem otázek vlastnictví duševního vlastnictví, že všechny takové zdroje by měly být citovány; ale pokud jsou dostupné materiály z nové práce seznamují zdroj 3D modelů, nebyl jsem schopen najít tuto referenci.
† Referenční zdroj se zdá být obecným vysvětlujícím textem z roku 2013, se specifickým VAE, který není detailizován.
†† Čerpáno z článku, jedná se o semanticky nejasný popis, protože jemné úpravy a LoRA jsou různé procesy s velmi odlišnými nároky.
Poprvé zveřejněno v sobotu, 21. března 2026












