Andersonův úhel
Cesta k lepší editaci videa s využitím AI

Výzkum syntézy videa a obrazu pravidelně produkuje architektury pro videoeditování a v posledních devíti měsících se tyto výstupy staly ještě častějšími. Říká se však, že většina z nich představuje pouze malé pokroky ve stavu techniky, protože základní výzvy jsou značné.
Nová spolupráce mezi Čínou a Japonskem však přinesla několik příkladů, které si zaslouží bližší prozkoumání přístupu, i když to nemusí být nutně průlomová práce.
V následujícím videu (z webu projektu, který může zatížit váš prohlížeč) vidíme, že zatímco možnosti deepfaking systému jsou v současné konfiguraci neexistující, systém odvádí velmi dobrou práci při změně identity mladé ženy na obrázku na základě video masky (vlevo dole):
Klikněte pro přehrávání. Založeno na semantické segmentační masce zobrazené v dolní části, původní (horní levá) žena je transformována do zřetelně odlišné identity, i když tento proces nedosahuje výměny identity, jak je uvedeno v promptu. Zdroj: https://yxbian23.github.io/project/video-painter/ (Upozornění: v době psaní tohoto článku byl web projektu náchylný ke krachu mého prohlížeče). Pokud máte přístup k původním videím, doporučujeme je prohlédnout pro lepší rozlišení a detaily, nebo se podívat na ukázky v přehledovém videu na adrese https://www.youtube.com/watch?v=HYzNfsD3A0s
Maska-založené editování tohoto typu je dobře etablováno v statických latentních difuzních modelech, které využívají nástroje jako ControlNet. Avšak zachování konzistence pozadí ve videu je mnohem obtížnější, i když maskované oblasti poskytují modelu kreativní flexibilitu, jak je vidět níže:
Klikněte pro přehrávání. Změna druhu, pomocí nové metody VideoPainter. Pokud máte přístup k původním videím, doporučujeme je prohlédnout pro lepší rozlišení a detaily, nebo se podívat na ukázky v přehledovém videu na adrese https://www.youtube.com/watch?v=HYzNfsD3A0s
Autorům nové práce se podařilo vyvinout metodu, která se liší od architektury BrushNet (kterou jsme popsali minulý rok) a ControlNet, které obě využívají dual-branch architekturu schopnou izolovat generování pozadí a popředí.
Avšak přímé použití této metody na produktivní Diffusion Transformers (DiT) přístup navržený modelem Sora společnosti OpenAI, přináší zvláštní výzvy, jak autoři uvádějí:
‘Přímé použití architektury BrushNet a ControlNet na video DiT přináší několik výzev. Zaprvé by vzhledem k robustnímu generativnímu základu a velké velikosti video DiT bylo zbytečné a výpočetně neúnosné replikovat celou nebo poloviční páteř video DiT jako kontextový kodér.
‘Zadruhé, na rozdíl od čistě konvoluční řídicí větve BrushNetu obsahují tokeny DiT v maskovaných oblastech kvůli globální pozornosti inherentně informace o pozadí, což v páteřích DiT komplikuje rozlišení maskovaných a nemaskovaných oblastí.
‘A konečně, ControlNet postrádá vkládání funkcí napříč všemi vrstvami, což omezuje přesné řízení pozadí při inpaintingu.’
Takže autoři vyvinuli plug-and-play přístup v podobě dual-branch frameworku nazvaného VideoPainter.
VideoPainter nabízí dual-branch video inpainting framework, který vylepšuje předem trénované DiTs pomocí lehkého kontextového kódéru. Tento kódér zahrnuje pouze 6% parametrů základen, které autoři prohlašují, že činí přístup efektivnějším než konvenční metody.
Model navrhuje tři klíčové inovace: streamlinovaný dvouvrstvý kontextový kódér pro efektivní vedení pozadí; maska-selektivní integrační systém, který odděluje maskované a nemaskované tokeny; a technika re-samplingu identifikátoru oblasti inpainting, která udržuje konzistenci identity napříč dlouhými videosekvencemi.
Zmrazením předem trénovaného DiT i kontextového kodéru a zavedením ID adaptéru VideoPainter zajišťuje, aby tokeny inpaintingové oblasti z předchozích klipů přetrvávaly v celém videu, čímž omezuje blikání a nekonzistence.
Framework je navržen také pro plug-and-play kompatibilitu, takže jej lze bez problémů začlenit do stávajících pracovních postupů generování a úpravy videa.
Pro podporu této práce, která používá CogVideo-5B-I2V jako generativní engine, autoři vytvořili podle svých slov dosud největší dataset pro video inpainting. Kolekce VPData obsahuje přes 390 000 klipů o celkové délce více než 886 hodin. Vyvinuli také související benchmark VPBench.
Klikněte pro přehrávání. Z ukázkového webu projektu vidíme segmentační schopnosti napájené sbírkou VPData a testovacím frameworkem VPBench. Pokud máte přístup k původním videím, doporučujeme je prohlédnout pro lepší rozlišení a detaily, nebo se podívat na ukázky v přehledovém videu na adrese https://www.youtube.com/watch?v=HYzNfsD3A0s
Nová práce je nazvaná VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control a pochází od sedmi autorů z Tencent ARC Lab, The Chinese University of Hong Kong, The University of Tokyo a University of Macau.
Kromě zmíněného projektu autoři také vydali přístupnější YouTube přehled a stránku na Hugging Face.
Metoda
Proces shromažďování dat pro VPData se skládá z kolekce, anotace, dělení, výběru a popisu:

Schéma procesu sestavení datové sady. Zdroj: https://arxiv.org/pdf/2503.05639
Zdrojové sbírky použité pro tuto kompilaci pocházely z Videvo a Pexels, s počáteční sbírkou kolem 450 000 videí.
Fáze předzpracování využívá framework Recognize Anything k otevřenému značkování videí a identifikaci hlavních objektů, Grounding Dino k určení jejich ohraničujících rámečků a Segment Anything Model 2 (SAM 2) k převodu hrubých výběrů na kvalitní segmentační masky.
Pro řízení přechodů mezi scénami a zachování konzistence inpaintingu VideoPainter používá PySceneDetect, který rozděluje klipy v přirozených střizích. Klipy byly rozděleny na desetisekundové úseky a úseky kratší než šest sekund byly vyřazeny.
Výběr dat používal tři filtry: estetickou kvalitu hodnocenou pomocí Laion-Aesthetic Score Predictor; sílu pohybu měřenou optickým tokem pomocí RAFT; a bezpečnost obsahu ověřovanou nástrojem Stable Diffusion Safety Checker.
Významným omezením existujících datasetů pro segmentaci videa je nedostatek podrobných textových anotací, které jsou pro vedení generativních modelů zásadní:

Výzkumníci upozorňují na nedostatek popisků videí ve srovnatelných kolekcích.
Proces přípravy dat proto zahrnuje přední modely vidění a jazyka, včetně CogVLM2 a Chat GPT-4o, které generují popisky z klíčových snímků a podrobné popisy maskovaných oblastí.
VideoPainter rozšiřuje předem trénované DiT vlastním lehkým kontextovým kodérem, který odděluje získávání kontextu pozadí od generování popředí, jak ukazuje pravá horní část schématu:

Koncepční schéma VideoPainteru. Kontextový kodér odděluje zpracování pozadí a ID Resample Adapter udržuje konzistenci identity mezi klipy.
Kodér pracuje se zjednodušeným vstupem: kombinací zašuměné latentní reprezentace, latentní reprezentace maskovaného videa získané pomocí variačního autoenkodéru (VAE) a zmenšených masek.
Zašuměná latentní reprezentace poskytuje kontext generování a latentní reprezentace maskovaného videa odpovídá existující distribuci DiT, což zlepšuje kompatibilitu.
Místo duplikování velkých částí modelu integruje VideoPainter pouze první dvě vrstvy DiT. Získané funkce se strukturovaně vracejí do zmrazeného DiT: rané funkce informují první polovinu modelu a pozdější funkce zpřesňují druhou polovinu.
Selektivní mechanismus tokenů navíc vrací pouze funkce důležité pro pozadí, čímž zabraňuje záměně maskovaných a nemaskovaných oblastí a zvyšuje účinnost inpaintingu popředí.
Metoda podporuje také různé způsoby stylizace, včetně oblíbené Low Rank Adaptation (LoRA).
Data a testování
VideoPainter byl trénován s modelem CogVideo-5B-I2V a jeho text-to-video protějškem. Dataset VPData byl použit v rozlišení 480 × 720 px s rychlostí učení 1 × 10-5.
ID Resample Adapter byl trénován 2 000 kroků a kontextový kodér 80 000 kroků; oba používaly optimalizátor AdamW. Trénování proběhlo ve dvou fázích na 64 GPU NVIDIA V100.
Pro benchmark byly náhodné masky převzaty z datové sady Davis a segmentační masky z VPBench autorů.
VPBench dataset obsahuje objekty, zvířata, lidi, krajiny a různé úkoly a pokrývá čtyři akce: přidat, odstranit, změnit a vyměnit. Sbírka obsahuje 45 6-vteřinových videí a devět videí trvajících v průměru 30 sekund.
Osmero metrik bylo použito pro proces. Pro Masked Region Preservation, autoři použili Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); Structural Similarity Index (SSIM); a Mean Absolute Error (MAE).
Pro text-alignment, výzkumníci použili CLIP Similarity pro vyhodnocení sémantické vzdálenosti mezi popiskem klipu a jeho skutečným vnímaným obsahem a také pro vyhodnocení přesnosti maskovaných oblastí.
Pro vyhodnocení obecné kvality výstupních videí byl použit Fréchet Video Distance (FVD).
Pro kvantitativní srovnání kola pro video inpainting, autoři nastavili svůj systém proti předchozím přístupům ProPainter, COCOCO a Cog-Inp (CogVideoX). Test se skládal z inpainting prvního snímku klipu pomocí modelů image inpainting a poté použití image-to-video (I2V) základy pro propagaci výsledků do latentního blend operace, v souladu s metodou navrženou v článku z roku 2023 z Izraele.
Jelikož projektový web není zcela funkční v době psaní tohoto článku a jelikož projektový YouTube video nemusí obsahovat všechny ukázky ze stránky projektu, je obtížné najít video ukázky, které jsou velmi specifické pro výsledky popsány v článku. Proto budeme ukazovat statické výsledky uvedené v článku a uzavřeme článek několika dalšími video ukázkami, které jsme podařilo extrahovat ze stránky projektu.

Kvantitativní srovnání VideoPainter vs. ProPainter, COCOCO a Cog-Inp na VPBench (segmentační masky) a Davis (náhodné masky). Metriky pokrývají maskované oblasti, textové zarovnání a kvalitu videa. Červená = nejlepší, modrá = druhá nejlepší.
Autoři komentují:
‘Ve segmentační VPBench, ProPainter a COCOCO vykazují nejhorší výkon napříč většinou metrik, primárně kvůli neschopnosti inpaintovat plně maskované objekty a obtížím s vyvážením pozadí a generací popředí.
‘V náhodném maskovém benchmarku Davis, ProPainter ukazuje zlepšení díky využití částečné informace o pozadí. Nicméně VideoPainter dosahuje optimálního výkonu napříč segmentací (standardní a dlouhé délky) a náhodnými maskami díky své dual-branch architektuře, která efektivně odděluje zachování pozadí a generaci popředí.’
Autoři poté představují statické ukázky kvalitativních testů, z nichž jsme vybrali výběr níže. Ve všech případech odkazujeme čtenáře na projektový web a YouTube video pro lepší rozlišení.

Srovnání s předchozími metodami inpainting.
Klikněte pro přehrávání. Ukázky spojené naší redakcí z ‘výsledků’ videí na projektu.
Autoři komentují:
‘VideoPainter konzistentně ukazuje výjimečné výsledky ve videokoherenci, kvalitě a zarovnání s textovým popiskem. Značně, ProPainter selhává při generování plně maskovaných objektů, protože se spoléhá pouze na propagaci pixelů pozadí místo generování.
‘Zatímco COCOCO ukazuje základní funkčnost, selhává při udržování konzistentní identity v inpaintovaných oblastech (nesourodé vzhledy plavidel a náhlé změny terénu) kvůli své single-backbone architektuře, která se snaží vyvážit zachování pozadí a generaci popředí.
‘Cog-Inp dosahuje základních výsledků inpainting; nicméně, jeho blendovací operace není schopna detekovat hranice masek, což vede k významným artefaktům.
‘Navíc, VideoPainter může generovat koherentní videa přesahující jednu minutu, zatímco udržuje konzistenci identity prostřednictvím našeho ID re-sampling.’
Výzkumníci také otestovali schopnost VideoPainteru vylepšit popisky a získat lepší výsledky touto metodou, porovnáním se systémem UniEdit, DiTCtrl a ReVideo.

Výsledky videoeditace proti třem předchozím přístupům.
Autoři komentují:
‘Pro obě standardní a dlouhé videa ve VPBench, VideoPainter dosahuje lepšího výkonu, dokonce překonává koncový ReVideo. Tento úspěch lze připsat jeho dual-branch architektuře, která zajišťuje vynikající zachování pozadí a generaci popředí, zatímco udržuje vysokou věrnost v needitovaných oblastech a zajišťuje, že editované oblasti jsou v souladu s editačními instrukcemi, doplněné o re-sampling identifikátoru oblasti, který udržuje konzistenci identity v dlouhém videu.’
Ačkoli článek uvádí pro tuto metriku statické příklady, nejsou příliš názorné; podrobnější výsledky lze nalézt v dalších videích projektu.
Konečně byla provedena studie lidského hodnocení, ve které třicet uživatelů vyhodnotilo 50 náhodně vybraných generací z VPBench a editačních podmnožin. Ukázky zdůrazňovaly zachování pozadí, zarovnání s promptem a obecnou kvalitu videa.

Výsledky uživatelské studie pro VideoPainter.
Autoři prohlašují:
‘VideoPainter významně překonává stávající metody, dosahuje vyšších preferenčních sazeb napříč všemi hodnotícími kritérii v obou úkolech.’
Autoři také uznávají, že kvalita generací VideoPainteru závisí na základním modelu, který může mít potíže s komplexním pohybem a fyzikou; a také pozorují, že funguje špatně s nízkokvalitními maskami nebo nesouladnými popisky.
Závěr
VideoPainter se zdá být cenným příspěvkem k literatuře. Typickým rysem nedávných řešení je však, že má značné výpočetní nároky. Navíc, mnoho ukázek vybraných pro prezentaci na projektu spadá daleko od nejlepších ukázek; bylo by proto zajímavé vidět tento framework porovnán s budoucími příspěvky a širším spektrem předchozích přístupů.
* Hodnota ‘videoeditování’ v tomto smyslu neznamená ‘sestavení různých klipů do sekvence’, což je tradiční význam tohoto termínu; ale spíše přímou změnu nebo nějakou modifikaci vnitřního obsahu existujících video klipů pomocí technik strojového učení
Poprvé publikováno v pondělí 10. března 2025. Aktualizováno v sobotu 25. července 2026, aby se nahradilo video.












