Andersonův úhel

Lepší generativní AI video pomocí prohození rámců během trénování

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Adobe Firefly, various prompts and edits.

Nová studie zveřejněná tento týden na Arxiv se zabývá problémem, se kterým se setkali všichni, kdo používají generátory AI videa Hunyuan Video nebo Wan 2.1: časové aberace, kdy generativní proces má tendenci náhle zrychlit, spojit, vynechat nebo jinak zkreslit kritické momenty ve vygenerovaném videu:

Click to play. Některé z temporálních chyb, které se stávají známými uživatelům nových generativních video systémů, zvýrazněné v nové studii. Vpravo je vidět zlepšující se efekt nového přístupu FluxFlow.  Source: https://haroldchen19.github.io/FluxFlow/

Video výše obsahuje výňatky z příkladových testovacích videí na (varujte se: poměrně chaotické) projektové stránce studie. Můžeme vidět několik stále známějších problémů, které jsou zmírněny metodou autorů (zobrazenou vpravo na videu), která je ve skutečnosti technikou předzpracování dat použitelnou pro jakoukoli generativní video architekturu.

V prvním příkladu, který znázorňuje “dva děti hrající s míčem”, vygenerovaný CogVideoX, vidíme (vlevo na kompilačním videu výše a v konkrétním příkladu níže), že rodinná generace rychle skáče přes několik základních mikro-pohybů, urychlující činnost dětí na “kreslířský” tón. Naopak, stejná data a metoda poskytují lepší výsledky s novou technikou předzpracování, nazvanou FluxFlow (vpravo od obrazu ve videu níže):

Click to play.

V druhém příkladu (používajícím NOVA-0.6B) vidíme, že centrální pohyb kočky byl nějakým způsobem poškozen nebo podstatně podvyživen v trénovacím stadiu, až do té míry, že generativní systém se stal “paralyzován” a nebyl schopen pohybovat se:

Click to play.

Tento syndrom, kdy se pohyb nebo předmět “zasekne”, je jedním z nejčastěji uváděných problémů HV a Wan, ve skupinách pro image a video syntézu.

Některé z těchto problémů jsou spojeny s problémy popisu videa ve zdrojových datech, které jsme předmětem naší pozornosti tento týden; ale autoři nové studie se soustředí na temporální kvality trénovacích dat, a předkládají přesvědčivé argumenty, že řešení těchto problémů z tohoto úhlu pohledu může přinést užitečné výsledky.

Jako jsme již zmínili v předchozím článku o popisu videa, některé sporty jsou zvláště obtížné pro rozlišení do klíčových momentů, což znamená, že kritické události (jako například slam-dunk) nedostávají dostatečnou pozornost během trénování:

Click to play.

V výše uvedeném příkladu generativní systém neví, jak přejít do další fáze pohybu, a přechází nelogicky z jedné pozice do druhé, měnící postoj a geometrii hráče během procesu.

Tyto jsou velké pohyby, které se ztratily během trénování – ale stejně zranitelné jsou i mnohem menší, ale zásadní pohyby, jako je mávání křídel motýla:

Click to play.  

Naproti tomu slam-dunk, mávání křídel není “vzácnou” událostí, ale spíše trvalou a monotónní událostí. Nicméně, jeho konzistence se ztrácí během vzorkování, protože pohyb je tak rychlý, že je velmi obtížné jej stanovit časově.

Tyto problémy nejsou zvláště nové, ale dostávají větší pozornost nyní, kdy jsou k dispozici výkonné generativní video modely pro nadšence pro místní instalaci a volnou generaci.

Komunity na Reddit a Discord původně považovaly tyto problémy za “související s uživatelem”. To je pochopitelná domněnka, protože systémy v otázce jsou velmi nové a minimálně zdokumentované. Proto různé odborníci navrhli různé (a ne vždy účinné) prostředky pro některé z chyb dokumentovaných zde, jako je změna nastavení v různých komponentách různých typů ComfyUI workflow pro Hunyuan Video (HV) a Wan 2.1.

V některých případech, místo rychlého pohybu, oba HV a Wan produkují pomalejší pohyb. Návrhy z Reddit a ChatGPT (které většinou využívají Reddit) zahrnují změnu počtu snímků v požadované generaci, nebo radikální snížení snímkové frekvence*.

Toto je všechno zoufalé; vznikající pravda je, že tyto problémy nemusí pocházet z uživatelské chyby, institucionálních pochybení nebo omezení financování, ale spíše z výzkumného zaměření, které pochopitelně upřednostnilo více naléhavé výzvy, jako je temporální koherence a konzistence, nad těmito menšími problémy.

Dokud nedávno, výsledky z volně dostupných a stažitelných generativních video systémů byly tak kompromitované, že nevznikla žádná velká snaha z komunity nadšenců, aby se tyto problémy vyřešily (nejen proto, že problémy byly fundamentální a nešlo je triviálně vyřešit).

Nyní, když jsme tak blízko věku čistě AI-generovaných fotorealistických video výstupů, je zřejmé, že obě výzkumné a neformální komunity se zajímají o řešení zbývajících problémů; doufejme, že tyto nejsou neřešitelné.

Takže, kromě naší minulé studie o tom, jak popisy ovlivňují trénování, pojďme se podívat na novou studii o temporální regularizaci a na to, jaké zlepšení může nabídnout současné generativní video scéně.

Centrální myšlenka je poměrně jednoduchá a jemná, a není horší pro to; nicméně studie je somewhat naplněna, aby dosáhla předepsaných osmi stránek, a my budeme přeskočit tuto naplnění, pokud je to nutné.

Ryba v rodinné generaci VideoCrafter frameworku je statická, zatímco FluxFlow-upravená verze zachycuje požadované změny. Source: https://arxiv.org/pdf/2503.15417

Ryba v rodinné generaci VideoCrafter frameworku je statická, zatímco FluxFlow-upravená verze zachycuje požadované změny. Source: https://arxiv.org/pdf/2503.15417

Nová práce je nazvána Temporal Regularization Makes Your Video Generator Stronger, a pochází od osmi výzkumníků z Everlyn AI, Hong Kong University of Science and Technology (HKUST), University of Central Florida (UCF) a The University of Hong Kong (HKU).

(v době psaní, existují některé problémy se související projektovou stránkou)

FluxFlow

Centrální myšlenka za FluxFlow, novou schématem předtrénování, je překonat široce rozšířené problémy blikání a temporální nekonzistence prohozením bloků a skupin bloků v temporálních rámcových pořadích, zatímco zdrojová data jsou vystavena trénovacímu procesu:

Centrální myšlenka za FluxFlow je přesunout bloky a skupiny bloků do neočekávaných a ne-temporálních pozic, jako forma datového rozšíření.

Centrální myšlenka za FluxFlow je přesunout bloky a skupiny bloků do neočekávaných a ne-temporálních pozic, jako forma datového rozšíření.

Studie vysvětluje:

‘[Artefakty] pocházejí z fundamentálního omezení: navzdory využití velkých datových sad, současné modely často spoléhají na zjednodušené temporální vzory ve trénovacích datech (například pevné směry chůze nebo opakované přechody snímků) místo toho, aby se učily rozmanité a pravděpodobné temporální dynamiky.

‘Tento problém je dále zhoršován nedostatkem explicitní temporální augmentace během trénování, což zanechává modely náchylné k přeučení na náhodné temporální korelace (například “snímek #5 musí následovat #4”) místo generalizace přes rozmanité pohybové scénáře.’

Většina video generativních modelů, autoři vysvětlují, stále příliš silně půjčuje z obrazové syntézy, zaměřené na prostorovou věrnost, zatímco většinou ignoruje temporální osu. Ačkoli techniky, jako je ořezávání, otočení a barevné rozmazání, pomohly zlepšit kvalitu statických obrazů, nejsou dostatečnými řešeními, když jsou aplikovány na videa, kde iluze pohybu závisí na konzistentních přechodech mezi snímky.

Vznikající problémy zahrnují blikající textury, rušivé přechody mezi snímky a opakující se nebo příliš jednoduché pohybové vzory.

Click to play.

Studie argumentuje, že ačkoli některé modely – včetně Stable Video Diffusion a LlamaGen – kompenzují stále složitějšími architekturami nebo inženýrskými omezeními, tyto přicházejí za cenu výpočetního výkonu a flexibility.

Jelikož temporální data augmentace již prokázala svou užitečnost ve video porozumění úkolech (ve frameworkách, jako je FineCliper, SeFAR a SVFormer) je překvapující, autoři tvrdí, že tato taktika je zřídka aplikována v generativním kontextu.

Narušující chování

Výzkumníci tvrdí, že jednoduché, strukturované narušení temporálního pořadí během trénování pomáhá modelům lépe generalizovat na realistické, rozmanité pohyby:

‘Trénováním na porušených sekvencích, generátor se učí obnovit pravděpodobné trajektorie, efektivní regularizaci temporální entropie. FLUXFLOW mostí mezeru mezi diskriminativní a generativní temporální augmentací, nabízející plug-and-play řešení pro temporálně pravděpodobné video generování, zatímco zlepšuje celkovou kvalitu.

‘Na rozdíl od stávajících metod, které zavádějí architektonické změny nebo spoléhají na post-processing, FLUXFLOW operuje přímo na úrovni dat, zavádějící řízené temporální perturbace během trénování.’

Click to play.

Perturbace na úrovni snímků, autoři uvádějí, zavádějí jemné narušení uvnitř sekvence. Toto narušení není příliš odlišné od masking augmentace, kde jsou části dat náhodně blokovány, aby se zabránilo systému přeučení na data, a aby se zlepšila generalizace.

Testy

Ačkoli centrální myšlenka zde není příliš rozsáhlá, aby vyplnila celou studii, existuje testovací sekce, na kterou se můžeme podívat.

Autoři testovali čtyři dotazy týkající se zlepšení temporální kvality, zatímco zachování prostorové věrnosti; schopnost učit se pohybové/optické tokové dynamiky; zachování temporální kvality v extraterm generaci; a citlivost na klíčové hyperparametry.

Výzkumníci aplikovali FluxFlow na tři generativní architektury: U-Net-based, ve formě VideoCrafter2; DiT-based, ve formě CogVideoX-2B; a AR-based, ve formě NOVA-0.6B.

Pro spravedlivé srovnání, fine-tunovali základní modely s FluxFlow jako další trénovací fázi, po dobu jednoho epochu, na OpenVidHD-0.4M datasetu.

Modely byly vyhodnoceny proti dvěma populárním benchmarkům: UCF-101; a VBench.

Pro UCF, Fréchet Video Distance (FVD) a Inception Score (IS) metriky byly použity. Pro VBench, výzkumníci se soustředili na temporální kvalitu, snímek-vzácnou kvalitu a celkovou kvalitu.

Kvantitativní počáteční hodnocení FluxFlow-Frame.

Kvantitativní počáteční hodnocení FluxFlow-Frame. “+ Original” označuje trénování bez FLUXFLOW, zatímco “+ Num × 1” ukazuje různé FluxFlow-Frame konfigurace. Nejlepší výsledky jsou stíněny; druhý nejlepší jsou podtrženy pro každý model.

Komentář k těmto výsledkům, autoři uvádějí:

‘Oba FLUXFLOW-FRAME a FLUXFLOW-BLOCK významně zlepšují temporální kvalitu, jak je patrné z metrik v Tab. 1, 2 (tj. FVD, Subject, Flicker, Motion, a Dynamic) a kvalitativních výsledků v [obrázek níže].

‘Například pohyb driftujícího auta ve VC2, kočka honící ocas v NOVA, a surfer jezdící na vlně v CVX se stávají zřetelněji tekutějšími s FLUXFLOW. Důležité je, že tyto temporální zlepšení jsou dosažena bez obětování prostorové věrnosti, jak je patrné z ostrých detailů vodních splashes, kouřových stop a vlnových textur, spolu se prostorovou a celkovou věrností.’

Níže vidíme výběr z kvalitativních výsledků, na které autoři odkazují (viz původní studii pro úplné výsledky a lepší rozlišení):

Výběr z kvalitativních výsledků.

Výběr z kvalitativních výsledků.

Studie naznačuje, že zatímco obě rámec-úroveň a blok-úroveň perturbace zlepšují temporální kvalitu, rámec-úroveň metody tendují k lepšímu výkonu. To je připsáno jejich jemnější granularitě, která umožňuje přesnější temporální úpravy. Blok-úroveň perturbace, na druhé straně, mohou zavést šum kvůli těsně spojeným prostorovým a temporálním vzorům uvnitř bloků, což snižuje jejich účinnost.

Závěr

Tato studie, spolu s Bytedance-Tsinghua kollaborací pro popisy zveřejněnou tento týden, mi ukázala, že zdánlivé nedostatky v nových generativních video modelech nemusí pocházet z uživatelské chyby, institucionálních pochybení nebo omezení financování, ale spíše z výzkumného zaměření, které pochopitelně upřednostnilo více naléhavé výzvy, jako je temporální koherence a konzistence, nad těmito menšími problémy.

Dokud nedávno, výsledky z volně dostupných a stažitelných generativních video systémů byly tak kompromitované, že nevznikla žádná velká snaha z komunity nadšenců, aby se tyto problémy vyřešily (nejen proto, že problémy byly fundamentální a nešlo je triviálně vyřešit).

Nyní, když jsme tak blízko věku čistě AI-generovaných fotorealistických video výstupů, je zřejmé, že obě výzkumné a neformální komunity se zajímají o řešení zbývajících problémů; doufejme, že tyto nejsou neřešitelné.

* Wan’s native frame rate je pouhých 16fps, a v reakci na mé vlastní problémy, poznamenávám, že fóra navrhují snížení snímkové frekvence až na 12fps, a poté použít FlowFrames nebo jiné AI-založené re-flowing systémy pro interpolaci mezer mezi takto řídkým počtem snímků.

První zveřejnění v pátek, 21. března 2025

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai