Andersonův úhel
Směr k úplné kontrole v generování videa pomocí umělé inteligence

Modely videozákladny, jako je Hunyuan a Wan 2.1, jsou sice silné, ale nenabízejí uživatelům takový granulární kontrolu, jakou vyžaduje filmová a televizní produkce (zejména produkce vizuálních efektů).
V profesionálních studiích vizuálních efektů se tyto open-source modely, spolu s dříve vyvinutými modely založenými na obrazech (nikoli na videu), jako je Stable Diffusion, Kandinsky a Flux, používají spolu s řadou podpůrných nástrojů, které upravují jejich surový výstup, aby splňovaly specifické kreativní potřeby. Když režisér řekne: “To vypadá skvěle, ale můžeme to udělat trochu [n]?”, nemůžete odpovědět tím, že model není dostatečně přesný, aby zvládl takové požadavky.
Místo toho tým AI VFX použije řadu tradičních CGI a kompozičních technik, spojených s vlastními postupy a pracovními postupy, vyvinutými v průběhu času, aby se pokusil posunout hranice video syntézy trochu dále.
Stejně jako analogy, model videozákladny je podobný výchozí instalaci webového prohlížeče, jako je Chrome; dělá mnoho věcí automaticky, ale pokud chcete, aby se přizpůsobil vašim potřebám, spíše než naopak, budete potřebovat některé pluginy.
Kontrolní freakové
V oblasti difuzní syntézy obrazu je nejvýznamnějším takovým třetím systémem ControlNet.
ControlNet je technika pro přidání strukturované kontroly do difuzních generativních modelů, která umožňuje uživatelům vést generování obrazu nebo videa pomocí dalších vstupů, jako jsou hrany, hloubka nebo informace o poloze.

Různé metody ControlNetu umožňují generovat obrazy z hloubky (horní řádek), semantickou segmentaci a generaci obrazu lidských a zvířecích postav (dolní řádek).
Místo toho, aby se spoléhal pouze na textové podněty, ControlNet zavádí samostatné neuronové síťové větve, nebo adaptéry, které zpracovávají tyto signály, zatímco zachovávají generativní schopnosti základního modelu.
To umožňuje jemně laděné výstupy, které se více shodují s uživatelskými specifikacemi, což z něj činí zvláště užitečný v aplikacích, kde je vyžadována přesná kompozice, struktura nebo kontrola pohybu:

S pomocí polohy lze pomocí ControlNetu získat různé typy přesných výstupů. Zdroj: https://arxiv.org/pdf/2302.05543
Jedná se o techniku, která umožňuje uživatelům vést generování obrazu nebo videa pomocí dalších vstupů, jako jsou hrany, hloubka nebo informace o poloze.
FullDiT
Do tohoto patu přichází nová nabídka z Číny, která navrhuje systém, ve kterém jsou opatření ControlNetu integrována přímo do generativního video modelu během trénování, místo aby byla ponechána jako dopočet.

Z nové práce: přístup FullDiT může zahrnout identitu, hloubku a kamerové pohyby do nativního generování a může vyvolat libovolnou kombinaci těchto prvků najednou. Zdroj: https://arxiv.org/pdf/2503.19907
Nazvaný FullDiT, nový přístup spojuje podmínky, jako je identita, hloubka a kamerový pohyb, do integrované části trénovaného generativního video modelu, pro který autoři vytvořili prototyp trénovaného modelu a doprovodné video klipy na projektovém webu.
V následujícím příkladu vidíme generace, které zahrnují kamerové pohyby, identitní informace a textové informace (tj. uživatelské textové podněty):
Klikněte pro přehrávání. Příklady kontrolních možností uživatele s pouze nativním trénovaným modelem. Zdroj: https://fulldit.github.io/
Autoři neuvádějí, že jejich experimentální trénovaný model je funkčním modelem videozákladny, ale spíše jako důkaz konceptu pro nativní text-to-video (T2V) a image-to-video (I2V) modely, které nabízejí uživatelům více kontroly než pouze obrazový podnět nebo textový podnět.
Pokud nejsou k dispozici žádné podobné modely, výzkumníci vytvořili novou referenční sadu nazvanou FullBench, pro hodnocení víceúlohových videí a prohlašují, že dosáhli špičkového výkonu ve srovnání s předchozími přístupy. Nicméně, protože FullBench byl navržen autory sami, jeho objektivita nebyla testována a jeho datová sada 1 400 případů může být příliš omezená pro širší závěry.
Možná nejzajímavějším aspektem architektury, kterou článek předkládá, je jeho potenciál pro začlenění nových typů kontroly. Autoři uvádějí:
‘V této práci prozkoumáváme pouze kontrolní podmínky kamery, identit a hloubky. Nevěnovali jsme se dalším podmínkám a modalitám, jako je audio, řeč, bodové mračno, ohraničující rámečky objektů, optický tok atd. Ačkoli návrh FullDiT může bezproblémově integrovat další modality s minimálními změnami architektury, otázka, jak rychle a efektivně přizpůsobit stávající modely novým podmínkám a modalitám, zůstává důležitou otázkou, která vyžaduje další prozkoumání.’
Metoda
Autoři tvrdí, že sjednocená pozornost mechanismus FullDiT umožňuje silnější mezi-modální reprezentační učení tím, že zachycuje prostorové a časové vztahy napříč podmínkami:

Podle nové práce FullDiT integruje více vstupních podmínek prostřednictvím plné sebe-pozornosti, převádí je na sjednocenou sekvenci. Na rozdíl od toho adapterové modely (nejvíce vlevo) používají samostatné moduly pro každý vstup, což vede k redundanci, konfliktům a slabšímu výkonu.
Na rozdíl od adapterových nastavení, která zpracovávají každý vstupní tok samostatně, tato sdílená pozornost struktura vyhýbá se konfliktům větví a snižuje parametrální režii. Tvrdí také, že architektura může být škálovatelná na nové typy vstupů bez významných změn – a že modelový schéma ukazuje známky generalizace na kombinace podmínek, které nebyly viděny během trénování, jako je propojení kamerového pohybu s identitou postavy.
Klikněte pro přehrávání. Příklady generování identit z projektového webu.
V architektuře FullDiT jsou všechny vstupní podmínky – jako text, kamerový pohyb, identita a hloubka – nejprve převedeny do jednotného tokenu formátu. Tyto tokeny jsou pak spojeny do jediné dlouhé sekvence, která je zpracována prostřednictvím zásobníku transformerových vrstev pomocí plné sebe-pozornosti. Tento přístup následuje předchozí práce, jako je Open-Sora Plan a Movie Gen.
Tento design umožňuje modelu učit se časové a prostorové vztahy společně napříč všemi podmínkami. Každá transformerová vrstva funguje nad celou sekvencí, umožňující dynamické interakce mezi modalitami bez závislosti na samostatných modulech pro každý vstup – a, jak jsme poznamenali, architektura je navržena tak, aby byla extenzivní, což usnadňuje začlenění dalších kontrolních signálů v budoucnu, bez významných strukturálních změn.
Síla tří
FullDiT převádí každý kontrolní signál do standardizovaného tokenu formátu, aby všechny podmínky mohly být zpracovány společně v rámci sjednocené pozornosti. Pro kamerový pohyb model kóduje sekvenci vnějších parametrů – jako poloha a orientace – pro každý snímek. Tyto parametry jsou časově označeny a projekty do vektorů, které odrážejí časovou povahu signálu.
Informace o identitě jsou zpracovávány odlišně, protože jsou v sobě samy prostorové spíše než časové. Model používá identifikační mapy, které ukazují, které postavy jsou přítomny v kterých částech každého snímku. Tyto mapy jsou rozděleny do záplat, s každou záplatou projekcí do vloženého prostoru, který zachycuje prostorové identifikační signály, umožňující modelu spojovat konkrétní oblasti snímku s konkrétními entitami.
Hloubka je prostorově-časový signál a model zpracovává ji rozdělením hloubkových videí do 3D záplat, které pokrývají jak prostor, tak čas. Tyto záplaty jsou poté vloženy způsobem, který zachovává jejich strukturu napříč snímky.
Jakmile jsou tyto podmínkové tokeny (kamera, identita a hloubka) spojeny do jediné dlouhé sekvence, FullDiT může zpracovat je společně pomocí plné sebe-pozornosti. Tato sdílená reprezentace umožňuje modelu učit se interakce napříč modalitami a napříč časem, bez závislosti na izolovaných zpracovacích tocích.
Data a testy
FullDiTova trénovací přístup spoléhal na selektivně anotované datové sady přizpůsobené každé vstupní podmínce, spíše než vyžadovat všechny podmínky být přítomny současně.
Pro textové podmínky se iniciativa řídí strukturovaným přístupem k popiskům, jak je popsáno v projektu MiraData.

Sbírka videí a pipeline anotace z projektu MiraData. Zdroj: https://arxiv.org/pdf/2407.06358
Pro kamerový pohyb byl RealEstate10K datová sada hlavním zdrojem dat, kvůli jeho vysoce kvalitním anotacím kamerových parametrů.
Autoři nicméně pozorovali, že trénování výhradně na statických scénách kamerových dat, jako je RealEstate10K, tendenci snižovat dynamické objekty a lidské pohyby ve vygenerovaných videích. Aby tomu čelili, provedli další jemné doladění pomocí interních dat, která zahrnovala více dynamické kamerové pohyby.
Identifikační anotace byly vygenerovány pomocí pipeline vyvinuté pro projekt ConceptMaster, který umožnil efektivní filtrování a extrakci jemných identifikačních informací.

Rámec ConceptMaster je navržen pro řešení problémů s identifikační dekuplírováním, zatímco zachovává konceptuální věrnost v přizpůsobených videích. Zdroj: https://arxiv.org/pdf/2501.04698
Hloubkové anotace byly získány z Panda-70M datové sady pomocí Depth Anything.
Optimalizace prostřednictvím datového pořadí
Autoři také implementovali progresivní trénovací harmonogram, který zavedl složitější podmínky časněji během trénování, aby zajistil, že model získal robustní reprezentace, než byly přidány jednodušší úkoly. Trénovací pořadí postupovalo od textu k kamerovým podmínkám, poté identitám a nakonec hloubce, s jednoduššími úkoly obecně zavedenými později a s méně příklady.
Autoři zdůrazňují hodnotu pořadí pracovní zátěže tímto způsobem:
‘Během fáze předtrénování jsme si všimli, že náročnější úkoly vyžadují delší trénovací dobu a měly by být zavedeny dříve v procesu učení. Tyto náročné úkoly zahrnují komplexní datové distribuce, které se výrazně liší od výstupního videa, vyžadující, aby model měl dostatečnou kapacitu, aby přesně zachytil a reprezentoval je.
‘Naopak, zavedení jednodušších úkolů příliš brzy může vést k tomu, že model se bude soustředit na učení těchto úkolů jako první, protože poskytují okamžitou zpětnou vazbu, což brání konvergenci náročnějších úkolů.’

Ilustrace trénovacího pořadí přijatého výzkumníky, s červenou barvou označující větší objem dat.
Po počátečním předtrénování následovala konečná fáze jemného doladění, která dále vylepšila model, aby zlepšil vizuální kvalitu a pohybovou dynamiku. Poté se trénování řídilo standardním difuzním rámcem*:
hluk byl přidán k video latencím a model se naučil předpovídat a odstranit jej, pomocí vložených podmínkových tokenů jako vedení.
Aby se efektivní vyhodnotil FullDiT a poskytl spravedlivé srovnání s existujícími metodami, a vzhledem k tomu, že nejsou k dispozici žádné vhodné referenční sady, autoři zavedli FullBench, kurátorovanou referenční sadu skládající se z 1 400 různých testovacích případů.

Instance datového prohlížeče pro novou referenční sadu FullBench. Zdroj: https://huggingface.co/datasets/KwaiVGI/FullBench
Každý datový bod poskytoval anotace pro různé vstupní signály, včetně kamerového pohybu, identit a hloubky.
Metriky
Autoři vyhodnotili FullDiT pomocí deseti metrik, které pokrývají pět hlavních aspektů výkonu: textové zarovnání, kamerová kontrola, identitní podobnost, hloubková přesnost a obecná kvalita videa.
Textové zarovnání bylo měřeno pomocí CLIP podobnosti, zatímco kamerová kontrola byla hodnocena pomocí rotační chyby (RotErr), translační chyby (TransErr) a kamerové pohybové konzistence (CamMC), následujícím přístupem CamI2V (v projektu CameraCtrl).
Identitní podobnost byla hodnocena pomocí DINO-I a CLIP-I, a hloubková kontrola přesnost byla kvantifikována pomocí Průměrné absolutní chyby (MAE).
Kvalita videa byla hodnocena třemi metrikami z MiraData: snímek-úrovňové CLIP podobnosti pro plynulost; optický tok-založený pohyb pro dynamiku; a LAION-Aesthetic skóre pro vizuální atraktivitu.
Trénování
Autoři trénovali FullDiT pomocí interního (nepublikovaného) text-to-video difuzního modelu, který obsahuje přibližně jednu miliardu parametrů. Úmyslně zvolili skromnou velikost parametrů, aby zajistili spravedlivé srovnání s předchozími metodami a zajistili reprodukovatelnost.
Pokud se trénovací videa lišila délkou a rozlišením, autoři standardizovali každou dávku tak, že videa byla přejmenšena a vyplněna na společné rozlišení, byly vybrány 77 snímků z každé sekvence a použity aplikované pozornosti a ztrátové masky, aby se optimalizoval efekt trénování.
Adam optimalizátor byl použit se učení rychlostí 1×10−5 napříč clusterem 64 NVIDIA H800 GPU, pro kombinovaný celkový 5 120 GB VRAM (zvažte, že v komunitách syntézy, 24GB na RTX 3090 je stále považováno za luxusní standard).
Model byl trénován přibližně 32 000 kroků, zahrnující až tři identit na video, spolu s 20 snímky kamerových podmínek a 21 snímky hloubkových podmínek, všechny rovnoměrně vybrané z celkových 77 snímků.
Pro inferenci model generoval videa v rozlišení 384×672 pixelů (přibližně pět sekund při 15 snímcích za sekundu) s 50 difuzními inferenčními kroky a klasifikátorem-volným řízením měřítkem pět.
Předchozí metody
Pro hodnocení kamery na video autoři srovnali FullDiT s MotionCtrl, CameraCtrl a CamI2V, se všemi modely trénovanými pomocí RealEstate10K datové sady, aby se zajistila konzistence a spravedlnost.
Při generování podmíněném na identitě, protože nebyly k dispozici žádné srovnatelné open-source multi-identitní modely, byl model hodnocen proti 1B-parametrovému modelu ConceptMaster, pomocí stejných trénovacích dat a architektury.
Pro úkoly z hloubky na video byly provedeny srovnání s Ctrl-Adapter a ControlVideo.

Kvantitativní výsledky pro generování videa v jednom úkolu. FullDiT byl srovnán s MotionCtrl, CameraCtrl a CamI2V pro generování kamery na video; ConceptMaster (1B parametr verze) pro identitu na video; a Ctrl-Adapter a ControlVideo pro hloubku na video.
Výsledky ukazují, že FullDiT, navzdory zpracování více vstupních signálů současně, dosáhl špičkového výkonu v metrikách souvisejících s textem, kamerovým pohybem, identitou a hloubkou.
V celkových kvalitativních metrikách systém obecně překonal ostatní metody, i když jeho plynulost byla mírně nižší než u ConceptMaster. Zde autoři komentují:
‘Plynulost FullDiT je mírně nižší než u ConceptMaster, protože výpočet plynulosti je založen na CLIP podobnosti mezi sousedními snímky. Protože FullDiT vykazuje mnohem větší dynamiku ve srovnání s ConceptMaster, metrika plynulosti je ovlivněna velkými variacemi mezi sousedními snímky.
‘Pro estetický skór, protože ratingový model upřednostňuje obrazy v malířském stylu a ControlVideo obvykle generuje videa v tomto stylu, dosahuje vysokého skóre v estetice.’
Ohledně kvalitativního srovnání by bylo lepší odkázat na ukázková videa na projektovém webu FullDiT, protože PDF příklady jsou nevyhnutelně statické (a také příliš velké na to, aby je zde bylo možné zcela reprodukovat).

První část kvalitativních výsledků v PDF. Prosím, odkážete se na původní článek pro další příklady, které jsou příliš rozsáhlé na to, aby je zde bylo možné reprodukovat.
Autoři komentují:
‘FullDiT prokazuje lepší uchování identity a generuje videa s lepší dynamikou a vizuální kvalitou ve srovnání s [ConceptMaster]. Protože ConceptMaster a FullDiT jsou trénovány na stejném základě, to zdůrazňuje účinnost podmíněného vstřikování s plnou pozorností.
‘… Další výsledky prokazují lepší ovladatelnost a generativní kvalitu FullDiT ve srovnání s existujícími metodami pro hloubku na video a kameru na video.’

Část PDF příkladů výstupu FullDiT s více signály. Prosím, odkážete se na původní článek a projektový web pro další příklady.
Závěr
Ačkoli FullDiT je zajímavým pokusem o více funkcemi vybavený typ modelu videozákladny, je třeba se ptát, zda poptávka po funkcích ControlNetu bude někdy ospravedlnit jejich implementaci ve velkém měřítku, alespoň pro FOSS projekty, které by se potýkaly s získáním obrovského množství GPU výpočetního výkonu, bez komerční podpory.
Primární výzvou je, že použití systémů, jako je Depth a Pose, obecně vyžaduje nezanedbatelnou znalost relativně složitých uživatelských rozhraní, jako je ComfyUI. Proto se zdá, že funkční FOSS model tohoto druhu je nejpravděpodobněji vyvinut skupinou menších VFX společností, které nemají peníze (nebo vůli, vzhledem k tomu, že tyto systémy jsou rychle zastaralé modelovými aktualizacemi), aby si takový model mohli dovolit vyvinout a trénovat za zavřenými dveřmi.
Na druhou stranu, API-řízené ‘rent-an-AI’ systémy mohou mít dostatečnou motivaci vyvinout jednodušší a uživatelsky přívětivější interpretativní metody pro modely, do kterých byly přímo trénovány pomocné kontrolní systémy.
Klikněte pro přehrávání. Kontrola hloubky a textu uložená na video generované pomocí FullDiT.
* Autoři nespecifikují žádný známý základní model (tj. SDXL, atd.)
Poprvé publikováno ve čtvrtek, 27. března 2025












