Andersonův úhel

AI Video Dokonale Zhotovuje Kočičí Selfie

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A still from a demo video for the paper 'Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models', depicting a POV of a 'cat selfie', while a dog skateboards in the background. Source: https://vita-epfl.github.io/FVG/

Generátory AI videa často poskytují výsledky, které jsou blízko, ale nejsou přesně to, co uživatel chtěl. Nové vysoké úrovně opravy však dělají veškerý rozdíl.

 

Generativní video systémy často mají potíže s vytvářením opravdu kreativních nebo divokých videí a často nesplňují očekávání uživatelů.

Jedním z důvodů je entanglement – fakt, že modely založené na vidění a jazyku musí kompromisovat, jak dlouho se trénují na svých zdrojových datech. Příliš málo tréninku a koncepty jsou flexibilní, ale nejsou plně vytvořené – příliš mnoho a koncepty jsou přesné, ale již nejsou dostatečně flexibilní, aby se mohly začlenit do nových kombinací.

Můžete získat představu z videa níže. Na levé straně je vidět kompromis, který mnoho AI systémů dodává v odpovědi na náročný prompt (prompt je uveden na vrcholu videa ve všech čtyřech případech), který žádá o nějakou kombinaci prvků, která je příliš fantastická, aby byla reálným tréninkovým příkladem. Na pravé straně je AI výstup, který se drží promptu mnohem lépe:

Klikněte pro přehrávání (bez zvuku). Na pravé straně vidíme ‘factorized’ WAN 2.2, který opravdu dodává na promptech, ve srovnání s neurčitými interpretacemi ‘vanilla’ Wan 2.2., na levé straně. Prosím, odkážete se na zdrojové video soubory pro lepší rozlišení a mnoho dalších příkladů, i když kurátorské verze zobrazené zde neexistují na projektu a byly sestaveny pro tento článek. Zdroj

Dobře, i když musíme omluvit klapajícího kachnu s lidskými rukama (!), je zřejmé, že příklady na pravé straně se drží původního textového promptu mnohem lépe než ty na levé straně.

Zajímavě, obě architektury jsou vlastně stejné – populární a velmi schopný Wan 2.2, čínské vydání, které získalo významné místo v otevřené komunitě a komunitě hobbyistů tento rok.

Rozdíl spočívá v tom, že druhá generativní pipeline je factorized, což v tomto případě znamená, že velký jazykový model (LLM) byl použit k reinterpretaci první (základní) snímku videa, aby bylo pro systém snazší dodržet, co uživatel požaduje.

Tato ‘vizuální kotva’ zahrnuje injekci obrazu vytvořeného z tohoto LLM-enhanced promptu do generativní pipeline jako ‘start frame’ a použití LoRA interpretačního modelu, aby pomohl integrovat ‘intruder’ snímek do procesu vytváření videa.

Výsledky, pokud jde o věrnost promptu, jsou quite remarkable, zejména pro řešení, které parece rather elegant:

Klikněte pro přehrávání (bez zvuku). Další příklady ‘factorized’ video generací, které opravdu dodržují scénář.  Prosím, odkážete se na zdrojové video soubory pro lepší rozlišení a mnoho dalších příkladů, i když kurátorské verze zobrazené zde neexistují na projektu a byly sestaveny pro tento článek.

Toto řešení přichází ve formě nové práce Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, a jeho video-laden doprovodný projektový web.

Zatímco mnoho současných systémů se snaží zvýšit přesnost promptu pomocí jazykových modelů k přepsání neurčitých nebo nedostatečně specifikovaných textů, nová práce argumentuje, že tato strategie stále vede k selhání, když je vnitřní scéna modelu vadná.

I když má podrobný přepsaný prompt, text-to-video modely často nesprávně skládají klíčové prvky nebo generují neslučitelné počáteční stavy, které porušují logiku animace. Dokud první snímek neodráží, co prompt popisuje, výsledné video nemůže být obnoveno, bez ohledu na to, jak dobrý je model pohybu.

Práce uvádí*:

‘[Text-to-video] modely často produkují distribučně posunuté snímky, ale stále dosahují [hodnoty] srovnatelné s I2V modely, ukazující, že jejich modelování pohybu zůstává přirozené i když věrnost scény je relativně špatná.

‘[Image-to-Video] modely vykazují komplementární chování, silné [hodnoty] z přesných počátečních scén a slabší temporální koherence, zatímco I2V+text vyvažuje obě aspekty.

‘Tento kontrast naznačuje strukturální nesoulad v současných T2V modelech: scénická kotva a temporální syntéza vyžadují odlišné induktivní偏见, ale existující architektury se snaží naučit obě najednou v rámci jednoho modelu.’

Diagnostické srovnání generativních módů zjistilo, že modely bez explicitní scénické kotvy skórovaly dobře na pohybu, ale často kompromitovaly na scéně, zatímco obrazově podmíněné přístupy ukázaly opačný vzorec:

Srovnání video generativních módů na dvou datech, ukazující, že I2V+text dosahuje nejlepší kvality snímku (FID) a temporální koherence (FVD), zdůrazňující výhodu oddělení scénické konstrukce od pohybu. Zdroj - https://arxiv.org/pdf/2512.16371

Srovnání video generativních módů na dvou datech, ukazující, že I2V+text dosahuje nejlepší kvality snímku (FID) a temporální koherence (FVD), zdůrazňující výhodu oddělení scénické konstrukce od pohybu. Zdroj

Tato zjištění ukazují na strukturální vadu, kdy současné modely se snaží naučit obě scénickou konstrukci a animaci najednou, ačkoli tyto dvě úkoly vyžadují odlišné typy induktivního偏见 a jsou lépe zpracovány samostatně.

Možná nejzajímavější je, že tato ‘finta’ může být potenciálně aplikována na lokální instalace modelů, jako jsou Wan 2.1 a 2.2, a podobné video difúzní modely, jako je Hunyuan Video. Anekdoticky, srovnání kvality výstupu hobbyistů s komerčními generativními portály, jako jsou Kling a Runway, většina hlavních poskytovatelů API se zlepšuje na otevřených nabídkách, jako je WAN s LoRAs, a – zdá se – s fintami podobnými těm, které jsou vidět v nové práci. Proto by tento přístup mohl představovat dohánění pro FOSS kontingent.

Testy provedené pro metodu ukazují, že tento jednoduchý a modulární přístup nabízí nový stav umění na T2V-CompBench benchmark, významně zlepšující všechny testované modely. Autoři uvádějí v závěru, že zatímco jejich systém radikálně zlepšuje věrnost, neřeší (ani není určen k řešení) identity drift, který je aktuálně bane generativní AI výzkumu.

Nová práce pochází od čtyř výzkumníků z Ecole Polytechnique Fédérale de Lausanne (EPFL) ve Švýcarsku.

Metoda a Data

Centrální tvrzení nové techniky je, že text-to-video (T2V) difúzní modely potřebují být ‘ukotveny’ k počátečním snímkům, které opravdu odpovídají požadovanému textovému promptu.

Aby se zajistilo, že model respektuje počáteční snímek, nová metoda narušuje standardní difúzní proces injekcí čistého latentu z kotvicího obrazu na časovém kroku nula, nahrazující jeden z obvyklých šumových vstupů. Tento neznámý vstup zpočátku zmást model, ale s minimálním LoRA finetuningem, se naučí zacházet s injekčním rámečkem jako s pevnou vizuální kotvou spíše než jako součást šumové trajektorie:

Dvoufázová metoda pro ukotvení text-to-video generace s vizuální kotvou: Vlevo, model je finetunován pomocí lehkého LoRA, aby zacházel s injekčním čistým latentem jako s pevnou scénickou kotvou. Vpravo, prompt je rozdělen na první snímek, který je použit k vygenerování kotvicího obrazu, který řídí video.

Dvoufázová metoda pro ukotvení text-to-video generace s vizuální kotvou: Vlevo, model je finetunován pomocí lehkého LoRA, aby zacházel s injekčním čistým latentem jako s pevnou scénickou kotvou. Vpravo, prompt je rozdělen na první snímek, který je použit k vygenerování kotvicího obrazu, který řídí video.

Na inferenci, metoda přepíše prompt, aby popisoval pouze první snímek, pomocí LLM k extrahování pravděpodobného počátečního scénického stavu zaměřeného na rozložení a vzhled.

Tento přepisovaný prompt je předán generátoru obrazu, aby vygeneroval kandidátní kotvicí snímek (který může být volitelně upraven uživatelem). Vybraný snímek je zakódován do latentu a injekčně aplikován do difúzního procesu nahrazující první časový krok, umožňující modelu vygenerovat zbytek videa zatímco zůstává ukotvený k počáteční scéně – proces, který funguje bez požadavku na změny základní architektury.

Proces byl testován vytvořením LoRAs pro Wan2.2-14B, Wan2.1-1B a CogVideo1.5-5B. LoRA trénink byl proveden na ranku 256, na 5000 náhodně vybraných klipů z UltraVideo sbírky.

Trénink trval 6000 kroků a vyžadoval 48 GPU hodin pro Wan-1B a CogVideo-5B a 96 GPU hodin pro Wan-14B. Autoři uvádějí, že Wan-5B nativně podporuje text-only a text-image kondicionování (které jsou v tomto případě aplikovány na starší rámce), a proto nevyžadoval žádné finetunování.

Testy

Ve experimentech provedených pro proces, každý textový prompt byl inicializován pomocí Qwen2.5-7B-Instruct, který použil výsledek k vygenerování podrobného ‘seed image’ popisu obsahujícího popis celé scény. Tento popis byl pak předán QwenImage, který byl úkolem vygenerovat ‘magic frame’ pro vložení do difúzního procesu.

Benchmarky použité k hodnocení systému zahrnovaly výše zmíněný T2V-CompBench, pro testování kompoziční understanding by scoring how well models preserved objects, attributes, and actions within a coherent scene; a VBench 2.0, pro hodnocení broader reasoning and consistency across 18 metrics, grouped into creativity, commonsense reasoning, controllability, human fidelity, and physics:

Across all seven evaluation categories of T2V-CompBench, the factorized T2V method outperformed both standard and upsampled T2V baselines for every tested model, with gains reaching up to 53.25%. The highest-scoring variants frequently matched or exceeded the proprietary PixVerse-V3 benchmark.

Across all seven evaluation categories of T2V-CompBench, the factorized T2V method outperformed both standard and upsampled T2V baselines for every tested model, with gains reaching up to 53.25%. The highest-scoring variants frequently matched or exceeded the proprietary PixVerse-V3 benchmark.

Ohledně této počáteční série testů, autoři uvádějí*:

‘[Across] all models, adding an anchor image consistently improves compositional performances. All smaller Factorized models (CogVideo 5B, Wan 5B and Wan 1B) outperform the larger Wan 14B T2V model.

Our factorized Wan 5B also outperforms commercial PixVerse-V3 baseline which is the best reported model on the benchmark. This demonstrates that visual grounding substantially enhances scene and action understanding even in smaller-capacity models.

‘Within each model family, the factorized version outperforms the original model. Notably, our lightweight anchor-grounded LoRA on WAN 14B reaches performance comparable its pretrained I2V 14B variant (0.661 vs. 0.666), despite requiring no full retraining.’

Další přišla VBench2.0 série:

The factorized T2V approach consistently improved VBench 2.0 performance across composition, commonsense reasoning, controllability, and physics, with some gains exceeding 60% – although human fidelity remained below the proprietary Veo 3 baseline.

The factorized T2V approach consistently improved VBench 2.0 performance across composition, commonsense reasoning, controllability, and physics, with some gains exceeding 60% – although human fidelity remained below the proprietary Veo 3 baseline.

Across all architectures, the factorized approach boosted scores in every VBench category except human fidelity, which slightly declined even with prompt upsampling. WAN 5B outperformed the larger WAN 14B, reinforcing earlier T2V-CompBench results that visual grounding contributed more than scale.

While gains on VBench were consistent, they were smaller than those seen on T2V-CompBench, and the authors attribute this to VBench’s stricter binary scoring regime.

Pro kvalitativní testy, práce dodává statické obrázky, ale odkazujeme čtenáře na kompozitní videa vložená do tohoto článku, pro jasnější představu, s výhradou, že zdrojová videa jsou četnější a rozmanitější, stejně jako mají větší rozlišení a detail. Najdete je zde. Ohledně kvalitativních výsledků, práce uvádí:

‘Anchored videos consistently exhibit more accurate scene composition, stronger object–attribute binding, and clearer temporal progression.’

Factorized metoda zůstala stabilní i když počet difúzních kroků byl snížen z 50 na 15, ukazující téměř žádnou ztrátu výkonu na T2V-CompBench. Naopak, obě text-only a upsampled baseline se zhoršily výrazně za stejných podmínek.

Ačkoli snížení kroků mohlo teoreticky ztrojnásobit rychlost, plná generativní pipeline se stala pouze 2,1x rychlejší v praxi, kvůli fixním nákladům z kotvicího obrazu. Přesto, výsledky ukazují, že kotva nejen zlepšila kvalitu vzorku, ale také pomohla stabilizovat difúzní proces, podporující rychlejší a efektivnější generaci bez ztráty přesnosti.

Projektový web poskytuje příklady upsampled vs. nové metody generací, z nichž nabízíme několik (nižší rozlišení) editovaných příkladů zde:

Klikněte pro přehrávání (bez zvuku). Upsampled počáteční zdroje vs. autorů factorized přístup.

Autoři uzavírají:

‘Our results suggest that improved grounding, rather than increased capacity alone, may be equally important. Recent advances in T2V diffusion have relied heavily on increasing model size and training data, yet even large models often struggle to infer a coherent initial scene from text alone.

‘This contrasts with image diffusion, where scaling is relatively straightforward; in video models, each architectural improvement must operate over an additional temporal dimension, making scaling substantially more resource intensive.

‘Our findings indicate that improved grounding can complement scale by addressing a different bottleneck: establishing the correct scene before motion synthesis begins.

‘By factorizing video generation into scene composition and temporal modeling, we mitigate several common failure modes without requiring substantially larger models. We view this as a complementary design principle that can guide future architectures toward more reliable and structured video synthesis.’

Závěr

Ačkoli problémy s entanglementem jsou velmi reálné a mohou vyžadovat speciální řešení (jako zlepšení kurace a distribuce hodnocení před tréninkem), bylo fascinující sledovat, jak factorizace ‘rozlepila’ několik zatvrzelých a ‘zablokovaných’ konceptů do mnohem přesnějších renderování – s pouze mírnou vrstvou LoRA kondicionování a zásahem pozoruhodně zlepšeného start/seed obrazu.

Propast v zdrojích mezi lokálními hobbyisty a komerčními řešeními nemusí být tak obrovská, jak se zdá, protože téměř všichni poskytovatelé se snaží racionalizovat své značné GPU náklady pro spotřebitele.

Anekdoticky, velmi velký počet současných generativních video poskytovatelů se zdá, že používá značené a obecně ‘vylepšené’ verze čínských FOSS modelů. Hlavní ‘moat’ těchto ‘middleman’ systémů se zdá být, že se jim podařilo trénovat LoRAs, nebo else – za větší náklady a mírně větší odměny – provedly plné finetunování modelových vah††.

Insights tohoto typu by mohly pomoci uzavřít tuto mezeru dále, v kontextu scény, kde Číňané se zdají být odhodláni (ne nutně z altruistických nebo ideálních důvodů) demokratizovat gen AI, zatímco západní obchodní zájmy by snad raději viděli, že se zvyšující se velikost modelu a regulace nakonec uzavřou dobré modely za API a více vrstvami obsahu filtrů.

 

* Autoři zdůrazňují, ne já.

Práce nespecifikuje, který GPU byl zvolen, nebo kolik jich bylo použito.

†† Ačkoli LoRA cesta je více pravděpodobná, obě pro ekonomickou snadnost použití a protože plné váhy, spíše než quantizované váhy, nejsou vždy k dispozici.

Poprvé zveřejněno v pátek, 19. prosince 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]