Modely a platformy AI
Vaření konzistence vyprávění pro generování dlouhých videí

Recentní veřejná vydání modelu Hunyuan Video generativní AI intenzivně diskutovalo o potenciálu velkých multimodálních modelů vidění-jazyka vytvořit celý film.
Jedním z důvodů, proč je to velmi vzdálená perspektiva, je velmi krátké okno pozornosti většiny generátorů videa AI, které se potýkají s udržením konzistence i v krátké jediné scéně, natož v sérii scén.
Dalším důvodem je, že konzistentní odkazy na videoobsah (jako prozkoumatelná prostředí, která by neměla náhodně měnit, pokud budete opakovat své kroky skrz ně) lze dosáhnout pouze v difuzních modelech pomocí technik, jako je nízká adaptace (LoRA), což omezuje možnosti základních modelů.
Takže vývoj generativního videa se zdá být určen k zastavení, pokud nejsou vyvinuty nové přístupy k vyprávěcí kontinuitě.
Recept na kontinuitu
S tímto na mysli, nová spolupráce mezi USA a Čínou navrhla použití instrukčních vařících videí jako možného šablony pro budoucí systémy vyprávěcí kontinuity.
Klikněte na přehrávání. Projekt VideoAuteur systematizuje analýzu částí vařícího procesu, aby vytvořil jemně popsánou novou datovou sadu a orchestraci metodu pro generování vařících videí. Odkazujte na zdroj stránky pro lepší rozlišení. Zdroj: https://videoauteur.github.io/
Název VideoAuteur navrhuje dvoustupňový pipeline pro generování instrukčních vařících videí pomocí koherentních stavů kombinujících klíčové snímky a popisky, dosahující špičkových výsledků v – přiznáváme – podpořené oblasti.
Stránka projektu VideoAuteur také zahrnuje řadu spíše více upoutávkových videí, které používají stejnou techniku, jako je například navrhovaný trailer pro (neexistující) Marvel/DC crossover:
Klikněte na přehrávání. Dva superhrdinové z alternativních univerzálních se setkávají v falešném traileru z VideoAuteur. Odkazujte na zdroj stránky pro lepší rozlišení.
Stránka také obsahuje podobně stylizované promo videa pro stejně neexistující Netflix seriál o zvířatech a reklamu na Tesla (TSLA ) auto.
Při vývoji VideoAuteur autoři experimentovali s různými ztrátovými funkcemi a dalšími novými přístupy. Pro vývoj receptu na generování pracovního postupu také kuratovali CookGen, největší datovou sadu zaměřenou na vařící doménu, s 200 000 video klipy o průměrné délce 9,5 sekund.
V průměru 768,3 slov na video je CookGen pohodlně nejvíce rozsáhle annotovanou datovou sadou svého druhu. Různé modely vidění/jazyka byly použity, mezi jinými přístupy, aby zajistily, že popisky byly tak detailní, relevantní a přesné, jak je to možné.
Vařící videa byla vybrána, protože vařící instrukční procházky mají strukturované a neambivalentní vyprávění, což činí anotaci a hodnocení lehčí úkolem. Kromě pornografických videí (které se pravděpodobně dostanou do tohoto konkrétního prostoru brzy) je obtížné si představit jakýkoli jiný žánr tak vizuálně a vyprávěcího “formulářového”.
Autoři uvádějí:
‘Naše navrhovaná dvoufázová auto-regresivní pipeline, která zahrnuje dlouhou vyprávěcí režii a vizuálně podmíněnou generaci videa, demonstruje slibné zlepšení v sémantické konzistenci a vizuální věrnosti generovaných dlouhých vyprávěcích videí.
‘Prostřednictvím experimentů na naší datové sadě pozorujeme zlepšení v prostorové a časové koherenci napříč videosekvencemi.
‘Doufáme, že naše práce může usnadnit další výzkum v generování dlouhých vyprávěcích videí.’
Nová práce je nazvaná VideoAuteur: Směrem k generování dlouhých vyprávěcích videí a pochází od osmi autorů z Johns Hopkins University, ByteDance a ByteDance Seed.
Kurace datové sady
Pro vývoj CookGen, který pohání dvoufázový generativní systém pro produkci AI vařících videí, autoři použili materiál z YouCook a HowTo100M sbírek. Autoři porovnávají rozsah CookGen s předchozími datovými sadami zaměřenými na vyprávěcí vývoj v generativním videu, jako je Flintstones dataset, Pororo kreslený dataset, StoryGen, Tencent’s StoryStream, a VIST.

Porovnání obrázků a délky textu mezi CookGen a nejbližšími podobnými datovými sadami. Zdroj: https://arxiv.org/pdf/2501.06173
CookGen se zaměřuje na reálná vyprávění, zejména procedurální činnosti, jako je vaření, nabízí jasnější a lehčí anotace a hodnocení ve srovnání s image-based komiksovými datovými sadami. Překračuje největší existující datovou sadu, StoryStream, s 150x více snímky a 5x hustějšími textovými popisky.
Vědci jemně doladili model popisků pomocí metodologie LLaVA-NeXT jako základ. Automatické rozpoznávání řeči (ASR) pseudo-štítky získané pro HowTo100M byly použity jako “akce” pro každé video a poté dále rafinovány velkými jazykovými modely (LLM).
Například ChatGPT-4o byl použit pro produkci datové sady popisků a byl požádán, aby se zaměřil na interakce mezi subjekty a objekty (jako ruce manipulující s nádobím a jídlem), atributy objektů a časové dynamiky.
Pokud jsou ASR skripty pravděpodobně neúplné a obecně “šumivé”, Intersection-over-Union (IoU) byl použit jako metrika pro měření, jak úzce se popisky shodují s částí videa, na kterou se vztahují. Autoři uvádějí, že to bylo zásadní pro vytvoření vyprávěcí konzistence.
Kurální klipy byly hodnoceny pomocí Fréchet Video Distance (FVD), která měří disparitu mezi skutečnými (reálnými) příklady a generovanými příklady, cả s a bez skutečných klíčových snímků, dosahující výkonného výsledku:

Použití FVD pro hodnocení vzdálenosti mezi generovanými videi s novými popisky, cả s a bez použití klíčových snímků zachycených z vzorkových videí.
Dále byly klipy hodnoceny GPT-4o a šesti lidskými anotátory, následujících LLaVA-Hound definici “halucinace” (tj. schopnost modelu vynalézt fiktivní obsah).
Vědci porovnali kvalitu popisků s Qwen2-VL-72B sbírkou, získáním mírně lepšího skóre.

Porovnání FVD a lidských hodnocení skóre mezi Qwen2-VL-72B a autoři sbírkou.
Metoda
Generativní fáze VideoAuteur je rozdělena mezi Dlouhým vyprávěcím režisérem (LND) a vizuálně podmíněným modelem generování videa (VCVGM).
LND generuje sekvenci vizuálních vložek nebo klíčových snímků, které charakterizují vyprávěcí tok, podobně jako “základní výstřižky”. VCVGM generuje video klipy na základě těchto voleb.

Schéma pro VideoAuteur zpracovatelský pipeline. Dlouhý vyprávěcí režisér dělá vhodné volby pro krmení Seed-X-powered generativního modulu.
Autoři rozsáhle diskutují o různých zásluhách proloženého obrazového textu režiséra a jazykově centrického klíčového režiséra a docházejí k závěru, že první přístup je účinnější.
Proložený obrazový text režisér generuje sekvenci proložením textových tokenů a vizuálních vložek, pomocí auto-regresivního modelu pro předpověď následujícího tokenu na základě kombinovaného kontextu textu a obrázků. To zajišťuje těsnou shodu mezi vizuálními a textovými prvky.
Naproti tomu jazykově centrický klíčový režisér syntetizuje klíčové snímky pomocí textově podmíněného difuzního modelu založeného pouze na popiscích, bez začlenění vizuálních vložek do generativního procesu.
Vědci zjistili, že zatímco jazykově centrická metoda generuje vizuálně atraktivní klíčové snímky, chybí jí konzistence napříč snímky, argumentujíce, že proložená metoda dosahuje vyšších skóre v realističnosti a vizuální konzistenci. Také zjistili, že tato metoda byla lépe schopna naučit se realistický vizuální styl prostřednictvím školení, i když někdy s některými opakujícími se nebo šumivými prvky.
Neobvykle, v výzkumném směru dominantním pro převzetí Stability.ai a Flux do workflow, autoři použili Tencent’s SEED-X 7B-parametr multi-modální LLM základního modelu pro jejich generativní pipeline (i když tento model využívá Stability.ai’s SDXL vydání Stability.ai pro omezenou část své architektury).
Autoři uvádějí:
‘Naše navrhovaná dvoufázová auto-regresivní pipeline, která zahrnuje dlouhou vyprávěcí režii a vizuálně podmíněnou generaci videa, demonstruje slibné zlepšení v sémantické konzistenci a vizuální věrnosti generovaných dlouhých vyprávěcích videí.
‘Kromě toho zlepšujeme robustnost a kvalitu generovaných videí přizpůsobením modelu pro zpracování šumivých vizuálních vložek, protože regresované vizuální latence nemusí být dokonalé kvůli regresním chybám.’
Tyypická vizuálně podmíněná generativní pipeline tohoto druhu často používá počáteční klíčové snímky jako výchozí bod pro modelové vedení, VideoAuteur rozšiřuje tento paradigm tím, že generuje vícedílné vizuální stavy v sémanticky koherentním latentním prostoru, vyhýbaje se potenciálnímu zkreslení založenému na “počátečních snímcích”.

Schéma pro použití vizuálních stavových vložek jako lepší kondiční metody.
Testy
V souladu s metodami SeedStory, vědci používají SEED-X pro aplikaci LoRA jemného ladění na jejich vyprávěcí datové sadě, popisují výsledek jako “Sora-like model”, předškoleno na velkém měřítku video/textových párů, a schopného přijímat jak vizuální, tak textové podněty a podmínky.
32 000 vyprávěcích videí bylo použito pro vývoj modelu, s 1 000 držených stranou jako validační vzorky. Videá byla oříznuta na 448 pixelů na kratší straně a poté středově oříznuta na 448x448px.
Pro školení byla generace vyprávění hodnocena primárně na YouCook2 validační sadě. Howto100M sada byla použita pro hodnocení kvality dat a také pro generaci obrazu-na-video.
Pro vizuální kondiční ztrátu autoři použili difuzní ztrátu z DiT a 2024 práce založené kolem Stability.ai.
Pro prokázání svého tvrzení, že proložená metoda je lepší, autoři postavili VideoAuteur proti několika metodám, které spoléhají pouze na textový vstup: EMU-2, SEED-X, SDXL a FLUX.1-schnell (FLUX.1-s).

Daný globální podnět, ‘Krok za krokem průvodce vařením mapo tofu’, proložený režisér generuje akce, popisky a obrazové vložky sekvenčně, aby vyprávěl proces. První dvě řádky ukazují klíčové snímky dekódované z EMU-2 a SEED-X latentních prostorů. Tyto obrázky jsou realistické a konzistentní, ale méně vysoce kvalitní než ty z pokročilých modelů, jako jsou SDXL a FLUX.
Autoři uvádějí:
‘Jazykově centrický přístup pomocí text-to-image modelů produkuje vizuálně atraktivní klíčové snímky, ale trpí nedostatkem konzistence napříč snímky kvůli omezené vzájemné informaci. Naopak, proložená generativní metoda využívá jazykově zarovnané vizuální latence, dosahující realistického vizuálního stylu prostřednictvím školení.
‘Nicméně, občas generuje obrázky s opakujícími se nebo šumivými prvky, protože auto-regresivní model bojuje s vytvořením přesných vložek v jednom průchodu.’
Lidské hodnocení dále potvrzuje autoři tvrzení o zlepšené výkonnosti proložené metody, s proloženými metodami dosahujícími nejvyšších skóre v průzkumu.

Porovnání přístupů z lidského průzkumu provedeného pro článek.
Nicméně, jazykově centrické přístupy dosahují nejlepších estetických skóre. Autoři tvrdí, že to však není centrální otázka při generování dlouhých vyprávěcích videí.
Klikněte na přehrávání. Segmenty generované pro video o stavbě pizzy, od VideoAuteur.
Závěr
Nejoblíbenější směr výzkumu v souvislosti s touto výzvou, tj. vyprávěcí konzistence v dlouhém formátu generování videa, se týká jednotlivých obrázků. Projekty tohoto druhu zahrnují DreamStory, StoryDiffusion, TheaterGen a NVIDIA’s ConsiStory.
V jistém smyslu, VideoAuteur také spadá do této “statické” kategorie, protože využívá počátečních obrázků, ze kterých jsou generovány klipové sekce. Nicméně, proložené video a sémantický obsah přivádějí proces o krok blíže k praktickému potrubí.
Poprvé zveřejněno ve čtvrtek, 16. ledna 2025












