Modely a platformy AI

Překlenutí mezery ve generativním videu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Images taken from the FCVG paper and project site, https://arxiv.org/pdf/2412.11755 and https://fcvg-inbetween.github.io/

Nový výzkum z Číny nabízí vylepšenou metodu interpolace mezery mezi dvěma časově vzdálenými snímky videa – jednu z nejzávažnějších výzev v současném závodě směrem k realističnosti generativního videa AI, stejně jako pro kompresi videa.

V příkladu videa níže vidíme v levém sloupci “začátek” (nahoře vlevo) a “konec” (dole vlevo) snímek. Úkolem soutěžících systémů je uhodnout, jak by se předmět ve dvou obrazech dostal ze snímku A do snímku B. V animaci se tento proces nazývá tweening a sahá až do éry němého filmu.

Kliknutím spustíte přehrávání. V prvním, levém sloupci, vidíme navrhovaný začátek a konec snímku. Ve středním sloupci a na vrcholu třetího (pravého) sloupce vidíme tři předchozí přístupy k této výzvě. V pravém dolním rohu vidíme, že nová metoda dosahuje mnohem přesvědčivějšího výsledku při poskytování mezilehlých snímků. Zdroj: https://fcvg-inbetween.github.io/

Nová metoda navržená čínskými výzkumníky se nazývá Frame-wise Conditions-driven Video Generation (FCVG), a její výsledky lze vidět v pravém dolním rohu videa výše, poskytující hladký a logický přechod z jednoho statického snímku na další.

Na rozdíl od toho můžeme vidět, že jeden z nejuznávanějších rámců pro interpolaci videa, projekt Frame Interpolation for Large Motion (FILM) od Googlu, zápasí, stejně jako mnohé podobné projekty, s interpretací velkých a odvážných pohybů.

Dva další rivalitní rámce zobrazené ve videu, Time Reversal Fusion (TRF) a Generative Inbetweening (GI), poskytují méně zkreslenou interpretaci, ale vytvořily frenetické a dokonce komické taneční pohyby, aniž by respektovaly implicitní logiku dvou dodaných snímků.

Kliknutím spustíte přehrávání. Dvě nedokonalé řešení problému tweeningu. Vlevo, FILM zachází se dvěma snímky jako s jednoduchými cíli morfologie. Vpravo, TRF ví, že nějaký druh tance musí být vložen, ale přichází s nerealizovatelným řešením, které prokazuje anatomické anomálie.

Nahoře vlevo můžeme vidět, jak FILM přistupuje k problému. Ačkoli FILM byl navržen tak, aby mohl zvládat velké pohyby, na rozdíl od předchozích přístupů založených na optickém toku, stále postrádá sémantické pochopení toho, co by se mělo stát mezi dvěma dodanými snímky, a jednoduše provede morfologii mezi snímky 80. a 90. let.

FCVG, vidět níže, dělá mnohem uvěřitelnější práci při odhadu pohybu a obsahu mezi dvěma snímky:

Kliknutím spustíte přehrávání. FCVG zlepšuje předchozí přístupy, ale je daleko od dokonalosti.

Stále existují artefakty, jako je nežádoucí morfologie rukou a obličeje, ale tato verze je povrchově nejvěrohodnější – a jakékoli zlepšení současného stavu musí být považováno za obtížnost úkolu; a velkou překážku, kterou tato výzva představuje pro budoucnost videa generovaného umělou inteligencí.

Proč interpolace matters

Jak jsme ukázali dříve, schopnost přesvědčivě vyplnit videoobsah mezi dvěma uživatelsky dodanými snímky je jedním z nejlepších způsobů, jak udržet časovou konzistenci v generativním videu, protože dva reálné a po sobě jdoucí snímky stejné osoby budou přirozeně obsahovat konzistentní prvky, jako je oblečení, vlasy a prostředí.

Když je použit pouze jeden počáteční snímek, omezené okno pozornosti generativního systému, které často bere v úvahu pouze blízké snímky, bude mít tendenci postupně “vyvíjet” aspekty předmětu, dokud (například) muž se nestane jiným mužem (nebo ženou), nebo prokáže “morfologii” oblečení – mezi mnoha dalšími rozptýleními, které jsou běžně generovány v otevřených zdrojových systémech T2V a ve většině placených řešení, jako je Kling:

Kliknutím spustíte přehrávání. Feeding the new paper’s two (real) source frames into Kling, with the prompt ‘A man dancing on a roof’, did not result in an ideal solution. Though Kling 1.6 was available at the time of creation, V1.5 is the latest to support user-input start and end frames. Source: https://klingai.com/

Je problém již vyřešen?

Na rozdíl od toho některé komerční, uzavřené a proprietární systémy似乎 dělají lépe s touto výzvou – zejména RunwayML, který byl schopen vytvořit velmi přesvědčivé mezilehlé snímky dvou zdrojových snímků:

Kliknutím spustíte přehrávání. RunwayML’s diffusion-based interpolation je velmi efektivní. Source: https://app.runwayml.com/

Opakující se cvičení, RunwayML produkoval druhý, stejně uvěřitelný výsledek:

Kliknutím spustíte přehrávání. Druhý běh RunwayML sekvence.

Jedním z problémů je, že nemůžeme nic naučit o výzvách, ani pokročit ve stavu umění otevřených zdrojů, z proprietárního systému. Nemůžeme vědět, zda tato lepší renderace byla dosažena jedinečnými architektonickými přístupy, daty (nebo metodami kurace dat, jako je filtrování a anotace), nebo kombinací těchto a dalších možných inovací výzkumu.

Druhým problémem je, že menší společnosti, jako jsou vizuální efekty, nemohou dlouhodobě spoléhat na B2B API poháněné služby, které by mohly potenciálně podkopat jejich logistické plánování s jednou cenovou úpravou – zejména pokud by jedna služba přišla dominovat trhu a tudíž byla více nakloněna zvyšovat ceny.

Když práva jsou špatná

Mnohem důležitější je, že pokud je dobře fungující komerční model trénován na nelicencovaných datech, jako parece být případem s RunwayML, jakékoli společnosti, které používají tyto služby, riskují down-stream právní expozici.

Pokud zákony (a některé žaloby) trvají déle než prezidenti, a pokud je klíčový trh USA mezi nejvíce žalujícími na světě, současný trend směrem k větší legislativní kontrole pro data pro trénování AI parece pravděpodobně přežít “lehký dotek” příštího prezidentského období Donalda Trumpa.

Tudíž sektor počítačového vidění bude muset řešit tuto výzvu tvrdým způsobem, aby jakékoli vznikající řešení mohlo vydržet dlouhodobě.

FCVG

Nová metoda z Číny je prezentována v papíru nazvaném Generative Inbetweening through Frame-wise Conditions-Driven Video Generation, a pochází od pěti výzkumníků z Harbin Institute of Technology a Tianjin University.

FCVG řeší problém nejednoznačnosti v úkolu interpolace pomocí frame-wise podmínek, společně s rámcem, který vymezuje hrany v uživatelsky dodaných počátečních a koncových snímcích, což pomáhá procesu udržet konzistentnější stopu přechodů mezi jednotlivými snímky a také celkový efekt.

Frame-wise podmínky zahrnují rozdělení vytváření mezilehlých snímků na podúkoly, místo toho, aby se pokusily vyplnit velmi velkou sémantickou prázdnotu mezi dvěma snímky (a čím delší je požadovaný výstup videa, tím větší je sémantická vzdálenost).

V grafu níže, z papíru, autoři porovnávají výše zmíněnou metodu time-reversal (TRF) se svou. TRF vytváří dvě cesty generování videa pomocí předtrénovaného modelu obraz-na-video (SVD). Jedna je “forward” cesta podmíněná počátečním snímkem, a druhá “backward” cesta podmíněná koncovým snímkem. Obě cesty začínají ze stejného náhodného šumu. To je znázorněno vlevo od obrázku níže:

Porovnání předchozích přístupů s FCVG. Zdroj: https://arxiv.org/pdf/2412.11755

Porovnání předchozích přístupů s FCVG. Zdroj: https://arxiv.org/pdf/2412.11755

Autoři tvrdí, že FCVG je zlepšením oproti metodám time-reversal, protože snižuje nejednoznačnost ve generování videa, poskytováním explicitních podmínek pro každý snímek, což vede k více stabilnímu a konzistentnímu výstupu.

Metody time-reversal, jako je TRF, mohou vést k nejednoznačnosti, protože forward a backward generovací cesty mohou divergovat, způsobující nesoulad nebo nekonzistence. FCVG řeší tuto problematiku pomocí frame-wise podmínek odvozených z odpovídajících linek mezi počátečním a koncovým snímkem (dolní pravá část obrázku výše), které řídí proces generování.

Kliknutím spustíte přehrávání. Další porovnání z projektu FCVG.

Time reversal umožňuje použití předtrénovaných modelů generování videa pro interpolaci, ale má některé nevýhody. Pohyb generovaný modely I2V je různorodý spíše než stabilní. Zatímco je to užitečné pro čistá úkoly obraz-na-video (I2V), vytváří nejednoznačnost a vede k nesouladným nebo nekonzistentním cestám videa.

Time reversal také vyžaduje náročné ladění hyperparametrů, jako je frame rate pro každý generovaný video. Kromě toho některé z technik použitých v time reversal pro snížení nejednoznačnosti výrazně zpomalují inference, zvyšují dobu zpracování.

Metoda

Autoři pozorují, že pokud lze vyřešit první z těchto problémů (různorodost vs. stabilita), všechny ostatní následující problémy se pravděpodobně vyřeší samy. To bylo již dříve pokoušeno v předchozích nabídkách, jako je výše zmíněný GI, a také ViBiDSampler.

Paper uvádí:

‘Nicméně [tam] stále existuje značná náhodnost mezi těmito cestami, což omezuje účinnost těchto metod při zpracování scénářů s velkými pohyby, jako jsou rychlé změny lidských póz. Nejednoznačnost v interpolované cestě primárně vzniká z nedostatečných podmínek pro mezilehlé snímky, protože dva vstupní obrázky poskytují podmínky pouze pro počáteční a koncové snímky.’

‘Proto [my] navrhujeme poskytnout explicitní podmínku pro každý snímek, což výrazně zmírňuje nejednoznačnost interpolované cesty.’

Můžeme vidět základní koncepty FCVG v akci v schématu níže. FCVG generuje sekvenci video snímků, které začínají a končí konzistentně se dvěma vstupními snímky. To zajišťuje, že snímky jsou časově stabilní, poskytují frame-specifické podmínky pro proces generování videa.

Schéma pro inference FCVG.

Schéma pro inference FCVG.

V tomto přehodnocení přístupu time-reversal kombinuje informace z obou forward a backward směrů, míchá je, aby vytvořily hladké přechody. Prostřednictvím iterativního procesu model postupně rafinuje šumivé vstupy, dokud není vytvořena konečná sada mezilehlých snímků.

Další fáze zahrnuje použití předtrénovaného GlueStick line-matching modelu, který vytváří korespondence mezi dvěma vypočítanými počátečními a koncovými snímky, s možným použitím skeletálních póz pro vedení modelu, prostřednictvím modelu Stable Video Diffusion.

GlueStick odvozuje linie z interpretovaných tvarů. Tyto linie poskytují odpovídající kotvy mezi počátečním a koncovým snímkem v FCVG*.

GlueStick odvozuje linie z interpretovaných tvarů. Tyto linie poskytují odpovídající kotvy mezi počátečním a koncovým snímkem v FCVG*.

Autoři poznamenávají:

‘Empiricky jsme zjistili, že lineární interpolace je dostatečná pro většinu případů, aby zajišťovala časovou stabilitu v mezilehlých videích, a naše metoda umožňuje uživatelům specifikovat nelineární interpolované cesty pro generování požadovaných [videí].’

Pracovní postup pro stanovení forward a backward frame-wise podmínek. Můžeme vidět odpovídající barvy, které udržují obsah konzistentním, jak se animace vyvíjí.

Pracovní postup pro stanovení forward a backward frame-wise podmínek. Můžeme vidět odpovídající barvy, které udržují obsah konzistentním, jak se animace vyvíjí.

Pro vložení získaných frame-wise podmínek do SVD používá FCVG metodu vyvinutou pro iniciativu ControlNeXt z roku 2024. V tomto procesu jsou kontrolní podmínky inicializovány pomocí více ResNet bloků, před cross-normalizací mezi podmínkami a větvemi SVD workflow.

Malá sada videí je použita pro fine-tuning modelu SVD, zatímco většina parametrů modelu je zmražena.

‘Tyto [výše zmíněné limitace] byly značně vyřešeny v FCVG: (i) poskytnutím explicitní podmínky pro každý snímek, nejednoznačnost mezi forward a backward cestami je výrazně zmírněna; (ii) pouze jeden tuneable [parametr je zaveden], zatímco hyperparametry v SVD jsou ponechány ve výchozím stavu, což vede k příznivým výsledkům ve většině scénářů; (iii) jednoduchá průměrná fúze, bez reinjekce šumu, je dostatečná v FCVG, a kroky inference lze podstatně snížit o 50% ve srovnání s [GI].’

Široké schéma pro vložení frame-wise podmínek do Stable Video Diffusion pro FCVG.

Široké schéma pro vložení frame-wise podmínek do Stable Video Diffusion pro FCVG.

Data a testy

Pro testování systému výzkumníci kuratovali dataset s rozmanitými scénáři, včetně venkovních prostředí, lidských póz a vnitřních lokalit, včetně pohybů, jako je pohyb kamery, taneční akce a mimické výrazy, mezi jinými. 524 vybraných klipů bylo взято z datasetů DAVIS a RealEstate10k. Tato sbírka byla doplněna high-frame-rate videy získanými z Pexels. Kurátorská sada byla rozdělena 4:1 mezi fine-tuning a testování.

Metriky použité byly Learned Perceptual Similarity Metrics (LPIPS); Fréchet Inception Distance (FID); Fréchet Video Distance (FVD); VBench; a Fréchet Video Motion Distance.

Autoři poznamenávají, že žádná z těchto metrik není dobře přizpůsobena pro odhad časové stability, a odkazují nás na videa na stránce projektu FCVG.

Kromě použití GlueStick pro line-matching byl použit DWPose pro odhad lidských póz.

Fine-tuning proběhlo po 70 000 iteracích pod AdamW optimalizátorem na NVIDIA A800 GPU, při learning rate 1×10-6, se snímky oříznutými na 512×320 patche.

Rivalitní předchozí rámce testované byly FILM, GI, TRF a DynamiCrafter.

Pro kvantitativní hodnocení byly mezery mezi snímky v rozsahu 12 až 23.

Kvantitativní výsledky proti předchozím rámcům.

Kvantitativní výsledky proti předchozím rámcům.

Ohledně těchto výsledků paper uvádí:

‘Naše metoda dosahuje nejlepších výsledků mezi čtyřmi generativními přístupy napříč všemi metrikami. Pokud jde o srovnání LPIPS s FILM, náš FCVG je marginálně horší, zatímco prokazuje lepší výkon v jiných metrikách. Při zvažování absence časové informace v LPIPS může být vhodnější priorizovat jiné metriky a vizuální pozorování. ‘

‘Navíc, při srovnání výsledků pod různými mezilehlými snímky, FILM může fungovat dobře, když je mezera malá, zatímco generativní metody jsou vhodnější pro velké mezery. Mezi těmito generativními metodami naše FCVG prokazuje významnou superioritu díky svým explicitním frame-wise podmínkám.’

Pro kvalitativní testování autoři vytvořili videa zobrazená na stránce projektu (některá jsou vložena do tohoto článku), a statické a animované výsledky v PDF papíru,

Vzorkové statické výsledky z papíru. Prosím, odkážete se na zdroj PDF pro lepší rozlišení a být vědomi, že PDF obsahuje animace, které lze přehrát v aplikacích, které podporují tuto funkci.

Vzorkové statické výsledky z papíru. Prosím, odkážete se na zdroj PDF pro lepší rozlišení a být vědomi, že PDF obsahuje animace, které lze přehrát v aplikacích, které podporují tuto funkci.

Autoři komentují:

‘Zatímco FILM produkuje hladké interpolované výsledky pro malé pohyby, zápasí s velkými pohyby kvůli vrozeným limitacím optického toku, což vede k nápadným artefaktům, jako je pohyb pozadí a rukou (v prvním případě). ‘

‘Generativní modely, jako je TRF a GI, trpí nejednoznačnostmi ve fúzních cestách, vedoucích k nestabilnímu mezilehlému pohybu, zvláště patrnému v komplexních scénách zahrnujících lidský a objektový pohyb. ‘

‘Naopak, naše metoda konzistentně dodává uspokojivé výsledky napříč různými scénáři.’ I když je přítomno významné zakrytí (ve druhém a šestém případě), naše metoda může stále zachytit rozumný pohyb. Kromě toho, náš přístup prokazuje odolnost vůči komplexním lidským akcím (v posledním případě).’

Autoři také zjistili, že FCVG generalizuje neobvykle dobře na animační styl videa:

Kliknutím spustíte přehrávání. FCVG produkuje velmi přesvědčivé výsledky pro kreslenou animaci.

Závěr

FCVG představuje alespoň incrementální zlepšení pro stav umění v interpolaci snímků v ne-proprietárním kontextu. Autoři zpřístupnili kód pro tuto práci na GitHubu, i když přidružený dataset nebyl uvolněn v době psaní.

Pokud proprietární komerční řešení překonávají otevřené zdrojové úsilí pomocí webových, nelicencovaných dat, zdá se, že není žádná budoucnost v takovém přístupu, alespoň pro komerční použití; rizika jsou prostě příliš velká.

Tudíž, i když otevřená scéna zaostává za působivou ukázkou současných lídrů trhu, je, zřejmě, želva, která může porazit zajíce na cílové čáře.

 

* Zdroj: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf

Requires Acrobat Reader, Okular, or any other PDF reader that can reproduce embedded PDF animations.

 

První publikováno v pátek, 20. prosince 2024

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai