Modely a platformy AI

Stabilní Video Difúze: Latentní Video Difúzní Modely pro Velké Soubory Dat

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Generativní AI je již delší dobu hnací silou komunity AI a pokroky, kterých bylo dosaženo v oblasti generativního modelování obrazů, zejména s použitím difúzních modelů, pomohly generativním video modelům výrazně pokročit nejen ve výzkumu, ale i v reálných aplikacích. Obvykle jsou generativní video modely trénovány buď od začátku, nebo jsou částečně nebo úplně fine-tunovány z předtrénovaných modelů obrazů s extra časovými vrstvami, na směsi obrazových a video dat.

Pokračujíc v pokrocích generativních video modelů, v tomto článku budeme hovořit o Stabilním Video Difúzním Modelu, latentním video difúzním modelu, který je schopen generovat vysoké rozlišení, špičkové obrázky a textové videoobsahy. Budeme hovořit o tom, jak latentní difúzní modely trénované pro syntézu 2D obrazů zlepšily schopnosti a efektivitu generativních video modelů přidáním časových vrstev a fine-tunováním modelů na malých datech s vysokou kvalitou. Budeme se blíže zabývat architekturou a fungováním Stabilního Video Difúzního Modelu a vyhodnotíme jeho výkon na různých metrikách a porovnáme ho se současnými špičkovými rámci pro generování videa. Takže začněme.

Stabilní Video Difúze a Generativní Video Modely: Úvod

Díky jeho téměř neomezenému potenciálu je Generativní AI hlavním předmětem výzkumu pro AI a ML praktiky již nějakou dobu a minulé roky viděly rychlé pokroky jak v účinnosti, tak v výkonu generativních obrazových modelů. Získané poznatky z generativních obrazových modelů umožnily výzkumníkům a vývojářům udělat pokroky v generativních video modelech, což vedlo ke zvýšené praktičnosti a reálným aplikacím. Nicméně, většina výzkumu, který se snaží zlepšit schopnosti generativních video modelů, se zaměřuje primárně na přesnou úpravu časových a prostorových vrstev, s malou pozorností věnovanou prozkoumání vlivu výběru správných dat na výsledek těchto generativních modelů.

Díky pokrokům generativních obrazových modelů, výzkumníci pozorovali, že dopad trénovací datové distribuce na výkon generativních modelů je skutečně významný a nesporný. Kromě toho, výzkumníci také pozorovali, že předtrénování generativního obrazového modelu na velkém a rozmanitém datasetu následované fine-tunováním na menším datasetu s lepší kvalitou často vede ke zlepšení výkonu. Tradičně, generativní video modely implementují poznatky získané z úspěšných generativních obrazových modelů a výzkumníci dosud nestudovali efekt dat a trénovacích strategií. Stabilní Video Difúzní Model je pokus o zlepšení schopností generativních video modelů tím, že se vydá do dříve nezkoumaných území se zvláštním zaměřením na výběr dat.

Poslední generativní video modely spoléhají na difúzní modely a textové nebo obrazové podmínky pro syntézu více konzistentních video nebo obrazových rámců. Difúzní modely jsou známé svou schopností naučit se, jak postupně odstranit šum z normálního rozložení implementací iterativního procesu jemnění, a dosáhly žádoucích výsledků na vysoké rozlišení videa a text-to-obrázek syntéze. Používající stejný princip ve svém jádru, Stabilní Video Difúzní Model trénuje latentní video difúzní model na svém video datasetu spolu s použitím Generativních Adversativních Sítí nebo GANů a dokonce autoregresivních modelů do jisté míry.

Stabilní Video Difúzní Model následuje jedinečnou strategii, která nebyla dosud implementována žádným generativním video modelem, protože spoléhá na latentní video difúzní základny s pevnou architekturou a pevnou trénovací strategií následovanou hodnocením efektu kurace dat. Stabilní Video Difúzní Model se snaží učinit následující příspěvky v oblasti generativního video modelování.

  1. Předložit systematický a efektivní workflow pro kuraci dat v pokusu o přeměnu velké kolekce nekuratovaných video vzorků na dataset s vysokou kvalitou, který je poté použit generativními video modely.
  2. Trénovat špičkové modely pro syntézu obrazu na video a textu na video, které překonávají existující rámce.
  3. Provádět doménově specifické experimenty pro prozkoumání 3D pochopení a silného motion prioru modelu.

Nyní, Stabilní Video Difúzní Model implementuje poznatky z Latentních Video Difúzních Modelů a technik kurace dat v jádru své základny.

Latentní Video Difúzní Modely

Latentní Video Difúzní Modely nebo Video-LDM následují přístup trénování primárního generativního modelu v latentním prostoru s redukovanou výpočetní složitostí, a většina Video-LDM implementuje předtrénovaný text-to-obrázek model spojený s přidáním časových mixovacích vrstev v předtrénovací architektuře. Jako výsledek, většina Video Latentních Difúzních Modelů buď trénuje pouze časové vrstvy, nebo úplně vynechává trénovací proces, na rozdíl od Stabilního Video Difúzního Modelu, který fine-tunuje celý rámec. Kromě toho, pro syntézu textu na video data, Stabilní Video Difúzní Model přímo kondicionuje sám sebe na textový prompt, a výsledky ukazují, že výsledný rámec může být fine-tunován na multi-view syntézu nebo obraz-na-video model snadno.

Data Kurace

Data Kurace je nezbytnou součástí nejen Stabilního Video Difúzního Modelu, ale i generativních modelů jako celku, protože je nezbytné předtrénovat velké modely na velkých datech, aby se zlepšil výkon napříč různými úkoly, včetně jazykového modelování nebo diskriminativního textu na obraz generování a mnohem více. Data Kurace byla úspěšně implementována na generativních obrazových modelech pomocí možností efektivní jazyk-obrázek reprezentace, ačkoli takové diskuze nebyly dosud zaměřeny na vývoj generativních video modelů. Existuje několik překážek, kterým vývojáři čelí při kuraci dat pro generativní video modely, a aby se tyto výzvy překonaly, Stabilní Video Difúzní Model implementuje tří-stupňovou trénovací strategii, což vede k vylepšením výsledků a výraznému zvýšení výkonu.

Data Kurace pro Vysokou Kvalitu Video Syntézy

Jak bylo diskutováno v předchozí sekci, Stabilní Video Difúzní Model implementuje tří-stupňovou trénovací strategii, což vede k vylepšením výsledků a výraznému zvýšení výkonu. První stupeň je obrazová předtrénovací fáze, která využívá 2D text-to-obrázek difúzní model. Druhý stupeň je pro video předtrénování, ve kterém rámec trénuje na velkém množství video dat. Nakonec, máme třetí stupeň pro video fine-tunování, ve kterém je model rafinován na malém podmnožině vysokokvalitních a vysokorozlišitelných videí.

Nicméně, předtím, než Stabilní Video Difúzní Model implementuje tyto tři stupně, je nezbytné zpracovat a annotovat data, protože slouží jako základ pro druhý stupeň nebo video předtrénovací fázi, a hraje kritickou roli při zajišťování optimálního výstupu. Aby se zajistila maximální efektivita, rámec nejprve implementuje kaskádový detekční pipeline ve třech různých úrovních FPS nebo snímcích za sekundu, a potřeba tohoto pipeline je demonstrována v následujícím obrázku.

Dále, Stabilní Video Difúzní Model anotuje každý video klip pomocí tří různých syntetických metod popisu. Následující tabulka porovnává datové sady použité ve Stabilním Difúzním Rámci před a po filtraci.

Stupeň I: Obrazová Předtrénovací

První stupeň ve tří-stupňovém pipeline implementovaném ve Stabilním Video Difúzním Modelu je obrazová předtrénovací fáze, a aby se toho dosáhlo, počáteční Stabilní Video Difúzní Model je založen na předtrénovaném obrazovém difúzním modelu, konkrétně Stabilní Difúze 2.1 modelu, který vybavuje silnějšími vizuálními reprezentacemi.

Stupeň II: Video Předtrénování

Druhý stupeň je video předtrénovací fáze, a tato fáze staví na poznatcích, že použití kurace dat v multimodálních generativních obrazových modelech často vede k lepším výsledkům a zvýšené efektivitě spolu se silnou diskriminativní obrazovou generací. Nicméně, kvůli nedostatku podobných silných předem připravených reprezentací pro filtrování nežádoucích vzorků pro generativní video modely, Stabilní Video Difúzní Model spoléhá na lidské preference jako vstupní signály pro tvorbu vhodného datasetu pro předtrénování rámce. Následující obrázek demonstruje pozitivní efekt předtrénování rámce na kuratovaném datasetu, který pomáhá zvýšit celkový výkon pro video předtrénování na menších datech.

Abychom byli konkrétnější, rámec používá různé metody pro kuraci podmnožin Latentního Video Difúze a zvažuje hodnocení LVD modelů trénovaných na těchto datech. Kromě toho, Stabilní Video Difúzní rámec také zjistil, že použití kuratovaných dat pro trénování rámců pomáhá zvýšit výkon rámce a difúzních modelů obecně. Kromě toho, strategie kurace dat také funguje na větších, relevantnějších a praktičtějších datech. Následující obrázek demonstruje pozitivní efekt předtrénování rámce na kuratovaném datasetu, který pomáhá zvýšit celkový výkon pro video předtrénování na menších datech.

Stupeň III: Vysoká Kvalita Fine-tunování

Až do druhého stupně, Stabilní Video Difúzní rámec se zaměřuje na zlepšení výkonu před video předtrénováním, a ve třetím stupni, rámec klade důraz na optimalizaci nebo další zlepšení výkonu rámce po vysoké kvalitě video fine-tunování, a jak je přechod ze druhého stupně na třetí stupeň dosažen v rámcu. Ve třetím stupni, rámec čerpá z trénovacích technik vypůjčených z latentních obrazových difúzních modelů a zvyšuje rozlišení trénovacích příkladů. Aby se analyzovala účinnost tohoto přístupu, rámec porovnává jej se třemi identickými modely, které se liší pouze inicializací. První identický model má inicializované váhy a video trénovací proces je vynechán, zatímco zbývající dva identické modely jsou inicializovány váhami vypůjčenými z jiných latentních video modelů.

Výsledky a Zjištění

Je čas se podívat, jak Stabilní Video Difúzní rámec funguje na reálných úkolech a jak se porovnává se současnými špičkovými rámci. Stabilní Video Difúzní rámec nejprve používá optimální přístup k datům pro trénování základního modelu a poté provádí fine-tunování pro generování několika špičkových modelů, kde každý model plní specifický úkol.

Výše uvedený obrázek reprezentuje vysoké rozlišení obrazových vzorků na video generovaných rámcem, zatímco následující obrázek demonstruje schopnost rámce generovat vysoké kvality textové video vzorky.

Předtrénovaný Základní Model

Jak bylo diskutováno dříve, Stabilní Video Difúzní model je založen na Stabilní Difúzi 2.1 rámci, a na základě nedávných zjištění, bylo důležité pro vývojáře přijmout šumový harmonogram a zvýšit šum, aby se získaly obrázky s lepšími rozlišeními při trénování obrazových difúzních modelů. Díky tomuto přístupu, Stabilní Video Difúzní základní model učí silné motion reprezentace a v procesu, překonává základní modely pro text na video generování v nulovém snímku, a výsledky jsou zobrazeny v následující tabulce.

Interpolace Snímků a Multi-View Generace

Stabilní Video Difúzní rámec fine-tunuje obraz na video model na multi-view datech, aby získal více nových pohledů na objekt, a tento model je známý jako SVD-MV nebo Stabilní Video Difúze-Multi View model. Původní SVD model je fine-tunován s pomocí dvou dat ve způsobu, že rámec vstupuje do jediného obrázku a vrací sekvenci multi-view obrázků jako výstup.

Jak je vidět na následujícím obrázku, Stabilní Video Difúzní Multi View rámec dosahuje vysoké výkony srovnatelné se špičkovými Scratch Multi View rámcem, a výsledky jsou jasnou demonstrací SVD-MV schopnosti využít poznatky získané z původního SVD rámce pro multi-view obraz generaci. Kromě toho, výsledky také ukazují, že běh modelu pro relativně menší počet iterací pomáhá dosáhnout optimálních výsledků, stejně jako u většiny modelů fine-tunovaných z SVD rámce.

Na výše uvedeném obrázku jsou metriky uvedeny na levé straně a jak je vidět, Stabilní Video Difúzní Multi View rámec překonává Scratch-MV a SD2.1 Multi-View rámec o solidní marži. Druhý obrázek demonstruje efekt počtu trénovacích iterací na celkový výkon rámce vzhledem k Clip Score, a SVD-MV rámce dosahují udržitelných výsledků.

Závěrečné Myšlenky

V tomto článku, jsme hovořili o Stabilní Video Difúzi, latentním video difúzním modelu, který je schopen generovat vysoké rozlišení, špičkové obrazové a textové videoobsahy. Stabilní Video Difúzní Model následuje jedinečnou strategii, která nebyla dosud implementována žádným generativním video modelem, protože spoléhá na latentní video difúzní základny s pevnou architekturou a pevnou trénovací strategií následovanou hodnocením efektu kurace dat.

Hovořili jsme o tom, jak latentní difúzní modely trénované pro syntézu 2D obrazů zlepšily schopnosti a efektivitu generativních video modelů přidáním časových vrstev a fine-tunováním modelů na malých datech s vysokou kvalitou. Abychom získali předtrénovací data, rámec provádí škálovací studii a následuje systematické datové sběrné postupy, a nakonec navrhuje metodu pro kuraci velkého množství video dat a přeměnu šumu na vstupní data vhodná pro generativní video modely.

Kromě toho, Stabilní Video Difúzní rámec zaměstnává tři odlišné video modelové trénovací stupně, které jsou analyzovány nezávisle, aby se posoudil jejich dopad na výkon rámce. Rámec nakonec vrací video reprezentaci dostatečně silnou pro fine-tunování modelů pro optimální video syntézu, a výsledky jsou srovnatelné se špičkovými video generativními modely, které jsou již v použití.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.