Modely a platformy AI
DynamiCrafter: Animace otevřených obrazových snímků s video difuzními předchozími znalostmi
Počítačové vidění je jedním z nejzajímavějších a nejvíce prozkoumaných oborů v komunitě AI dnes, a navzdory rychlému vylepšování modelů počítačového vidění, stále existuje dlouholetá výzva, která stále trápí vývojáře, a to animace obrazů. I dnes, rámce animace obrazů bojují s konverzí statických obrazů na jejich příslušné video protějšky, které zobrazují přirozenou dynamiku, zatímco zachovávají původní vzhled obrazů. Tradičně, rámce animace obrazů se zaměřují primárně na animaci přírodních scén s doménou-specifickými pohyby, jako je lidské vlasy nebo pohyby těla, nebo stochastickými dynamikami, jako jsou tekutiny a mraky. Ačkoli tento přístup funguje do určité míry, omezuje to použitelnost těchto rámců animace na více generických vizuálních obsahů.
Navíc, konvenční přístupy k animaci obrazů se zaměřují primárně na syntézu oscilujících a stochastických pohybů, nebo na přizpůsobení pro specifické kategorie objektů. Nicméně, významnou vadou tohoto přístupu je silná předpoklad, která je uložena na tyto metody, což nakonec omezuje jejich použitelnost, zejména v obecných scénářích, jako je animace otevřených obrazových snímků. V posledních letech, T2V nebo Text to Video modely prokázaly pozoruhodný úspěch v generování živých a rozmanitých videí pomocí textových podnětů, a tato demonstrace T2V modelů je základem pro rámec DynamiCrafter.
Rámec DynamiCrafter je pokusem o překonání současných omezení modelů animace obrazů a rozšíření jejich použitelnosti na obecné scénáře zahrnující otevřené obrazové snímky. Rámec DynamiCrafter se snaží syntetizovat dynamický obsah pro otevřené obrazové snímky, přeměňující je na animované videá. Klíčovým nápadem za DynamiCrafterem je začlenit obraz jako vedení do generativního procesu, snažící se využít pohybové předchozí znalosti již existujících text-to-video difuzních modelů. Pro daný obraz, model DynamiCrafter nejprve implementuje dotazovací transformátor, který projektuje obraz do prostoru bohatého kontextu, umožňujícího videu modelu strávit obrazový obsah v kompatibilním způsobem. Nicméně, model DynamiCrafter stále bojuje s tím, aby zachoval některé vizuální detaily ve výsledných videích, problém, který model DynamiCrafter překonává tím, že krmit celý obraz do difuzního modelu spojením obrazu s počátečními šumy, a tím doplňující model o přesnější obrazové informace.
Tento článek se snaží pokrýt rámec DynamiCrafter v hloubce, a prozkoumáme mechanismus, metodologii, architekturu rámce spolu s jeho srovnáním se stávajícími rámci generace obrazů a videí. Takže pojďme začít.
DynamiCrafter : Animace otevřených obrazových snímků
Animace statického obrazu často nabízí atraktivní vizuální zkušenost pro publikum, protože se zdá, že přivádí statický obraz k životu. V průběhu let, mnoho rámců prozkoumalo různé metody animace statických obrazů. Počáteční rámce animace implementovaly fyzikální simulace založené na přístupu, který se zaměřoval na simulaci pohybu specifických objektů. Nicméně, kvůli nezávislému modelování každé kategorie objektů, tyto přístupy nebyly účinné ani neměly obecnou použitelnost. Pro replikaci více realistických pohybů, referenční metody se objevily, které přenesly pohyb nebo vzhled informací z referenčních signálů, jako jsou videa, do syntetického procesu. Ačkoli referenční metody dodaly lepší výsledky s lepší časovou koherencí ve srovnání se simulovanými přístupy, potřebovaly další vedení, které omezilo jejich praktické aplikace.
V posledních letech, většina rámců animace se zaměřuje primárně na animaci přírodních scén s stochastickými, doménou-specifickými nebo oscilujícími pohyby. Ačkoli přístup implementovaný těmito rámci funguje do určité míry, výsledky, které tyto rámce generují, nejsou uspokojivé, s významným prostorem pro zlepšení. Pozoruhodné výsledky, kterých dosáhly modely Text to Video v posledních letech, inspirovaly vývojáře rámce DynamiCrafter, aby využili silné generativní schopnosti modelů Text to Video pro animaci obrazů.
Klíčovým základem rámce DynamiCrafter je začlenit podmíněný obraz do videa generativního procesu Text to Video difuzních modelů. Nicméně, konečným cílem animace obrazů zůstává ne-triviální, protože animace obrazů vyžaduje zachování detailů, jakož i porozumění vizuálním kontextům, které jsou nezbytné pro vytváření dynamiky. Nicméně, multi-modální řiditelné video difuzní modely, jako je VideoComposer, se pokusily umožnit generaci videa s vizuálním vedením z obrazu. Nicméně, tyto přístupy nejsou vhodné pro animaci obrazů, protože vedou k náhlým časovým změnám nebo nízké vizuální shodě s vstupním obrazem, kvůli jejich méně komplexním mechanismům injekce obrazu. Pro překonání této překážky, rámec DynamiCrafter navrhuje duální injekční přístup, skládající se z vizuálního vedení detailů a textově-aligovaného kontextového представienia. Duální injekční přístup umožňuje rámcu DynamiCrafter zajistit, aby video difuzní model syntetizoval dynamický obsah, který zachovává detaily, v komplementárním způsobem.

Pro daný obraz, rámec DynamiCrafter nejprve projektuje obraz do prostoru bohatého kontextu, pomocí speciálně navržené sítě kontextového učení. Konkrétněji, prostor kontextového представienia se skládá z learnable dotazovacího transformátoru, který dále podporuje jeho adaptaci na difuzní modely, a předem trénovaného CLIP obrazového encoderu, který extrahuje textově-aligované obrazové rysy. Model poté používá bohaté kontextové rysy pomocí cross-attention vrstev, a model používá gated fúzi, aby kombinoval tyto textové rysy s cross-attention vrstvami. Nicméně, tento přístup obchoduje naučené kontextové представienia s textově-aligovanými vizuálními detaily, které umožňují sémantické porozumění obrazového kontextu a umožňují rozumnou a živou dynamiku být syntetizována. Navíc, v pokusu o doplnění dalších vizuálních detailů, rámec spojuje celý obraz s počátečními šumy do difuzního modelu. Jako výsledek, duální injekční přístup implementovaný rámcem DynamiCrafter zajišťuje vizuální shodu, jakož i věrohodný dynamický obsah, vstupnímu obrazu.
Pokračujeme, difuzní modely nebo DMs prokázaly pozoruhodný výkon a generativní sílu v T2I nebo Text to Image generaci. Pro replikaci úspěchu T2I modelů na video generaci, VDM nebo Video Diffusion Models jsou navrženy, které používají prostor-časově factorizovanou U-Net architekturu v pixelovém prostoru, aby modelovaly nízkorozlišené videa. Přenos učení z T2I rámců na T2V rámce pomůže snížit náklady na trénink. Ačkoli VDM nebo Video Diffusion Models mají schopnost generovat vysoce kvalitní videa, akceptují pouze textové podněty jako jediné sémantické vedení, které nemusí odrážet skutečné záměry uživatele nebo může být vágní. Nicméně, výsledky většiny VDM modelů zřídka dodržují vstupní obraz a trpí ne-reálnou časovou variací. Přístup DynamiCrafter je postaven na textově podmíněných Video Diffusion Modelech, které využívají jejich bohaté dynamické předchozí znalosti pro animaci otevřených obrazových snímků. Činí tak tím, že začleňují přizpůsobené návrhy pro lepší sémantické porozumění a shodu s vstupním obrazem.
DynamiCrafter : Metoda a Architektura
Pro daný statický obraz, rámec DynamiCrafter se snaží animovat obraz na video, tj. produkovat krátký video klip. Video klip dědí vizuální obsah z obrazu a zobrazuje přirozenou dynamiku. Nicméně, existuje možnost, že obraz se může objevit v libovolné poloze výsledné sekvence snímků. Výskyt obrazu v libovolné poloze je speciální typ výzvy pozorované v úkolech generace videa podmíněné obrazem s vysokými požadavky na vizuální shodu. Rámec DynamiCrafter překonává tuto výzvu tím, že využívá generativní předchozí znalosti předem trénovaných video difuzních modelů.
Obrazová Dynamika z Video Difuzní Předchozí Znalosti
Obvykle, otevřené text-to-video difuzní modely jsou známy tím, že zobrazují dynamický vizuální obsah modelovaný podmíněně na textových popisech. Pro animaci statického obrazu s generativními předchozími znalostmi Text to Video, rámce by měly nejprve injektovat vizuální informace do procesu generace videa komplexním způsobem. Navíc, pro dynamickou syntézu, T2V model by měl strávit obraz pro kontextové porozumění, zatímco by měl také být schopen zachovat vizuální detaily ve generovaných videích.

Textově-Aligované Kontextové Představienie
Pro vedení generace videa obrazovým kontextem, rámec DynamiCrafter se snaží projektovat obraz do aligovaného prostoru vložení, umožňujícího videu modelu použít obrazové informace v kompatibilním způsobem. Následně, rámec DynamiCrafter používá obrazový encoder, aby extrahoval obrazové rysy z vstupního obrazu, protože textové vložení jsou generována pomocí předem trénovaného CLIP textového encoderu. Nyní, ačkoli globální sémantické tokeny z CLIP obrazového encoderu jsou aligovány s obrazovými popisky, primárně reprezentují vizuální obsah na sémantické úrovni, a proto nedokáží zachytit plný rozsah obrazu. Rámec DynamiCrafter implementuje plné vizuální tokeny z poslední vrstvy CLIP encoderu, aby extrahoval více kompletní informace, protože tyto vizuální tokeny prokázaly vysokou věrnost v podmíněné generaci obrazů. Navíc, rámec používá kontextové a textové vložení, aby interagovaly s U-Net intermediálními rysy pomocí duálních cross-attention vrstev. Návrh tohoto komponentu ermögňuje modelu absorbovat obrazové podmínky v závislosti na vrstvě. Navíc, protože intermediální vrstvy U-Net architektury jsou více spojeny s objekty a tvary, je očekáváno, že obrazové rysy budou ovlivňovat vzhled videí převážně, protože dvě koncové vrstvy jsou více spojeny s vzhledem.
Vizuální Detailní Vedení
Rámec DynamiCrafter používá bohaté informační kontextové představienie, které umožňuje video difuznímu modelu v jeho architektuře produkovat videa, která se podobají vstupnímu obrazu blízce. Nicméně, jako je ukázáno v následujícím obrazu, generovaný obsah může zobrazit některé nesrovnalosti kvůli omezené schopnosti předem trénovaného CLIP encoderu zachovat vstupní informace kompletně, protože byl navržen pro aligování jazykových a vizuálních rysů.

Pro zlepšení vizuální shody, rámec DynamiCrafter navrhuje poskytnout video difuznímu modelu další vizuální detaily extrahované z vstupního obrazu. Pro dosažení tohoto, model DynamiCrafter spojuje podmíněný obraz s počátečními šumy a krmit je do denoisovací U-Net komponenty jako vedení.
Trénovací Paradigma
Rámec DynamiCrafter integruje podmíněný obraz prostřednictvím dvou komplementárních proudů, které hrají významnou roli v vedení detailů a kontextové kontrole. Pro facilitaci tohoto, model DynamiCrafter používá tří-krokový trénovací proces
- V prvním kroku, model trénuje síť kontextového učení.
- V druhém kroku, model adaptuje síť kontextového učení na Text to Video model.
- V třetím a konečném kroku, model fine-tunuje síť kontextového učení společně s komponentem Vizuálního Detailního Vedení.
Pro adaptaci obrazových informací pro kompatibilitu s modelem Text-to-Video (T2V), rámec DynamiCrafter navrhuje vývoj sítě kontextového učení, P, navržené pro zachycení textově-aligovaných vizuálních detailů z daného obrazu. Rozpoznávající, že P vyžaduje mnoho optimalizačních kroků pro konvergenci, přístup rámce zahrnuje inicializaci trénování pomocí jednoduššího Text-to-Image (T2I) modelu. Tato strategie umožňuje síti kontextového učení soustředit se na učení o obrazovém kontextu, než ji integruje s modelem T2V prostřednictvím společného trénování s P a prostorovými vrstvami, namísto temporálních vrstev, modelu T2V.
Pro zajištění kompatibility T2V, rámec DynamiCrafter spojuje vstupní obraz s počátečními šumy a fine-tunuje obě P a prostorové vrstvy modelu VDM. Tato metoda je zvolena pro zachování integrity existujících temporálních znalostí modelu T2V, bez negativních účinků husté injekce obrazu, které by mohly kompromitovat výkon a odchýlit se od našeho primárního cíle. Navíc, rámec používá strategii náhodného výběru video snímku jako obrazového vedení, aby dosáhl dvou cílů: (i) aby zabránil síti rozvoje předvídatelného vzoru, který přímo spojuje spojený obraz s konkrétní polohou snímku, a (ii) aby povzbudil více adaptabilní kontextové představienie, zabránit poskytování příliš rigidních informací pro jakýkoli konkrétní snímek.
DynamiCrafter : Experimenty a Výsledky
Rámec DynamiCrafter nejprve trénuje síť kontextového učení a obrazové cross-attention vrstvy na Stable Diffusion. Rámec poté nahrazuje Stable Diffusion komponentu s VideoCrafter a dále fine-tunuje síť kontextového učení a prostorové vrstvy pro adaptaci, a s obrazovou konkatencí. Při inferenci, rámec采用 DDIM sampler s multi-condition klasifikátorem-free vedením. Navíc, pro vyhodnocení časové koherence a kvality videí syntetizovaných v obou časových a prostorových doménách, rámec hlásí FVD nebo Frechet Video Distance, a KVD nebo Kernel Video Distance, a vyhodnocuje zero-shot výkon na všech metodách MSR-VTT a UCF-101 benchmarků. Pro prozkoumání percepční shody mezi generovanými výsledky a vstupním obrazem, rámec zavádí PIC nebo Perceptual Input Conformity, a采用 percepční vzdálenost metriky DreamSim jako funkci vzdálenosti.
Následující obrázek demonstruje vizuální srovnání generovaného animovaného obsahu s různými styly a obsahem.

Jak je vidět, mezi všemi různými metodami, rámec DynamiCrafter dodržuje vstupní obrazové vedení dobře, a generuje časově koherentní videa. Následující tabulka obsahuje statistiky z uživatelské studie s 49 účastníky preference míry pro Temporální Koherenci (T.C), a Pohybovou Kvalitu (M.C) spolu s výběrem míry pro vizuální shodu s vstupním obrazem (I.C). Jak je vidět, rámec DynamiCrafter je schopen překonat existující metody o značnou míru.

Následující obrázek demonstruje výsledky dosažené pomocí duálního injekčního metody a trénovacího paradigmatu.

Konečné Myšlenky
V tomto článku, jsme mluvili o DynamiCrafter, pokusu o překonání současných omezení modelů animace obrazů a rozšíření jejich použitelnosti na obecné scénáře zahrnující otevřené obrazové snímky. Rámec DynamiCrafter se snaží syntetizovat dynamický obsah pro otevřené obrazové snímky, přeměňující je na animované videa. Klíčovým nápadem za DynamiCrafterem je začlenit obraz jako vedení do generativního procesu, snažící se využít pohybové předchozí znalosti již existujících text-to-video difuzních modelů. Pro daný obraz, model DynamiCrafter nejprve implementuje dotazovací transformátor, který projektuje obraz do prostoru bohatého kontextu, umožňujícímu videu modelu strávit obrazový obsah v kompatibilním způsobem. Nicméně, model DynamiCrafter stále bojuje s tím, aby zachoval některé vizuální detaily ve výsledných videích, problém, který model DynamiCrafter překonává tím, že krmit celý obraz do difuzního modelu spojením obrazu s počátečními šumy, a tím doplňující model o přesnější obrazové informace.












