Modely a platformy AI

AnimateLCM: Animace Personalizovaných Difuzních Modelů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Před několika lety dosáhly difuzní modely obrovského úspěchu a uznání pro úkoly generování obrázků a videí. Video difuzní modely, zejména, získaly značnou pozornost kvůli jejich schopnosti produkovat videa s vysokou koherencí a věrností. Tyto modely generují vysoce kvalitní videa pomocí iterativního procesu odstraňování šumu v jejich architektuře, který postupně transformuje vysokodimenzionální Gaussovo šumu do reálných dat.

Stable Diffusion je jedním z nejvýznamnějších modelů pro generativní úkoly obrázků, který spoléhá na Variational AutoEncoder (VAE) pro mapování mezi reálným obrázkem a downsamplovanými latentními rysy. To umožňuje modelu snížit generativní náklady, zatímco mechanismus cross-attention v jeho architektuře usnadňuje textově podmíněné generování obrázků. Nedávno, framework Stable Diffusion vytvořil základ pro několik plug-and-play adaptérů, aby dosáhli více inovativních a efektivní generace obrázků nebo videí. Nicméně, iterativní generativní proces, který je použitý většinou video difuzních modelů, činí proces generování obrázků časově náročným a relativně nákladným, omezujícím tak jeho aplikace.

V tomto článku budeme mluvit o AnimateLCM, personalizovaném difuzním modelu s adaptéry, který má za cíl generovat vysoce kvalitní videa s minimálním počtem kroků a výpočetními náklady. Framework AnimateLCM je inspirován modelem Consistency, který urychluje vzorkování s minimálním počtem kroků destilací předtrénovaných difuzních modelů obrázků. Kromě toho, úspěšné rozšíření modelu Consistency, Latent Consistency Model (LCM), usnadňuje podmíněné generování obrázků. Místo přímého provádění učení konzistence na surovém video datasetu, framework AnimateLCM navrhuje použití decoupled učení konzistence. Tato strategie decoupluje destilaci pohybů a generování obrázků, umožňující modelu vylepšit vizuální kvalitu generovaného obsahu a zlepšit tréninkovou efektivitu současně. Kromě toho, model AnimateLCM navrhuje trénink adaptérů od začátku nebo přizpůsobení existujících adaptérů k jeho destilovanému video modelu konzistence. To usnadňuje kombinaci plug-and-play adaptérů v rámci stabilních difuzních modelů pro dosažení různých funkcí bez poškození rychlosti vzorkování.

Tento článek má za cíl pokrýt framework AnimateLCM v hloubce. Prozkoumáme mechanismus, metodologii a architekturu frameworku, spolu s jeho srovnáním se stávajícími frameworky generování obrázků a videí. Takže, pojďme začít.

AnimateLCM: Animace Personalizovaných Difuzních Modelů

Difuzní modely byly frameworkem pro generování obrázků a videí díky jejich efektivitě a schopnostem na generativních úkolech. Většina difuzních modelů spoléhá na iterativní proces odstraňování šumu pro generování obrázků, který transformuje vysokodimenzionální Gaussovo šumu do reálných dat postupně. Ačkoli tato metoda dodává somewhat uspokojivé výsledky, iterativní proces a počet iterací zpomaluje proces generování a také přidává k výpočetním požadavkům difuzních modelů, které jsou mnohem pomalejší než ostatní generativní frameworky, jako je GAN nebo Generative Adversarial Networks. V posledních letech byly navrženy modely Consistency jako alternativa k iterativním difuzním modelům pro urychlení procesu generování a zachování výpočetních požadavků.

Hlavní výhodou modelů Consistency je, že se učí konzistenční mapování, která udržují konzistenci trajektorií zavedených předtrénovanými difuzními modely. Proces učení modelů Consistency umožňuje jim generovat vysoce kvalitní obrázky s minimálním počtem kroků a také eliminuje potřebu výpočetně náročných iterací. Kromě toho, model Latent Consistency nebo LCM, postavený na frameworku Stable Diffusion, může být integrován do webového uživatelského rozhraní s existujícími adaptéry pro dosažení dalších funkcí, jako je reálné převádění obrázku na obrázek. V porovnání, ačkoli existující video difuzní modely dodávají přijatelné výsledky, je třeba udělat pokrok v oblasti urychlení vzorkování videa, a to je velmi důležité kvůli vysokým výpočetním nákladům generování videa.

To nás přivádí k AnimateLCM, frameworku pro generování vysoce kvalitních videí, který potřebuje minimální počet kroků pro úkoly generování videa. Framework AnimateLCM následuje model Latent Consistency a navrhuje použití decoupled učení konzistence, které decoupluje destilaci pohybů a generování obrázků. Framework AnimateLCM nejprve provede destilaci stabilních difuzních modelů do modelů konzistence obrázků, a poté provede 3D inflaci obou modelů konzistence a difuzních modelů, aby akomodoval 3D rysy. Nakonec, framework AnimateLCM získá model konzistence videa provedením destilace konzistence na video datech. Kromě toho, framework AnimateLCM navrhuje použití inicializační strategie, aby se zabránilo potenciálnímu poškození rysů v důsledku procesu difuze.

Kromě toho, framework AnimateLCM navrhuje efektivní urychlení strategie pro adaptéry, které nevyžadují trénink specifických učitelů.

Přínosy frameworku AnimateLCM lze velmi dobře shrnout jako: Navrhovaný framework AnimateLCM má za cíl dosáhnout vysoce kvalitního, rychlého a vysoce věrného generování videa, a k tomu navrhuje decoupled destilaci, která decoupluje pohyb a generování obrázků, výsledkem čehož je lepší kvalita generování a zlepšení tréninkové efektivnosti.

InstantID: Metodologie a Architektura

V jádru, framework InstantID čerpá inspiraci z difuzních modelů a strategií urychlení vzorkování. Difuzní modely, také známé jako score-based generativní modely, prokázaly pozoruhodné image generativní schopnosti. Pod vedením score směru, iterativní vzorkovací strategie implementovaná difuzními modely odstraňuje šum z dat postupně. Efektivita difuzních modelů je jedním z hlavních důvodů, proč jsou používány většinou video difuzních modelů trénováním na přidružených temporálních vrstvách. Na druhé straně, strategie urychlení vzorkování pomáhají řešit pomalé generovací rychlosti v difuzních modelech. Metoda urychlení založená na destilaci ladí původní difuzní váhy s rafinovanou architekturou nebo plánovačem, aby zlepšila generovací rychlost.

Pokračujme, framework InstantID je postaven na frameworku Stable Diffusion, který umožňuje frameworku InstantID aplikovat relevantní koncepty. Model zachází s diskrétním procesem vpřed jako kontinuální-time Variance Preserving SDE. Kromě toho, framework Stable Diffusion je rozšířením DDPM nebo Denoising Diffusion Probabilistic Model, ve kterém je trénovací datový bod perturbován postupně diskrétním Markovovým řetězcem s perturbačním jádrem, umožňujícím distribuci šumových dat na různých časových krocích.

Pro dosažení vysoce kvalitního generování videa s minimálním počtem kroků, framework AnimateLCM zkrotí stabilní difuzní modely, aby následovaly konzistenční vlastnost. Celková tréninková struktura frameworku AnimateLCM se skládá z decoupled učení konzistence pro teacher-free adaptaci a efektivní učení konzistence.

Přechod z Difuzních Modelů na Modely Konsistence

Framework AnimateLCM představuje svou vlastní adaptaci modelu Stable Diffusion nebo DM na model Konsistence nebo CM, následujícím designem modelu Latent Consistency nebo LCM. Je důležité poznamenat, že ačkoli stabilní difuzní modely obvykle předpovídají šum přidáný k vzorkům, jsou esenciální sigma-difuzní modely. Je to v kontrastu s modely konzistence, které mají za cíl předpovědět řešení PF-ODE trajektorie přímo. Kromě toho, ve stabilních difuzních modelech s určitými parametry, je esenciální pro model použít strategii bez klasifikátoru. Framework AnimateLCM však používá klasifikátor-free guidance augmentovaný ODE solver pro vzorkování adjektivních párů ve stejných trajektoriích, výsledkem čehož je lepší efektivita a kvalita.

Decoupled Učení Konsistence

Pro proces destilace konzistence, vývojáři pozorovali, že data použitá pro trénink silně ovlivňují kvalitu konečného generování modelů konzistence. Nicméně, hlavní problém s veřejně dostupnými datovými sadami je, že často obsahují watermark data, nebo jsou nízké kvality, a mohou obsahovat příliš krátké nebo nejasné popisky. Kromě toho, trénink modelu přímo na velkých video datech je výpočetně nákladný a časově náročný, což z něj činí nevhodnou možnost pro většinu výzkumníků.

Vzhledem k dostupnosti filtrovaných vysoce kvalitních datových sad, framework AnimateLCM navrhuje decoupled destilaci pohybů a generování obrázků. Konkrétněji, framework AnimateLCM nejprve destiluje stabilní difuzní modely do modelů konzistence obrázků s filtrovanými vysoce kvalitními obrazovými textovými datovými sadami s lepší rozlišením. Framework poté trénuje lehké LoRA váhy ve vrstvách stabilního difuzního modelu, tím zmrazí váhy stabilního difuzního modelu. Jakmile model naladí LoRA váhy, funguje jako všestranný urychlovací modul a prokázal svou kompatibilitu s ostatními personalizovanými modely ve stabilních difuzních komunitách. Pro inference, framework AnimateLCM spojuje váhy LoRA s původními váhami bez poškození inference rychlosti.

Je důležité rozpoznat, že zatímco prostorové LoRA váhy jsou navrženy pro urychlení vzorkování bez zohlednění temporálního modelování, a temporální moduly jsou vyvinuty prostřednictvím standardních difuzních technik, jejich přímá integrace má tendenci poškozovat reprezentaci na počátku tréninku. To představuje značné výzvy pro efektivní a efektivní integraci s minimálním konfliktem. Prostřednictvím empirického výzkumu, framework AnimateLCM identifikoval úspěšný inicializační přístup, který nejen využívá konzistenční priority z prostorových LoRA váh, ale také zmírňuje negativní účinky jejich přímé kombinace.

Na počátku tréninku konzistence, předtrénované prostorové LoRA váhy jsou integrovány výhradně do online modelu konzistence, ušetřeného cílového modelu konzistence. Tato strategie zajišťuje, že cílový model, sloužící jako vzdělávací průvodce pro online model, nevytváří chybné předpovědi, které by mohly negativně ovlivnit proces učení online modelu. Během tréninkového období, LoRA váhy jsou postupně integrovány do cílového modelu konzistence prostřednictvím procesu exponenciálního pohyblivého průměru (EMA), dosahujícího optimálního váhového poměru po několika iteracích.

Teacher-Free Adaptace

Stabilní difuzní modely a plug-and-play adaptéry často jdou ruku v ruce. Nicméně, bylo pozorováno, že i když plug-and-play adaptéry fungují do jisté míry, tendují ztrácet kontrolu nad detaily, i když většina z nich je trénována s image difuzními modely. Pro řešení tohoto problému, framework AnimateLCM volí teacher-free adaptaci, jednoduchou, ale efektivní strategii, která buď přizpůsobí existující adaptéry pro lepší kompatibilitu, nebo trénuje adaptéry od začátku. Tento přístup umožňuje frameworku AnimateLCM dosáhnout kontrolované generování videa a image-to-video generování s minimálním počtem kroků bez požadavku na učitele.

AnimateLCM: Experimenty a Výsledky

Framework AnimateLCM používá stabilní difuzní model v1-5 jako základní model a implementuje DDIM ODE solver pro tréninkové účely. Framework také aplikuje stabilní difuzní model v1-5 s otevřenými motion váhami jako učitel video difuzní model s experimenty prováděnými na datasetu WebVid2M bez dalších nebo augmentovaných dat. Kromě toho, framework používá dataset TikTok s BLIP-captioned krátkými textovými popisky pro kontrolované generování videa.

Kvalitativní Výsledky

Následující obrázek demonstruje výsledky čtyřkrokového generování metody implementované frameworkem AnimateLCM v text-to-video generování, image-to-video generování a kontrolovaném generování videa.

Jak je vidět, výsledky dodané každým z nich jsou uspokojivé, s generovanými výsledky demonstrujícími schopnost frameworku AnimateLCM následovat konzistenční vlastnost, i s různými inferenčními kroky, zachovávající podobný pohyb a styl.

Kvantitativní Výsledky

Následující obrázek ilustruje kvantitativní výsledky a srovnání frameworku AnimateLCM se stávajícími metodami DDIM a DPM++.

Jak je vidět, framework AnimateLCM překonává stávající metody o značnou míru, zejména v nízkém krokovém režimu, od 1 do 4 kroků. Kromě toho, metriky frameworku AnimateLCM zobrazené v tomto srovnání jsou vyhodnoceny bez použití CFG nebo klasifikátor-free guidance, což umožňuje frameworku ušetřit téměř 50% inference času a inference peak paměťových nákladů. Kromě toho, pro další ověření jeho výkonu, prostorové váhy uvnitř frameworku AnimateLCM jsou nahrazeny veřejně dostupným personalizovaným realistickým modelem, který nachází dobrý kompromis mezi věrností a rozmanitostí, což pomáhá dále zlepšit výkon.

Závěrečné Myšlenky

V tomto článku jsme mluvili o AnimateLCM, personalizovaném difuzním modelu s adaptéry, který má za cíl generovat vysoce kvalitní videa s minimálním počtem kroků a výpočetními náklady. Framework AnimateLCM je inspirován modelem Consistency, který urychluje vzorkování s minimálním počtem kroků destilací předtrénovaných difuzních modelů obrázků, a úspěšným rozšířením modelu Consistency, modelem Latent Consistency nebo LCM, který usnadňuje podmíněné generování obrázků. Místo přímého provádění učení konzistence na surovém video datasetu, framework AnimateLCM navrhuje použití decoupled učení konzistence, které decoupluje destilaci pohybů a generování obrázků, umožňující modelu vylepšit vizuální kvalitu generovaného obsahu a zlepšit tréninkovou efektivitu současně.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.