Modele și platforme AI

AnimateLCM: Animarea Modelelor de Difuzie Personalizate

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În ultimii ani, modelele de difuzie au obținut un succes masiv și recunoaștere pentru sarcinile de generare de imagini și videoclipuri. Modelele de difuzie video, în special, au atras o atenție semnificativă datorită capacității lor de a produce videoclipuri cu coerență ridicată și fidelitate. Aceste modele generează videoclipuri de înaltă calitate prin utilizarea unui proces de denoising iterativ în arhitectura lor, care transformă treptat zgomotul gaussian de înaltă dimensiune în date reale.

Stable Diffusion este unul dintre cele mai reprezentative modele pentru sarcinile de generare de imagini, bazându-se pe un Variational AutoEncoder (VAE) pentru a mapa între imaginea reală și caracteristicile latente down-samples. Acest lucru permite modelului să reducă costurile generative, în timp ce mecanismul de atenție cruzi în arhitectura sa facilitează generarea de imagini condiționate de text. Mai recent, framework-ul Stable Diffusion a constituit baza pentru mai multe adaptoare plug-and-play pentru a obține o generare de imagini sau videoclipuri mai inovatoare și eficientă. Cu toate acestea, procesul generativ iterativ utilizat de majoritatea modelelor de difuzie video face ca procesul de generare de imagini să fie lent și comparativ costisitor, limitându-i aplicațiile.

În acest articol, vom discuta despre AnimateLCM, un model de difuzie personalizat cu adaptoare destinat generării de videoclipuri de înaltă fidelitate cu un număr minim de pași și costuri computaționale. Framework-ul AnimateLCM este inspirat de Modelul de Coerență, care accelerează eșantionarea cu un număr minim de pași prin distilarea modelelor de difuzie de imagine pre-antrenate. Mai mult, extensia cu succes a Modelului de Coerență, Modelul de Coerență Latentă (LCM), facilitează generarea de imagini condiționate. În loc de a efectua învățarea coerenței direct pe setul de date video brut, framework-ul AnimateLCM propune utilizarea unei strategii de învățare a coerenței decuplate. Această strategie decuplează distilarea priorităților de generare a mișcării și a imaginilor, permițând modelului să îmbunătățească calitatea vizuală a conținutului generat și să îmbunătățească eficiența de antrenare în același timp. În plus, modelul AnimateLCM propune antrenarea adaptoarelor de la zero sau adaptarea adaptoarelor existente la modelul său de consistență video distilat. Acest lucru facilitează combinarea adaptoarelor plug-and-play din familia modelelor de difuzie stabilă pentru a obține funcții diferite fără a afecta negativ viteza de eșantionare.

Acest articol are ca scop să acopere framework-ul AnimateLCM în profunzime. Explorăm mecanismul, metodologia și arhitectura framework-ului, împreună cu comparația sa cu cadrele de generare de imagini și videoclipuri de ultimă generație. Deci, să începem.

AnimateLCM: Animarea Modelelor de Difuzie Personalizate

Modelele de difuzie au fost framework-ul preferat pentru sarcinile de generare de imagini și videoclipuri datorită eficienței și capacităților lor în sarcinile generative. Majoritatea modelelor de difuzie se bazează pe un proces de denoising iterativ pentru generarea de imagini care transformă treptat zgomotul gaussian de înaltă dimensiune în date reale. Deși metoda oferă rezultate satisfăcătoare, procesul iterativ și numărul de eșantioane iterate încetinesc procesul de generare și adaugă la cerințele computaționale ale modelelor de difuzie, care sunt mult mai lente decât alte cadre generative, cum ar fi GAN sau Rețelele Adversative Generative. În ultimii ani, Modelele de Coerență sau CM au fost propuse ca o alternativă la modelele de difuzie iterative pentru a accelera procesul de generare și a menține cerințele computaționale constante.

Punctul forte al modelelor de coerență constă în faptul că ele învață hărți de coerență care mențin auto-coerența traiectoriilor introduse de modelele de difuzie pre-antrenate. Procesul de învățare al Modelelor de Coerență permite generarea de imagini de înaltă calitate cu un număr minim de pași și elimină nevoia de iterații computațional intensive. Mai mult, Modelul de Coerență Latentă sau LCM, construit pe baza framework-ului de difuzie stabilă, poate fi integrat în interfața web cu adaptoarele existente pentru a obține o serie de funcții suplimentare, cum ar fi traducerea imaginilor în timp real. În comparație, deși modelele de difuzie video existente oferă rezultate acceptabile, progresul este încă de făcut în domeniul accelerării eșantionării video, și are o importanță deosebită datorită costurilor computaționale ridicate ale generării de videoclipuri.

Acest lucru ne conduce la AnimateLCM, un cadru de generare de videoclipuri de înaltă fidelitate care necesită un număr minim de pași pentru sarcinile de generare de videoclipuri. Urmând Modelul de Coerență Latentă, framework-ul AnimateLCM tratează procesul de difuzie inversă ca o ecuație diferențială augmentată de fluxul de probabilitate, și antrenează modelul pentru a prezice soluția unor astfel de fluxuri de probabilitate direct în spațiul latent. Cu toate acestea, în loc de a efectua învățarea coerenței direct pe datele video brute, care necesită resurse de antrenare și computaționale ridicate și adesea duce la o calitate slabă, framework-ul AnimateLCM propune o strategie de învățare a coerenței decuplate. Această strategie decuplează distilarea priorităților de generare a mișcării și a imaginilor, permițând modelului să îmbunătățească calitatea vizuală a conținutului generat și să îmbunătățească eficiența de antrenare în același timp.

Framework-ul AnimateLCM efectuează mai întâi distilarea coerenței pentru a adapta modelul de difuzie de imagine la modelul de coerență de imagine, și apoi efectuează o inflație 3D atât pentru modelul de coerență de imagine, cât și pentru modelul de difuzie de imagine, pentru a acomoda caracteristici 3D. În cele din urmă, framework-ul AnimateLCM obține modelul de coerență video prin efectuarea distilării coerenței pe datele video. Mai mult, pentru a atenua coruperea potențială a caracteristicilor ca urmare a procesului de difuzie, framework-ul AnimateLCM propune, de asemenea, utilizarea unei strategii de inițializare. Deoarece framework-ul AnimateLCM este construit pe baza framework-ului de difuzie stabilă, poate înlocui greutățile spațiale ale modelului său de coerență video antrenat cu greutățile de imagine personalizate disponibile public, pentru a obține rezultate inovatoare de generare.

În plus, pentru a antrena adaptoare specifice de la zero sau pentru a se potrivi mai bine cu adaptoarele disponibile public, framework-ul AnimateLCM propune o strategie eficientă de accelerare pentru adaptoarele care nu necesită antrenarea unor modele specifice de profesor.

Contribuțiile framework-ului AnimateLCM pot fi rezumate astfel: Framework-ul AnimateLCM propus are ca scop obținerea unei generări de videoclipuri de înaltă calitate, rapidă și de înaltă fidelitate, și pentru a atinge acest obiectiv, framework-ul AnimateLCM propune o strategie de distilare decuplată care decuplează prioritățile de generare a mișcării și a imaginilor, rezultând o calitate de generare mai bună și o eficiență de antrenare îmbunătățită.

InstantID: Metodologie și Arhitectură

La nivel fundamental, framework-ul InstantID se inspiră puternic din modelele de difuzie și strategiile de viteză de eșantionare. Modelele de difuzie, cunoscute și sub numele de modele generative bazate pe scor, au demonstrat capacități remarcabile de generare de imagini. Sub îndrumarea direcției scorului, strategia de eșantionare iterativă implementată de modelele de difuzie denoisează datele corupte de zgomot treptat. Eficiența modelelor de difuzie este unul dintre motivele principale pentru care acestea sunt utilizate de majoritatea modelelor de difuzie video prin antrenarea pe straturi temporale adăugate.

Pe de altă parte, strategiile de accelerare a vitezei de eșantionare ajută la abordarea vitezelor de generare lente în modelele de difuzie. Metoda de accelerare bazată pe distilare ajustează greutățile originale ale modelului de difuzie cu o arhitectură rafinată sau un programator pentru a îmbunătăți viteza de generare.

În continuare, framework-ul InstantID se bazează pe modelul de difuzie stabilă, care permite framework-ului InstantID să aplice noțiuni relevante. Modelul tratează procesul de difuzie directă discretă ca o ecuație diferențială în timp continuă cu conservarea varianței. Mai mult, modelul de difuzie stabilă este o extensie a modelului de difuzie probabilistic de denoising (DDPM), în care punctul de date de antrenare este perturbat treptat de către lanțul Markov discret cu un kernel de perturbare care permite distribuția datelor zgomotoase la diferite pași de timp să urmeze distribuția.

Pentru a obține o generare de videoclipuri de înaltă fidelitate cu un număr minim de pași, framework-ul AnimateLCM domesticește modelele de difuzie video bazate pe stabilitate pentru a urma proprietatea de auto-coerență. Structura generală de antrenare a framework-ului AnimateLCM constă într-o strategie de învățare a coerenței decuplate pentru adaptarea profesorului liber și învățarea eficientă a coerenței.

Tranzitarea de la Modelele de Difuzie la Modelele de Coerență

Framework-ul AnimateLCM introduce propria sa adaptare a Modelului de Difuzie Stabilă (DM) la Modelul de Coerență (CM), urmând designul Modelului de Coerență Latentă (LCM). Este important de remarcat că, deși modelele de difuzie stabilă prezic în general zgomotul adăugat la eșantioane, acestea sunt esențialmente modele de difuzie sigma. Acest lucru este în contrast cu modelele de coerență, care au ca scop prezicerea directă a soluției traiectoriei PF-ODE. Mai mult, în modelele de difuzie stabilă cu anumite parametri, este esențial ca modelul să utilizeze o strategie de îndrumare fără clasificator pentru a genera imagini de înaltă calitate. Framework-ul AnimateLCM, însă, utilizează un solver ODE augmentat cu îndrumare fără clasificator pentru a eșantiona perechile adiacente în aceleași traiectorii, rezultând o eficiență și o calitate îmbunătățită.

Învățarea Coerenței Decuplate

Pentru procesul de distilare a coerenței, dezvoltatorii au observat că datele utilizate pentru antrenare influențează puternic calitatea generării finale a modelelor de coerență. Cu toate acestea, problema majoră cu seturile de date disponibile public în prezent este că acestea adesea conțin date cu filigran, sau sunt de calitate scăzută, și pot conține captionuri prea scurte sau ambigue. Mai mult, antrenarea modelului direct pe videoclipuri cu rezoluție mare este computațional costisitoare și consumatoare de timp, făcând-o o opțiune nefezabilă pentru majoritatea cercetătorilor.

Având în vedere disponibilitatea seturilor de date de înaltă calitate filtrate, framework-ul AnimateLCM propune decuplarea distilării priorităților de generare a mișcării și a imaginilor. Mai exact, framework-ul AnimateLCM efectuează mai întâi distilarea modelului de difuzie stabilă într-un model de coerență de imagine, utilizând seturi de date de imagini și texte de înaltă calitate cu o rezoluție mai bună. Apoi, framework-ul antrenează greutățile LoRA ușoare la straturile modelului de difuzie stabilă, înghețând greutățile modelului de difuzie stabilă. Odată ce modelul ajustează greutățile LoRA, acesta funcționează ca un modul de accelerare versatil și a demonstrat compatibilitatea cu alte modele personalizate din comunitățile de difuzie stabilă. Pentru inferență, framework-ul AnimateLCM combină greutățile LoRA cu greutățile originale fără a corupe viteza de inferență.

Este important de recunoscut că, deși greutățile LoRA spațiale sunt proiectate pentru a accelera procesul de eșantionare fără a lua în considerare modelarea temporală, și modulele temporale sunt dezvoltate prin tehnici standard de difuzie, integrarea directă a acestora tinde să corupă reprezentarea la începutul antrenamentului. Acest lucru prezintă provocări semnificative în ceea ce privește integrarea eficientă și fără conflict a acestora. Prin cercetare empirică, framework-ul AnimateLCM a identificat o abordare de inițializare de succes care nu numai că utilizează prioritățile de coerență de la greutățile LoRA spațiale, dar mitigă și efectele adverse ale combinației directe a acestora.

La începutul antrenamentului de coerență, greutățile LoRA spațiale pre-antrenate sunt integrate exclusiv în modelul de coerență online, evitând inserarea în modelul țintă de coerență. Această strategie asigură că modelul țintă, care servește ca ghid educațional pentru modelul online, nu generează predicții defecte care ar putea afecta negativ procesul de învățare al modelului online. Pe parcursul perioadei de antrenament, greutățile LoRA sunt integrate progresiv în modelul țintă de coerență prin intermediul unui proces de medie mobilă exponențială (EMA), atingând echilibrul optim al greutăților după mai multe iterații.

Adaptarea Fără Profesor

Modelele de difuzie stabilă și adaptoarele plug-and-play merg adesea mână în mână. Cu toate acestea, s-a observat că, deși adaptoarele plug-and-play funcționează până la un anumit punct, acestea tind să piardă controlul asupra detaliilor, chiar și atunci când majoritatea acestor adaptoare sunt antrenate cu modele de difuzie de imagine. Pentru a contracara această problemă, framework-ul AnimateLCM optează pentru adaptarea fără profesor, o strategie simplă dar eficientă care either adaptează adaptoarele existente pentru o compatibilitate mai bună sau antrenează adaptoarele de la zero. Abordarea permite framework-ului AnimateLCM să obțină generarea de videoclipuri controlabile și de imagine-la-videoclip cu un număr minim de pași, fără a necesita modele de profesor.

AnimateLCM: Experimente și Rezultate

Framework-ul AnimateLCM utilizează modelul de difuzie stabilă v1-5 ca model de bază și implementează solverul ODE DDIM pentru scopuri de antrenare. Framework-ul aplică, de asemenea, modelul de difuzie stabilă v1-5, cu greutăți de mișcare deschise ca model de difuzie video de profesor, experimentele fiind efectuate pe setul de date WebVid2M fără date suplimentare sau augmentate. Mai mult, framework-ul utilizează setul de date TikTok cu prompturi textuale BLIP pentru generarea de videoclipuri controlabile.

Rezultate Calitative

Următoarea figură demonstrează rezultatele metodei de generare în patru pași implementate de framework-ul AnimateLCM în generarea de videoclipuri de la text, generarea de videoclipuri de la imagine și generarea de videoclipuri controlabile.

După cum se poate observa, rezultatele furnizate de fiecare dintre acestea sunt satisfăcătoare, rezultatele generate demonstrând capacitatea framework-ului AnimateLCM de a urma proprietatea de coerență, chiar și cu pași de inferență variabili, menținând mișcarea și stilul similar.

Rezultate Cantitative

Următoarea figură ilustrează rezultatele cantitative și comparația framework-ului AnimateLCM cu metodele DDIM și DPM++ de ultimă generație.

După cum se poate observa, framework-ul AnimateLCM depășește metodele existente cu o marjă semnificativă, în special în regimul cu pași redusi, cuprins între 1 și 4 pași. Mai mult, metricile framework-ului AnimateLCM afișate în această comparație sunt evaluate fără utilizarea îndrumării fără clasificator (CFG), ceea ce permite framework-ului să economisească aproape 50% din timpul de inferență și costul de memorie de vârf. Mai mult, pentru a-și valida în continuare performanța, greutățile spațiale din cadrul framework-ului AnimateLCM sunt înlocuite cu un model realist personalizat disponibil public, care reușește să echilibreze fidelitatea și diversitatea, ajutând la îmbunătățirea performanței suplimentar.

Gânduri Finale

În acest articol, am discutat despre AnimateLCM, un model de difuzie personalizat cu adaptoare destinat generării de videoclipuri de înaltă fidelitate cu un număr minim de pași și costuri computaționale. Framework-ul AnimateLCM este inspirat de Modelul de Coerență, care accelerează eșantionarea cu un număr minim de pași prin distilarea modelelor de difuzie de imagine pre-antrenate, și de extensia cu succes a Modelului de Coerență, Modelul de Coerență Latentă (LCM), care facilitează generarea de imagini condiționate. În loc de a efectua învățarea coerenței direct pe setul de date video brut, framework-ul AnimateLCM propune utilizarea unei strategii de învățare a coerenței decuplate, care decuplează distilarea priorităților de generare a mișcării și a imaginilor, permițând modelului să îmbunătățească calitatea vizuală a conținutului generat și să îmbunătățească eficiența de antrenare în același timp.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.