Modele și platforme AI
DynamiCrafter: Animarea Imaginilor cu Domeniu Deschis cu Priori de Difuzie Video
Viziunea computerizată este unul dintre cele mai interesante și bine cercetate domenii din comunitatea inteligenței artificiale de astăzi, și în ciuda îmbunătățirii rapide a modelelor de viziune computerizată, o provocare veche care încă deranjează dezvoltatorii este animarea imaginilor. Chiar și astăzi, cadrele de animare a imaginilor se luptă să convertească imaginile statice în contrapartidele lor video care afișează dinamici naturale, păstrând în același timp aspectul original al imaginilor. În mod tradițional, cadrele de animare a imaginilor se concentrează în primul rând pe animarea scenelor naturale cu mișcări stohastice, specifice domeniului sau oscilante. Deși această abordare funcționează până la un anumit punct, ea limitează aplicabilitatea acestor cadre de animare la conținut vizual mai generic.
Mai mult, abordările convenționale de animare a imaginilor se concentrează în primul rând pe sintetizarea mișcărilor oscilante și stohastice, sau pe personalizarea pentru categorii de obiecte specifice. Cu toate acestea, o lipsă notabilă a acestei abordări este reprezentată de ipotezele puternice impuse asupra acestor metode, care limitează în cele din urmă aplicabilitatea lor, în special în scenarii generale, cum ar fi animarea imaginilor cu domeniu deschis. În ultimii ani, modelele T2V sau Text la Video au demonstrat un succes remarcabil în generarea de videoclipuri vii și diverse, utilizând prompturi textuale, și această demonstrație a modelelor T2V este ceea ce formează baza pentru cadruul DynamiCrafter.
Cadruul DynamiCrafter este o încercare de a depăși limitările actuale ale modelelor de animare a imaginilor și de a-și extinde aplicabilitatea la scenarii generice care implică imagini cu domeniu deschis. Cadruul DynamiCrafter încearcă să sintetizeze conținut dinamic pentru imagini cu domeniu deschis, transformându-le în videoclipuri animate. Ideea cheie din spatele DynamiCrafter este de a incorpora imaginea ca ghidare în procesul generativ, în încercarea de a utiliza priorul de mișcare al modelelor de difuzie text-la-video existente. Pentru o imagine dată, modelul DynamiCrafter implementează mai întâi un transformator de interogare care proiectează imaginea într-un spațiu de reprezentare contextuală bogată și aliniată cu textul, facilitând modelului video să digere conținutul imaginii într-un mod compatibil. Cu toate acestea, modelul DynamiCrafter se luptă încă să păstreze unele detalii vizuale în videoclipurile rezultate, o problemă pe care modelul DynamiCrafter o depășește prin alimentarea imaginii complete cu modelul de difuzie, concatenând imaginea cu zgomotele inițiale, suplimentând astfel modelul cu informații de imagine mai precise.
Acest articol își propune să acopere cadruul DynamiCrafter în profunzime, și vom explora mecanismul, metodologia, arhitectura cadruului, împreună cu comparația cu cadrele de generare a imaginilor și videoclipurilor de ultimă generație. Deci, să începem.
DynamiCrafter: Animarea Imaginilor cu Domeniu Deschis
Animarea unei imagini statice oferă adesea o experiență vizuală captivantă pentru public, deoarece pare să aducă imaginea statică la viață. De-a lungul anilor, numeroase cadre au explorat diverse metode de animare a imaginilor statice. Cadrele inițiale de animare au implementat abordări bazate pe simulări fizice care se concentrau pe simularea mișcării unor obiecte specifice. Cu toate acestea, datorită modelării independente a fiecărei categorii de obiecte, aceste abordări nu au fost nici eficiente, nici nu au avut generalizabilitate. Pentru a replica mișcări mai realiste, au apărut metode bazate pe referințe care transferau informații de mișcare sau de aparență de la semnale de referință, cum ar fi videoclipuri, către procesul de sinteză. Deși metodele bazate pe referințe au oferit rezultate mai bune, cu o coerență temporală mai bună în comparație cu abordările bazate pe simulări, ele au necesitat îndrumarea suplimentară care a limitat aplicațiile practice.
În ultimii ani, majoritatea cadrelor de animare se concentrează în primul rând pe animarea scenelor naturale cu mișcări stohastice, specifice domeniului sau oscilante. Deși abordarea implementată de aceste cadre funcționează până la un anumit punct, rezultatele generate de aceste cadre nu sunt satisfăcătoare, cu un spațiu semnificativ pentru îmbunătățire. Rezultatele remarcabile obținute de modelele generative Text-la-Video în ultimii ani au inspirat dezvoltatorii cadruului DynamiCrafter să valorifice capacitățile generative puternice ale modelelor Text-la-Video pentru animarea imaginilor.
Ideea cheie din spatele cadruului DynamiCrafter este de a incorpora o imagine condițională în încercarea de a guverna procesul de generare a videoclipurilor a modelelor Text-la-Video de difuzie. Cu toate acestea, obiectivul final al animării imaginilor rămâne nefast, deoarece animarea imaginilor necesită păstrarea detaliilor, precum și înțelegerea contextului vizual esențial pentru crearea dinamicii. Cu toate acestea, modelele de difuzie video controlabile multi-modale, cum ar fi VideoComposer, au încercat să permită generarea de videoclipuri cu îndrumarea vizuală de la o imagine. Cu toate acestea, aceste abordări nu sunt potrivite pentru animarea imaginilor, deoarece ele fie rezultă în schimbări temporale bruște, fie au o conformitate vizuală scăzută cu imaginea de intrare, datorită mecanismelor lor de injectare a imaginii mai puțin cuprinzătoare. Pentru a contracara acest obstacol, cadruul DynamiCrafter propune o abordare de injectare duală, constând în îndrumarea detaliilor vizuale și reprezentarea contextuală aliniată cu textul. Abordarea de injectare duală permite cadruului DynamiCrafter să asigure ca modelul de difuzie video să sintetizeze conținut dinamic păstrat detaliile într-un mod complementar.

Pentru o imagine dată, cadruul DynamiCrafter proiectează imaginea în spațiul de reprezentare contextuală aliniată cu textul, utilizând o rețea de învățare contextuală special concepută. Mai exact, spațiul de reprezentare contextuală constă într-un transformator de interogare invățabil pentru a promova adaptarea sa la modelele de difuzie, și un encoder de imagine CLIP pre-antrenat pentru a extrage caracteristici de imagine aliniate cu textul. Modelul utilizează apoi caracteristicile contextuale bogate prin straturi de atenție încrucișate, și modelul utilizează fuziunea poartă pentru a combina aceste caracteristici de text cu straturile de atenție încrucișate. Cu toate acestea, această abordare schimbă reprezentările contextuale învățate cu detalii vizuale aliniate cu textul, ceea ce facilitează înțelegerea semantică a contextului imaginii, permițând sintetizarea unor dinamici rezonabile și vii. Mai mult, în încercarea de a suplimenta detalii vizuale suplimentare, cadruul concatenează imaginea completă cu zgomotul inițial către modelul de difuzie. Ca rezultat, abordarea de injectare duală implementată de cadruul DynamiCrafter garantează conformitatea vizuală, precum și conținut dinamic plauzibil pentru imaginea de intrare.
În continuare, modelele de difuzie sau DM au demonstrat performanțe remarcabile și putere generativă în generarea de imagini Text-la-Imagine. Pentru a repeta succesul modelelor T2I în generarea de videoclipuri, sunt propuse Modele de Difuzie Video (VDM) care utilizează o arhitectură U-Net factorizată spațiu-timp în spațiul pixelilor pentru a modela videoclipuri de rezoluție joasă. Transferul învățămintelor din cadrele T2I către cadrele T2V va ajuta la reducerea costurilor de antrenare. Deși modelele VDM au capacitatea de a genera videoclipuri de calitate ridicată, ele acceptă doar prompturi textuale ca singura îndrumare semantică, care nu reflectă întotdeauna intențiile reale ale utilizatorului sau pot fi vagi. Cu toate acestea, rezultatele majorității modelelor VDM rareori se conformează imaginii de intrare și suferă de problema variației temporale nerealiste. Abordarea DynamiCrafter se bazează pe modele de difuzie video condiționate de text, care valorifică priorul lor dinamic bogat pentru animarea imaginilor cu domeniu deschis. Acesta face acest lucru prin incorporarea unor proiectări personalizate pentru o mai bună înțelegere semantică și conformitate cu imaginea de intrare.
DynamiCrafter: Metodă și Arhitectură
Pentru o imagine statică dată, cadruul DynamiCrafter încearcă să animeze imaginea într-un videoclip, adică să producă un videoclip scurt. Videoclipul moștenește conținutul vizual de la imagine și prezintă dinamici naturale. Cu toate acestea, există posibilitatea ca imaginea să apară într-o locație arbitrară a secvenței de cadre rezultate. Apariția unei imagini într-o locație arbitrară este o provocare specială observată în sarcinile de generare a videoclipurilor condiționate de imagine, cu cerințe de conformitate vizuală ridicate. Cadruul DynamiCrafter depășește această provocare prin utilizarea priorilor generativi ai modelelor de difuzie video pre-antrenate.
Dinamica Imaginilor din Priorul de Difuzie Video
De obicei, modelele de difuzie text-la-video deschise sunt cunoscute pentru afișarea conținutului vizual dinamic, condiționat de descrieri textuale. Pentru a anima o imagine statică cu priori generativi Text-la-Video, cadrele trebuie să injecteze informația vizuală în procesul de generare a videoclipurilor într-un mod cuprinzător. Mai mult, pentru sinteza dinamică, modelul T2V trebuie să digere imaginea pentru înțelegerea contextului, în timp ce trebuie să poată păstra detaliile vizuale în videoclipurile generate.

Reprezentarea Contextuală Aliniată cu Textul
Pentru a ghida generarea de videoclipuri cu contextul imaginii, cadruul DynamiCrafter încearcă să proiecteze imaginea într-un spațiu de încorporare aliniat, permițând modelului video să utilizeze informația de imagine într-un mod compatibil. În continuare, cadruul DynamiCrafter utilizează un encoder de imagine pentru a extrage caracteristici de imagine din imaginea de intrare, deoarece încorporările textuale sunt generate utilizând un encoder de text CLIP pre-antrenat. Acum, deși tokenurile semantice globale de la encoderul de imagine CLIP sunt aliniate cu captionurile de imagine, ele reprezintă în primul rând conținutul vizual la nivel semantic, nefiind capabile să capteze întreaga imagine. Cadruul DynamiCrafter implementează tokenuri vizuale complete din ultimul strat al encoderului CLIP pentru a extrage informații mai complete, deoarece aceste tokenuri vizuale demonstrează fidelitate ridicată în sarcinile de generare de imagini condiționate. Mai mult, cadruul utilizează încorporările contextuale și textuale pentru a interacționa cu caracteristicile intermediare U-Net utilizând straturile de atenție încrucișate duale. Proiectarea acestui component facilitează capacitatea modelului de a absorbi condițiile de imagine într-un mod dependent de strat. Mai mult, deoarece straturile intermediare ale arhitecturii U-Net se asociază mai mult cu pozițiile sau formele obiectelor, se așteaptă ca caracteristicile de imagine să influențeze aparența videoclipurilor în primul rând, deoarece straturile din capăt sunt mai legate de aparență.
Îndrumarea Detaliilor Vizuale
Cadruul DynamiCrafter utilizează o reprezentare contextuală bogată și informativă care permite modelului de difuzie video din arhitectura sa să producă videoclipuri care semănă cu imaginea de intrare. Cu toate acestea, așa cum se demonstrează în imaginea următoare, conținutul generat poate afișa unele discrepanțe datorită capacității limitate a encoderului de imagine CLIP pre-antrenat de a păstra informația de intrare complet, deoarece a fost proiectat pentru a alinia caracteristici lingvistice și vizuale.

Pentru a îmbunătăți conformitatea vizuală, cadruul DynamiCrafter propune să furnizeze modelului de difuzie video detalii vizuale suplimentare extrase din imaginea de intrare. Pentru a realiza acest lucru, modelul DynamiCrafter concatenează imaginea condițională cu zgomotul inițial per cadru și le alimentează componentei U-Net de denoizare ca îndrumare.
Paradigma de Antrenare
Cadruul DynamiCrafter integrează imaginea condițională prin două fluxuri complementare care joacă un rol semnificativ în îndrumarea detaliilor și controlul contextului. Pentru a facilita acest lucru, modelul DynamiCrafter utilizează un proces de antrenare în trei etape
- În prima etapă, modelul antrenează rețeaua de reprezentare contextuală a imaginii.
- În a doua etapă, modelul adaptează rețeaua de reprezentare contextuală a imaginii la modelul Text-la-Video.
- În a treia și ultima etapă, modelul ajustează rețeaua de reprezentare contextuală a imaginii împreună cu componentul de Îndrumare a Detaliilor Vizuale.
Pentru a adapta informația de imagine pentru compatibilitate cu modelul Text-la-Video (T2V), cadruul DynamiCrafter sugerează dezvoltarea unei rețele de reprezentare contextuală, P, proiectată pentru a capta detalii vizuale aliniate cu textul din imaginea dată. Recunoscând că P necesită multe pași de optimizare pentru convergență, abordarea cadruului implică inițial antrenarea acesteia utilizând un model T2I mai simplu. Această strategie permite rețelei de reprezentare contextuală să se concentreze pe învățarea contextului imaginii înainte de a o integra cu modelul T2V prin antrenarea comună a P și a straturilor spațiale, și nu a straturilor temporale, ale modelului T2V.
Pentru a asigura compatibilitatea T2V, cadruul DynamiCrafter combină imaginea de intrare cu zgomotul per cadru, procedând apoi la ajustarea atât a rețelei P, cât și a straturilor spațiale ale modelului VDM. Această metodă este aleasă pentru a menține integritatea cunoștințelor temporale existente ale modelului T2V, fără efectele adverse ale combinării dense a imaginii, care ar putea compromite performanța și ar devia de la obiectivul nostru principal. Mai mult, cadruul utilizează o strategie de selecție aleatorie a unui cadru video ca condiție de imagine pentru a atinge două obiective: (i) pentru a preveni dezvoltarea unei rețele care să dezvolte un model predictibil care să asocieze direct imaginea combinată cu o locație specifică a cadrelor, și (ii) pentru a încuraja o reprezentare contextuală mai adaptabilă, prevenind furnizarea de informații prea rigide pentru orice cadru specific.
DynamiCrafter: Experimente și Rezultate
Cadruul DynamiCrafter antrenează mai întâi rețeaua de reprezentare contextuală și straturile de atenție încrucișate pe modelul Stable Diffusion. Apoi, cadruul înlocuiește componentul Stable Diffusion cu VideoCrafter și ajustează rețeaua de reprezentare contextuală și straturile spațiale pentru adaptare, împreună cu concatenarea imaginii. La inferență, cadruul adoptă samplerul DDIM cu îndrumare multi-condițională fără clasificator. Mai mult, pentru a evalua coerența temporală și calitatea videoclipurilor sintetizate atât în domeniul temporal, cât și în cel spațial, cadruul raportează distanța video Frechet (FVD), precum și distanța video Kernel (KVD), și evaluează performanța zero-shot pe toate metodele de referință MSR-VTT și UCF-101. Pentru a investiga conformitatea perceptuală dintre rezultatele generate și imaginea de intrare, cadruul introduce conformitatea perceptuală a intrării (PIC) și adoptă metrica de distanță perceptuală DreamSim ca funcție de distanță.
Următoarea figură demonstrează comparația vizuală a conținutului animat generat cu diverse stiluri și conținut.

Așa cum se poate observa, printre toate metodele diferite, cadruul DynamiCrafter se conformează bine condiției de imagine de intrare și generează videoclipuri temporale coerente. Următoarea tabelă conține statistici dintr-un studiu cu 49 de participanți privind rata de preferință pentru coerența temporală (T.C) și calitatea mișcării (M.C), împreună cu rata de selecție pentru conformitatea vizuală cu imaginea de intrare (I.C). Așa cum se poate observa, cadruul DynamiCrafter reușește să depășească metodele existente cu o marjă considerabilă.

Următoarea figură demonstrează rezultatele obținute utilizând metoda de injectare duală și paradigma de antrenare.

Gânduri Finale
În acest articol, am discutat despre DynamiCrafter, o încercare de a depăși limitările actuale ale modelelor de animare a imaginilor și de a-și extinde aplicabilitatea la scenarii generice care implică imagini cu domeniu deschis. Cadruul DynamiCrafter încearcă să sintetizeze conținut dinamic pentru imagini cu domeniu deschis, transformându-le în videoclipuri animate. Ideea cheie din spatele DynamiCrafter este de a incorpora imaginea ca ghidare în procesul generativ, în încercarea de a utiliza priorul de mișcare al modelelor de difuzie text-la-video existente. Pentru o imagine dată, modelul DynamiCrafter implementează mai întâi un transformator de interogare care proiectează imaginea într-un spațiu de reprezentare contextuală bogată și aliniată cu textul, facilitând modelului video să digere conținutul imaginii într-un mod compatibil. Cu toate acestea, modelul DynamiCrafter se luptă încă să păstreze unele detalii vizuale în videoclipurile rezultate, o problemă pe care modelul DynamiCrafter o depășește prin alimentarea imaginii complete cu modelul de difuzie, concatenând imaginea cu zgomotele inițiale, suplimentând astfel modelul cu informații de imagine mai precise.












