Modele și platforme AI
CameraCtrl: Controlul Camerei pentru Generarea de Videoclipuri T2V
În ultimii ani, cadrele recente care încearcă să genereze texte în videoclipuri sau generații T2V folosesc modele de difuzie pentru a adăuga stabilitate în procesul de antrenare, iar modelul de difuzie video, unul dintre pionierii în cadrul generației de texte în videoclipuri, extinde o arhitectură de difuzie a imaginilor 2D într-o încercare de a acomoda datele video și de a antrena modelul pe videoclipuri și imagini împreună de la zero. Construind pe baza acestuia și pentru a implementa un generator de imagini preantrenat puternic, cum ar fi Stable Diffusion, lucrările recente inflă arhitectura 2D prin interpolarea straturilor temporale între straturile 2D preantrenate și ajustează modelul nou pe seturi de date mari nevăzute. În ciuda abordării lor, modelele de difuzie text-în-videoclip se confruntă cu o provocare semnificativă, deoarece ambiguitatea utilizării exclusiv a descrierilor text pentru a genera mostrele de videoclip adesea duce la faptul că modelul de text-în-videoclip are un control mai slab asupra generării. Pentru a aborda această limitare, unele modele oferă îndrumări îmbunătățite, în timp ce altele lucrează cu semnale precise pentru a controla mișcările de scenă sau umane în videoclipurile sintetizate cu precizie. Pe de altă parte, există câteva cadre de texte în videoclipuri care adoptă imagini ca semnal de control pentru generatorul de videoclipuri, ceea ce duce la modelarea precisă a relațiilor temporale sau la o calitate ridicată a videoclipului.
Ar fi sigur să spunem că controlabilitatea joacă un rol crucial în sarcinile generative de imagini și videoclipuri, deoarece permite utilizatorilor să creeze conținutul pe care îl doresc. Cu toate acestea, cadrele existente adesea ignoră controlul precis al poziției camerei, care servește ca o limbă cinematografică pentru a exprima nuanțele narative mai profunde modelului. Pentru a aborda limitările actuale de controlabilitate, în acest articol, vom discuta despre CameraCtrl, o idee nouă care încearcă să permită controlul precis al poziției camerei pentru modelele de text-în-videoclipuri. După parametrizarea precisă a traiectoriei camerei, modelul antrenează un modul de cameră plug and play pe un model de text-în-videoclipuri și lasă celelalte componente neatinse. Mai mult, modelul CameraCtrl efectuează, de asemenea, un studiu cuprinzător privind efectul diferitelor seturi de date și sugerează că videoclipurile cu aspecte similare și o distribuție diversă a camerei pot îmbunătăți controlabilitatea și capacitatea de generalizare a modelului. Experimentele efectuate pentru a analiza performanța modelului CameraCtrl în sarcini din lumea reală indică eficiența cadrului în obținerea unui control precis și adaptabil la domeniu al camerei, deschizând calea pentru urmărirea generației personalizate și dinamice de videoclipuri din poziția camerei și intrări textuale.
Acest articol își propune să acopere cadrul CameraCtrl în profunzime și explorăm mecanismul, metodologia, arhitectura cadrului, împreună cu comparația sa cu cadrele actuale. Deci, să începem.
CameraCtrl: Controlul Camerei pentru Generarea T2V
Dezvoltarea și avansarea recentă a modelelor de difuzie au avansat semnificativ generația de videoclipuri ghidate de texte în ultimii ani și a revoluționat fluxurile de design de conținut. Controlabilitatea joacă un rol semnificativ în aplicațiile practice de generare de videoclipuri, deoarece permite utilizatorilor să personalizeze rezultatele generate conform nevoilor și cerințelor lor. Cu o controlabilitate ridicată, modelul poate îmbunătăți realismul, calitatea și utilizabilitatea videoclipurilor generate, iar în timp ce intrările de text și imagine sunt utilizate în mod obișnuit de modele pentru a îmbunătăți controlabilitatea generală, ele adesea lipsesc controlul precis asupra mișcării și conținutului. Pentru a aborda această limitare, unele cadre au propus să utilizeze semnale de control, cum ar fi scheletul de poziție, fluxul optic și alte semnale multi-modale, pentru a permite un control mai precis pentru a ghida generația de videoclipuri. O altă limitare cu care se confruntă cadrele existente este că lipsesc controlul precis asupra stimulării sau ajustării punctelor de cameră în generația de videoclipuri, deoarece capacitatea de a controla camera este crucială, deoarece nu numai că îmbunătățește realismul videoclipurilor generate, dar, permițând puncte de vedere personalizate, îmbunătățește și angajamentul utilizatorului, o funcție esențială în dezvoltarea de jocuri, realitatea augmentată și realitatea virtuală. Mai mult, gestionarea mișcărilor camerei în mod abil permite creatorilor să evidențieze relațiile dintre personaje, să sublinieze emoțiile și să direcționeze atenția publicului țintă, ceea ce este de o importanță deosebită în industria filmului și publicității.
Pentru a aborda și a depăși aceste limitări, cadrul CameraCtrl, un modul de cameră învățabil și precis plug and play, cu capacitatea de a controla punctele de vedere ale camerei pentru generația de videoclipuri. Cu toate acestea, integrarea unei camere personalizate într-un flux de model de text-în-videoclipuri existent este o sarcină mai ușoară de spus decât de făcut, ceea ce obligă cadrul CameraCtrl să caute modalități de a reprezenta și a injecta camera în arhitectura modelului în mod eficient. În același timp, cadrul CameraCtrl adoptă încorporările plucker ca forma principală a parametrilor camerei, iar motivul pentru care a optat pentru încorporările plucker se datorează capacității lor de a codifica descrieri geometrice ale informațiilor despre poziția camerei. Mai mult, pentru a asigura generalizabilitatea și aplicabilitatea modelului CameraCtrl după antrenare, modelul introduce un model de control al camerei care acceptă doar încorporări plucker ca intrare. Pentru a asigura că modelul de control al camerei este antrenat în mod eficient, cadrul și dezvoltatorii săi efectuează un studiu cuprinzător pentru a investiga modul în care diferitele date de antrenare afectează cadrul de la date sintetice la date realiste. Rezultatele experimentale indică faptul că implementarea datelor cu distribuție diversă a poziției camerei și aspecte similare cu modelul de bază original realizează cel mai bun compromis între controlabilitate și generalizabilitate. Dezvoltatorii cadrului CameraCtrl au implementat modelul pe baza cadrului AnimateDiff, permițând astfel un control precis în generația de videoclipuri în diferite contexte de creație de videoclipuri personalizate, demonstrând versatilitatea și utilitatea sa într-o gamă largă de contexte de creație de videoclipuri.

Cadrul AnimateDiff adoptă abordarea eficientă de ajustare LoRA pentru a obține greutățile modelului pentru diferite tipuri de cadre. Cadrul Direct-a-video propune implementarea unui încorporator de cameră pentru a controla poziția camerei în timpul procesului de generație de videoclipuri, dar condiționează doar trei parametri ai camerei, limitând astfel capacitatea de control a camerei la tipurile de bază. Pe de altă parte, cadrele, inclusiv MotionCtrl, proiectează un controlor de mișcare care acceptă mai mult de trei parametri de intrare și poate produce videoclipuri cu poziții de cameră mai complexe. Cu toate acestea, necesitatea de a ajusta părți ale videoclipurilor generate împiedică generalizabilitatea modelului. Mai mult, unele cadre incorporează semnale de control structurale suplimentare, cum ar fi hărțile de adâncime, în proces pentru a îmbunătăți controlabilitatea atât pentru generația de imagini, cât și pentru generația de texte. De obicei, modelul alimentează aceste semnale de control într-un encoder suplimentar și, apoi, injectează semnalele într-un generator utilizând diverse operații.
CameraCtrl: Arhitectura Modelului
Înainte de a putea examina arhitectura și paradigma de antrenare pentru encoderul de cameră, este esențial să înțelegem diferitele reprezentări ale camerei. De obicei, o poziție a camerei se referă la parametrii intrinseci și extrinseci, iar una dintre alegerile straightforward pentru a lăsa un generator de videoclipuri să se condiționeze de poziția camerei este de a alimenta valorile brute ale parametrilor camerei în generator. Cu toate acestea, implementarea unei astfel de abordări poate să nu îmbunătățească controlul precis al camerei din mai multe motive. În primul rând, în timp ce matricea de rotație este constrânsă de ortogonalitate, vectorul de translație este, de obicei, nelimitat în magnitudine și duce la o nepotrivire în procesul de învățare care poate afecta consistența controlului. În al doilea rând, utilizarea directă a parametrilor camerei poate face dificilă pentru modelul de a corela aceste valori cu pixelii imaginii, ceea ce duce la o scădere a controlului asupra detaliilor vizuale. Pentru a evita aceste limitări, cadrul CameraCtrl alege încorporările plucker ca reprezentare a poziției camerei, deoarece încorporările plucker au reprezentări geometrice ale fiecărui pixel al cadrului de videoclipuri și pot oferi o descriere mai elaborată a informațiilor despre poziția camerei.
Controlabilitatea Camerei în Generatoarele de Videoclipuri
În timp ce modelul parametrizează traiectoria camerei într-o secvență de încorporări plucker, adică hărți spațiale, modelul are opțiunea de a utiliza un model de encoder pentru a extrage caracteristicile camerei și, apoi, pentru a fuziona caracteristicile camerei în generatoarele de videoclipuri. Asemănător cu adaptarea text-în-imagini, modelul CameraCtrl introduce un encoder de cameră proiectat special pentru videoclipuri. Encoderul de cameră include un model de atenție temporală după fiecare bloc convolutiv, permițându-i să capteze relațiile temporale ale pozițiilor camerei de-a lungul clipului de videoclipuri. Așa cum se demonstrează în imaginea următoare, encoderul de cameră acceptă doar intrări de încorporări plucker și livrează caracteristici multi-scară. După obținerea caracteristicilor multi-scară ale camerei, modelul CameraCtrl își propune să integreze aceste caracteristici în arhitectura U-Net a modelului de text-în-videoclipuri în mod nedureros și determină straturile care ar trebui să fie utilizate pentru a incorpora informațiile despre cameră în mod eficient. Mai mult, deoarece majoritatea cadrelor existente adoptă o arhitectură similară cu U-Net, care conține atât straturi de atenție temporală, cât și spatiale, modelul CameraCtrl injectează reprezentările camerei în blocul de atenție temporală, o decizie care este susținută de capacitatea straturilor de atenție temporală de a capta relații temporale, aliniindu-se cu natura intrinsecă cauzală și secvențială a unei traiectorii de cameră cu straturile de atenție spațială care imaginează cadrele individuale.

Învățarea Distribuțiilor de Cameră
Antrenarea componentei de encoder de cameră din cadrul CameraCtrl pe un generator de videoclipuri necesită o cantitate mare de videoclipuri etichetate și annotate bine, cu modelul fiind capabil să obțină traiectoria camerei utilizând abordarea de structură din mișcare sau SfM. Cadrul CameraCtrl încearcă să selecteze setul de date cu aspecte care se potrivesc cu datele de antrenare ale modelului de text-în-videoclipuri de bază și are o distribuție a poziției camerei cât mai largă posibil. Exemplele din setul de date generate utilizând motoare virtuale prezintă o distribuție diversă a camerei, deoarece dezvoltatorii au flexibilitatea de a controla parametrii camerei în timpul fazei de rendering, deși suferă de o lacună de distribuție în comparație cu seturile de date care conțin mostre din lumea reală. Când se lucrează cu seturi de date care conțin mostre din lumea reală, distribuția camerei este, de obicei, îngustă, iar în astfel de cazuri, cadrul trebuie să găsească un echilibru între diversitatea dintre diferitele traiectorii de cameră și complexitatea traiectoriei individuale de cameră. Complexitatea traiectoriei individuale de cameră asigură că modelul învață să controleze traiectorii complexe în timpul procesului de antrenare, în timp ce diversitatea dintre diferitele traiectorii de cameră asigură că modelul nu se supraspecializează pe anumite tipare fixe. Mai mult, pentru a monitoriza procesul de antrenare al encoderului de cameră, cadrul CameraCtrl propune metrica de aliniere a camerei pentru a măsura calitatea controlului camerei prin cuantificarea erorii dintre traiectoria camerei a mostrelor generate și condițiile de intrare ale camerei.
CameraCtrl: Experimente și Rezultate
Cadrul CameraCtrl implementează modelul AnimateDiff ca model de text-în-videoclipuri de bază și un motiv major pentru acest lucru este că strategia de antrenare a modelului AnimateDiff permite modulei săi de mișcare să se integreze cu modelele de text-în-imagini de bază sau cu LoRAs de text-în-imagini pentru a acomoda generația de videoclipuri în diferite genuri și domenii. Modelul utilizează optimizerul Adam pentru a antrena modelul cu o rată de învățare constantă de 1e-4. Mai mult, pentru a asigura că modelul nu afectează negativ capacitățile de generație de videoclipuri ale modelului de text-în-videoclipuri original, cadrul CameraCtrl utilizează metrica FID sau distanța de început a lui Frechet pentru a evalua calitatea aparenței videoclipului și compară calitatea videoclipului generat înainte și după includerea modulului de cameră.
Pentru a evalua performanța sa, cadrul CameraCtrl este evaluat împotriva a două cadre de control al camerei existente: MotionCtrl și AnimateDiff. Cu toate acestea, deoarece cadrul AnimateDiff are suport doar pentru opt traiectorii de cameră de bază, comparația dintre CameraCtrl și AnimateDiff se limitează la trei traiectorii de bază. Pe de altă parte, pentru comparația cu MotionCtrl, cadrul selectează peste o mie de traiectorii de cameră aleatorii din setul de date existent, în plus față de traiectoriile de cameră de bază, generează videoclipuri utilizând aceste traiectorii și le evaluează utilizând metricele TransErr și RotErr.

Așa cum se poate observa, cadrul CameraCtrl depășește cadrul AnimateDiff în traiectoria de bază și oferă rezultate mai bune în comparație cu cadrul MotionCtrl pe metrica de traiectorie complexă.
Mai mult, figura următoare demonstrează efectul arhitecturii encoderului de cameră asupra calității generale a mostrelor generate. Rândul a la Rândul d reprezintă rezultatele generate cu encoderul de cameră implementat în arhitectură: ControlNet, ControlNet cu atenție temporală, T2I Adaptor și T2I adaptor cu atenție temporală, respectiv.

În figura următoare, primele două cadre prezintă videoclipul generat utilizând o combinație a encoderului RGB al cadrului SparseCtrl și metodei utilizate în cadrul CameraCtrl.

Gânduri Finale
În acest articol, am discutat despre CameraCtrl, o idee nouă care încearcă să permită controlul precis al poziției camerei pentru modelele de text-în-videoclipuri. După parametrizarea precisă a traiectoriei camerei, modelul antrenează un modul de cameră plug and play pe un model de text-în-videoclipuri și lasă celelalte componente neatinse. Mai mult, modelul CameraCtrl efectuează, de asemenea, un studiu cuprinzător privind efectul diferitelor seturi de date și sugerează că videoclipurile cu aspecte similare și o distribuție diversă a camerei pot îmbunătăți controlabilitatea și capacitatea de generalizare a modelului. Experimentele efectuate pentru a analiza performanța modelului CameraCtrl în sarcini din lumea reală indică eficiența cadrului în obținerea unui control precis și adaptabil la domeniu al camerei, deschizând calea pentru urmărirea generației personalizate și dinamice de videoclipuri din poziția camerei și intrări textuale.












