Modele și platforme AI

MagicDance: Generare Realistă de Videoclipuri cu Mișcări Umane

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Viziunea computerizată este unul dintre cele mai discutate domenii din industria inteligenței artificiale, datorită potențialelor sale aplicații într-o gamă largă de sarcini în timp real. În ultimii ani, cadrele de viziune computerizată au evoluat rapid, iar modelele moderne sunt capabile să analizeze caracteristici faciale, obiecte și multe altele în scenarii în timp real. În ciuda acestor capacități, transferul de mișcări umane rămâne o provocare formidabilă pentru modelele de viziune computerizată. Această sarcină implică retargetarea mișcărilor faciale și corporale de la o imagine sau videoclip sursă la o imagine sau videoclip țintă. Transferul de mișcări umane este utilizat pe scară largă în modelele de viziune computerizată pentru stilizarea imaginilor sau videoclipurilor, editarea conținutului multimedia, sinteza umană digitală și chiar generarea de date pentru cadrele de percepție.

În acest articol, ne concentrăm pe MagicDance, un model bazat pe difuzie proiectat pentru a revoluționa transferul de mișcări umane. Cadru MagicDance se axează în mod special pe transferul de expresii faciale și mișcări umane bidimensionale pe videoclipuri de dans uman dificile. Scopul său este de a genera videoclipuri de dans noi, conduse de secvențe de poziții, pentru identități țintă specifice, menținând identitatea originală. Cadru MagicDance utilizează o strategie de antrenament în două etape, axată pe disentanglementul mișcărilor umane și factori de apariție, cum ar fi tonul pielii, expresiile faciale și îmbrăcămintea. Vom explora cadru MagicDance, arhitectura, funcționalitatea și performanța sa în comparație cu alte cadre de transfer de mișcări umane de ultimă generație. Să intrăm în detalii.

MagicDance: Transfer Realist de Mișcări Umane

După cum s-a menționat anterior, transferul de mișcări umane este una dintre cele mai complexe sarcini de viziune computerizată, datorită complexității implicate în transferul mișcărilor și expresiilor umane de la imaginea sau videoclipul sursă la imaginea sau videoclipul țintă. În mod tradițional, cadrele de viziune computerizată au realizat transferul de mișcări umane prin antrenarea unui model generativ specific sarcinii, inclusiv GAN sau Rețele Adversative Generative, pe seturi de date țintă pentru expresii faciale și poziții corporale. Deși antrenarea și utilizarea modelelor generative oferă rezultate satisfăcătoare în unele cazuri, ele suferă de două limitări majore.

  1. Ele depind puternic de un component de deformare a imaginii, ca urmare a căruia ele adesea luptă să interpoleze părți ale corpului invizibile în imaginea sursă, fie din cauza unei schimbări de perspectivă sau a auto-ocluiziei.
  2. Ele nu pot generaliza la alte imagini sursă din exterior, ceea ce limitează aplicațiile lor, în special în scenarii în timp real, în sălbăticie.

Modelele moderne de difuzie au demonstrat capacități excepționale de generare de imagini în diferite condiții, iar modelele de difuzie sunt acum capabile să prezinte imagini puternice într-o varietate de sarcini descendente, cum ar fi generarea de videoclipuri și completarea de imagini, prin învățarea de la seturi de imagini la scară web. Datorită capacităților lor, modelele de difuzie ar putea fi o alegere ideală pentru sarcinile de transfer de mișcări umane. Deși modelele de difuzie pot fi implementate pentru transferul de mișcări umane, ele au unele limitări, fie în ceea ce privește calitatea conținutului generat, fie în ceea ce privește conservarea identității sau suferă de incoerențe temporale ca urmare a limitărilor de proiectare și strategie de antrenament. Mai mult, modelele bazate pe difuzie nu demonstrează niciun avantaj semnificativ față de cadrele GAN în ceea ce privește generalizabilitatea.

Pentru a depăși obstacolele cu care se confruntă cadrele de difuzie și GAN în sarcinile de transfer de mișcări umane, dezvoltatorii au introdus MagicDance, un cadru nou care își propune să exploateze potențialul cadrelor de difuzie pentru transferul de mișcări umane, demonstrând un nivel fără precedent de conservare a identității, calitate vizuală superioară și generalizabilitate de domeniu. La baza sa, conceptul fundamental al cadru MagicDance este de a divide problema în două etape: controlul apariției și controlul mișcării, două capacități necesare cadrelor de difuzie pentru a furniza ieșiri de transfer de mișcări precise.

Figura de mai sus oferă o scurtă prezentare a cadru MagicDance, și cum se poate vedea, cadru utilizează modelul Stable Diffusion și implementează două componente suplimentare: Modelul de Control al Apariției și ControlNet de Poziție, unde primul oferă îndrumări de apariție modelului SD dintr-o imagine de referință prin atenție, iar al doilea oferă îndrumări de expresie/poziție modelului de difuzie dintr-o imagine sau videoclip condiționat. Cadru utilizează, de asemenea, o strategie de antrenament multistadial pentru a învăța aceste submodule eficient pentru a disentangle controlul poziției și apariției.

În rezumat, cadru MagicDance este un

  1. Cadru nou și eficient, constând în controlul poziției disentanglat de apariție și preantrenarea controlului apariției.
  2. Cadru MagicDance este capabil să genereze expresii faciale și mișcări umane realiste sub controlul intrărilor de poziție și imaginilor sau videoclipurilor de referință.
  3. Cadru MagicDance își propune să genereze conținut uman consistent în ceea ce privește apariția prin introducerea unui modul de atenție multi-sursă care oferă îndrumări precise pentru cadru Stable Diffusion UNet.
  4. Cadru MagicDance poate fi utilizat, de asemenea, ca o extensie convenabilă sau un plug-in pentru cadru Stable Diffusion și asigură compatibilitatea cu greutățile modelului existent, deoarece nu necesită o nouă finisare a parametrilor.

În plus, cadru MagicDance demonstrează capacități excepționale de generalizare atât pentru apariție, cât și pentru mișcare.

  1. Generalizarea apariției: Cadru MagicDance demonstrează capacități superioare în ceea ce privește generarea de apariții diverse.
  2. Generalizarea mișcării: Cadru MagicDance are, de asemenea, capacitatea de a genera o gamă largă de mișcări.

MagicDance: Obiective și Arhitectură

Pentru o imagine de referință dată, fie a unui om real, fie a unei imagini stilizate, obiectivul principal al cadru MagicDance este de a genera o imagine de ieșire sau un videoclip condiționat de intrare și de intrările de poziție {P, F}, unde P reprezintă scheletul poziției umane și F reprezintă reperele faciale. Imaginea de ieșire generată sau videoclipul ar trebui să păstreze apariția și identitatea oamenilor implicați, împreună cu conținutul de fundal prezent în imaginea de referință, menținând poziția și expresiile definite de intrările de poziție.

Arhitectură

În timpul antrenamentului, cadru MagicDance este antrenat ca o sarcină de reconstruire a cadrului pentru a reconstrui adevărul cu imaginea de referință și intrarea de poziție sursă din același videoclip de referință. În timpul testării, pentru a realiza transferul de mișcări, intrarea de poziție și imaginea de referință sunt sursă din surse diferite.

Arhitectura generală a cadru MagicDance poate fi împărțită în patru categorii: etapa preliminară, preantrenarea controlului apariției, controlul poziției disentanglat de apariție și modulul de mișcare.

Etapa Preliminară

Modelele de difuzie latente sau LDM reprezintă modele de difuzie special concepute pentru a opera în spațiul latent, facilitat de utilizarea unui autoencoder, iar cadru Stable Diffusion este un exemplu notabil de LDM care utilizează un autoencoder cuantificat-vectorial și o arhitectură U-Net temporală. Cadru Stable Diffusion utilizează un transformator bazat pe CLIP ca encoder de text pentru a procesa intrările textuale, convertind textul în încorporări. Faza de antrenament a cadru Stable Diffusion expune modelul la o condiție de text și o imagine de intrare, implicând încodarea imaginii într-o reprezentare latentă și supunerea acesteia la o secvență predefinită de pași de difuzie dirijați de o metodă gaussiană. Secvența rezultată produce o reprezentare latentă zgomotoasă care oferă o distribuție normală standard, iar obiectivul principal de învățare al cadru Stable Diffusion este de a denumi reprezentările latente zgomotoase iterativ în reprezentări latente.

Preantrenarea Controlului Apariției

O problemă majoră cu cadru ControlNet original este incapacitatea sa de a controla apariția în mișcări spațial variabile în mod constant, deși tendința sa este de a genera imagini cu poziții care semănă cu cele din imaginea de intrare, iar apariția generală fiind influențată în principal de intrările textuale. Deși această metodă funcționează, nu este potrivită pentru transferul de mișcări care implică sarcini în care nu intrările textuale, ci imaginea de referință servește ca sursă principală de informații despre apariție.

Modulul de preantrenare a controlului apariției din cadru MagicDance este proiectat ca o ramură auxiliară pentru a oferi îndrumări pentru controlul apariției într-o abordare stratificată. În loc să se bazeze pe intrările textuale, modulul se concentrează pe valorificarea atributele de apariție din imaginea de referință, cu scopul de a îmbunătăți capacitatea cadru de a genera caracteristicile de apariție cu acuratețe, în special în scenarii care implică dinamici de mișcare complexe. Mai mult, doar modelul de control al apariției este antrenabil în timpul preantrenării controlului apariției.

Controlul Poziției Disentanglat de Apariție

O soluție naivă pentru a controla poziția în imaginea de ieșire este de a integra modelul ControlNet preantrenat direct cu modelul de control al apariției preantrenat, fără a-l ajusta. Cu toate acestea, integrarea poate duce la faptul că cadru luptă cu controlul poziției independent de apariție, ceea ce poate conduce la o discrepanță între pozițiile de intrare și pozițiile generate. Pentru a aborda această discrepanță, cadru MagicDance ajustează modelul ControlNet de Poziție împreună cu modelul de control al apariției preantrenat.

Modulul de Mișcare

Atunci când lucrează împreună, ControlNet de Poziție disentanglat de apariție și modelul de control al apariției pot realiza un transfer de imagine la mișcare precis și eficient, deși acesta poate duce la incoerențe temporale. Pentru a asigura coerența temporală, cadru integrează un modul de mișcare suplimentar în arhitectura principală a modelului Stable Diffusion UNet.

MagicDance: Preantrenare și Seturi de Date

Pentru preantrenare, cadru MagicDance utilizează un set de date TikTok care conține peste 350 de videoclipuri de dans de lungimi variabile între 10 și 15 secunde, capturând o singură persoană care dansează, majoritatea acestor videoclipuri conținând fața și partea superioară a corpului uman. Cadru MagicDance extrage fiecare videoclip individual la 30 de cadre pe secundă și rulează OpenPose pe fiecare cadru pentru a infera scheletul poziției, pozițiile mâinilor și reperele faciale.

Pentru preantrenare, modelul de control al apariției este preantrenat cu un batch de 64 pe 8 GPU-uri NVIDIA A100 pentru 10.000 de pași, cu o dimensiune a imaginii de 512×512, urmat de ajustarea comună a modelelor de control al poziției și apariției cu un batch de 16 pentru 20.000 de pași. În timpul antrenamentului, cadru MagicDance eșantionează aleator două cadre ca țintă și referință, cu imaginile fiind decupate în aceeași poziție și înălțime. În timpul evaluării, modelul decupează imaginea central în loc de a o decupa aleator.

MagicDance: Rezultate

Rezultatele experimentale efectuate pe cadru MagicDance sunt demonstrate în imaginea de mai jos, și cum se poate vedea, cadru MagicDance depășește cadrele existente, cum ar fi Disco și DreamPose, pentru transferul de mișcări umane în toate metricile. Cadrele care au un “*” în fața numelui utilizează imaginea țintă direct ca intrare și conțin mai multe informații în comparație cu alte cadre.

Este interesant de remarcat că cadru MagicDance atinge un scor Face-Cos de 0,426, o îmbunătățire de 156,62% față de cadru Disco și o creștere de aproape 400% în comparație cu cadru DreamPose. Rezultatele indică capacitatea robustă a cadru MagicDance de a păstra informații despre identitate și creșterea vizibilă a performanței indică superioritatea cadru MagicDance față de metodele actuale de ultimă generație.

Figurile de mai jos compară calitatea generării de videoclipuri umane între cadrele MagicDance, Disco și TPS. Cum se poate observa, rezultatele generate de cadrele GT, Disco și TPS suferă de incoerențe în ceea ce privește identitatea și expresiile faciale umane.

Mai mult, imaginea de mai jos demonstrează vizualizarea transferului de expresii faciale și mișcări umane pe setul de date TikTok, cu cadru MagicDance fiind capabil să genereze expresii și mișcări realiste și vii sub diverse repere faciale și intrări de poziție, păstrând cu acuratețe informațiile despre identitate din imaginea de referință.

Este demn de remarcat că cadru MagicDance are capacități excepționale de generalizare pentru imagini de referință din afara domeniului, cu poziții și stiluri nevizionate, cu o controlabilitate remarcabilă a apariției, chiar și fără ajustări suplimentare pe domeniul țintă, rezultatele fiind demonstrate în imaginea de mai jos.

Imaginile de mai jos demonstrează capacitățile de vizualizare ale cadru MagicDance în ceea ce privește transferul de expresii faciale și mișcări umane. Cum se poate vedea, cadru MagicDance se generalizează perfect la mișcări umane din sălbăticie.

MagicDance: Limitări

OpenPose este un component esențial al cadru MagicDance, deoarece joacă un rol crucial pentru controlul poziției, afectând calitatea și coerența temporală a imaginilor generate în mod semnificativ. Cu toate acestea, cadru MagicDance încă găsește o provocare în a detecta reperele faciale și scheletul poziției cu acuratețe, în special atunci când obiectele din imagini sunt parțial vizibile sau prezintă mișcări rapide. Aceste probleme pot duce la artefacte în imaginea generată.

Concluzie

În acest articol, am discutat despre MagicDance, un model bazat pe difuzie care își propune să revoluționeze transferul de mișcări umane. Cadru MagicDance încearcă să transfere expresii faciale și mișcări umane bidimensionale pe videoclipuri de dans uman dificile, cu scopul de a genera videoclipuri de dans noi, conduse de secvențe de poziții, pentru identități țintă specifice, menținând identitatea constantă. Cadru MagicDance este o strategie de antrenament în două etape pentru disentanglementul mișcărilor umane și apariției, cum ar fi tonul pielii, expresiile faciale și îmbrăcămintea.

MagicDance este o abordare nouă pentru a facilita generarea realistă de videoclipuri umane prin încorporarea transferului de expresii faciale și mișcări, permițând generarea de animații coerente în sălbăticie fără a necesita ajustări suplimentare, demonstrând o avansare semnificativă față de metodele existente. Mai mult, cadru MagicDance demonstrează capacități excepționale de generalizare pentru secvențe de mișcări complexe și identități umane diverse, stabilind cadru MagicDance ca lider în domeniul transferului de mișcări asistat de inteligență artificială și generarea de videoclipuri.

Kunal Kejriwal este un inginer backend specializat în Python, PostgreSQL, Redis și infrastructură cloud pe GCP și AWS. Cu trei ani de experiență în construirea și scalarea sistemelor de producție, el scrie despre infrastructura AI, sistemele distribuite și arhitectura din spatele implementării sarcinilor de învățare automată.