Unghiul lui Anderson
Tehnologia Google LipSync3D oferă o sincronizare îmbunătățită a mișcării buzelor “deepfaked”

O colaborare între cercetătorii Google AI și Institutul Indian de Tehnologie Kharagpur oferă un nou cadru pentru a sintetiza capete care vorbesc din conținut audio. Proiectul are ca scop producerea unor modalități optimizate și rezonabil resursate pentru a crea conținut video “talking head” din audio, în scopul sincronizării mișcărilor buzelor cu audio dublat sau tradus prin mașină, și pentru a fi utilizat în avatare, în aplicații interactive și în alte medii în timp real.

Sursă: https://www.youtube.com/watch?v=L1StbX9OznY
Modelele de învățare automată antrenate în acest proces – denumite LipSync3D – necesită doar un singur videoclip al identității feței țintă ca date de intrare. Pipeline-ul de pregătire a datelor separă extragerea geometriei faciale de evaluarea iluminării și a altor aspecte ale unui videoclip de intrare, permițând un antrenament mai economic și mai focalizat.

Fluxul de lucru în două etape al lui LipSync3D. Sus, generarea unei fețe 3D dinamice texturate din “audio țintă”; jos, inserarea mesh-ului generat într-un videoclip țintă.
De fapt, contribuția cea mai notabilă a lui LipSync3D la corpul de cercetare în acest domeniu poate fi algoritmul său de normalizare a iluminării, care decuplează iluminarea de antrenare și inferență.

Decuplarea datelor de iluminare de la geometria generală ajută LipSync3D să producă ieșiri de mișcare a buzelor mai realiste în condiții dificile. Alte abordări din ultimii ani s-au limitat la condiții de iluminare “fixe” care nu vor dezvălui capacitatea lor mai limitată în acest sens.
În timpul preprocesării cadrelor de intrare, sistemul trebuie să identifice și să elimine punctele specifice, deoarece acestea sunt specifice condițiilor de iluminare în care a fost luat videoclipul și vor interfera altfel cu procesul de rearanjare a iluminării.

LipSync3D, așa cum îi sugerează și numele, nu efectuează doar o analiză a pixelilor pe fețele evaluate, ci utilizează activ repere faciale identificate pentru a genera mesh-uri CGI mobile, împreună cu texturile “desfășurate” care sunt înfășurate în jurul lor într-un pipeline CGI tradițional.

Normalizarea poziției în LipSync3D. Stânga, cadrele de intrare și caracteristicile detectate; mijloc, vârfurile normalizate ale mesh-ului generat; și dreapta, atlasul texturii corespunzător, care oferă adevărul de referință pentru predicția texturii. Sursă: https://arxiv.org/pdf/2106.04185.pdf
Pe lângă metoda de rearanjare a iluminării, cercetătorii afirmă că LipSync3D oferă trei inovații principale față de lucrările anterioare: separarea geometriei, iluminării, poziției și texturii în fluxuri de date discrete într-un spațiu normalizat; un model de predicție a texturii auto-regresiv ușor de antrenat, care produce sinteză de videoclip temporar consistent; și realism crescut, așa cum este evaluat de evaluările umane și metricele obiective.

Separarea diferitelor aspecte ale imaginilor faciale video permite un control mai mare în sinteza video.
LipSync3D poate deriva geometria mișcării buzelor direct din audio, prin analizarea fonemelor și a altor aspecte ale vorbirii, și traducerea lor în poziții musculare cunoscute corespunzătoare din jurul gurii.

Acest proces utilizează o conductă de predicție comună, unde geometria inferată și textura au encodatori dedicați într-un ansamblu de autoencoder, dar împărtășesc un encoder audio cu vorbirea care urmează a fi impusă modelului:
Sinteza de mișcare labilă a lui LipSync3D este, de asemenea, destinată să alimenteze avatare CGI stilizate, care, în esență, nu sunt decât același tip de mesh și informații texturale ca și imaginile din lumea reală:

Un avatar 3D stilizat are mișcările buzelor alimentate în timp real de un videoclip al unui vorbitor sursă. Într-un astfel de scenariu, cele mai bune rezultate ar fi obținute prin pre-antrenarea personalizată.
Cercetătorii anticipează, de asemenea, utilizarea avatarelor cu o senzație puțin mai realistă:
![]()
Timpul de antrenament pentru videoclipuri variază de la 3 la 5 ore pentru un videoclip de 2-5 minute, într-un pipeline care utilizează TensorFlow, Python și C++ pe un GeForce GTX 1080. Sesiunile de antrenament au utilizat o dimensiune de lot de 128 de cadre pe 500-1000 de epoci, fiecare epocă reprezentând o evaluare completă a videoclipului.
Spre o sincronizare dinamică a mișcării buzelor
Domeniul sincronizării buzelor pentru a se potrivi cu o pistă audio nouă a primit o atenție considerabilă în cercetarea de vedere a computerului în ultimii ani (a se vedea mai jos), nu în ultimul rând, deoarece este un produs secundar al controversatei tehnologii deepfake.
În 2017, Universitatea din Washington a prezentat cercetări capabile să învețe sincronizarea buzelor din audio, utilizând-o pentru a schimba mișcările buzelor fostului președinte Obama. În 2018, Institutul Max Planck pentru Informatică a condus o altă inițiativă de cercetare pentru a permite transferul de identitate la identitate video, cu sincronizarea buzelor ca produs secundar al procesului; și în mai 2021, startup-ul de inteligență artificială FlawlessAI a dezvăluit tehnologia sa de sincronizare a buzelor TrueSync, primită pe scară largă în presă ca un mijloc de îmbunătățire a tehnologiilor de dublaj pentru lansări majore de filme în diferite limbi.
Și, desigur, dezvoltarea continuă a depozitelor deschise de deepfake oferă o altă ramură de cercetare activă, contribuită de utilizatori, în acest domeniu al sintezei de imagini faciale.











