Unghiul lui Anderson

De ce deepfake-urile nu pot transmite în prezent subtilitatea emoțiilor

mm
Adaugă Unite.AI la sursele tale preferate pe Google
The Book of Boba Fett - Disney

Ieșirea de ieri a episodului 6 din spin-off-ul Războiul stelelor Cartea lui Boba Fett pare să fi împărțit opinia fanilor. Primit cu aprobare generală, există o presupunere larg răspândită pe rețelele sociale că reconstrucția mult îmbunătățită a lui Mark Hamill îmbătrânit (comparativ cu apariția sa anterioară în finalul sezonului 2 al Mandalorianul în 2020) este un rezultat direct al faptului că Industrial Light and Magic a angajat practicantul de deepfakes amator Shamook (care și-a îmbunătățit radical lucrările cu software open source); și că reprezentările personajului trebuie să fie o combinație de tehnologie de deepfakes, poate curățate cu CGI.

În prezent, există o confirmare limitată a acestui fapt, deși Shamook a spus puține lucruri lumii de când NDA-ul contractual ILM a intrat în vigoare. Cu toate acestea, lucrarea este o îmbunătățire extraordinară față de CGI-ul din 2020; prezintă unele dintre “luciu” asociate cu modelele de deepfakes derivate din lucrări arhivă; și, în general, se potrivește cu cel mai bun standard vizual actual pentru deepfakes.

Altă parte a opiniei fanilor este că noua încercare de a-l “rejuveniza” pe Luke are un set diferit de defecte decât cea anterioară. Poate cel mai elocvent, lipsa de expresivitate și emoții subtile în secvențele foarte lungi care prezintă noua recreare a lui Skywalker sunt mai tipice pentru deepfakes decât pentru CGI; The Verge a descrie simularea din Boba Fett în termeni de ‘ chip blând și gol al feței înghețate a lui Mark Hamill din 1983’.

Indiferent de tehnologiile din spatele noii reconstrucții ILM, transformările de deepfakes au o problemă fundamentală cu subtilitatea emoțiilor, care este dificil de abordat fie prin schimbări în arhitectură, fie prin îmbunătățirea materialului de antrenare, și care este de obicei evitată prin alegerile atente pe care le fac deepfakers virali atunci când selectează un videoclip țintă.

Limitări ale alinierii faciale

Cele două depozite FOSS de deepfakes cel mai frecvent utilizate sunt DeepFaceLab (DFL) și FaceSwap, ambele derivate din codul sursă anonim și controversat din 2017, cu DFL având un avantaj enorm în industria VFX, în ciuda instrumentalității sale limitate.

Fiecare dintre aceste pachete este însărcinat inițial cu extragerea landmark-urilor faciale din fețele pe care le-a putut identifica din materialul sursă (adică cadre de videoclipuri și/sau imagini statice).

Rețeaua de aliniere facială (FAN) a lui Adrian Bulat în acțiune, din depozitul oficial. Sursă: https://github.com/1adrianb/face-alignment

Rețeaua de aliniere facială (FAN) a lui Adrian Bulat în acțiune, din depozitul oficial. Sursă: https://github.com/1adrianb/face-alignment

Atât DFL, cât și FaceSwap utilizează biblioteca Facial Alignment Network (FAN). FAN poate crea landmark-uri 2D și 3D (a se vedea imaginea de mai sus) pentru fețele extrase. Landmark-urile 3D pot lua în considerare în mod extensiv orientarea percepută a feței, până la profiluri extreme și unghiuri relativ acute.

Însă este evident că acestea sunt linii directoare foarte rudimentare pentru dirijarea și evaluarea pixelilor:

De pe forumul FaceSwap, un indicator aproximativ al landmark-urilor disponibile pentru liniamentele faciale. Sursă: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

De pe forumul FaceSwap, un indicator aproximativ al landmark-urilor disponibile pentru liniamentele faciale. Sursă: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

Cele mai bazice liniamente ale feței sunt permise: ochii pot să se lărgească și să se închidă, la fel și maxilarul, în timp ce configurațiile de bază ale gurii (cum ar fi zâmbirea, încruntarea etc.) pot fi trasate și adaptate. Fața poate să se rotească în orice direcție până la aproximativ 200 de grade de la punctul de vedere al camerei.

Dincolo de acest punct, acestea sunt garduri foarte grosolane pentru modul în care pixelii se vor comporta în cadrul acestor limite și reprezintă singurele linii directoare matematice și precise faciale în întregul proces de deepfakes. Procesul de antrenare în sine compară pur și simplu modul în care pixelii sunt dispuși în interiorul sau în apropierea acestor limite.

Antrenament în DeepFaceLab. Sursă: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

Antrenament în DeepFaceLab. Sursă: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

Deoarece nu există nicio prevedere pentru topologia sub-părților feței (convexitate și concavitate a obrajilor, detalii de îmbătrânire, gropițe etc.), nu este nici măcar posibil să încerci să potrivești astfel de sub- caractere “subtile” între o sursă (‘fața pe care vrei să o suprascrii’) și o țintă (‘fața pe care vrei să o lipești’) identitate.

Rezolvarea cu date limitate

Obținerea de date potrivite între două identități în scopul antrenării de deepfakes nu este ușor. Cu cât unghiul necesar pentru potrivire este mai neobișnuit, cu atât mai mult vei trebui să faci compromisuri cu privire la faptul că acea potrivire (rară) între identitățile A și B prezintă aceeași expresie.

Aproape, dar nu exact o potrivire.

Aproape, dar nu exact o potrivire.

În exemplul de mai sus, cele două identități sunt destul de asemănătoare în dispoziție, dar aceasta este cât de aproape poate ajunge acest set de date la o potrivire exactă.

Diferențe clare rămân: unghiul și obiectivul nu se potrivesc exact, iar nici iluminarea; subiectul A nu își închide complet ochii, spre deosebire de subiectul B; calitatea imaginii și compresia este mai proastă la subiectul A; și, într-un fel, subiectul B pare mult mai fericit decât subiectul A.

Însă, știți, asta este tot ce avem, așa că vom trebui să ne antrenăm oricum.

Deoarece această potrivire A > < B are atâtea elemente neobișnuite, puteți fi siguri că există foarte puține, dacă există, potriviri similare în set. Prin urmare, antrenamentul va subantrena sau suprantrena.

Subantrenare: Dacă această potrivire este o minoritate reală (adică setul de date părinte este destul de mare și nu prezintă adesea caracteristicile acestor două fotografii), nu va primi mult timp de antrenare în comparație cu potrivirile mai “populare” (adică ușoare/neutre). Prin urmare, acest unghi/expresie nu va fi bine reprezentat într-un deepfake realizat cu modelul antrenat.

Suprantrenare: În disperare din cauza lipsei de potriviri de date pentru astfel de potriviri rare A > < B, deepfakers vor face uneori copii ale potrivirii de mai multe ori în setul de date, astfel încât să aibă o șansă mai bună de a deveni o caracteristică a modelului final. Acest lucru va duce la suprantrenare, în care videoclipurile de deepfakes realizate cu modelul sunt susceptibile de a repeta pedant potrivirile care sunt evidente între cele două fotografii, cum ar fi extinderea diferită în care ochii sunt închiși.

În imaginea de mai jos, vedem cum Vladimir Putin este antrenat în DeepFaceLab pentru a face un schimb cu Kevin Spacey. Aici, antrenamentul este relativ avansat la 160.000 de iterații.

Sursă: https://i.imgur.com/OdXHLhU.jpg (original de pe un site pe care nu-l pot lega aici).

Sursă: https://i.imgur.com/OdXHLhU.jpg

Un observator ocazional ar putea susține că Putin arată un pic, ei bine, mai spațios decât Spacey în aceste schimburi de test.

Să vedem ce face un program de recunoaștere a emoțiilor online din neconcordanța dintre expresii:

Sursă: https://www.noldus.com/facereader/measure-your-emotions

Sursă: https://www.noldus.com/facereader/measure-your-emotions

Conform acestui oracle, care analizează o topografie facială mult mai detaliată decât DFL și Faceswap, Spacey este mai puțin furios, dezgustat și disprețuitor decât deepfake-ul rezultat al lui Putin în această potrivire.

Neconcordanța provine ca parte a unui pachet împletit, deoarece aplicațiile populare de deepfakes nu au capacitatea de a înregistra sau de a potrivi expresii sau emoții, cu excepția cazului în care o fac tacit, ca o hartă brută pixel > pixel.

Pentru noi, diferențele sunt uriașe. Învățăm să citim expresii faciale ca o tehnică de supraviețuire de bază de la cei mai mici ani și continuăm să ne bazăm pe această abilitate în viața adultă pentru scopuri de integrare socială și progres, împerechere și ca un cadru de evaluare a amenințărilor în curs de desfășurare. Deoarece suntem atât de sensibili la micro-expresii, tehnologiile de deepfakes vor trebui în cele din urmă să țină cont de acest lucru.

Împotriva curentului

Deși revoluția deepfakes a adus promisiunea de a insera “staruri de film clasice” în filme și emisiuni TV moderne, AI nu poate călători înapoi în timp și nu poate filma lucrările lor clasice la o definiție și calitate mai compatibilă, ceea ce este esențial pentru acest caz de utilizare.

Presupunând (și pentru scopurile noastre, nu contează dacă este greșit) că reconstrucția lui Hamill din Boba Fett a fost în mare parte opera unui model de deepfakes antrenat, setul de date pentru model ar fi trebuit să exploateze imagini din perioada apropiată de linia temporală a show-ului (adică Hamill ca un tânăr de aproximativ 30 de ani în perioada producerii Întoarcerea lui Jedi, 1981-83)).

Filmul a fost film pe peliculă Eastman Color Negative 250T 5293/7293, o emulsie de 250 ASA care a fost considerată medie până la fină la acea vreme, dar a fost depășită în claritate, gamă de culori și fidelitate chiar și până la sfârșitul anilor 1980. Este o peliculă a epocii sale, iar sfera operatică a Jedi i-a oferit puține prim-planuri chiar și actorilor săi principali, făcând problemele de granulație și mai critice, deoarece fețele sursă ocupă doar o parte a cadrului.

O serie de scene cu Hamill în Întoarcerea lui Jedi (1983).

O serie de scene cu Hamill în Întoarcerea lui Jedi (1983).

În plus, o mare parte a imaginilor cu efecte vizuale care îl prezintă pe Hamill ar fi fost rulate printr-o imprimantă optică, ceea ce ar fi mărit granulația filmului. Cu toate acestea, accesul la arhivele Lucasfilm – care au probabil îngrijit negativul master și ar putea oferi ore de imagini brute neutilizate – ar putea depăși această problemă.

Uneori este posibil să se acopere o serie de ani de producție a unui actor pentru a crește și diversifica setul de date de deepfakes. În cazul lui Hamill, deepfakers sunt împiedicați de schimbarea aspectului după un accident de mașină în 1977 și de faptul că el a început imediat a doua sa carieră ca actor de voce apreciat după Jedi, făcând materialul sursă relativ sărac.

Gamă limitată de emoții?

Dacă aveți nevoie ca actorul dvs. de deepfakes să mănânce decorul, veți avea nevoie de imagini sursă care conțin o gamă neobișnuit de largă de expresii faciale. Este posibil ca singurele imagini sursă disponibile la acea vârstă să nu prezinte multe dintre aceste expresii.

De exemplu, până când a apărut arcul narativ al Întoarcerea lui Jedi, personajul lui Hamill și-a stăpânit în mare măsură emoțiile, o evoluție absolut centrală pentru mitologia francizei originale. Prin urmare, dacă creați un model de deepfakes Hamill din datele Jedi, veți trebui să lucrați cu gama mai limitată de emoții și cu o compunere facială mai puțin obișnuită pe care rolul lui Hamill a cerut-o la acea vreme, în comparație cu intrările sale anterioare în franciză.

Chiar și dacă se consideră că există momente în Întoarcerea lui Jedi în care personajul Skywalker se află sub stres și ar putea furniza material pentru o gamă mai mare de expresii, materialul facial din aceste scene este, în orice caz, efemer și supus blur-ului de mișcare și montajului rapid tipic pentru scenele de acțiune; astfel încât datele sunt destul de dezechilibrate.

Generalizare: Combinarea emoțiilor

Dacă reconstrucția lui Skywalker din Boba Fett este, într-adevăr, un deepfake, lipsa de varietate expresivă care i-a fost imputată din unele părți nu ar fi în întregime datorată materialului sursă limitat. Procesul de antrenare encoder-decoder al deepfakeslor caută un model generalizat care să distileze cu succes caracteristici centrale din mii de imagini și care să poată încerca să creeze un deepfake unui unghi care lipsește sau este rar în setul de date.

Dacă nu ar fi fost pentru această flexibilitate, o arhitectură de deepfakes ar fi copiat și lipit doar morfe de bază pe baza unui cadru, fără a lua în considerare adaptarea temporală sau contextul.

Cu toate acestea, schimbul dureros pentru această versatilitate este că fidelitatea expresiei este probabil să fie o victimă a procesului, iar orice expresii care sunt “subtile” nu vor fi cele potrivite. Ne jucăm fețele noastre ca o orchestră de 100 de piese și suntem bine echipați pentru a face acest lucru, în timp ce software-ul de deepfakes este, probabil, lipsit de cel puțin secțiunea de coarde.

Disparitatea afectului în expresii

Mișcările faciale și efectele lor asupra noastră nu sunt un limbaj uniform pe toate fețele; sprâncenele ridicate care par insouciant pe Roger Moore ar putea să pară mai puțin sofisticate pe Seth Rogan, în timp ce farmecul seducător al lui Marilyn Monroe ar putea să se traducă într-o emoție mai negativă dacă ar fi deepfaked pe o persoană a cărei rol cel mai disponibil este “furios” sau “nemulțumit” (cum ar fi personajul lui Aubrey Plaza de-a lungul a șapte sezoane din Parks and Recreation).

Prin urmare, echivalența pixel > pixel între seturile de fețe A/B nu este neapărat utilă în acest sens; dar este tot ceea ce oferă software-ul de deepfakes FOSS de ultimă generație.

Ce este, probabil, necesar este un cadru de deepfakes care nu numai că poate recunoaște expresii și deduce emoții, dar are și capacitatea de a încarna concepte de nivel superior, cum ar fi furios, seductor, plictisit, obosit etc., și de a categorisi aceste emoții și expresiile lor asociate în fiecare dintre cele două seturi de fețe, mai degrabă decât examinarea și replicarea dispoziției unei guri sau a unei pleoape.

 

 

Publicat pentru prima dată pe 3 februarie 2022. Actualizat la 19:47 EET, atribuirea numelui incorectă.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai