Unghiul lui Anderson
Zorii Emoțiilor Deepfake

Cercetătorii au dezvoltat o nouă tehnică de învățare automată pentru a impune arbitrar noi emoții pe fețele din videoclipuri, adaptând tehnologii existente care au apărut recent ca soluții pentru a face să corespundă mișcările buzelor cu dublajul într-o limbă străină.
Cercetarea este o colaborare egală între Universitatea Northeastern din Boston și Laboratorul Media de la MIT și se intitulează Invertable Frowns: Video-to-Video Facial Emotion Translation. Deși cercetătorii recunosc că calitatea inițială a rezultatelor trebuie să fie dezvoltată prin cercetări ulterioare, ei afirmă că tehnica, numită Wav2Lip-Emotion, este prima de acest fel care abordează direct modificarea expresiilor faciale din videoclipuri prin tehnici de rețele neuronale.
Codul sursă a fost publicat pe GitHub, deși punctele de control ale modelului vor fi adăugate mai târziu în depozitul de cod deschis, promit autorii.

În stânga, un cadru ‘trist’ din videoclipul sursă. În dreapta, un cadru ‘fericit’. În centru se află două abordări incipiente pentru sintetizarea unor emoții alternative – rândul superior: o mască facială completă în care întreaga suprafață a expresiei a fost înlocuită; rândul inferior: o metodă mai tradițională Wav2Lip, care înlocuiește doar partea inferioară a feței. Sursă: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf
Un singur videoclip ca date sursă
În teorie, astfel de manipulări sunt posibile acum prin antrenarea completă a unor depozite tradiționale de deepfake, cum ar fi DeepFaceLab sau FaceSwap. Cu toate acestea, fluxul de lucru standard ar implica utilizarea unei identități alternative identității “țintă”, cum ar fi un actor care imită identitatea țintă, ale cărui expresii ar fi transferate către o altă persoană, împreună cu restul interpretării. În plus, tehnici de clonare a vocii deepfake ar fi de obicei necesare pentru a completa iluzia.
Mai mult, schimbarea efectivă a expresiei țintă1>țintă1 într-un singur videoclip sursă în aceste cadre populare ar implica schimbarea vectorilor de aliniere facială într-un mod în care aceste arhitecturi nu o fac în prezent.

Wav2Lip-Emotion menține sincronizarea buzelor dialogului audio original din videoclip în timp ce transformă expresiile asociate.
În schimb, Wav2Lip-Emotion își propune să “copieze și să lipească” expresii legate de emoții dintr-o parte a unui videoclip și să le înlocuiască în alte puncte, cu o frugalitate autoimpusă a datelor sursă care urmează să ofere în cele din urmă o metodă cu mai puțin efort pentru manipularea expresiilor.
Modele offline ar putea fi dezvoltate ulterior, care să fie antrenate pe videoclipuri alternative ale vorbitorului, eliminând nevoia ca vreun videoclip să conțină o “paletă” de stări de expresie cu care să se manipuleze videoclipul.
Scopuri posibile
Autorii sugerează o serie de aplicații pentru modificarea expresiilor, inclusiv un filtru de videoclip live pentru a compensa efectele PTSD și suferinzilor de paralizie facială. Articolul observă:
‘Persoanele cu sau fără expresii faciale inhibate ar putea beneficia de ajustarea propriilor expresii pentru a se potrivi mai bine cu circumstanțele sociale. O persoană ar putea dori să modifice expresiile din videoclipurile prezentate lor. Vorbind, oamenii ar putea striga unul la altul în timpul unei conferințe video, dar totuși ar dori să obțină conținutul schimbului lor fără expresiile neplăcute. Sau un regizor de film ar putea dori să îmbunătățească sau să diminueze expresiile unui actor.’
Deoarece expresia facială este un indicator cheie și de bază al intenției, chiar și atunci când se freacă împotriva cuvintelor rostite, capacitatea de a altera expresia oferă, într-o anumită măsură, capacitatea de a schimba modul în care comunicarea este primită.
Lucrări anterioare
Interesul pentru modificarea expresiilor prin învățare automată datează cel puțin din 2012, când o colaborare între Adobe, Facebook și Universitatea Rutgers a propus o metodă pentru a altera expresiile prin utilizarea unei abordări de reconstrucție 3D bazată pe tensori, care a impus cu greutate o plasă CGI peste fiecare cadru al unui videoclip țintă pentru a efectua schimbarea.

Cercetarea din 2012 a lui Adobe/Facebook a manipulat expresiile prin impunerea unor schimbări tradiționale, conduse de CGI, asupra filmărilor video. Expresiile puteau fi augmentate sau suprimate. Sursă: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf
Deși rezultatele au fost promițătoare, tehnica a fost greoaie și resursele necesare au fost considerabile. În acest moment, CGI-ul era mult înaintea abordărilor bazate pe viziunea computerului și manipularea directă a caracteristicilor și a pixelilor.
Mai strâns legat de noul articol este MEAD, un set de date și un model de generare a expresiilor lansat în 2020, capabil să genereze videoclipuri “talking-head”, deși fără nivelul de sofisticare care poate fi obținut prin modificarea directă a videoclipului sursă.

Generarea expresiilor cu MEAD din 2020, o colaborare între SenseTime Research, Carnegie Mellon și trei universități chineze. Sursă: https://wywu.github.io/projects/MEAD/MEAD.html
În 2018, un alt articol, intitulat GANimation: Anatomically-aware Facial Animation from a Single Image, a apărut ca o colaborare academică între Statele Unite și Spania și a utilizat Rețele Adversariale Generative pentru a augmenta sau schimba expresiile în imagini statice.

Schimbarea expresiilor în imagini statice cu GANimation. Sursă: https://arxiv.org/pdf/1807.09251.pdf
Wav2Lip-Emotion
În schimb, noul proiect se bazează pe Wav2Lip, care a atras atenția în 2020 prin oferirea unei metode potențiale pentru resincronizarea mișcărilor buzelor pentru a se potrivi cu un discurs (sau o melodie) nouă care nu a apărut în videoclipul original.
Arhitectura originală Wav2Lip a fost antrenată pe un corpus de propoziții vorbite din arhivele BBC. Pentru a adapta Wav2Lip spre sarcina de alterare a expresiilor, cercetătorii “au rafinat” arhitectura pe setul de date menționat anterior MEAD.
MEAD constă din 40 de ore de videoclipuri cu 60 de actori care citesc aceeași propoziție în timp ce efectuează o varietate de expresii faciale. Actorii provin din 15 țări diferite și oferă o gamă de caracteristici internaționale menite să ajute proiectul (și proiectele derivate) să producă o sinteză a expresiilor aplicabilă și bine generalizată.
La momentul cercetării, MEAD a lansat doar prima parte a setului de date, care prezintă 47 de persoane care efectuează expresii precum “furios”, “dezgust”, “frică”, “dispreț”, “fericit”, “trist” și “uimire”. În această primă încercare de abordare a unei noi abordări, cercetătorii au limitat domeniul de aplicare al proiectului la suprapunerea sau alterarea percepției emoțiilor “fericit” și “trist”, deoarece acestea sunt cele mai ușor recunoscute.
Metodă și rezultate
Arhitectura originală Wav2Lip înlocuiește doar partea inferioară a feței, în timp ce Wav2Lip-Emotion experimentează și cu o mască de înlocuire facială completă și sinteză de expresii. Prin urmare, a fost necesar ca cercetătorii să modifice, de asemenea, metodele de evaluare integrate, deoarece acestea nu au fost proiectate pentru o configurație cu față completă.
Autorii îmbunătățesc codul original prin păstrarea intrării audio originale, menținând consistența mișcării buzelor.
Elementul generator are un codificator de identitate, un codificator de vorbire și un decodificator facial, în conformitate cu lucrările anterioare. Elementul de vorbire este codificat suplimentar ca convoluții 2D împachetate care sunt concatenate ulterior cu cadrele asociate.
Pe lângă elementul generativ, arhitectura modificată prezintă trei componente discriminator principale, care vizează calitatea sincronizării buzelor, un element de obiectiv emoțional și un obiectiv de calitate vizuală antrenat adversar.
Pentru reconstrucția feței complete, lucrarea originală Wav2Lip nu a conținut niciun precedent, și prin urmare modelul a fost antrenat de la zero. Pentru antrenamentul feței inferioare (jumătate de mască), cercetătorii au procedat de la punctele de control incluse în codul original Wav2Lip.
Pe lângă evaluarea automată, cercetătorii au utilizat opinia furnizată de o platformă de servicii semi-automatizată. Lucrătorii au evaluat în general ieșirea cu o notă ridicată în ceea ce privește recunoașterea emoțiilor suprapuse, dar au raportat doar evaluări “moderate” pentru calitatea imaginii.
Autorii sugerează că, pe lângă îmbunătățirea calității videoclipurilor generate cu rafinări ulterioare, iterațiile viitoare ale lucrării ar putea cuprinde o gamă mai largă de emoții, și că lucrarea ar putea fi aplicată în viitor și datelor sursă etichetate sau inferate automat și seturilor de date, ducând în cele din urmă la un sistem autentic în care emoțiile ar putea fi reglate în sus sau în jos la discreția utilizatorului, sau înlocuite în cele din urmă cu emoții contrastante în raport cu videoclipul sursă.












