Unghiul lui Anderson

Modificarea emoțiilor în secvențele video cu ajutorul inteligenței artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetători din Grecia și Regatul Unit au dezvoltat o abordare inovatoare de schimbare a expresiilor și a stării de spirit aparente a oamenilor în secvențele video, păstrând în același timp fidelitatea mișcărilor buzelor față de sunetul original, într-un mod în care încercările anterioare nu au putut să o egaleze.

Din videoclipul care însoțește articolul (încorporat la sfârșitul acestui articol), o scurtă secvență cu actorul Al Pacino având expresia modificată subtil de NED, pe baza unor concepte semantice de nivel înalt. Sursă: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Din videoclipul care însoțește articolul (încorporat la sfârșitul acestui articol), o scurtă secvență cu actorul Al Pacino având expresia modificată subtil de NED, pe baza unor concepte semantice de nivel înalt care definesc expresii faciale individuale și emoțiile asociate. Metoda “Reference-Driven” de pe partea dreaptă ia emoțiile interpretate dintr-un videoclip sursă și le aplică întregii secvențe video. Sursă: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Acest domeniu se încadrează în categoria în creștere a emoțiilor create cu ajutorul inteligenței artificiale, în care identitatea vorbitorului original este păstrată, dar expresiile și micro-expresiile sale sunt modificate. Pe măsură ce această tehnologie a inteligenței artificiale se maturizează, ea oferă posibilitatea producțiilor de film și televiziune de a face modificări subtile ale expresiilor actorilor – dar deschide și o categorie nouă de “video cu emoții modificate”.

Modificarea fețelor

Expresiile faciale ale unor persoane publice, cum ar fi politicienii, sunt atent curate; în 2016, expresiile faciale ale lui Hillary Clinton au fost supuse unei atenții intense din partea mass-media pentru impactul lor potențial negativ asupra șanselor sale electorale; expresiile faciale, se pare, sunt și un subiect de interes pentru FBI; și ele sunt un indicator critic în interviurile de angajare, făcând ca perspectiva unei filtre “control expresie” în direct să fie o dezvoltare dorită pentru cei care își caută un loc de muncă și care încearcă să treacă de preselecția pe Zoom.

Un studiu din 2005 din Regatul Unit a afirmat că aspectul facial influențează deciziile de vot, în timp ce o caracteristică din 2019 a ziarului Washington Post a examinat utilizarea “clipurilor video în afara contextului”, care este, în prezent, cel mai apropiat lucru de a putea schimba modul în care o persoană publică pare să se comporte, să răspundă sau să se simtă.

Spre manipularea neurală a expresiilor

În prezent, stadiul actual al manipulării expresiilor faciale este destul de rudimentar, deoarece implică abordarea dezimplicării conceptelor de nivel înalt (cum ar fi trist, furios, fericit, zâmbitor) din conținutul video real. Deși arhitecturile tradiționale de deepfake par să realizeze această dezimplicare destul de bine, reflectarea emoțiilor între identități diferite necesită ca două seturi de fețe de antrenare să conțină expresii corespunzătoare pentru fiecare identitate.

Deoarece caracteristicile de identificare facială și poziția feței sunt în prezent atât de strâns legate, o paritate largă a expresiilor, poziției capului și (într-o măsură mai mică) iluminării este necesară între două seturi de fețe pentru a antrena un model de deepfake eficient pe sisteme precum DeepFaceLab. Cu cât o anumită configurație (cum ar fi

Exemple tipice de imagini cu fețe din seturile de date utilizate pentru antrenarea deepfake-urilor. În prezent, puteți modifica expresia facială a unei persoane doar prin crearea unor căi de expresie la expresie specifice ID-ului într-o rețea neurală de deepfake. Software-ul de deepfake din 2017 nu are o înțelegere intrinsică, semantică a unui “zâmbet” – el doar asociază și potrivește schimbări percepute în geometria facială între cele două subiecte.

Ce este de dorit și nu a fost încă realizat perfect este să recunoaștem cum subiectul B (de exemplu) zâmbește și să creăm pur și simplu un comutator de zâmbet în arhitectură, fără a trebui să o asociez cu o imagine echivalentă a subiectului A zâmbind.

Articolul nou se intitulează Neural Emotion Director: control semantic al expresiilor faciale în videoclipuri “în sălbăticie” și provine de la cercetători de la Școala de Inginerie Electrică și Informatică de la Universitatea Tehnică Națională din Atena, Institutul de Informatică de la Fundația pentru Cercetare și Tehnologie Hellas (FORTH) și Colegiul de Inginerie, Matematică și Științe Fizice de la Universitatea din Exeter din Regatul Unit.

Echipa a dezvoltat un cadru numit Neural Emotion Director (NED), care incorporează o rețea de traducere a emoțiilor bazată pe 3D, Manipulator de emoții bazat pe 3D.

NED ia o secvență primită de parametri de expresie și o traduce într-un domeniu țintă. A fost antrenat pe date neordonate, ceea ce înseamnă că nu este necesar să se antreneze pe seturi de date în care fiecare identitate are expresii faciale corespunzătoare.

Videoclipul, afișat la sfârșitul acestui articol, rulează o serie de teste în care NED impune o stare emoțională aparentă asupra unor secvențe video din setul de date YouTube.

Videoclipul, afișat la sfârșitul acestui articol, rulează o serie de teste în care NED impune o stare emoțională aparentă asupra unor secvențe video din setul de date YouTube.

Autorii afirmă că NED este prima metodă video pentru “regizarea” actorilor în situații aleatorii și imprevizibile și au făcut codul disponibil pe pagina proiectului NED.

Metodă și arhitectură

Sistemul este antrenat pe două seturi mari de date video care au fost etichetate cu “etichete de emoție”.

Ieșirea este posibilă datorită unui renderer de fețe video care redă emoția dorită în video folosind tehnici tradiționale de sinteză a imaginilor faciale, inclusiv segmentarea feței, alinierea punctelor de reper faciale și amestecarea, unde doar zona facială este sintetizată și apoi impusă peste secvența originală.

Arhitectura pipeline-ului Neural Emotion Detector (NED). Sursă: https://arxiv.org/pdf/2112.00585.pdf

Arhitectura pipeline-ului Neural Emotion Detector (NED). Sursă: https://arxiv.org/pdf/2112.00585.pdf

Inițial, sistemul obține recuperarea facială 3D și impune alinierea punctelor de reper faciale pe cadrele de intrare pentru a identifica expresia. După aceea, acești parametri de expresie recuperați sunt transmiși la Manipulatorul de emoții bazat pe 3D, iar un vector de stil este calculat prin intermediul unei etichete semantice (cum ar fi “fericit”) sau a unui fișier de referință.

Un fișier de referință este un videoclip care prezintă o expresie/emotie recunoscută, care este apoi impusă asupra întregii secvențe video țintă, înlocuind expresia originală.

Etape în pipeline-ul de transfer al emoțiilor, cu actori diferiți din videoclipurile YouTube.

Etape în pipeline-ul de transfer al emoțiilor, cu actori diferiți din videoclipurile YouTube.

Forma finală a feței generate în 3D este apoi concatenată cu coordonatele feței medii normalizate (NMFC) și imaginile ochilor (punctele roșii din imaginea de mai sus) și transmisă renderer-ului neural, care efectuează manipularea finală.

Rezultate

Cercetătorii au efectuat studii extensive, inclusiv studii cu utilizatori și studii de ablație, pentru a evalua eficacitatea metodei față de lucrările anterioare și au constatat că, în majoritatea categoriilor, NED depășește stadiul actual al tehnologiei în acest subsector al manipulării faciale neurale.

Autorii articolului prevăd că implementările ulterioare ale acestei lucrări și unelte de natură similară vor fi utile în principal în industriile de televiziune și cinematografie, afirmând:

‘Metoda noastră deschide o mulțime de posibilități noi pentru aplicații utile ale tehnologiilor de renderare neurală, de la post-producția de film și jocuri video la avatare afective foto-reale.’

Acesta este un studiu timpuriu în domeniu, dar unul dintre primele care încearcă reînregistrarea facială cu videoclipuri și nu cu imagini statice. Deși videoclipurile sunt, în esență, multe imagini statice care rulează foarte repede, există considerații temporale care fac aplicațiile anterioare de transfer de emoții mai puțin eficiente. În videoclipul care însoțește articolul și în exemplele din articol, autorii includ comparații vizuale ale ieșirii NED față de alte metode recente comparabile.

Mai multe comparații detaliate și multe alte exemple ale NED pot fi găsite în videoclipul complet de mai jos:

 

3 decembrie 2021, 18:30 GMT+2 – La cererea unuia dintre autorii articolului, s-au făcut corecții cu privire la “fișierul de referință”, pe care l-am descris greșit ca o fotografie statică (deși, de fapt, este un clip video). De asemenea, s-a făcut o modificare a numelui Institutului de Informatică de la Fundația pentru Cercetare și Tehnologie.
3 decembrie 2021, 20:50 GMT+2 – A doua cerere din partea unuia dintre autorii articolului pentru o modificare suplimentară a numelui instituției menționate mai sus.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai