Unghiul lui Anderson
Disney combină CGI cu redare neurală pentru a aborda „Valea ciudată”

Divizia de cercetare AI a Disney a dezvoltat o metodă hibridă pentru simularea facială de calitate cinematografică, combinând punctele forte ale redării neurale faciale cu consistența unei abordări bazate pe CGI.
Lucrarea în curs de publicare poartă titlul Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering și este prezentată într-un nou video de 10 minute pe canalul Disney Research de pe YouTube (încorporat la sfârșitul acestui articol*).

Plaseuri combinate cu redări faciale neurale. Vezi încorporarea video la sfârșitul articolului pentru detalii și calitate superioare. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk
Așa cum se menționează în video, redarea neurală a fețelor (inclusiv deepfake-urile) poate produce ochi și interiorul gurii mult mai realiste decât poate CGI, în timp ce texturile faciale generate de CGI sunt mai consecvente și adecvate pentru efecte vizuale la nivel de cinema.
Prin urmare, Disney experimentează cu lăsarea generatorului neural StyleGan2 de la NVIDIA să gestioneze trăsăturile înconjurătoare ale feței și elementele „critice pentru viață”, cum ar fi ochii, în timp ce suprapune o piele facială CGI consecventă și elemente conexe în rezultat.
Din video (vezi sfârșitul articolului), conceptul arhitectural din spatele abordării hibride a Disney, în care o plasă CGI tradițională, de tipul folosit pentru a recrea o „tânără” Carrie Fisher și pe Peter Cushing, decedat, pentru Rogue One (2016), este integrată în medii faciale redare neurală.
Video-ul face o referire tacită la critica frecventă privind lipsa de autenticitate și efectul de „vale ciudată” al recreării CGI a actorului britanic decedat Star Wars Peter Cushing în Rogue One (2016), recunoscând:
‘[Există] încă o diferență uriașă între ceea ce oamenii pot captura și reda cu ușurință și dublele digitale fotorealiste finale, complete cu păr, ochi și interiorul gurii. Pentru a închide această diferență, de obicei este nevoie de multă muncă manuală din partea artiștilor calificați.’
În realitate, chiar și cele mai moderne sisteme de captare facială nu încearcă să recreeze ochii, interiorul gurii sau părul, care fie prezintă probleme de autenticitate în astfel de tehnici (ochii), fie de consistență temporală (părul).

Video-ul ilustrează ce vor primi artiștii VFX după o sesiune tipică de captare facială modernă. Ochii, părul, părul facial și interiorul gurii vor trebui gestionați de echipe separate în fluxul de producție, pe lângă texturare și iluminare.
Controlul iluminării
Abordarea hibridă aduce și un avantaj în ceea ce privește re-iluminarea – o provocare notabilă pentru redarea neurală a fețelor, deoarece suprapunerile de piele CGI pot fi re-iluminate mult mai ușor.

O versiune animată a abordării CGI/Neural.
În medii mai dificile, cum ar fi filmările în exterior, cercetătorii au dezvoltat o metodă de completare (inpainting) în jurul unei zone demilitarizate care înconjoară persoana „creată”.

Se generează o margine neagră pentru a permite un „canvas” pentru completarea părților exterioare ale identității și integrarea pielii CGI în rezultatul combinat CGI/neural.
Video-ul notează:
‘[Redarea] neurală nu se potrivește perfect cu constrângerile de fundal. – este menită doar ca ghid, deoarece optimizarea pentru componente umane realiste precum părul, ochii și dinții este obiectivul principal. Mai provocator este să încerci să menții o identitate consecventă, în timp ce schimbi iluminarea mediului.’
Crearea plaselor CGI din redări neurale
Echipa de cercetare a dezvoltat, de asemenea, un autoencoder varițional antrenat pe o bază de date (nespecificată) de imagini 3D ale fețelor și susține că poate genera plase faciale 3D „aleatorii, dar plauzibile” din date de referință.
Există limitări pe care această cercetare trebuie să le depășească, inclusiv dificultatea de a menține părul consistent din punct de vedere temporal în redările neurale, iar video-ul (vezi mai jos) prezintă mai multe exemple de păr care se mută rapid într-un panoramă altfel consecventă în jurul unei fețe CGI/neural.
Consistența temporală în redarea video neurală este o problemă mult mai largă decât cea a Disney și se pare că iterațiile viitoare ale acestui sistem ar putea recurge la adăugarea părului „în post-producție”, sau la diverse alte abordări posibile pentru generarea părului, în loc să se bazeze pe speranța că o nouă metodă neurală o va rezolva în cele din urmă.
Utilizări pentru generarea de seturi de date
Metoda este propusă și ca o posibilă tehnică de generare a datelor sintetice și de îmbogățire a peisajului seturilor de imagini faciale, care în ultimii ani a devenit periculos monoton.
Disney prevede ca noua tehnică să populeze seturile de imagini faciale.
‘[Fiecare] rezultat fotorealist pe care îl generăm are o geometrie corespunzătoare subiacente și hărți de aspect, redate din unghiuri de cameră necunoscute cu iluminare cunoscută. Această informație „ground truth” poate fi vitală pentru antrenarea aplicațiilor ulterioare, cum ar fi reconstrucția facială monoculară 3D, recunoașterea facială sau înțelegerea scenei. Astfel, fiecare redare de rezultat ar putea fi considerată un eșantion de date, și putem genera multe variații ale multor indivizi diferiți.
‘În plus, chiar și pentru o singură persoană redată cu o singură expresie, dintr-un singur unghi și iluminare, putem genera variații aleatoare ale redării foto-realiste prin modificarea seminței de randomizare în timpul optimizării.’
Cercetătorii observă că această diversitate a ieșirilor configurabile ar putea fi utilă în antrenarea aplicațiilor de recunoaștere facială, concluzionând:
‘[Metoda] noastră poate valorifica tehnologia actuală de captare, modelare și redare a pielii faciale și poate crea automat redări faciale fotorealiste complete care corespund identității dorite, expresiei și configurației scenei. Această abordare are aplicații în redarea facială pentru film și divertisment, economisind munca artiștilor manuali și, de asemenea, pentru generarea de date în diferite domenii ale învățării profunde.’
Pentru o privire mai detaliată asupra noii abordări, vizionați video-ul de 10 minute lansat astăzi:
https://www.unite.ai/wp-content/uploads/2021/11/dataset-generation.jpg
* Linkul video original a fost înlocuit cu altul aparent identic la 8 ore după publicarea acestui articol. Am modificat toate legăturile relevante, deoarece nu există nicio urmă a video-ului original.
8:24 GMT+2 – Video înlocuit, deoarece a fost schimbat de canalul Disney Research de pe YouTube dintr-un motiv necunoscut.












