Unghiul lui Anderson

NeRF face o altă mișcare spre înlocuirea CGI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetătorii de la MIT și Google au făcut un pas mare în rezolvarea uneia dintre cele mai fundamentale obstacole pentru o tehnologie emergentă condusă de IA care ar putea înlocui în cele din urmă CGI – separarea imaginilor de câmp de radianță neurală (NeRF) în componentele lor vizuale constitutive, astfel încât imaginile pot fi retexturate și relitate.

Abordarea nouă, numită NeRFactor, separă eficient imaginile capturate în normale per obiect (pe care pot fi asignate texturi), vizibilitatea luminii, albedo (proporția de lumină incidentală care este reflectată de la o suprafață) și funcțiile de distribuție a reflectanței bidirecționale (BRDF).

Cu aceste aspecte izolate, este posibil nu numai să se schimbe texturile pentru obiecte individuale sau grupuri de obiecte, dar și să se adauge surse de lumină și implementări de umbre noi și unice, discountând orice ar fi fost capturat de matricele de camere multiple care generează intrări pentru imagini NeRF.

Normale, vizibilitate, albedo și BRDF separate sub NeRFactor. Sursă: https://www.youtube.com/watch?v=UUVSPJlwhPg

Normale, vizibilitate, albedo și BRDF separate sub NeRFactor. Sursă: https://www.youtube.com/watch?v=UUVSPJlwhPg

Modelul susține umbre moi sau dure de la surse de lumină arbitrare, definite de utilizator, și separă cele patru aspecte ale videoclipului capturat în mod programatic, utilizând o pierdere de reconstrucție, date din calcule anterioare ale BRDF și o regularizare simplă de netezire.

Fluxul de lucru al NeRFactor, extrăgând separat aspecte actionabile ale imaginilor derivate din matricele de camere multiple. Sursă: https://arxiv.org/pdf/2106.01970.pdf

NeRFactor utilizează o sondă de lumină HDR, o abordare bine stabilită care a pătruns în scena industrială și artistică vizuală de la introducerea sa în 1998, pentru a evalua posibilele căi pentru raze, ceea ce permite iluminare arbitrară. Deoarece acest lucru generează un număr imposibil de controlat de parametri posibili, sonda de lumină este filtrată printr-un perceptron multi-strat (MLP), care asociază geometria percepută cu sonda fără a încerca să calculeze o hartă completă de volum de lumină pentru spațiul modelului.

Doi modele de câmp de radianță neurală sunt utilizați pentru a demonstra cinci modele de iluminare posibile sub NeRFactor. Faceți clic pe imagine pentru o rezoluție mai mare.

Motiv de reflecție

Cercetarea nouă este poate cel mai semnificativă în separarea straturilor de imagini capturate care controlează reflexia. Acesta rămâne unul dintre cele mai mari provocări pentru imagini de câmp de radianță neurală, deoarece un sistem NeRF cu adevărat nou și flexibil va trebui nu numai să poată înlocui texturi, dar în mod crucial va trebui să aibă o modalitate de a reflecta obiecte în mișcare (în afara mediului fix) care ar fi de obicei contabilizate într-un flux de lucru CGI.

Acestă problemă a fost remarcată recent în legătură cu cercetarea impresionantă a Intel în transformarea filmelor de jocuri video în videouri fotorealistice prin rețele neuronale convoluționale. În astfel de fluxuri de lucru, multe aspecte “coapte” ale materialului sursă ar trebui să devină discrete și interschimbabile, și acest lucru este, în mod evident, mai ușor de rezolvat pentru relitare (care este o funcție a geometriei renderizate în NeRF) decât pentru reflexii (care utilizează geometrie “în afara ecranului” care este în întregime în afara sferei modelului).

Prin urmare, izolarea straturilor în videoclipurile NeRF care facilitează reflexia aduce NeRF cu un pas mai aproape de rezolvarea “provocării reflexiei”.

Utilizarea unui mediu HDR rezolvă deja problema generării reflexiilor de mediu din lume (adică ceruri, peisaje și alte factori ambientali “fixi”), dar vor fi necesare abordări noi pentru a introduce reflexii dinamice și în mișcare.

Fotogrammetrie cu NeRF

Imaginile de câmp de radianță neurală utilizează analiza de învățare automată pentru a dezvolta un spațiu complet volumetric dintr-o scenă sau obiect care a fost capturat dintr-un număr de unghiuri.

Diverse scheme NeRF bazate care au apărut în ultimul an au utilizat o varietate de dispozitive de cameră contribuitoare; unele utilizează 16 sau mai multe camere, altele doar una sau două. În toate cazurile, punctele de vedere intermediare sunt “umplute” (adică interpretate) astfel încât scena sau obiectul poate fi navigat fluent.

Entitatea rezultată este un spațiu complet volumetric, cu o înțelegere intrinsecă 3D care poate fi exploatată în multe moduri, inclusiv capacitatea de a genera mesh-uri CG tradiționale din suma 3D parsată a imaginilor de intrare.

NeRF în contextul unui “Nou CGI”

Imaginile de câmp de radianță neurală sunt desenate direct din imagini ale lumii reale, inclusiv imagini în mișcare ale oamenilor, obiectelor și scenelor. În contrast, o metodologie CGI “studiază” și interpretează lumea, necesitând lucrători calificați pentru a construi mesh-uri, schele și texturi care utilizează imagini ale lumii reale (adică capturi faciale și de mediu).

În plus, CGI a avut probleme continue cu efectul “văii uncane” în încercările sale de a recrea asemănări umane, ceea ce nu reprezintă o constrângere pentru o abordare condusă de NeRF, care capturează pur și simplu videoclipuri sau imagini cu oameni reali și le manipulează.

Mai mult, NeRF poate genera geometrie de mesh CGI tradițională direct din fotografii, după cum este necesar, și în esență poate înlocui multe dintre procedurile manuale care au fost întotdeauna necesare în imagini generate de calculator.

Provocări pentru NeRF

Cercetarea recentă de la MIT și Google vine în contextul unei adevărate inundații de articole NeRF în ultimul an, multe dintre care au oferit soluții la diversele provocări ridicate de articolul inițial din 2020.

În aprilie, o inovație de la un consorțiu de cercetare chinez a oferit o modalitate de a izola discret liniile temporale individuale ale aspectelor dintr-o scenă NeRF, inclusiv oameni.

ST-NeRF

Abordarea chineză permite utilizatorilor să copieze, să lipească și să redimensioneze elemente capturate, dezlegându-le de la cronologia liniară a videoclipului sursă original. Sursă: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Acestă abordare nu numai că permite reimaginarea scenei din orice unghi capturat de matricea de camere (și nu doar dintr-o singură vedere reprezentată într-un videoclip obișnuit), dar permite și o compunere versatilă – și chiar capacitatea de a reprezenta două aspecte din același material filmat care rulează în propriile lor cadre temporale (sau chiar rulează înapoi, după cum este necesar).

Două aspecte NeRF separate rulează la viteze diferite în aceeași scenă. Sursă: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Abordarea chineză permite utilizatorilor să copieze, să lipească și să redimensioneze elemente capturate, dezlegându-le de la cronologia liniară a videoclipului sursă original. Sursă: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Una dintre cele mai mari provocări pentru NeRF este reducerea resurselor considerabile necesare pentru antrenarea unei scene, și acest lucru a fost abordat într-un număr de articole recente. De exemplu, Institutul Max Planck pentru Sisteme Intelligente a introdus recent KiloNeRF, care nu numai că accelerează timpul de renderizare cu un factor de 1000, dar permite chiar NeRF să funcționeze în mod interactiv.

KiloNeRF rulează un mediu interactiv la 50fps pe un GTX 1080ti. Sursă: https://github.com/creiser/kilonerf

KiloNeRF rulează un mediu interactiv la 50fps pe un GTX 1080ti. Sursă: https://github.com/creiser/kilonerf

În plus, Recursive-NeRF (dintr-un articol din mai 2021 de la cercetători de la Universitatea Tsinghua) oferă renderizare recursivă de înaltă calitate la cerere. În loc să oblige utilizatorul să renderizeze întregi scene, inclusiv părți care nu sunt vizibile, Recursive-NeRF oferă ceva asemănător cu comprimarea cu pierderi a JPEG, și poate genera sub-NeRF discrete pentru a gestiona imagini suplimentare la cerere – realizând o economie uriașă de resurse computaționale.

Păstrarea detaliilor în timp ce se elimină calculele de render inutile cu Recursive-NeRF. Sursă: https://arxiv.org/pdf/2105.09103.pdf

Păstrarea detaliilor în timp ce se elimină calculele de render inutile cu Recursive-NeRF. Faceți clic pe imagine pentru o rezoluție mai mare. Sursă: https://arxiv.org/pdf/2105.09103.pdf

Alte abordări includ FastNeRF, care afirmă că realizează renderizare neuronală de înaltă fidelitate la 200fps.

A fost remarcat că multe dintre tehnicile de optimizare pentru NeRF implică “coacerea” scenei, prin angajarea aspectelor care sunt dorite să fie renderizate și eliminarea altor aspecte, ceea ce limitează explorarea, dar accelerează foarte mult interactivitatea.

Dezavantajul acestuia este că stresul se mută de la GPU la stocare, deoarece scenele “coapte” ocupă o cantitate imensă de spațiu pe disc; până la un anumit punct, acest lucru poate fi mitigat prin subspecimenarea datelor “coapte”, deși acest lucru implică și un anumit angajament, în ceea ce privește închiderea căilor de explorare sau interactivitate.

În ceea ce privește captura și scheletizarea mișcării, o nouă abordare de la universitățile Zheijang și Cornell, dezvăluită în mai, a oferit o metodă pentru a recrea oameni animabili utilizând câmpuri de greutate de amestec și structuri scheletice interpretate din videoclipul de intrare:

Structură scheletică derivată în NeRF animabil. Sursă: https://www.youtube.com/watch?v=eWOSWbmfJo4

Structură scheletică derivată în NeRF animabil. Sursă: https://www.youtube.com/watch?v=eWOSWbmfJo4

Când va avea NeRF momentul “Jurassic Park”?

În ciuda ritmului rapid de progres în sinteza de imagini prin câmpuri de radianță neuronale, este doar în această perioadă când se va stabili orice fel de “lege a termodinamicii” pentru cât de utilizabil poate deveni NeRF. În ceea ce privește cronologia istorică a CGI, NeRF se află în prezent în jurul anului 1973, imediat după prima utilizare a CGI în Westworld.

Acest lucru nu înseamnă că NeRF va trebui să aștepte neapărat nouă ani pentru a-și atinge echivalentul Wrath Of Khan sau decenii pentru a atinge progresele pe care CGI le-a realizat sub patronajul entuziast al lui James Cameron în 1989 The Abyss sau 1991 Terminator 2 – și apoi, momentul revoluționar al tehnologiei în 1993 Jurassic Park.

Scena de imagine s-a schimbat foarte mult de la perioada lungă de stagnare a efectelor vizuale foto-chimice, care a dominat producția de film și televiziune de la nașterea cinematografiei până în anii 1990. Apariția revoluției PC și accelerarea legii lui Moore au condus la revoluția CGI, care altfel ar fi putut avea loc încă din anii 1960.

Rămâne de văzut dacă există vreo barieră atât de implacabilă care ar putea împiedica progresul NeRF pentru atât de mult timp – și dacă inovațiile ulterioare în viziunea computerizată nu ar putea să o depășească în cele din urmă pe NeRF ca principalul concurent pentru coroana CGI, caracterizând câmpurile de radianță neuronale ca “mașina de fax” a sintezei de imagini neuronale.

Deocamdată, NeRF nu a fost utilizat în niciun context în afara cercetării academice; dar este demn de remarcat că jucători importanți precum Google Research și multe dintre cele mai proeminente laboratoare de cercetare în viziunea computerizată concurează pentru cea mai recentă inovație NeRF.

Multe dintre cele mai mari obstacole ale NeRF au început să fie abordate direct anul acesta; dacă cercetările ulterioare oferă o soluție la “problema reflexiei”, și dacă multe direcții de cercetare care optimizează NeRF se contopesc într-o soluție decisivă pentru cerințele tehnologiei de procesare și/sau stocare, NeRF are cu adevărat o șansă de a deveni “noul CGI” în următorii cinci ani.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai