Unghiul lui Anderson
Spre Real-Time AI Oameni Cu Rendare Neural Lumigraph

În ciuda valului actual de interes pentru Neural Radiance Fields (NeRF), o tehnologie capabilă să creeze medii și obiecte 3D generate de AI, această abordare nouă a tehnologiei de sinteză a imaginilor încă necesită mult timp de antrenament și lipsește o implementare care să permită interfețe în timp real, foarte receptive.
Însă, o colaborare între câteva nume impresionante din industrie și academia oferă o nouă abordare a acestei provocări (cunoscută generic sub numele de Sinteză de Vederi Noi, sau NVS).
Cercetarea articolului, intitulat Rendare Neural Lumigraph, afirmă o îmbunătățire a stadiului actual cu aproximativ două ordine de mărime, reprezentând câteva pași spre renderarea în timp real a graficii prin pipe-line-uri de învățare automată.

Rendare Neural Lumigraph (dreapta) oferă o rezoluție mai bună a artefactelor de amestecare și o manipulare îmbunătățită a ocluziunii față de metodele anterioare. Sursă.
Deși creditelor pentru articolul menționat numai Universitatea Stanford și compania de tehnologie a display-urilor holografice Raxium (care operează în prezent în mod stealth), contributorii includ un arhitect principal de învățare automată la Google, un om de știință computer la Adobe și directorul tehnic la StoryFile (care a făcut știri recent cu o versiune AI a lui William Shatner).
În legătură cu publicitatea recentă a lui Shatner, StoryFile pare să utilizeze NLR în noul său proces de creare a entităților interactive generate de AI, bazate pe caracteristicile și narativele individuale ale oamenilor.
StoryFile își imaginează utilizarea acestei tehnologii în expoziții de muzeu, narative interactive online, display-uri holografice, realitate augmentată (AR) și documentare a patrimoniului – și pare să urmărească, de asemenea, aplicații potențiale noi ale NLR în interviuri de recrutare și aplicații de dating virtual:

Utilizări propuse dintr-un video online de la StoryFile. Sursă: https://www.youtube.com/watch?v=2K9J6q5DqRc
Captură Volumetrică Pentru Interfețe De Sinteză De Vederi Noi Și Video
Principiul capturii volumetrice, de-a lungul gamei de articole care se adună pe această temă, este ideea de a lua imagini statice sau video ale unui subiect și de a utiliza învățarea automată pentru a “umple” punctele de vedere care nu au fost acoperite de matricea originală de camere.

Sursă: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
În imaginea de mai sus, preluată din cercetarea AI a Facebookului din 2019 (a se vedea mai jos), vedem cele patru etape ale capturii volumetrice: multiple camere obțin imagini/filmări; arhitectura encoder/decoder (sau alte arhitecturi) calculează și concatenează relația dintre puncte de vedere; algoritmii de ray-marching calculează voxelii (sau alte unități geometrice spațiale XYZ) ale fiecărui punct din spațiul volumetric; și (în majoritatea articolelor recente) se efectuează antrenament pentru a sintetiza o entitate completă care poate fi manipulată în timp real.
Este această fază de antrenament, adesea extinsă și încărcată cu date, care a ținut până acum sinteza de vederi noi în afara domeniului de timp real sau al capturii foarte receptive.
Faptul că Sinteza de Vederi Noi creează o hartă 3D completă a unui spațiu volumetric înseamnă că este relativ trivial să coase aceste puncte împreună într-o matrice tradițională generată de calculator, capturând și articulând efectiv un om generat de CGI (sau orice alt obiect relativ delimitat) pe loc.
Abordările care utilizează NeRF se bazează pe nori de puncte și hărți de adâncime pentru a genera interpolările dintre punctele de vedere rare ale dispozitivelor de captură:

NeRF poate genera adâncime volumetrică prin calcularea hărților de adâncime, și nu prin generarea de matrice CGI. Sursă: https://www.youtube.com/watch?v=JuH79E8rdKc
Deși NeRF este capabil să calculeze matrice, majoritatea implementărilor nu utilizează acest lucru pentru a genera scene volumetrice.
În schimb, abordarea Implicit Differentiable Renderer (IDR) publicată de Institutul de Știință Weizmann în octombrie 2020, se bazează pe exploatarea informațiilor despre matricea 3D generate automat din matricele de captură:

Exemple de capturi IDR transformate în matrice CGI interactive. Sursă: https://www.youtube.com/watch?v=C55y7RhJ1fE
În timp ce NeRF lipsește de capacitatea IDR de estimare a formei, IDR nu poate egala calitatea imaginii NeRF, iar ambele necesită resurse extinse pentru antrenament și colectare (deși inovațiile recente în NeRF încep să adreseze acest lucru).

Dispozitivul de cameră personalizat al NLR, cu 16 camere GoPro HERO7 și 6 camere centrale Back-Bone H7PRO. Pentru renderarea în timp real, acestea funcționează la o rată minimă de 60fps. Sursă: https://arxiv.org/pdf/2103.11571.pdf
În schimb, Rendarea Neural Lumigraph utilizează SIREN (Rețele Sinusoidale) pentru a incorpora punctele forte ale fiecărei abordări în cadrul său propriu, care este destinat să genereze ieșiri direct utilizabile în pipe-line-urile grafice în timp real existente.
SIREN a fost utilizat pentru implementări similare în ultimul an și reprezintă acum o apel API popular pentru notebook-urile Colab în comunitățile de sinteză a imaginilor; cu toate acestea, inovația NLR constă în aplicarea SIREN-ului la supravegherea imaginilor multi-vederi bidimensionale, care este problematică din cauza gradului în care SIREN produce ieșiri supra-ajustate și nu generalizate.
După ce matricea CGI este extrasă din imaginile matricei, matricea este rasterizată prin OpenGL, iar pozițiile verticalelor matricei sunt mapate la pixelii corespunzători, după care se calculează amestecarea hărților contributive.
Matricea rezultată este mai generalizată și reprezentativă decât cea a NeRF (a se vedea imaginea de mai jos), necesită mai puține calcule și nu aplică detalii excesive în zone (cum ar fi pielea facială netedă) care nu pot beneficia de aceasta:
Pe partea negativă, NLR nu are încă nicio capacitate pentru iluminare dinamică sau reluare, iar ieșirea este limitată la hărți de umbră și alte considerații de iluminare obținute la momentul capturii. Cercetătorii intenționează să abordeze acest lucru în lucrările viitoare.
În plus, articolul recunoaște că formele generate de NLR nu sunt la fel de precise ca unele abordări alternative, cum ar fi Selectarea punctului de vedere pixel cu pixel pentru stereo multi-vederi neordonate, sau cercetarea Institutului Weizmann menționată anterior.
Ascensiunea Sintezei de Imagini Volumetrice
Ideea de a crea entități 3D dintr-o serie limitată de fotografii cu rețele neuronale precede NeRF, cu articole vizionare care datează din 2007 sau mai devreme. În 2019, departamentul de cercetare AI al Facebook a produs un articol de cercetare seminal, Volumetrii Neuronale: Învățarea de Volumetrii Dinamice Renderabile din Imagini, care a permis pentru prima dată interfețe receptive pentru oameni sintetici generați de captură volumetrică bazată pe învățare automată.

Cercetarea Facebook din 2019 a permis crearea unei interfețe utilizator receptive pentru o persoană volumetrică. Sursă: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/













