Unghiul lui Anderson

Spre Real-Time AI Oameni Cu Rendare Neural Lumigraph

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Neural Lumigraph Rendering

În ciuda valului actual de interes pentru Neural Radiance Fields (NeRF), o tehnologie capabilă să creeze medii și obiecte 3D generate de AI, această abordare nouă a tehnologiei de sinteză a imaginilor încă necesită mult timp de antrenament și lipsește o implementare care să permită interfețe în timp real, foarte receptive.

Însă, o colaborare între câteva nume impresionante din industrie și academia oferă o nouă abordare a acestei provocări (cunoscută generic sub numele de Sinteză de Vederi Noi, sau NVS).

Cercetarea articolului, intitulat Rendare Neural Lumigraph, afirmă o îmbunătățire a stadiului actual cu aproximativ două ordine de mărime, reprezentând câteva pași spre renderarea în timp real a graficii prin pipe-line-uri de învățare automată.

Rendare Neural Lumigraph (dreapta) oferă o rezoluție mai bună a artefactelor de amestecare și o manipulare îmbunătățită a ocluziunii față de metodele anterioare. Sursă: https://www.youtube.com/watch?v=maVF-7x9644

Rendare Neural Lumigraph (dreapta) oferă o rezoluție mai bună a artefactelor de amestecare și o manipulare îmbunătățită a ocluziunii față de metodele anterioare. Sursă.

Deși creditelor pentru articolul menționat numai Universitatea Stanford și compania de tehnologie a display-urilor holografice Raxium (care operează în prezent în mod stealth), contributorii includ un arhitect principal de învățare automată la Google, un om de știință computer la Adobe și directorul tehnic la StoryFile (care a făcut știri recent cu o versiune AI a lui William Shatner).

În legătură cu publicitatea recentă a lui Shatner, StoryFile pare să utilizeze NLR în noul său proces de creare a entităților interactive generate de AI, bazate pe caracteristicile și narativele individuale ale oamenilor.

StoryFile își imaginează utilizarea acestei tehnologii în expoziții de muzeu, narative interactive online, display-uri holografice, realitate augmentată (AR) și documentare a patrimoniului – și pare să urmărească, de asemenea, aplicații potențiale noi ale NLR în interviuri de recrutare și aplicații de dating virtual:

Utilizări propuse dintr-un video online de la StoryFile. Sursă: https://www.youtube.com/watch?v=2K9J6q5DqRc

Utilizări propuse dintr-un video online de la StoryFile. Sursă: https://www.youtube.com/watch?v=2K9J6q5DqRc

Captură Volumetrică Pentru Interfețe De Sinteză De Vederi Noi Și Video

Principiul capturii volumetrice, de-a lungul gamei de articole care se adună pe această temă, este ideea de a lua imagini statice sau video ale unui subiect și de a utiliza învățarea automată pentru a “umple” punctele de vedere care nu au fost acoperite de matricea originală de camere.

Sursă: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Sursă: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

În imaginea de mai sus, preluată din cercetarea AI a Facebookului din 2019 (a se vedea mai jos), vedem cele patru etape ale capturii volumetrice: multiple camere obțin imagini/filmări; arhitectura encoder/decoder (sau alte arhitecturi) calculează și concatenează relația dintre puncte de vedere; algoritmii de ray-marching calculează voxelii (sau alte unități geometrice spațiale XYZ) ale fiecărui punct din spațiul volumetric; și (în majoritatea articolelor recente) se efectuează antrenament pentru a sintetiza o entitate completă care poate fi manipulată în timp real.

Este această fază de antrenament, adesea extinsă și încărcată cu date, care a ținut până acum sinteza de vederi noi în afara domeniului de timp real sau al capturii foarte receptive.

Faptul că Sinteza de Vederi Noi creează o hartă 3D completă a unui spațiu volumetric înseamnă că este relativ trivial să coase aceste puncte împreună într-o matrice tradițională generată de calculator, capturând și articulând efectiv un om generat de CGI (sau orice alt obiect relativ delimitat) pe loc.

Abordările care utilizează NeRF se bazează pe nori de puncte și hărți de adâncime pentru a genera interpolările dintre punctele de vedere rare ale dispozitivelor de captură:

NeRF poate genera adâncime volumetrică prin calcularea hărților de adâncime, și nu prin generarea de matrice CGI. Sursă: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF poate genera adâncime volumetrică prin calcularea hărților de adâncime, și nu prin generarea de matrice CGI. Sursă: https://www.youtube.com/watch?v=JuH79E8rdKc

Deși NeRF este capabil să calculeze matrice, majoritatea implementărilor nu utilizează acest lucru pentru a genera scene volumetrice.

În schimb, abordarea Implicit Differentiable Renderer (IDR) publicată de Institutul de Știință Weizmann în octombrie 2020, se bazează pe exploatarea informațiilor despre matricea 3D generate automat din matricele de captură:

Exemple de capturi IDR transformate în matrice CGI interactive. Sursă: https://www.youtube.com/watch?v=C55y7RhJ1fE

Exemple de capturi IDR transformate în matrice CGI interactive. Sursă: https://www.youtube.com/watch?v=C55y7RhJ1fE

În timp ce NeRF lipsește de capacitatea IDR de estimare a formei, IDR nu poate egala calitatea imaginii NeRF, iar ambele necesită resurse extinse pentru antrenament și colectare (deși inovațiile recente în NeRF începadreseze acest lucru).

Dispozitivul de cameră personalizat al NLR, cu 16 camere GoPro HERO7 și 6 camere centrale Back-Bone H7PRO. Pentru renderarea în timp real, acestea funcționează la o rată minimă de 60fps. Sursă: https://arxiv.org/pdf/2103.11571.pdf

Dispozitivul de cameră personalizat al NLR, cu 16 camere GoPro HERO7 și 6 camere centrale Back-Bone H7PRO. Pentru renderarea în timp real, acestea funcționează la o rată minimă de 60fps. Sursă: https://arxiv.org/pdf/2103.11571.pdf

În schimb, Rendarea Neural Lumigraph utilizează SIREN (Rețele Sinusoidale) pentru a incorpora punctele forte ale fiecărei abordări în cadrul său propriu, care este destinat să genereze ieșiri direct utilizabile în pipe-line-urile grafice în timp real existente.

SIREN a fost utilizat pentru implementări similare în ultimul an și reprezintă acum o apel API popular pentru notebook-urile Colab în comunitățile de sinteză a imaginilor; cu toate acestea, inovația NLR constă în aplicarea SIREN-ului la supravegherea imaginilor multi-vederi bidimensionale, care este problematică din cauza gradului în care SIREN produce ieșiri supra-ajustate și nu generalizate.

După ce matricea CGI este extrasă din imaginile matricei, matricea este rasterizată prin OpenGL, iar pozițiile verticalelor matricei sunt mapate la pixelii corespunzători, după care se calculează amestecarea hărților contributive.

Matricea rezultată este mai generalizată și reprezentativă decât cea a NeRF (a se vedea imaginea de mai jos), necesită mai puține calcule și nu aplică detalii excesive în zone (cum ar fi pielea facială netedă) care nu pot beneficia de aceasta:

Sursă: https://arxiv.org/pdf/2103.11571.pdf

Sursă: https://arxiv.org/pdf/2103.11571.pdf

Pe partea negativă, NLR nu are încă nicio capacitate pentru iluminare dinamică sau reluare, iar ieșirea este limitată la hărți de umbră și alte considerații de iluminare obținute la momentul capturii. Cercetătorii intenționează să abordeze acest lucru în lucrările viitoare.

În plus, articolul recunoaște că formele generate de NLR nu sunt la fel de precise ca unele abordări alternative, cum ar fi Selectarea punctului de vedere pixel cu pixel pentru stereo multi-vederi neordonate, sau cercetarea Institutului Weizmann menționată anterior.

Ascensiunea Sintezei de Imagini Volumetrice

Ideea de a crea entități 3D dintr-o serie limitată de fotografii cu rețele neuronale precede NeRF, cu articole vizionare care datează din 2007 sau mai devreme. În 2019, departamentul de cercetare AI al Facebook a produs un articol de cercetare seminal, Volumetrii Neuronale: Învățarea de Volumetrii Dinamice Renderabile din Imagini, care a permis pentru prima dată interfețe receptive pentru oameni sintetici generați de captură volumetrică bazată pe învățare automată.

Cercetarea Facebook din 2019 a permis crearea unei interfețe utilizator receptive pentru o persoană volumetrică. Sursă: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Cercetarea Facebook din 2019 a permis crearea unei interfețe utilizator receptive pentru o persoană volumetrică. Sursă: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]