Unghiul lui Anderson

Redare Neurală: NeRF Face o Plimbare în Aerul Proaspăt

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O colaborare între Google Research și Universitatea Harvard a dezvoltat o nouă metodă de a crea video neural de 360 de grade al scenelor complete folosind Neural Radiance Fields (NeRF). Abordarea inovatoare aduce NeRF un pas mai aproape de utilizarea abstractă casual în orice mediu, fără a fi restricționată la modele de masă sau scenarii interioare închise.

Sursă: https://www.youtube.com/watch?v=zBSH-k9GbV4

Vezi sfârșitul articolului pentru videoclipul complet. Sursă: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 poate gestiona fundaluri extinse și obiecte „infinit” precum cerul, deoarece, spre deosebire de majoritatea iterațiilor anterioare, stabilește limite în modul în care razele de lumină sunt interpretate și creează granițe de atenție care raționalizează timpii de antrenament altfel lungi. Vezi noul video însoțitor încorporat la sfârșitul acestui articol pentru mai multe exemple și o perspectivă extinsă asupra procesului.

Noul document poartă titlul Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields și este condus de Senior Staff Research Scientist la Google Research, Jon Barron.

Pentru a înțelege inovația, este necesar să aveți o înțelegere de bază a modului în care funcționează sinteza de imagini bazată pe câmpuri de radianță neurală.

Ce este NeRF?

Este problematic să descrii o rețea NeRF în termeni de „video”, deoarece este mai degrabă un mediu virtual complet realizat în 3D, dar bazat pe AI, în care multiple puncte de vedere din fotografii individuale (inclusiv cadre video) sunt folosite pentru a îmbina o scenă care există tehnic doar în spațiul latent al unui algoritm de învățare automată – dar din care pot fi extrase la cerere un număr extraordinar de puncte de vedere și videoclipuri.

O reprezentare a punctelor multiple de captare a camerei care furnizează datele pe care NeRF le asamblează într-o scenă neurală (imaginea din dreapta).

O reprezentare a punctelor multiple de captare a camerei care furnizează datele pe care NeRF le asamblează într-o scenă neurală (imaginea din dreapta).

Informațiile obținute din fotografiile contributoare sunt antrenate într-o matrice similară cu o grilă de voxeli tradițională în fluxurile de lucru CGI, în sensul că fiecare punct din spațiul 3D primește o valoare, făcând scena navigabilă.

O matrice de voxeli tradițională plasează informația pixelului (care există în mod normal într-un context 2D, cum ar fi grila de pixeli a unui fișier JPEG) într-un spațiu tridimensional. Sursă: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

O matrice de voxeli tradițională plasează informația pixelului (care există în mod normal într-un context 2D, cum ar fi grila de pixeli a unui fișier JPEG) într-un spațiu tridimensional. Sursă: ResearchGate

După calcularea spațiului interstițial dintre fotografii (dacă este necesar), calea fiecărui pixel posibil din fiecare fotografie contributoare este efectiv „trasată prin raze” și i se atribuie o valoare de culoare, inclusiv o valoare de transparență (fără care matricea neurală ar fi complet opacă sau complet goală).

Ca și grilele de voxeli, și spre deosebire de spațiul de coordonate 3D bazat pe CGI, „interiorul” unui obiect „închis” nu există într-o matrice NeRF. Poți deschide un set de tobe CGI și să privești în interior, dacă dorești; dar din perspectiva NeRF, existența setului de tobe se încheie când valoarea de opacitate a suprafeței sale este egală cu „1”.

O Privire Mai Larg asupra unui Pixel

Mip-NeRF 360 este o extensie a cercetării din martie 2021, care a introdus eficient anti-aliasing în NeRF fără supra-eșantionare exhaustivă.

NeRF calculează în mod tradițional doar o singură cale a pixelului, ceea ce tinde să producă tipul de „jaggies” care caracteriza formatele de imagini timpurii de pe internet, precum și sisteme de jocuri anterioare. Aceste margini zimțate au fost rezolvate prin diverse metode, de obicei implicând eșantionarea pixelilor adiacenți și găsirea unei reprezentări medii.

Deoarece NeRF tradițional eșantionează doar acea singură cale a pixelului, Mip-NeRF a introdus o zonă de captare „conică”, ca o torță cu fascicul larg, care furnizează suficiente informații despre pixelii adiacenți pentru a produce anti-aliasing economic cu detalii îmbunătățite.

Captarea conică pe care o folosește Mip-NeRF este tăiată în frustrumuri conice (mai jos), care este apoi „estompată” pentru a reprezenta un spațiu Gaussian mai vag ce poate fi folosit pentru a calcula acuratețea și aliasing-ul unui pixel. Sursă: https://www.youtube.com/watch?v=EpH175PY1A0

Captarea conică pe care o folosește Mip-NeRF este tăiată în frustrumuri conice (imaginea de jos), care sunt apoi „estompate” pentru a crea spații Gaussian vagi ce pot fi folosite pentru a calcula acuratețea și aliasing-ul unui pixel. Sursă: https://www.youtube.com/watch?v=EpH175PY1A0

Îmbunătățirea față de o implementare standard a NeRF a fost notabilă:

Mip-NeRF (dreapta), lansat în martie 2021, oferă detalii îmbunătățite printr-un pipeline de aliasing mai cuprinzător, dar economic, în loc să „estompeze” pixelii pentru a evita marginile zimțate. Sursă: https://jonbarron.info/mipnerf/

Mip-NeRF (dreapta), lansat în martie 2021, oferă detalii îmbunătățite printr-un pipeline de aliasing mai cuprinzător, dar economic, în loc să „estompeze” pixelii pentru a evita marginile zimțate. Sursă: https://jonbarron.info/mipnerf/

NeRF Nelimitat

Documentul din martie a lăsat nerezolvate trei probleme în ceea ce privește utilizarea Mip-NeRF în medii nelimitate care ar putea include obiecte foarte îndepărtate, inclusiv ceruri. Noul document rezolvă aceasta prin aplicarea unui deformație în stil Kalman asupra Gaussianelor Mip-NeRF.

În al doilea rând, scenele mai mari necesită o putere de procesare mai mare și timpi de antrenament extinși, pe care Mip-NeRF 360 îi rezolvă prin „distilarea” geometriei scenei cu un mic „propunere” perceptron cu mai multe straturi (MLP), care predefinește geometria prezisă de un MLP NeRF standard mare. Acest lucru accelerează antrenamentul de trei ori.

În cele din urmă, scenele mai mari tind să facă discretizarea geometriei interpretate ambiguă, rezultând tipul de artefacte cu care jucătorii pot fi familiarizați când imaginea jocului „se rupe”. Noul document abordează acest lucru prin crearea unui nou regularizator pentru intervalele de raze Mip-NeRF.

În partea dreaptă, vedem artefacte nedorite în Mip-NeRF din cauza dificultății de a delimita o scenă atât de mare. În partea stângă, vedem că noul regularizator a optimizat scena suficient pentru a elimina aceste perturbări.

În partea dreaptă, vedem artefacte nedorite în Mip-NeRF din cauza dificultății de a delimita o scenă atât de mare. În partea stângă, vedem că noul regularizator a optimizat scena suficient pentru a elimina aceste perturbări.

Pentru a afla mai multe despre noul document, vizionați videoclipul de mai jos și, de asemenea, introducerea video din martie 2021 la Mip-NeRF. De asemenea, puteți afla mai multe despre cercetarea NeRF consultând acoperirea noastră de până acum.

Publicat inițial 25 noiembrie 2021
21 decembrie 2021, 12:25pm – Video înlocuit. – MA

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai