Andersons vinkel
Nevral gjengivelse: NeRF tar en tur i frisk luft

Et samarbeid mellom Google Research og Harvard University har utviklet en ny metode for å lage 360‑graders nevrale video av komplette scener ved hjelp av Neural Radiance Fields (NeRF). Den nye tilnærmingen bringer NeRF ett steg nærmere uformell, abstrakt bruk i ethvert miljø, uten å være begrenset til bordtoppsmodeller eller lukkede interiørscenarier.

Se slutten av artikkelen for full video. Kilde: https://www.youtube.com/watch?v=zBSH-k9GbV4
Mip-NeRF 360 kan håndtere utvidede bakgrunner og «uendelige» objekter som himmelen, fordi den, i motsetning til de fleste tidligere iterasjoner, setter grenser for hvordan lysstråler tolkes, og skaper oppmerksomhetsgrenser som forklarer ellers lange treningstider. Se den nye vedlagte videoen som er innebygd på slutten av denne artikkelen for flere eksempler og en utvidet innsikt i prosessen.
Det nye papiret heter Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, og ledes av Senior Staff Research Scientist ved Google Research, Jon Barron.
For å forstå gjennombruddet er det nødvendig å ha en grunnleggende forståelse av hvordan bildesyntese basert på nevrale strålingsfelt fungerer.
Hva er NeRF?
Det er problematisk å beskrive et NeRF‑nettverk som en «video», siden det er nærmere et fullstendig 3D‑realistisk, men AI‑basert virtuelt miljø, hvor flere synsvinkler fra enkeltbilder (inkludert videorammer) brukes til å sy sammen en scene som teknisk sett kun eksisterer i den latente rommet til en maskinlæringsalgoritme – men som gjør et ekstraordinært antall synsvinkler og videoer tilgjengelige etter ønske.

En fremstilling av de flere kamerapunktene som gir dataene som NeRF samler til en nevralscene (vist til høyre).
Informasjon hentet fra de bidragende bildene trenes inn i en matrise som ligner på en tradisjonell voxel‑grid i CGI‑arbeidsflyter, der hvert punkt i 3D‑rommet får en verdi, noe som gjør scenen navigerbar.

En tradisjonell voxel‑matrix plasserer pikselinformasjon (som vanligvis finnes i en 2D‑kontekst, for eksempel JPEG‑filens pikselgrid) inn i et tredimensjonalt rom. Kilde: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties
Etter å ha beregnet det mellomliggende rommet mellom bildene (om nødvendig), blir banen til hver mulig piksel fra hvert bidragende bilde i praksis «ray‑traced» og tildelt en fargeverdi, inkludert en gjennomsiktighetsverdi (uten denne ville den nevrale matrisen være helt ugjennomsiktig eller helt tom).
I likhet med voxel‑grid, og i motsetning til CGI‑baserte 3D‑koordinatrom, har «interiøret» til et «lukket» objekt ingen eksistens i en NeRF‑matrise. Du kan åpne opp et CGI‑trommesett og se inn, om du vil; men for NeRF slutter eksistensen av trommesettet når opasiteten til overflaten blir lik «1».
Et bredere perspektiv på en piksel
Mip-NeRF 360 er en utvidelse av forskning fra mars 2021, som effektivt introduserte effektiv anti‑aliasing til NeRF uten omfattende supersampling.
NeRF beregner tradisjonelt kun én pikselbane, noe som har en tendens til å produsere de såkalte «jaggies» som preget tidlige internett‑bildeformater, så vel som tidligere spillsystemer. Disse kantete kantene ble løst med ulike metoder, vanligvis ved å sample nabopiksler og finne en gjennomsnittlig representasjon.
Fordi tradisjonell NeRF kun sampler den ene pikselbanen, introduserte Mip-NeRF et «konisk» oppsamlingsområde, som en bredstråle‑lykt, som gir nok informasjon om nabopiksler til å produsere økonomisk anti‑aliasing med forbedret detaljgrad.

Det koniske oppsamlingsområdet som Mip-NeRF bruker er delt opp i koniske frustum (nedenfor), som videre «bløres» for å representere et mer vagt Gaussisk rom som kan brukes til å beregne nøyaktigheten og aliasingen til en piksel. Kilde: https://www.youtube.com/watch?v=EpH175PY1A0
Forbedringen i forhold til en standard NeRF‑implementering var merkbar:

Mip-NeRF (høyre), lansert i mars 2021, gir forbedret detalj gjennom en mer omfattende men økonomisk alias‑pipeline, i stedet for kun å «bløre» piksler for å unngå kantete kanter. Kilde: https://jonbarron.info/mipnerf/
NeRF Ubegrenset
Mars‑papiret etterlot tre uløste problemer med hensyn til bruk av Mip-NeRF i ubundne miljøer som kan inkludere svært fjerne objekter, inkludert himmelen. Det nye papiret løser dette ved å anvende en Kalman‑lignende deformasjon på Mip-NeRF‑Gaussene.
For det andre krever større scener mer prosesseringskraft og lengre treningstider, noe Mip-NeRF 360 løser ved å «destillere» scenegometrien med en liten «forslags» multi‑layer perceptron (MLP), som forhåndsbegrenser geometrien som forutsies av en stor standard NeRF‑MLP. Dette gjør treningen tre ganger raskere.
Til slutt har større scener en tendens til å gjøre diskretiseringen av den tolkte geometrien tvetydig, noe som resulterer i de artefakter som spillere kjenner igjen når spillgrafikk «river». Det nye papiret adresserer dette ved å lage en ny regularisator for Mip‑NeRF‑stråleintervaller.

Til høyre ser vi uønskede artefakter i Mip-NeRF på grunn av vanskeligheten med å avgrense en så stor scene. Til venstre ser vi at den nye regularisatoren har optimalisert scenen tilstrekkelig til å fjerne disse forstyrrelsene.
For å finne ut mer om det nye papiret, sjekk videoen nedenfor, samt mars‑2021‑videoen som introduserer Mip-NeRF. Du kan også lære mer om NeRF‑forskning ved å se vår dekning så langt.
Opprinnelig publisert 25. november 2021
21. desember 2021, 12:25pm – Erstattet død video. – MA












