Andersons vinkel

Neuralt rendering: NeRF tar en spasertur i frisk luft

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et samarbeid mellom Google Research og Harvard University har utviklet en ny metode for å lage 360-graders neuralt video av komplette scener ved hjelp av Neural Radiance Fields (NeRF). Den nye tilnærmingen bringer NeRF et skritt nærmere casual abstrakt bruk i enhver miljø, uten å være begrenset til tabletop-modeller eller lukkede interiørscenarier.

Kilde: https://www.youtube.com/watch?v=YStDS2-Ln1s

Se slutten av artikkelen for fullt video. Kilde: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 kan håndtere utvidede bakgrunner og ‘ubegrenset’ objekter som himmelen, fordi den, i motsetning til de fleste tidligere iterasjonene, setter grenser for hvordan lysstråler tolkes, og oppretter grenser for oppmerksomhet som rasjonaliserer ellers lange treningstider. Se den nye vedlagte videoen nedenfor for flere eksempler og en utvidet innsikt i prosessen.

Den nye artikkelen heter Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, og er ledet av Senior Staff Research Scientist ved Google Research Jon Barron.

For å forstå gjennombruddet, er det nødvendig å ha en grunnleggende forståelse av hvordan neuralt radiance-felt-basert bilde-syntese fungerer.

Hva er NeRF?

Det er problematisk å beskrive et NeRF-nettverk i termer av et ‘video’, da det er nærmere et fullstendig 3D-realisiert, men AI-basert virtuelt miljø, hvor multiple visninger fra enkeltbilder (inkludert video-rammer) brukes til å sy sammen en scene som teknisk sett bare eksisterer i den latente rommet til en maskinlæringsalgoritme – men fra hvilken en ekstraordinær mengde visninger og videoer kan trekkes ut når som helst.

En avbildning av de multiple kamerafangstpunkter som gir dataene som NeRF samler inn i en neural scene (avbildet til høyre).

En avbildning av de multiple kamerafangstpunkter som gir dataene som NeRF samler inn i en neural scene (avbildet til høyre).

Informasjon som er avledet fra de bidragende bildene, trenes inn i en matrise som er lignende en tradisjonell voxel-grid i CGI-arbeidsflyter, i og med at hver punkt i 3D-rommet ender opp med en verdi, som gjør scenen navigerbar.

En tradisjonell voxel-matrise plasserer pikselinformasjon (som normalt eksisterer i en 2D-kontekst, som pikselgridet i en JPEG-fil) i et tredimensjonalt rom. Kilde: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

En tradisjonell voxel-matrise plasserer pikselinformasjon (som normalt eksisterer i en 2D-kontekst, som pikselgridet i en JPEG-fil) i et tredimensjonalt rom. Kilde: ResearchGate

Efter å ha beregnet det interstitielle rommet mellom bildene (hvis nødvendig), blir banen til hver mulig piksel i hver bidragende bilde effektivt ‘ray-tracet’ og tildelt en fargeverdi, inkludert en transparensverdi (uten hvilken den neurale matrisen ville være fullstendig opak eller fullstendig tom).

Like voxel-grid og ulike CGI-basert 3D-koordinatrom, har ‘interiøret’ i en ‘lukket’ gjenstand ingen eksistens i en NeRF-matrise. Du kan splitte åpne en CGI-trommesett og se inni, hvis du ønsker; men så langt NeRF er bekymret, eksisterer trommesettet bare når opasitetsverdien til overflaten er lik ‘1’.

En videre utsikt over en piksel

Mip-NeRF 360 er en utvidelse av forskning fra mars 2021, som effektivt introduserte effektiv anti-aliasing til NeRF uten uttømmende supersampling.

NeRF beregner tradisjonelt bare en pikselbane, som er tilbøyelig til å produsere den type ‘jaggies’ som karakteriserte tidlige internett-bildeformater, samt tidligere spill-systemer. Disse hakketegnene ble løst ved hjelp av ulike metoder, vanligvis ved å prøve adjacent piksler og finne en gjennomsnittsrepresentasjon.

Fordi tradisjonell NeRF bare prøver en pikselbane, introduserte Mip-NeRF en ‘konisk’ innfangningsområde, som en bredstrålet lommelykt, som gir nok informasjon om adjacent piksler til å produsere økonomisk anti-aliasing med forbedret detalj.

Den koniske kegle-innfangningsområdet som Mip-NeRF bruker, blir skåret opp i koniske frustumer (nedenfor), som blir ytterligere 'uskarpet' for å representere en vag Gaussian-rom som kan brukes til å beregne nøyaktigheten og aliasingen av en piksel. Kilde: https://www.youtube.com/watch?v=EpH175PY1A0

Den koniske kegle-innfangningsområdet som Mip-NeRF bruker, blir skåret opp i koniske frustumer (nedenfor), som blir ytterligere ‘uskarpet’ for å representere en vag Gaussian-rom som kan brukes til å beregne nøyaktigheten og aliasingen av en piksel. Kilde: https://www.youtube.com/watch?v=EpH175PY1A0

Forbedringen over en standard NeRF-implementering var merkbar:

Mip-NeRF (høyre), utgitt i mars 2021, gir forbedret detalj gjennom en mer omfattende, men økonomisk anti-aliasing-pipeline, i stedet for bare å 'uskarpe' piksler for å unngå hakketegn. Kilde: https://jonbarron.info/mipnerf/

Mip-NeRF (høyre), utgitt i mars 2021, gir forbedret detalj gjennom en mer omfattende, men økonomisk anti-aliasing-pipeline, i stedet for bare å ‘uskarpe’ piksler for å unngå hakketegn. Kilde: https://jonbarron.info/mipnerf/

NeRF Ubegrenset

Mars-artikkelen lot tre problemer uløst med hensyn til å bruke Mip-NeRF i ubegrensede miljøer som kan inkludere svært fjerne objekter, inkludert himmelen. Den nye artikkelen løser dette ved å bruke en Kalman-liknende warp til Mip-NeRF-Gaussian.

For det andre, krever større scener større prosesseringskraft og utvidede treningstider, som Mip-NeRF 360 løser ved å ‘destillere’ scene-geometri med en liten ‘forslag’ multi-lag perceptron (MLP), som for-begrenser geometrien som forutsies av en stor standard NeRF-MLP. Dette akselerer treningstiden med en faktor på tre.

Til slutt, tenderer større scener å gjøre diskretiseringen av den tolkede geometrien tvetydig, resulterende i den type feil som spillere kan være kjent med når spill-utgang ‘rives’. Den nye artikkelen løser dette ved å opprette en ny regularisator for Mip-NeRF-ray-intervaller.

Til høyre ser vi uønskede feil i Mip-NeRF på grunn av vanskelighetene med å begrense så store scener. Til venstre ser vi at den nye regularisatoren har optimalisert scenen godt nok til å fjerne disse forstyrrelsene.

Til høyre ser vi uønskede feil i Mip-NeRF på grunn av vanskelighetene med å begrense så store scener. Til venstre ser vi at den nye regularisatoren har optimalisert scenen godt nok til å fjerne disse forstyrrelsene.

For å finne ut mer om den nye artikkelen, se videoen nedenfor, og også mars 2021 video-introduksjonen til Mip-NeRF. Du kan også finne ut mer om NeRF-forskning ved å se vår dekning så langt.

Opprinnelig publisert 25. november 2021
21. desember 2021, 12:25 – Erstattet død video. – MA

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai