Andersons vinkel
NeRFocus: Bringer lett fokuskontroll til Neural Radiance Fields

Ny forskning fra Kina tilbyr en metode for å oppnå rimelig kontroll over dybdesfokus-effekter for Neural Radiance Fields (NeRF), som tillater sluttbrukeren å justere fokus og dynamisk endre konfigurasjonen av den virtuelle linsen i renderingsrommet.
Denne teknikken, kalt NeRFocus, implementerer en ny ‘tynn lins’-tilnærming til fokus-traversering, og innfører P-trening, en probabilistisk treningstrategi som eliminerer behovet for dedikerte dybdesfokus-datasett, og forenkler en fokus-aktivert treningssyklus.

Den artikkelen heter NeRFocus: Neural Radiance Field for 3D Synthetic Defocus, og kommer fra fire forskere fra Shenzhen Graduate School ved Peking University, og Peng Cheng Laboratory i Shenzhen, et institutt finansiert av Guangdong Provincial Government.
Behandling av foveated locus of attention i NeRF
Hvis NeRF noen gang skal ta sin plass som en gyldig teknologi for virtuell og forbedret virkelighet, må den ha en lett metode for å tillate realistisk foveated rendering, der de fleste renderingsressursene samles rundt brukerens blikk, i stedet for å være fordelt udiscriminerende over hele det tilgjengelige visuelle rommet.

Fra artikkelen Foveated Neural Radiance Fields for Real-Time and Egocentric Virtual Reality, ser vi attention locus i en ny foveated rendering-scheme for NeRF. Kilde: https://arxiv.org/pdf/2103.16365.pdf
En essensiell del av autentisiteten til fremtidige NeRF-utgaver vil være systemets evne til å reflektere det menneskelige øyets egen kapasitet til å skifte fokus over en rekke perspektiver (se første bilde ovenfor).
Dette fokusradius er også en perseptuell indikator for skalaen på scenen; utsikten fra en helikopter som flyr over en by vil ha ingen navigerbare fokusfelt, fordi hele scenen eksisterer utenfor brukerens ytre fokuskapasitet, mens undersøkelse av en miniatyr eller ‘nær felt’-scene vil ikke bare tillate ‘fokus-racking’, men bør, for realisme, inneholde en smal dybdesfokus som standard.
Under er en video som demonstrerer de innledende kapasitetene til NeRFocus, levert til oss av artikkelforfatteren:
Bortenfor begrensede fokusplasser
Ved å være klar over kravene til fokuskontroll, har flere NeRF-prosjekter i de siste årene gjort provisjon for det, selv om alle forsøk hittil er effektivt sleight-of-hand-omgåelser av en eller annen type, eller innebærer merkede post-prosessering-rutiner som gjør dem lite sannsynlige bidrag til de sanntids-miljøene som til slutt er tenkt for Neural Radiance Fields-teknologier.
Syntetisk fokuskontroll i neurale renderings-rammeverk har blitt forsøkt med ulike metoder i løpet av de siste 5-6 årene – for eksempel, ved å bruke et segmenteringsnettverk til å avskjære forgrunns- og bakgrunnsdata, og deretter generisk å uskarpe bakgrunnen – en vanlig løsning for enkle to-planes fokus-effekter.

Fra artikkelen ‘Automatic Portrait Segmentation for Image Stylization’, en vanlig, animasjons-stil-separasjon av fokusplasser. Kilde: https://jiaya.me/papers/portrait_eg16.pdf
Flerplans-representasjoner legger til noen virtuelle ‘animasjons-celler’ til denne paradigmen, for eksempel ved å bruke dybde-estimering til å kutte scenen opp i en hakket, men håndterbar gradient av distinkte fokusplasser, og deretter orkestrere dybde-avhengige kerner til å syntetisere uskarphet.
I tillegg, og høyt relevant for potensielle AR/VR-miljøer, kan forskjellen mellom de to synspunktene i et stereokamera-sett brukes som en dybde-proxy – en metode foreslått av Google Research i 2015.

Fra Google-ledende artikkel Fast Bilateral-Space Stereo for Synthetic Defocus, gir forskjellen mellom de to synspunktene en dybde-kart som kan fasilitere uskarphet. Men denne tilnærmingen er uautentisk i situasjonen ovenfor, der bildet er tatt med en 35-50mm (SLR-standard) linse, men den ekstreme uskarpheten av bakgrunnen ville bare noen gang skje med en linse som overstiger 200mm, som har en svært begrenset fokusplass som produserer smal dybdesfokus i normale, menneske-størrelse miljøer. Kilde
Tilnærmingen av denne typen tenderer til å demonstrere kant-artefakter, ettersom de prøver å representere to distinkte og kant-begrensede sfærer av fokus som en kontinuerlig fokusradius.
I 2021 tilbød RawNeRF-initiativet High Dynamic Range (HDR)-funksjonalitet, med større kontroll over lavt-lys-situasjoner, og en tilsynelatende imponerende kapasitet til å justere fokus:

RawNeRF justerer fokus vakkert (om enn i dette tilfelle uautentisk, på grunn av urealistiske fokusplasser), men kommer med en høy beregningskostnad. Kilde: https://bmild.github.io/rawnerf/
Men RawNeRF krever tungvinte forhåndsregning for sine flerplans-representasjoner av den trenede NeRF, resulterende i en arbeidsflyt som ikke kan lett tilpasses lettere eller lavere-latens implementeringer av NeRF.
Modellering av en virtuell linse
NeRF selv er basert på pinhole-bilde-modellen, som renderer hele scenen skarpt på en måte lignende en standard CGI-scene (før de ulike tilnærmingene som render uskarphet som en post-prosessering eller innbygd effekt basert på dybdesfokus).
NeRFocus skaper en virtuell ‘tynn linse’ (i stedet for en ‘glassløs’ åpning) som beregner strålebanen til hver innkommende piksel og renderer den direkte, effektivt inverterer den standard bilderegistreringsprosessen, som opererer post facto på lysinngang som allerede er påvirket av refraktive egenskaper til linsedesignet.

Dette modellen introduserer en rekke muligheter for innhold-rendering innenfor frustum (den største sirkelen av innflytelse avbildet ovenfor).
Å beregne den korrekte fargen og tettheten for hver multilayer-perceptron (MLP) i denne bredere rekke av muligheter er en ekstra oppgave. Dette har blitt løst tidligere ved å bruke overvåket trening til et stort antall DLSR-bilder, som innebærer opprettelse av ekstra datasett for en probabilistisk treningssyklus – effektivt involverer laborieus forberedelse og lagring av flere mulige beregnede ressurser som kan eller ikke kan være nødvendig.
NeRFocus overvinner dette ved P-trening, der treningsssett genereres basert på grunnleggende uskarpe operasjoner. Dermed er modellen dannet med uskarpe operasjoner som er innbygd og navigerbare.

Blændingsdiameter er satt til null under trening, og forhåndsdefinerte sannsynligheter brukes til å velge en uskarpe-kernel tilfeldig. Denne oppnådde diameteren brukes til å skalerer opp hver sammensatt konus-diameter, og lar MLP nøyaktig forutsi strålingen og tettheten til frustum (den vide sirkelen i bildene ovenfor, som representerer sonen for transformasjon for hver piksel)
Forfatterne av den nye artikkelen observerer at NeRFocus er potensielt kompatibel med HDR-drevne tilnærmingen til RawNeRF, som kunne potensielt hjelpe med rendering av visse utfordrende seksjoner, som uskarpe spekular-høydepunkter, og mange av de andre beregnings-intensive effektene som har utfordret CGI-arbeidsflyter i over 30 år.
Prosessen innebærer ikke ekstra krav til tid og/eller parametre i sammenligning med tidligere tilnærminger som core NeRF og Mip-NeRF (og, antageligvis Mip-NeRF 360, selv om dette ikke er behandlet i artikkelen), og er anvendelig som en generell utvidelse av den sentrale metoden til neurale strålingsfelt.
Publisert første gang 12. mars 2022.












