Andersons vinkel

NeRFocus: Bringer let fokuskontrol til Neural Radiance Fields

mm
Føj Unite.AI til dine foretrukne kilder på Google

Nyt forskning fra Kina tilbyder en metode til at opnå billig kontrol over dybdeeffekter for Neural Radiance Fields (NeRF), hvilket giver brugeren mulighed for at justere fokus og dynamisk ændre konfigurationen af den virtuelle linse i renderingsrummet.

Denne teknik, der hedder NeRFocus, implementerer en ny ‘tynd linse-billede’-tilgang til fokus-gennemløb og innoverer P-training, en sandsynlighedsbaseret træningsstrategi, der eliminerer behovet for dedikerede dybde-af-felt-datasæt og forenkler en fokus-aktiveret træningsworkflow.

Den artikel er titleret NeRFocus: Neural Radiance Field for 3D Synthetic Defocus og kommer fra fire forskere fra Shenzhen Graduate School ved Peking University og Peng Cheng Laboratory i Shenzhen, en institut finansieret af Guangdong Provincial Government.

Behandling af foveated locus of attention i NeRF

Hvis NeRF nogensinde skal tage sin plads som en gyldig teknologi for virtuel og forstærket virkelighed, har det brug for en let metode til realistisk foveated rendering, hvor de fleste renderingsressourcer samles omkring brugernes blik, snarere end at være udiscrimineret fordelt på lavere opløsning over hele det tilgængelige visuelle rum.

Fra 2021-artiklen Foveated Neural Radiance Fields for Real-Time and Egocentric Virtual Reality, ser vi attention locus i en ny foveated rendering-skema for NeRF. Kilde: https://arxiv.org/pdf/2103.16365.pdf

Fra 2021-artiklen Foveated Neural Radiance Fields for Real-Time and Egocentric Virtual Reality, ser vi attention locus i en ny foveated rendering-skema for NeRF. Kilde: https://arxiv.org/pdf/2103.16365.pdf

En essentiel del af autenticiteten af fremtidige udviklinger af egocentrisk NeRF vil være systemets evne til at reflektere det menneskelige øjes egen kapacitet til at skifte fokus over en tilbagetrædende plane af perspektiv (se første billede ovenfor).

Dette gradient af fokus er også en perceptuel indikator for skalaen af scenen; udsigten fra en helikopter, der flyver over en by, vil have ingen navigable fokusfelt, fordi hele scenen findes ud over brugernes yderste fokuskapacitet, mens undersøgelse af en miniature eller ‘nær felt’-scene ikke kun vil tillade ‘fokus-racking’, men også bør, for realismeens skyld, indeholde en smal dybde af felt som standard.

Nedenfor er en video, der demonstrerer de første muligheder for NeRFocus, leveret af artiklens korresponderende forfatter:

Beyond Restricted Focal Planes

Bevidst om kravene til fokuskontrol har en række NeRF-projekter i de seneste år gjort provision for det, selvom alle forsøg indtil nu er efektive sleight-of-hand-workarounds af en slags eller kræver bemærkelsesværdige post-processing-rutiner, der gør dem til usandsynlige bidrag til de realtids-miljøer, der til sidst er tænkt for Neural Radiance Fields-teknologier.

Synthetisk fokuskontrol i neurale renderings-rammer er forsøgt med forskellige metoder i de sidste 5-6 år – for eksempel ved at bruge et segmenteringsnetværk til at afgrænse forgrunden og baggrunden og derefter generisk udfokusere baggrunden – en almindelig løsning for simple to-planes fokus-effekter.

Fra artiklen Automatic Portrait Segmentation for Image Stylization, en almindelig, animations-stil adskillelse af fokusplaner. Kilde: https://jiaya.me/papers/portrait_eg16.pdf

Fra artiklen ‘Automatic Portrait Segmentation for Image Stylization’, en almindelig, animations-stil adskillelse af fokusplaner. Kilde: https://jiaya.me/papers/portrait_eg16.pdf

Multiplane-repræsentationer tilføjer få virtuelle ‘animations-celler’ til denne paradigm, for eksempel ved at bruge dybde-estimering til at skære scenen op i en hakket, men håndterbar gradient af distinkte fokusplaner, og derefter orkestrere dybde-afhængige kerner til at syntetisere uskarphed.

Dertil og højst relevant for potentielle AR/VR-miljøer kan forskellen mellem de to synspunkter i en stereo-kamera-opstilling bruges som en dybde-proxy – en metode foreslået af Google Research i 2015.

Fra Google-ledede artikel Fast Bilateral-Space Stereo for Synthetic Defocus, giver forskellen mellem de to synspunkter en dybde-kort, der kan faciliterer uskarphed. Men denne tilgang er uægte i situationen, hvor billedet er taget med en 35-50mm (SLR-standard) linse, men den ekstreme udfokussering af baggrunden ville kun nogensinde optræde med en linse, der overstiger 200mm, som har en højtbegrænset fokusplane, der producerer en smal dybde af felt i normale, menneskestørrelse-miljøer

Fra Google-ledede artikel Fast Bilateral-Space Stereo for Synthetic Defocus, giver forskellen mellem de to synspunkter en dybde-kort, der kan faciliterer uskarphed. Men denne tilgang er uægte i situationen, hvor billedet er taget med en 35-50mm (SLR-standard) linse, men den ekstreme udfokussering af baggrunden ville kun nogensinde optræde med en linse, der overstiger 200mm, som har en højtbegrænset fokusplane, der producerer en smal dybde af felt i normale, menneskestørrelse-miljøer

Tilgange af denne art tendenser til at demonstrere kant-artefakter, da de forsøger at repræsentere to distinkte og kant-begrænsede sfærer af fokus som en kontinuierlig fokus-gradient.

I 2021 tilbød RawNeRF-initiativet High Dynamic Range (HDR)-funktioner med større kontrol over lav-belysningssituationer og en tilsyneladende imponerende kapacitet til at justere fokus:

RawNeRF justerer fokus smukt (om end, i dette tilfælde, uægte, på grund af urealistiske fokusplaner), men kommer med en høj beregningsomkostning. Kilde: https://bmild.github.io/rawnerf/

RawNeRF justerer fokus smukt (om end, i dette tilfælde, uægte, på grund af urealistiske fokusplaner), men kommer med en høj beregningsomkostning. Kilde: https://bmild.github.io/rawnerf/

Men RawNeRF kræver omfattende forudregning for sine multiplane-repræsentationer af det trænede NeRF, hvilket resulterer i en workflow, der ikke kan tilpasses let til lettere eller lavere-latens-implementationer af NeRF.

Modellering af en virtuel linse

NeRF selv er baseret på pinhole-billede-modellen, der renderer hele scenen skarpt på en måde, der ligner en standard CGI-scene (før de forskellige tilgange, der render uskarphed som en post-processing eller indre effekt baseret på dybde af felt).

NeRFocus opretter en virtuel ‘tynd linse’ (i stedet for en ‘glasløs’ åbning), der beregner strålebanen for hver indkommende pixel og renderer den direkte, effektivt inverterer den standard image-kaptur-proces, der opererer post facto på lysindgang, der allerede er påvirket af linse-designets refraktive egenskaber.

Dette model introducerer en række muligheder for indhold-rendering inden for frustum (den største cirkel af indflydelse afbildet ovenfor).

At beregne den korrekte farve og densitet for hver multilayer-perceptron (MLP) i denne bredere række af muligheder er en ekstra opgave. Dette er løst før ved at anvende overvåget træning til et stort antal DLSR-billeder, hvilket indebærer oprettelse af ekstra datasæt for en sandsynlighedsbaseret træningsworkflow – effektivt involverer den omstændelige forberedelse og lagring af multiple mulige beregnede ressourcer, der måske eller måske ikke er nødvendige.

NeRFocus overvinder dette ved P-training, hvor træningsdatasæt genereres baseret på grundlæggende uskarphedsoperationer. Således dannes modellen med uskarphedsoperationer indbygget og navigable.

Åbningsdiameter sættes til nul under træning, og foruddefinerede sandsynligheder bruges til at vælge en uskarpheds-kernel tilfældigt. Denne opnåede diameter bruges til at skala op hver sammensat kegles diameter, hvilket giver MLP mulighed for at prædicere radiansen og densiteten af frustum (de brede cirkler i billederne ovenfor, der repræsenterer zonen for transformation for hver pixel)

Åbningsdiameter sættes til nul under træning, og foruddefinerede sandsynligheder bruges til at vælge en uskarpheds-kernel tilfældigt. Denne opnåede diameter bruges til at skala op hver sammensat kegles diameter, hvilket giver MLP mulighed for at prædicere radiansen og densiteten af frustum (de brede cirkler i billederne ovenfor, der repræsenterer zonen for transformation for hver pixel)

Artiklens forfattere observerer, at NeRFocus potentielt er kompatibelt med den HDR-drevne tilgang i RawNeRF, der kunne hjælpe med at rendre visse udfordrende sektioner, såsom defocused specular highlights, og mange af de andre beregnings-intense effekter, der har udfordret CGI-workflows i mere end 30 år.

Processen indebærer ikke ekstra krav til tid og/eller parametre i forhold til tidligere tilgange som core NeRF og Mip-NeRF (og, formodentlig Mip-NeRF 360, selvom dette ikke behandles i artiklen), og er anvendelig som en generel udvidelse af den centrale metodologi for neurale radiance-felter.

 

Offentliggjort første gang den 12. marts 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai