Andersons vinkel

Neural Rendering: NeRF tar en promenad i friska luften

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ett samarbete mellan Google Research och Harvard University har utvecklat en ny metod för att skapa 360‑graders neurala videor av kompletta scener med hjälp av Neural Radiance Fields (NeRF). Det nya tillvägagångssättet tar NeRF ett steg närmare vardaglig abstrakt användning i vilken miljö som helst, utan att vara begränsat till bordmodeller eller slutna interiörscenarier.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Se slutet av artikeln för hela videon. Källa: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 kan hantera utökade bakgrunder och ‘oändliga’ objekt som himlen, eftersom den, till skillnad från de flesta tidigare iterationer, sätter gränser för hur ljusstrålar tolkas och skapar uppmärksamhetsgränser som förklarar annars långa träningstider. Se den nya medföljande videon som är inbäddad i slutet av den här artikeln för fler exempel och en fördjupad insikt i processen.

Den nya artikeln har titeln Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields och leds av Senior Staff Research Scientist på Google Research, Jon Barron.

För att förstå genombrottet är det nödvändigt att ha en grundläggande förståelse för hur bildsyntes baserad på neurala strålningsfält fungerar.

Vad är NeRF?

Det är problematiskt att beskriva ett NeRF‑nätverk i termer av en ‘video’, eftersom det snarare liknar en fullt 3D‑realiserad men AI‑baserad virtuell miljö, där flera synvinklar från enskilda foton (inklusive videobilder) används för att sammanfoga en scen som tekniskt bara existerar i det latenta rummet hos en maskininlärningsalgoritm – men från vilken ett extraordinärt antal synvinklar och videor kan extraheras efter behov.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

En avbildning av de flera kamerapunkterna som samlar in data som NeRF sätter ihop till en neural scen (bilden till höger).

Information som härrör från de bidragande fotona tränas in i en matris som liknar ett traditionellt voxel‑grid i CGI‑arbetsflöden, där varje punkt i 3D‑rummet får ett värde, vilket gör scenen navigerbar.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

En traditionell voxelmatris placerar pixelinformation (som normalt finns i ett 2D‑sammanhang, såsom pixelrutnätet i en JPEG‑fil) i ett tredimensionellt rum. Källa: ResearchGate

Efter att ha beräknat det interstitiella utrymmet mellan fotona (om nödvändigt) spåras vägen för varje möjlig pixel i varje bidragande foto faktiskt med ‘ray tracing’ och tilldelas ett färgvärde, inklusive ett transparensvärde (utan vilket den neurala matrisen skulle vara helt ogenomskinlig eller helt tom).

Precis som voxel‑gridar, och till skillnad från CGI‑baserade 3D‑koordinatrum, har ‘interiören’ av ett ‘slutet’ objekt ingen existens i en NeRF‑matris. Du kan öppna upp ett CGI-trummorset och titta in, om du vill; men såvitt NeRF är bekymrat, upphör trummorsetets existens när opacitetsvärdet på dess yta blir ‘1’.

En bredare vy av en pixel

Mip-NeRF 360 är en vidareutveckling av forskning från mars 2021, som effektivt introducerade effektiv kantutjämning till NeRF utan omfattande supersampling.

NeRF beräknar traditionellt bara en pixelväg, vilket tenderar att producera den typ av ‘jaggies’ som kännetecknade tidiga internetbildformat, samt tidigare spelsystem. Dessa hackiga kanter löstes med olika metoder, oftast genom att sampla intilliggande pixlar och hitta en genomsnittlig representation.

Eftersom traditionell NeRF bara samplar den ena pixelvägen, introducerade Mip-NeRF ett ‘koniskt’ insamlingsområde, likt en bredstråle, som ger tillräcklig information om intilliggande pixlar för att producera ekonomisk kantutjämning med förbättrad detalj.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Det koniska insamlingsområdet som Mip-NeRF använder delas upp i koniska frustum (nedre bilden), som ytterligare ‘blurras’ för att skapa vaga Gaussiska områden som kan användas för att beräkna ett pixels noggrannhet och kantutjämning. Källa: https://www.youtube.com/watch?v=EpH175PY1A0

Förbättringen jämfört med en standard‑NeRF‑implementation var märkbar:

Mip-NeRF (right), released in mars 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (höger), släppt i mars 2021, ger förbättrad detalj genom en mer omfattande men ändå ekonomisk kantutjämningspipeline, snarare än att bara ‘blurra’ pixlar för att undvika hackiga kanter. Källa: https://jonbarron.info/mipnerf/

NeRF utan begränsning

Mars‑artikeln lämnade tre problem olösta när det gäller att använda Mip-NeRF i obegränsade miljöer som kan inkludera mycket avlägsna objekt, inklusive himlar. Den nya artikeln löser detta genom att applicera en Kalman‑liknande förvrängning på Mip‑NeRF‑Gaussier.

För det andra kräver större scener mer beräkningskraft och längre träningstider, vilket Mip‑NeRF 360 löser genom att ‘destillera’ scengeometri med ett litet ‘förslag’-flerlagers perceptron (MLP), som föravgränsar geometrin som förutsägs av ett stort standard‑NeRF‑MLP. Detta snabbar upp träningen med en faktor tre.

Slutligen tenderar större scener att göra diskretiseringen av den tolkade geometrin tvetydig, vilket resulterar i den typ av artefakter som spelare kan känna igen när spelgrafik ‘spricker’. Den nya artikeln hanterar detta genom att skapa en ny regulariserare för Mip‑NeRF‑strålintervall.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

På höger sida ser vi oönskade artefakter i Mip‑NeRF på grund av svårigheten att avgränsa en så stor scen. På vänster sida ser vi att den nya regulariseraren har optimerat scenen tillräckligt för att ta bort dessa störningar.

För att läsa mer om den nya artikeln, titta på videon nedan, och även på mars 2021‑videointroduktionen till Mip‑NeRF. Du kan också läsa mer om NeRF‑forskning genom att kolla in vår bevakning hittills.

Ursprungligen publicerad 25 november 2021
21 december 2021, 12:25pm – Ersatt död video. – MA

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai