Andersons vinkel

Neuralt rendering: NeRF tar en promenad i friska luften

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En samarbetsinsats mellan Google Research och Harvard University har utvecklat en ny metod för att skapa 360-graders neurala videor av kompletta scener med hjälp av Neural Radiance Fields (NeRF). Den nya metoden tar NeRF ett steg närmare en mer avslappnad och abstrakt användning i vilken miljö som helst, utan att vara begränsad till tabellmodeller eller slutna inomhusmiljöer.

Källa: https://www.youtube.com/watch?v=YStDS2-Ln1s

Se slutet av artikeln för fullständig video. Källa: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 kan hantera utvidgade bakgrunder och ‘oändliga’ objekt som himlen, eftersom den, till skillnad från de flesta tidigare iterationerna, sätter gränser för hur ljusstrålar tolkas och skapar gränser för uppmärksamhet som rationaliserar annars långa tränings­tider. Se den nya videon som är infogad i slutet av den här artikeln för fler exempel och en fördjupad insikt i processen.

Den nya artikeln har titeln Mip-NeRF 360: Obegränsade anti-aliasade neurala radiancefält och leds av Senior Staff Research Scientist på Google Research Jon Barron.

För att förstå genombrottet krävs det att man har en grundläggande förståelse för hur neurala radiancefält-baserad bildsyntes fungerar.

Vad är NeRF?

Det är problematiskt att beskriva ett NeRF-nätverk i termer av en ‘video’, eftersom det är närmare en fullständigt 3D-realiserad men AI-baserad virtuell miljö, där flera vy­punkter från enskilda foton (inklusive videoramar) används för att sy ihop en scen som tekniskt sett endast existerar i den latenta utrymmet för en maskin­inlärnings­algoritm – men från vilken en extraordinär mängd vy­punkter och videor kan extraheras när som helst.

En avbildning av de flera kamera­inspelnings­punkter som tillhandahåller de data som NeRF sätter samman till en neural scen (avbildad till höger).

En avbildning av de flera kamera­inspelnings­punkter som tillhandahåller de data som NeRF sätter samman till en neural scen (avbildad till höger).

Information som hämtats från de bidragande fotona tränas in i en matris som liknar en traditionell voxelgrid i CGI-arbetsflöden, så att varje punkt i 3D-utrymmet får ett värde, vilket gör scenen navigerbar.

En traditionell voxel­matris placerar pixel­information (som normalt finns i en 2D-kontext, som pixellayouten i en JPEG-fil) i ett tredimensionellt utrymme. Källa: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

En traditionell voxel­matris placerar pixel­information (som normalt finns i en 2D-kontext, som pixellayouten i en JPEG-fil) i ett tredimensionellt utrymme. Källa: ResearchGate

Efter att ha beräknat det mellanrum som finns mellan fotona (om nödvändigt), är den effektiva ‘ray-tracing’-banan för varje möjlig pixel i varje bidragande foto tilldelad ett färgvärde, inklusive ett transparensvärde (utan vilket den neurala matrisen skulle vara helt ogenomskinlig eller helt tom).

Liksom voxelgridar och till skillnad från CGI-baserade 3D-koordinat­utrymmen, har ‘insidan’ av ett ‘stängt’ objekt ingen existens i en NeRF-matris. Du kan öppna en CGI-trumma och titta inuti, om du vill; men så långt NeRF är bekymrad, upphör trummans existens när opacitetsvärdet på dess yta är ‘1’.

En vidare vy av en pixel

Mip-NeRF 360 är en utvidgning av forskning från mars 2021, som effektivt introducerade effektiv anti-aliasing till NeRF utan uttömmande supersampling.

NeRF beräknar traditionellt endast en pixelbana, vilket tenderar att producera den typ av ‘jaggies’ som kännetecknade tidiga internet­bild­format, samt tidigare spel­system. Dessa hackiga kanter löstes med hjälp av olika metoder, vanligtvis genom att samp­la angränsande pixlar och hitta en genomsnittlig representation.

Eftersom traditionell NeRF endast samp­lar en pixelbana, introducerade Mip-NeRF en ‘konisk’ upptagnings­område, liknande en bredstrålande fack­lampa, som tillhandahåller tillräcklig information om angränsande pixlar för att producera ekonomisk anti-aliasing med förbättrad detalj.

Den koniska kon­upptagnings­området som Mip-NeRF använder är skuren upp i koniska frustum (nedan), som sedan 'suddas ut' för att representera ett suddigt gaussiskt utrymme som kan användas för att beräkna pixe­lens nog­grann­het och aliasing. Källa: https://www.youtube.com/watch?v=EpH175PY1A0

Den koniska kon­upptagnings­området som Mip-NeRF använder är skuren upp i koniska frustum (nedre bild), som sedan ‘suddas ut’ för att skapa suddiga gaussiska utrymmen som kan användas för att beräkna pixe­lens nog­grann­het och aliasing. Källa: https://www.youtube.com/watch?v=EpH175PY1A0

Förbättringen jämfört med en standard­NeRF-implementering var betydande:

Mip-NeRF (höger), som släpptes i mars 2021, tillhandahåller förbättrad detalj genom en mer omfattande men ekonomisk anti-alias­pipeline, snarare än att bara 'sudda ut' pixlar för att undvika hackiga kanter. Källa: https://jonbarron.info/mipnerf/

Mip-NeRF (höger), som släpptes i mars 2021, tillhandahåller förbättrad detalj genom en mer omfattande men ekonomisk anti-alias­pipeline, snarare än att bara ‘sudda ut’ pixlar för att undvika hackiga kanter. Källa: https://jonbarron.info/mipnerf/

NeRF obegränsad

Mars­artikeln lämnade tre problem olösta i fråga om att använda Mip-NeRF i obegränsade miljöer som kan innehålla mycket avlägsna objekt, inklusive himlar. Den nya artikeln löser detta genom att tillämpa en Kalman-liknande warp till Mip-NeRF-Gaussiska.

Andra, större scener kräver större bearbetnings­kraft och utökade tränings­tider, vilket Mip-NeRF 360 löser genom att ‘destillera’ scen­geometrin med en liten ‘förslags’-multi­layer­perceptron (MLP), som för­binder geometrin som förutsägs av en stor standard­NeRF-MLP. Detta påskyndar tränings­tiden med en faktor på tre.

Slutligen, större scener tenderar att göra diskretiseringen av den tolkade geometrin tvetydig, vilket resulterar i de typer av artefakter som spelare kan vara bekanta med när spel­utmatningen ‘river’. Den nya artikeln löser detta genom att skapa en ny regularisator för Mip-NeRF-strålintervall.

Till höger ser vi oönskade artefakter i Mip-NeRF på grund av svårigheten att begränsa en sådan stor scen. Till vänster ser vi att den nya regularisatorn har optimerat scenen tillräckligt för att ta bort dessa störningar.

Till höger ser vi oönskade artefakter i Mip-NeRF på grund av svårigheten att begränsa en sådan stor scen. Till vänster ser vi att den nya regularisatorn har optimerat scenen tillräckligt för att ta bort dessa störningar.

För att ta reda på mer om den nya artikeln, se videon nedan och också mars 2021-videon som introducerar Mip-NeRF. Du kan också ta reda på mer om NeRF-forskning genom att läsa vår bevakning hittills.

Publicerad ursprungligen den 25 november 2021
21 december 2021, 12:25 – Ersatt död video. – MA

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai