Andersons vinkel
Den nya CGI: Skapar neuronnätverksgrannskap med Block-NeRF

Neuronnätverksstrålning (NeRF) tillåter att föremål återskapas och utforskas inom neuronnätverk med hjälp av flera vyfotografier som indata, utan komplexiteten och kostnaden för traditionella CGI-metoder.
Men processen är beräkningsmässigt dyr, vilket initialt begränsade NeRF-miljöer till tabellmodellscenarier. Trots detta har NeRF antagits av en dedikerad, till och med frän forskargrupp, som under det senaste året aktiverat utomhusrekonstruktioner samt redigerbara neurala människor, förutom många andra innovationer.
Nu har ett nytt forskningsinitiativ, som inkluderar deltagande från Google Research, erkänt de möjliga hårda gränserna för att optimera NeRF, och fokuserar istället på att sy ihop NeRF-miljöer för att skapa på begäran grannskap som består av flera samordnade NeRF-instanser.

Vy från ett Block-NeRF-nätverk av länkade NeRF. Se den inbäddade videon i slutet av artikeln, och även källlänken för högupplösta, fullängds tilläggsvideos. Källa: https://waymo.com/research/block-nerf/
Att navigera i nätverket av länkade NeRF gör NeRF skalbart och modulärt, och tillhandahåller navigerbara miljöer som laddar extra delar av grannskapet när de behövs, på ett sätt som liknar resursallokeringsmetoderna i videospel, där det som finns runt hörnet sällan laddas förrän det blir tydligt att miljön kommer att behövas.
I en stor satsning på att avgranska separata aspekter som väder och tid, introducerar Block-NeRF också “utseendekoder”, som gör det möjligt att dynamiskt ändra dagen:


Ändra dagen med Block-NeRF. Se den inbäddade videon i slutet av artikeln, och även källlänken för högupplösta, fullängds tilläggsvideos. Källa: https://waymo.com/research/block-nerf/
Den nya artikeln föreslår att NeRF-optimering närmar sig sin egen termiska gräns, och att framtida distributioner av neurala strålningsmiljöer i virtuell verklighet, andra typer av interaktiva sfärer och VFX-arbete, sannolikt kommer att bero på parallella operationer, liknande sättet som Moore’s Law till slut gav vika för multi-core-arkitekturer, parallella optimeringar och nya tillvägagångssätt för cachelagring.
Författarna till artikeln (med titeln Block-NeRF: Skalbar stor scen neural vy-syntes) använde 2,8 miljoner bilder för att skapa den största neuronnätverksmiljön som någonsin försökts – en serie grannskap i San Francisco.

Block-NeRF navigerar San Franciscos Grace Cathedral. Se den inbäddade videon i slutet av artikeln, och även källlänken för högupplösta, fullängds tilläggsvideos. Källa: https://waymo.com/research/block-nerf/
Huvudförfattaren till artikeln, som representerar UC Berkley, är Matthew Tancik, meduppfinnaren av Neuronnätverksstrålning, som genomförde arbetet under sin praktik på det autonoma fordonsutvecklingsföretaget Waymo, som är värd för projektsidan. Initiativet erbjuder också en videoöversikt på YouTube, inbäddad i slutet av den här artikeln, samt många stödjande och tilläggsvideos på projektsidan.
Artikeln är skriven tillsammans med flera andra NeRF-ursprung, inklusive Ben Mildenhall (Google Research), Pratul P. Srinivasan (Google Research) och Jonathan T. Barron (Google Research). Övriga bidragsgivare är Vincent Casser, Xinchen Yan, Sabeek Pradhan, Henrik Kretzschmar och Vincent Casser, alla från Waymo.
Block-NeRF utvecklades främst som forskning om virtuella miljöer för autonoma fordonssystem, inklusive självkörande bilar och drönare.

Embarcadero-vägen från en 180-graders vy i Block-NeRF. Se den inbäddade videon i slutet av artikeln, och även källlänken för högupplösta, fullängds tilläggsvideos. Källa: https://waymo.com/research/block-nerf/
Andra faktorer som kan ändras dynamiskt i Block-NeRF är bländare (se bild ovan), väder och årstider.
Men att ändra årstid kan orsaka relaterade förändringar i miljön, såsom träd utan löv, vilket kräver en ännu mer omfattande indatauppsättning än den som konstruerades för Block-NeRF. Artikeln påstår:
‘[Löv] förändras årstidsmässigt och rör sig i vinden; detta resulterar i suddiga representationer av träd och växter. Likaså, tidsmässiga oförenligheter i träningsdata, såsom byggnadsarbete, hanteras inte automatiskt och kräver manuell omträning av de berörda blocken.’
Apokalyptisk rendering
Om du tittar på den inbäddade videon i slutet, kommer du att märka en Walking Dead-liknande gleshet i det nätverkade Block-NeRF-miljön. Av olika skäl, inte minst för att tillhandahålla en simulerad startmiljö för robotiska system, bilar, fotgängare och andra tillfälliga föremål togs medvetet bort från källmaterialet, men detta har lämnat vissa artefakter efter sig, såsom skuggorna av “raderade” parkerade fordon:

Skuggan av ett raderat fordon. Källa: https://waymo.com/research/block-nerf/
För att tillhandahålla en rad olika belysningsmiljöer, såsom dag eller natt, har nätverken tränats för att inkorporera avgranskad dataström relaterad till varje önskad tillstånd. I bilden nedan ser vi de bidragande strömmarna för Block-NeRF-film av en motorväg under dagen och natten:

De på begäran-faceterna bakom en tydligen ‘gräddad’ Block-NeRF-rendering, som tillåter en användare att slå på natten när som helst. Källa: https://waymo.com/research/block-nerf/
Miljö- och etiska överväganden
Under de senaste åren har forskningsinlämnanden börjat inkludera varningar och ansvarsfriskrivningar angående möjliga etiska och miljömässiga konsekvenser av det föreslagna arbetet. I fallet med Block-NeRF noterar författarna att energibehoven är höga, och att redovisning för kortvariga och långvariga tillfälliga föremål (såsom löv på träd och byggnadsarbete) skulle kräva regelbunden om-scanning av källdata, vilket leder till ökad “övervakning” i urbana områden vars neuronnätverksmodeller behöver uppdateras.
Författarna påstår:
‘Beroende på den skala som detta arbete tillämpas på, kan dess beräkningskrav leda till eller förvärra miljöskador om den energi som används för beräkning leder till ökade koldioxidutsläpp. Som nämns i artikeln, förutser vi ytterligare arbete, såsom cachemetoder, som kunde reducera beräkningskraven och därmed mildra miljöskadorna.’
När det gäller övervakning fortsätter de:
‘Framtida tillämpningar av detta arbete kan omfatta ännu större datainsamling, vilket väcker ytterligare integritetsproblem. Medan detaljerad bild av offentliga vägar redan kan hittas på tjänster som Google Street View, kan vår metod främja upprepade och regelbundna scannningar av miljön. Flera företag inom den autonoma fordonstekniken är också kända för att utföra regelbundna områdesscannningar med hjälp av sina fordon; dock kan vissa bara använda LiDAR-scannningar, som kan vara mindre känsliga än att samla in kamerabilder.’
Metoder och lösningar
De enskilda NeRF-miljöerna kan skalas ner, i teorin, till vilken storlek som helst innan de sätts samman till en Block-NeRF-matris. Detta öppnar vägen för den granulära inklusionen av innehåll som definitivt är föremål för förändring, såsom träd, och för identifiering och hantering av byggnadsarbete, som kan bestå under lång tid, även år, men som sannolikt kommer att utvecklas och så småningom bli konsekventa enheter.
Men i denna initiala forskningsutgåva är diskreta NeRF-block begränsade till de faktiska stadsblocken i varje avbildad miljö, sydda ihop, med en 50% överlappning som säkerställer konsekvent övergång från ett block till nästa när användaren navigerar i nätverket.
<p.Varje block är begränsat av ett geografiskt filter. Författarna noterar att denna del av ramverket är öppen för automatisering, och, förvånansvärt, att deras implementering förlitar sig på OpenStreetMap snarare än Google Maps.

Intersektionsradien för ett Block-NeRF ‘aktiverat’ renderutrymme. Källa: Waymo
Blocken tränas parallellt, med behövliga block renderade på begäran. De innovativa utseendekoderna är också orkestrerade bland blockuppsättningen, vilket säkerställer att man inte reser oväntat in i olika väder, tid på dagen eller till och med en annan årstid.

Block-NeRF-segment konditionerade för exponering på ett sätt analogt med High Dynamic Range (HDR) i fotografiskt källmaterial. Källa: Waymo
Förmågan att växla belysning och andra miljövariabler är härledd från de generativa latentoptimeringar som introducerades i NeRF i vildmarken (NeRF-W), som i sin tur hämtade metoden från 2019 års Facebook AI forskningsartikel Optimering av det latenta utrymmet i generativa nätverk.
En semantisk segmenteringsmodell som ursprungligen skapades för Panoptic-DeepLab 2020 används för att blockera oönskade element (såsom människor och fordon)
Data
Eftersom man fann att vanliga urbana dataset, såsom CityScapes, inte var lämpliga för sådan intensiv detalj-arbete som Block-NeRF kräver, skapade forskarna sin egen dataset. Bilddata samlades in från 12 kameror som omfattade en 360-graders vy, med filmsekvenser tagna vid 10 Hz med en skalär exponeringsvärde.

De San Francisco-grannskap som täcktes var Alamo Square och Mission Bay. För Alamo Square-insamlingarna täcktes ett område som uppskattades till 960m x 570m, indelat i 35 Block-NeRF-instanser, var och en tränad på data från 38 till 48 olika datainsamlingssessioner, med en total körningstid på 18-28 minuter.
Antalet bidragande bilder för varje Block-NeRF varierade mellan 64 575 och 108 216, och den totala körningstiden som representerades för detta område var 13,4 timmar över 1 330 olika datainsamlingssessioner. Detta resulterade i 2 818 745 träningsbilder bara för Alamo Square. Se artikeln för ytterligare information om datainsamlingen för Mission Bay.
Publicerad första gången den 11 februari 2022.












