Andersons vinkel
Den nye CGI: Oppretting av neurale nabolag med Block-NeRF

Neurale lysfelt (NeRF) gjør det mulig å gjenskape og utforske objekter inne i neurale nettverk ved hjelp av flere fotografier tatt fra ulike vinkler, uten den kompleksiteten og kostnadene forbundet med tradisjonelle CGI-metoder.
Likevel er prosessen komputasjonskrevd, noe som opprinnelig begrenset NeRF-miljøer til modellscenarier på bordet. Likevel har NeRF blitt tatt i bruk av en dedikert, ja, til og med frenetisk forskningsmiljø, som over det siste året har gjort det mulig å gjenskape utendørsområder samt redigerebare neurale mennesker, samt mange andre innovasjoner.
Nå er det igangsatt et nytt forskningsinitiativ, som inkluderer deltakelse fra Google Research, som erkjenner de mulige grensene for å optimalisere NeRF, og i stedet fokuserer på å sy sammen NeRF-miljøer for å skape på forespørsel nabolag bestående av flere koordinerte NeRF-eksemplarer.

Visning fra et Block-NeRF-nettverk av sammenkoblede NeRF-er. Se innlejret video på slutten av artikkelen, og også kilde-link for høyoppløselige, fulle lengde supplerende videoer. Kilde: https://waymo.com/research/block-nerf/
Navigering i nettverket av sammenkoblede NeRF-er gjør NeRF skalerbart og modulært, og gir navigerbare miljøer som laster inn ekstra deler av nabolaget etter behov, på en måte som ligner ressursoptimeringsmetodene i videospill, hvor det som er rundt hjørnet sjelden lastes inn før det blir klart at miljøet kommer til å være nødvendig.
I en stor drive for å skille separate aspekter som vær og tid, innfører Block-NeRF også ‘utseendekoder’, som gjør det mulig å dynamisk endre tid på dagen:


Endring av tid på dagen med Block-NeRF. Se innlejret video på slutten av artikkelen, og også kilde-link for høyoppløselige, fulle lengde supplerende videoer. Kilde: https://waymo.com/research/block-nerf/
Den nye artikkelen foreslår at NeRF-optimalisering nærmer seg sin egen termiske grense, og at fremtidige utviklinger av neurale lysfelt i virtuell virkelighet, andre typer interaktive sfærer og VFX-arbeid, sannsynligvis kommer til å avhenge av parallell drift, på samme måte som Moores lov til slutt ga plass til multi-kjerne-arkitekturer, parallell optimering og nye tilnærminger til caching.
Forfatterne av artikkelen (med tittelen Block-NeRF: Skalerbart, stort scenarie, neuralt synssyntese) brukte 2,8 millioner bilder for å skape det største neurale scenariet noensinne forsøkt – en serie nabolag i San Francisco.

Block-NeRF navigerer i San Franciscos Grace Cathedral. Se innlejret video på slutten av artikkelen, og også kilde-link for høyoppløselige, fulle lengde supplerende videoer. Kilde: https://waymo.com/research/block-nerf/
Hovedforfatteren på artikkelen, som representerer UC Berkley, er Matthew Tancik, med-oppfinneren av Neurale Lysfelt, som utførte arbeidet som intern i selskapet Waymo, som er vert for prosjektsiden. Initiativet tilbyr også en videooversikt på YouTube, innlejret på slutten av denne artikkelen, samt mange støttende og supplerende videoeksempler på prosjektsiden.
Artikkelen er skrevet sammen med flere andre NeRF-oppfinnere, inkludert Ben Mildenhall (Google Research), Pratul P. Srinivasan (Google Research) og Jonathan T. Barron (Google Research). De andre bidragsyterne er Vincent Casser, Xinchen Yan, Sabeek Pradhan, Henrik Kretzschmar og Vincent Casser, alle fra Waymo.
Block-NeRF ble utviklet hovedsakelig som forskning på virtuelle miljøer for autonome kjøretøysystemer, inkludert selvkjørende biler og droner.

Embarcadero-veien fra en 180-graders visningsvinkel i Block-NeRF. Se innlejret video på slutten av artikkelen, og også kilde-link for høyoppløselige, fulle lengde supplerende videoer. Kilde: https://waymo.com/research/block-nerf/
Andre faktorer som kan endres dynamisk i Block-NeRF er blant annet lysåpning (se bildet ovenfor), vær og årstider.
Men å endre årstid kan føre til relaterte endringer i miljøet, som for eksempel trær uten blader, noe som krever en enda mer omfattende inndata enn det som ble konstruert for Block-NeRF. Artikkelen slår fast:
‘[Løvverk] endrer seg sesongmessig og beveger seg i vinden; dette resulterer i uklare representasjoner av trær og planter. Liknende, tidsmessige inkonsistenser i treningsdataene, som for eksempel byggearbeid, blir ikke automatisk håndtert og krever manuell om-trening av de berørte blokkene.’
Apokalyptisk rendering
Hvis du ser på videoen som er innlejret på slutten, vil du merke en Walking Dead-lignende sparsomhet i det nettverksbaserte Block-NeRF-miljøet. Av ulike årsaker, ikke minst for å gi et simulert startmiljø for robotiske systemer, biler, fotgjengere og andre midlertidige objekter ble bevisst fjernet fra kildematerialet, men dette har etterlatt noen artefakter, som skyggen av “slettet” parkert kjøretøy:

Fantomskyggen av et slettet kjøretøy. Kilde: https://waymo.com/research/block-nerf/
For å kunne håndtere en rekke lysmiljøer, som for eksempel dag eller natt, er nettverkene trenet for å inkorporere skilte datastrømmer relatert til hver ønsket betingelse. I bildet under ser vi de bidragende strømmene for Block-NeRF-avspilling av en motorvei om dagen og om natten:

De på forespørsel-facetene bak en tilsynelatende ‘bakt’ Block-NeRF-avspilling, som lar en bruker slå på natten etter behov. Kilde: https://waymo.com/research/block-nerf/
Miljømessige og etiske overveielser
Over de siste årene har forskningsinnlegg begynt å inkludere forbehold og advarsler om mulige etiske og miljømessige konsekvenser av det foreslåtte arbeidet. I tilfelle Block-NeRF påpeker forfatterne at energikravene er høye, og at det å regne med kortvarige og langvarige midlertidige objekter (som for eksempel blader på trær og byggearbeid) ville kreve jevnlige gjen-scanning av kilde-dataene, noe som ville føre til økt “overvåking” i byområder som trenger å oppdatere deres neurale modeller.
Forfatterne slår fast:
‘Avhengig av skalaen dette arbeidet utføres på, kan datamaskin-kravene føre til eller forverre miljøskader hvis energien brukt til datamaskin-arbeid fører til økte karbonutslipp. Som nevnt i artikkelen, forutser vi videre arbeid, som for eksempel caching-metoder, som kunne redusere datamaskin-kravene og dermed mildne miljøskadene.’
Med hensyn til overvåking fortsetter de:
‘Fremtidige anvendelser av dette arbeidet kan omfatte enda større datainnsamling, noe som øker privatlivsproblemer. Mens detaljerte bilder av offentlige veier allerede kan finnes på tjenester som Google Street View, kan vår metode fremme gjentatte og mer regelmessige scanninger av miljøet. Flere selskaper i det autonome kjøretøysområdet er også kjent for å utføre regelmessige områdeskanninger ved hjelp av sine flåter av kjøretøy; likevel kan noen bare bruke LiDAR-scanninger, som kan være mindre følsomme enn å samle inn kamera-bilder.’
Metoder og løsninger
De enkelte NeRF-miljøene kan skaleres ned til enhver størrelse før de samles inn i en Block-NeRF-matrise. Dette åpner veien for den granulære inklusjonen av innhold som definitivt er underlagt endring, som for eksempel trær, og for identifisering og håndtering av byggearbeid, som kan vedvare over tid, selv over flere år med gjen-innsamling, men som sannsynligvis vil utvikle seg og til slutt bli konsistente enheter.
Likevel, i denne første forskningsutgaven, er diskrete NeRF-blokker begrenset til de faktiske byblokkene i hvert avbildet miljø, sydd sammen med en 50% overlapping som sikrer konsistent overgang fra en blokk til den neste når brukeren navigerer i nettverket.
Hver blokk er begrenset av en geografisk filter. Forfatterne påpeker at denne delen av rammeverket er åpen for automatisering, og, overraskende, at deres implementering avhenger av OpenStreetMap i stedet for Google Maps.

Krysningsradiusen for et Block-NeRF ‘aktivt’ render-rom. Kilde: Waymo
Blokkene trenes i parallell, med nødvendige blokker rendret på forespørsel. De innovative utseendekodene er også orkestrert blant blokksettet, og sikrer at en ikke reiser uventet inn i forskjellig vær, tid på dagen eller sogar en annen årstid.

Block-NeRF-segmenter er betinget av eksponering på en måte analog til High Dynamic Range (HDR) i fotografisk kilde-materiale. Kilde: Waymo
Evnen til å skifte lys og andre miljøvariable er avledet fra de generative latente optimaliseringer som ble introdusert i NeRF i villmarken (NeRF-W), som selv avledet metoden fra Facebook AI-forskningsartikkelen fra 2019 Optimizing the Latent Space of Generative Networks.
En semantisk segmenteringsmodell som opprinnelig ble utviklet for Panoptic-DeepLab i 2020, brukes til å blokkere uønskede elementer (som for eksempel mennesker og kjøretøy)
Data
Etter å ha funnet ut at vanlige by-datasett som CityScapes ikke var egnet for så intensivt detaljarbeid som Block-NeRF omfatter, opprettet forskerne sitt eget datasett. Bilde-data ble fanget fra 12 kameraer som omfattet en 360-graders visning, med opptak tatt med en hastighet på 10 Hz og en skalerings-exponeringsverdi.

San Francisco-nabolagene som ble dekket, var Alamo Square og Mission Bay. For Alamo Square-oppfanget, ble et område på omtrent 960m x 570m dekket, delt inn i 35 Block-NeRF-eksemplarer, hver trenet på data fra 38 til 48 forskjellige datainnsamlingskjøringer, med en total kjøretid på 18-28 minutter.
Antallet bidragende bilder for hver Block-NeRF varierte fra 64 575 til 108 216, og den totale kjøretiden representert for dette området var 13,4 timer over 1 330 forskjellige datainnsamlingskjøringer. Dette resulterte i 2 818 745 treningsbilder bare for Alamo Square. Se artikkelen for flere detaljer om datainnsamlingen for Mission Bay.
Først publisert 11. februar 2022.












