Andersons vinkel

Den nye CGI: Oprettelse af neurale nabolag med Block-NeRF

mm
Føj Unite.AI til dine foretrukne kilder på Google

Neurale lysfelter (NeRF) giver mulighed for at genskabe og udforske objekter inden for neurale netværk ved hjælp af flere synsvinkel-fotografier som input, uden den kompleksitet og omkostning, der er forbundet med traditionelle CGI-metoder.

Processen er dog computermæssigt dyrekøbt, hvilket initialt begrænsede NeRF-miljøer til bordmodel-scenarier. Alligevel er NeRF blevet adopteret af en dedikeret, ja endda frenetisk forskningskommunitet, som over det sidste år har muliggjort eksterne rekonstruktioner samt redigérbar neurale mennesker, samt mange andre innovationer.

Nu er der et nyt forskningsinitiativ, som inkluderer deltagelse fra Google Research, der erkender de mulige hårde grænser for at optimere NeRF, og i stedet fokuserer på at sy sammen NeRF-miljøer for at oprette påkrævet nabolag, der består af multiple koordinerede NeRF-eksemplarer.

Synsvinkel fra et Block-NeRF-netværk af sammenkædede NeRF'er. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Synsvinkel fra et Block-NeRF-netværk af sammenkædede NeRF’er. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Navigering i netværket af sammenkædede NeRF’er gør NeRF skalerbart og modulært, og giver navigable miljøer, der indlæser ekstra dele af nabolaget, som de er nødvendige, på en måde, der ligner ressourceoptimeringsmetoderne i videospil, hvor det, der er rundt om hjørnet, sjældent indlæses, før det bliver klart, at miljøet vil blive nødvendigt.

I et stort initiativ for at adskille separate aspekter som vejr og time, introducerer Block-NeRF også ‘udseendekoder’, der gør det muligt at dynamisk ændre tidspunktet på dagen:

Ændring af tidspunktet på dagen med Block-NeRF. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Ændring af tidspunktet på dagen med Block-NeRF. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Den nye artikel foreslår, at NeRF-optimering nærmer sig sin egen termiske grænse, og at fremtidige udrulninger af neurale lysfelter i virtuel virkelighed, andre typer interaktive sfærer og VFX-arbejde sandsynligvis vil afhænge af parallel operationer, ligesom Moores lov til sidst gav plads til multi-core-arkitekturer, parallel optimering og nye tilgange til cachelagring.

Artikelens forfattere (med titlen Block-NeRF: Skalerbar stor scene neuralt synssyntese) brugte 2,8 millioner billeder til at oprette den største neurale scene, der nogensinde er forsøgt – en række nabolag i San Francisco.

Block-NeRF navigerer gennem San Franciscos Grace Cathedral. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Block-NeRF navigerer gennem San Franciscos Grace Cathedral. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Artikelens hovedforfatter, der repræsenterer UC Berkley, er Matthew Tancik, medopfinder af neurale lysfelter, der udførte arbejdet, mens han var praktikant hos selvstændig køretøjs-teknologiudviklingsselskabet Waymo, som er vært for projektets side. Initiativet tilbyder også en videooversigt på YouTube, indlejret i slutningen af denne artikel, samt mange understøttende og supplementære videoeksempler på projektets side.

Artiklen er co-forfattet af flere andre NeRF-opfindere, herunder Ben Mildenhall (Google Research), Pratul P. Srinivasan (Google Research) og Jonathan T. Barron (Google Research). De andre bidragydere er Vincent Casser, Xinchen Yan, Sabeek Pradhan, Henrik Kretzschmar og Vincent Casser, alle fra Waymo.

Block-NeRF blev udviklet primært som forskning i virtuelle miljøer for selvstændige køretøjs-systemer, herunder selvkørende biler og droner.

Embarcadero-kørebanen set fra en 180-graders synsvinkel i Block-NeRF. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Embarcadero-kørebanen set fra en 180-graders synsvinkel i Block-NeRF. Se det indlejrede video i slutningen af artiklen, og også kildekoden for højopløselige fuldlængde-supplementære videoer. Kilde: https://waymo.com/research/block-nerf/

Andre faktorer, der kan ændres dynamisk i Block-NeRF, er blændeåbning (se billedet ovenfor), vejr og årstider.

Men at ændre årstid kan føre til relaterede ændringer i miljøet, såsom træer uden blade, hvilket kræver en endnu mere omfattende input-datasæt end det, der blev konstrueret for Block-NeRF. Artiklen fastslår:

‘[Løv] ændrer sig sæsonbestemt og bevæger sig i vinden; dette resulterer i uklare repræsentationer af træer og planter. Lignende tidsmæssige inkonsistenser i træningsdata, såsom byggearbejde, håndteres ikke automatisk og kræver manuel gen-træning af de berørte blokke.’

Apokalyptisk rendering

Hvis du kigger på videoen, der er indlejret i slutningen, vil du bemærke en Walking Dead-lignende sparsomhed i det netværksbaserede Block-NeRF-miljø. Af flere årsager, ikke mindst for at give en simuleret starter-miljø for robot-systemer, biler, fodgængere og andre midlertidige objekter blev bevidst udeladt fra kildematerialet, men dette har efterladt nogle artefakter, såsom skyggerne af “slettede” parkerede køretøjer:

Fantomskyggen af et slettet køretøj. Kilde: https://waymo.com/research/block-nerf/

Fantomskyggen af et slettet køretøj. Kilde: https://waymo.com/research/block-nerf/

For at tilpasse sig en række lysmiljøer, såsom dag eller nat, er netværket blevet trænet til at inkorporere adskilte datastrømme relateret til hver ønsket betingelse. I billedet nedenfor ser vi de bidragende strømme for Block-NeRF-optagelser af en motorvej om dagen og om natten:

De påkrævede aspekter bag en tilsyneladende 'bagt' Block-NeRF-render, der giver brugeren mulighed for at slå natten til, hvis nødvendigt. Kilde: https://waymo.com/research/block-nerf/

De påkrævede aspekter bag en tilsyneladende ‘bagt’ Block-NeRF-render, der giver brugeren mulighed for at slå natten til, hvis nødvendigt. Kilde: https://waymo.com/research/block-nerf/

Miljømæssige og etiske overvejelser

Over de sidste par år er forskningsindsendelser begyndt at inkludere forbehold og advarsler om mulige etiske og miljømæssige konsekvenser af det foreslåede arbejde. I tilfældet med Block-NeRF bemærker forfatterne, at energikraven er høj, og at det at tage hensyn til kortvarige og langvarige midlertidige objekter (såsom blade på træer og byggearbejde, henholdsvis) ville kræve regelmæssig genskanning af kilddata, hvilket ville føre til øget “overvågning” i byområder, hvis neurale modeller skal opdateres.

Forfatterne fastslår:

‘Afhængigt af, hvor stort dette arbejde udføres, kan compute-kravene føre til eller forværre miljøskader, hvis energien, der bruges til compute, fører til øgede CO2-udledninger. Som nævnt i artiklen, forudser vi yderligere arbejde, såsom cachelagring, der kunne reducere compute-kravene og dermed mindske miljøskaderne.’

Vedrørende overvågning fortsætter de:

‘Fremtidige anvendelser af dette arbejde kan omfatte endnu større dataindsamling, hvilket rejser yderligere privatlivsproblemer. Selvom detaljerede billeder af offentlige veje allerede kan findes på tjenester som Google Street View, kan vores metode fremme gentagne og mere regelmæssige scanninger af miljøet. Flere selskaber i selvstændigt køretøjs-branchen udfører også regelmæssige områdeskanninger med deres flåde af køretøjer; dog kan nogle kun bruge LiDAR-scanninger, der kan være mindre følsomme end at indsamle kamera-billeder.’

Metoder og løsninger

De enkelte NeRF-miljøer kan i teorien skaleres ned til enhver størrelse, før de samles i en Block-NeRF-matrix. Dette åbner mulighed for at inkludere indhold, der bestemt er underlagt ændringer, såsom træer, og for at identificere og håndtere byggearbejde, der kan bestå over tid, selv om det sandsynligvis vil udvikle sig og til sidst blive konsistente enheder.

Men i denne første forskningsudgave er discrete NeRF-blokke begrænset til de faktiske byblokke i hvert afbildet miljø, syet sammen med en 50% overlap, der sikrer konsistent overgang fra den ene blok til den næste, mens brugeren navigerer i netværket.

Hver blok er begrænset af en geografisk filter. Forfatterne bemærker, at denne del af rammen er åben for automatisering, og – overraskende – at deres implementering afhænger af OpenStreetMap snarere end Google Maps.

Intersektionsradius for et Block-NeRF 'aktiveret' render-område. Kilde: Waymo

Intersektionsradius for et Block-NeRF ‘aktiveret’ render-område. Kilde: Waymo

Blokke trænes i parallel, og nødvendige blokke renderes påkrævet. De innovative udseendekoder er også orkestrerede mellem blok-sættet, sådan at man ikke uventet rejser ind i forskelligt vejr, tid på dagen eller endda en anden årstid.

Block-NeRF-segmenter er betinget af eksponering på en måde, der ligner High Dynamic Range (HDR) i fotografisk kildemateriale. Kilde: Waymo

Block-NeRF-segmenter er betinget af eksponering på en måde, der ligner High Dynamic Range (HDR) i fotografisk kilodemateriale. Kilde: Waymo

Evnen til at skifte lys- og andre miljøvariable er afledt fra de generative latente optimeringer, der blev introduceret i NeRF i det vilde (NeRF-W), der selv afledte metoden fra Facebook AI-forskningsartiklen fra 2019 Optimering af det latente rum i generative netværk.

En semantisk segmenteringsmodel, der oprindeligt blev udviklet til Panoptic-DeepLab i 2020, bruges til at blokere uønskede elementer (såsom mennesker og køretøjer)

Data

Da det blev opdaget, at almindelige by-datasæt som CityScapes ikke var egnet til så intensivt detaljarbejde som Block-NeRF, oprettede forskerne deres eget datasæt. Billeddata blev indsamlet fra 12 kameralinjer, der dækkede en 360-graders synsvinkel, med optagelser taget med 10 Hz og en skalar eksponeringsværdi.

San Francisco-nabolagene, der blev dækket, var Alamo Square og Mission Bay. For Alamo Square-optagelserne blev et område på ca. 960m x 570m dækket, opdelt i 35 Block-NeRF-eksemplarer, hver trænet på data fra 38 til 48 forskellige dataindsamlinger, med en samlet køretid på 18-28 minutter.

Antallet af bidragende billeder for hver Block-NeRF lå mellem 64.575 og 108.216, og den samlede køretid, der blev repræsenteret for dette område, var 13,4 timer over 1.330 forskellige dataindsamlinger. Dette resulterede i 2.818.745 træningsbilleder kun for Alamo Square. Se artiklen for yderligere detaljer om dataindsamlingen for Mission Bay.

 

Offentliggjort første gang den 11. februar 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai