Andersons vinkel

NeRF tar et skritt nærmere å erstatte CGI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere ved MIT og Google har tatt et stort skritt i å løse en av de mest grunnleggende hindringene for en ny, AI-drevet teknologi som kan erstatter CGI – å separere neural radiance field (NeRF) bilder i deres bestanddelene, slik at bildene kan teksturiseres og belyses på nytt.

Den nye tilnærmingen, kalt NeRFactor, splitter effektivt inn fanget bilde i per-objekt normale (der teksturer kan tilordnes), lys synlighet, albedo (prosenten av tilfeldig lys som reflekteres bort fra en overflate) og Bidirectional Reflectance Distribution Functions (BRDFs).

Med disse aspektene isolert, er det mulig ikke bare å bytte teksturer for enkeltobjekter eller objektgrupper, men også å legge til nye og unike lyskilder og skyggeimplementeringer, uten å ta hensyn til de som ble fanget av multi-kamera-arrays som genererer innmatningsdata for NeRF-bilder.

Normals, visibility, albedo and BRDF separated under NeRFactor. Source: https://www.youtube.com/watch?v=UUVSPJlwhPg

Normals, visibility, albedo and BRDF separated under NeRFactor. Source: https://www.youtube.com/watch?v=UUVSPJlwhPg

Modellen støtter myke eller harde skygger fra vilkårlige, brukerdefinerte lyskilder, og separerer de fire aspektene av fanget video programmatically, ved å bruke en rekonstruksjons tap, data fra tidligere beregninger av BRDF, og enkel, enkel glatt regulering.

NeRFactor’s work-flow, extracting separately actionable facets of imagery derived from multiple-camera arrays. Source: https://arxiv.org/pdf/2106.01970.pdf

NeRFactor bruker en HDR-lys-sonde, en etablert tilnærming som har vært fremherskende i det visuelle industri- og kunstscenen siden dens innføring i 1998, for å evaluere mulige ruter for stråler, som muliggjør vilkårlig lys. Siden dette genererer et ustyrbart antall mulige parametre, filtreres lys-sonden gjennom en multi-lag perceptron (MLP), som kartlegger den oppfattede geometrien til sonde uten å forsøke å beregne en fullstendig lysvolumkart for modellrommet.

Two neural radiance field models are used to demonstrate five lighting models possible under NeRFactor. Click image for higher resolution.

Årsak til refleksjon

Den nye forskningen er kanskje mest betydelig i å separere lagene av fanget bilde som kontrollerer refleksjon. Dette er fortsatt en av de største utfordringene for neural radiance field-bilder, siden en virkelig ny og fleksibel NeRF-system må kunne ikke bare erstatte teksturer, men også reflektere bevegelige objekter (foruten bare den faste omgivelsen) som vanligvis ville bli tatt med i en CGI-arbeidsflyt.

Dette problemet ble nylig notert i forbindelse med Intels imponerende nye forskning i å transformere videospillfilm til fotorealistiske videoer via konvolusjonsneurale nettverk. I slike arbeidsflyter ville mange “bakede” aspekter av kildematerialet måtte bli diskrete og ombyttable, og dette er kanskje lettere å løse for belysning (som er en funksjon av geometrien som renderes i NeRF) enn for refleksjoner (som bruker “off-screen” geometri som er helt utenfor modellens omfang).

Derfor bringer isoleringen av lagene i NeRF-video som muliggjør refleksjon NeRF ett skritt nærmere å løse sin “refleksjonsutfordring”.

Bruken av en HDR-miljø løser allerede problemet med å generere verdensmiljørefleksjoner (dvs. himmel, landskap og andre “faste” omgivelsesfaktorer), men nye tilnærminger vil være nødvendige for å introdusere bevegelige og dynamiske refleksjoner.

Fotogrammetri med NeRF

Neural Radiance Field-bilder bruker maskinlæringanalyse for å utvikle et fullstendig volumetrisk rom fra en scene eller objekt som er fanget fra flere vinkler.

Ulike NeRF-baserte skjemaer som har oppstått i løpet av det siste året har brukt en rekke bidragende kameraenheter; noen bruker 16 eller flere kameraer, andre så få som ett eller to. I alle tilfeller blir de mellomliggende utsiktene “infillt” (dvs. tolket) så at scenen eller objektet kan flyttes gjennom flytende.

Resultatet er et fullstendig volumetrisk rom, med en innebygd 3D-forståelse som kan utnyttes på mange måter, inkludert evnen til å generere tradisjonelle CG-mesh fra 3D-parsed summen av innmatningsbildene.

NeRF i sammenheng med en ‘ny CGI’

Neural radiance field-bilder er tegnet direkte fra bilder av den virkelige verden, inkludert bevegelige bilder av mennesker, objekter og scener. I motsetning til dette “studerer” og tolker en CGI-metodikken verden, og krever dyktige arbeidere for å bygge mesh, rigg og teksturer som bruker virkelige verdensbilder (dvs. ansikts- og miljøfangst).

I tillegg har CGI hatt pågående problemer med “uncanny valley”-effekten i sine forsøk på å gjenskape menneskelige likheter, noe som ikke utgjør noen begrensning for en NeRF-drevet tilnærming, som bare fanger videoer eller bilder av virkelige mennesker og manipulerer dem.

Videre kan NeRF generere tradisjonelle CGI-stil mesh-geometri direkte fra fotos hvis nødvendig, og i virkeligheten kan erstatter mange av de manuelle prosedyrene som alltid har vært nødvendige i datagenerert bilde.

Utfordringer for NeRF

Denne siste forskningen fra MIT og Google kommer i sammenheng med en rekke NeRF-papirer i løpet av det siste året, mange av dem har tilbudt løsninger på de ulike utfordringene som er kastet opp av det opprinnelige 2020-papiret.

I april tilbød innovasjon fra et kinesisk forskningskonsortium en måte å diskret isolere de enkelte tidslinjene til aspektene i en NeRF-scene, inkludert mennesker.

ST-NeRF

The Chinese research allows end-users to copy, paste and resize captured elements, disentangling them from the linear timeline of the original source video. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Dette tilnærmingen muliggjør ikke bare å forestille seg scenen fra hvilken som helst vinkel fanget av kamera-arrays (og ikke bare den enkeltvinklede representert i en typisk videoopptak), men også å muliggjøre versatil komposisjon – og sogar å representere to aspekter fra samme opptak som kjører i deres egne individuelle tidsrammer (eller sogar kjører bakover, hvis nødvendig).

Two separate NeRF facets run at different speeds in the same scene. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4

The Chinese research allows end-users to copy, paste and resize captured elements, disentangling them from the linear timeline of the original source video. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4

En av de største utfordringene for NeRF er å senke de betydelige ressursene som er nødvendige for å trene en scene, og dette har blitt adressert i en rekke nylige papirer. For eksempel introduserte Max Planck-instituttet for intelligente systemer nylig KiloNeRF, som ikke bare akselerer renderingstider med en faktor på 1000, men også muliggjør NeRF å operere interaktivt.

KiloNeRF running an interactive environment at 50fps on a GTX 1080ti. Source: https://github.com/creiser/kilonerf

KiloNeRF running an interactive environment at 50fps on a GTX 1080ti. Source: https://github.com/creiser/kilonerf

Likevel er NeRF-hastighetsinnovasjonen som virkelig fanget forskernes og allmennhetens forestilling i 2021 PlenOctrees-samarbeidet, ledet av UC Berkeley, som tilbyr sanntidsrendering av Neural Radiance Fields:

Effekten av PlenOctrees’ interaktive muligheter er reproduktivt i en live, web-basert grensesnitt.

Live interactive movement of a PlenOctrees object in Firefox (movement is smoother and more dynamic than this GIF represents). Source: http://alexyu.net/plenoctrees/demo/

Live interactive movement of a PlenOctrees object in Firefox (movement is smoother and more dynamic than this GIF represents). Source: http://alexyu.net/plenoctrees/demo/

I tillegg tilbyr Recursive-NeRF (fra en papir i mai 2021 av forskere ved Tsinghua University) høykvalitets rekursiv rendering på forespørsel. I stedet for å tvinge brukeren til å rendre hele scener, inkludert deler som kanskje ikke sees, tilbyr Recursive-NeRF noe lignende JPEGs tapende kompresjon, og kan generere diskrete sub-NeRFs for å håndtere ekstra bilde på forespørsel – og oppnår en enorm besparelse i beregningsressursene.

Retaining detail while dumping unnecessary render calculations with Recursive-NeRF. Source: https://arxiv.org/pdf/2105.09103.pdf

Retaining detail while dumping unnecessary render calculations with Recursive-NeRF.  Click on image for higher resolution. Source: https://arxiv.org/pdf/2105.09103.pdf

Andre tilnærminger inkluderer FastNeRF, som hevder å oppnå høykvalitets neuralt rendering på 200fps.

Det har blitt notert at mange av optimeringsteknikkene for NeRF involverer ‘baking’ scenen, ved å binde seg til aspekter som ønskes å rendre og kaste bort andre aspekter, noe som begrenser utforskning, men akselerer interaktivitet betydelig.

Ulemper med dette er at stressen flyttes fra GPU-en til lagringen, fordi “bakede” scener tar opp en uforholdsmessig stor mengde diskplass; til en viss grad kan dette mitigeres ved å nedprøve den “bakede” data, selv om dette også innebærer en viss forpliktelse, i form av å lukke av utforskning eller interaktivitet.

Angående bevegelsesfangst og rigging, tilbød en ny tilnærming fra Zheijang og Cornell-universitetene, avdekket i mai, en metode for å gjenskape animerbare mennesker ved å bruke blanding av vekt- og skjelettstrukturer tolket fra innmatningsvideo:

Derived skeletal structure in Animatable NeRF. Source: https://www.youtube.com/watch?v=eWOSWbmfJo4

Derived skeletal structure in Animatable NeRF. Source: https://www.youtube.com/watch?v=eWOSWbmfJo4

Når vil NeRF få sitt ‘Jurassic Park’-øyeblikk?

Til tross for den raske fremdriften med bilde-syntese via neurale lysfelt, er det først nå at noen form for “termodynamikklov” vil bli etablert for hvordan NeRF kan bli deployert. I forhold til en tidsline analog til historien om CGI, er NeRF for øyeblikket svært nær 1973, like før den første bruken av CGI i Westworld.

Det betyr ikke at NeRF nødvendigvis må vente ni år for sitt ekvivalente Wrath Of Khan-milepæl, eller tiår for de tilsvarende gjennombruddene som CGI oppnådde under James Camerons entusiastiske patronasje i 1989s The Abyss eller 1991s Terminator 2 – og deretter, teknologiens virkelig revolusjonære gjennombruddsøyeblikk i 1993s Jurassic Park.

Bildescenen har endret seg mye siden den lange perioden med stagnasjon for foto-kjemiske visuelle effekter, som dominerte film- og TV-produksjon fra fødselen av kinoen til begynnelsen av 1990-årene. PC-revolusjonen og akselerasjonen av Moores lov ledet til CGI-revolusjonen, som ellers kunne ha funnet sted så tidlig som i 1960-årene.

Det er fortsatt å se om det er noen barrierer som kan holde tilbake NeRFs fremdrift så lenge – og om påfølgende innovasjoner i datavisjon kanskje ikke i mellomtiden helt overtar NeRF som den viktigste utfordreren til CGI-kronen, og karakteriserer neurale lysfelt som det kortvarige “faks-maskinen” for neuralt bilde-syntese.

Så langt har NeRF ikke blitt brukt i noen kontekst utenfor akademisk forskning; men det er verd å merke seg at store aktører som Google Research, og mange av de mest prominente datavisjonsforskningslaboratoriene, konkurrerer om de siste NeRF-gjennombruddene.

Mange av NeRFs største hindringer har begynt å bli direkte adressert i år; hvis påfølgende forskning tilbyr en løsning på “refleksjonsproblemet”, og de mange trådene av NeRF-optimiseringsforskning samles inn i en avgjørende løsning på teknologiens betydelige behandlings- og/eller lagringskrav, har NeRF virkelig en sjanse til å bli “den nye CGI” i løpet av de neste fem årene.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai