Andersons vinkel

NeRF: Facebook Co-Research Utvikler Blandet Statiske/Dynamiske Video-Syntese

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et samarbeid mellom Virginia Polytechnic Institute and State University og Facebook har løst en av de største utfordringene i NeRF-video-syntese: fritt å blande statiske og dynamiske bilder og videoer i Neural Radiance Fields (NeRF)-utdata.

Systemet kan generere navigerbare scener som inneholder både dynamiske video-elementer og statiske miljøer, hver innspilt på stedet, men skilt ut i kontrollerbare aspekter av en virtuell miljø:

Det oppnår dette fra ett enkelt synspunkt, uten behov for den type multi-kamera-oppsett som kan binde slike initiativer til et studio-miljø.

Den artikkelen, med tittelen Dynamic View Synthesis from Dynamic Monocular Video, er ikke den første til å utvikle en monokulær NeRF-arbeidsflyt, men ser ut til å være den første til å samtidig trene en tid-variabel og en tid-statiske modell fra samme inndata, og å generere en ramme som tillater bevegelsesvideo å eksistere innenfor en ‘forhåndsmappet’ NeRF-locale, lignende den type virtuelle miljøer som ofte omgir skuespillere i høy-budsjett SF-utgivelser.

Beyond D-NeRF

Forskerne har måttet i stor grad gjenskape fleksibiliteten til Dynamic NeRF (D-NeRF) med bare ett synspunkt, og ikke flertallet av kameraer som D-NeRF bruker. For å løse dette, har de forutsagt fremover- og bakover-scene-strøm og brukt denne informasjonen til å utvikle en vridd radians-felt som er tids-konsistent.

Med bare ett synspunkt, var det nødvendig å bruke 2D optisk strøm-analyse for å få 3D-punkter i referanse-rammer. Den beregnede 3D-punktet blir deretter matet tilbake til den virtuelle kameraet for å etablere en ‘scene-strøm’ som matcher den beregnede optiske strømmen med den estimerte optiske strømmen.

Ved treningstid, blir dynamiske elementer og statiske elementer forsonet i en fullstendig modell som separat tilgjengelige aspekter.

Ved å inkludere en beregning av dybde-orden-tap, og å anvende streng regularisering av scene-strøm-prediksjon i D-NeRF, blir problemet med bevegelses-uskarphet betydelig mildnet.

Selv om forskningen har mye å tilby når det gjelder å regularisere NeRF-beregning, og betydelig forbedrer evnen og fasiliteten til å utforske utdata fra ett enkelt synspunkt, er likeverdig å merke seg den nye separasjonen og gjen-sammenføringen av dynamiske og statiske NeRF-elementer.

Et slikt system, som bare har ett kamera, kan ikke gjenskape den panoptiske utsikten til multi-kamera-oppsett NeRF, men kan gå hvor som helst, og uten en lastebil.

NeRF – Statiske eller Video?

Nylig så vi på noen imponerende nye NeRF-forskning fra Kina som kan skille ut elementer i en dynamisk NeRF-scene innspilt med 16 kameraer.

ST-NeRF

ST-NeRF (ovenfor) tillater seeren å omplassere individuelle elementer i en innspilt scene, og sogar å endre størrelsen på dem, endre avspillingshastigheten, fryse dem eller kjøre dem bakover. I tillegg tillater ST-NeRF brukeren å ‘rulle’ gjennom noen del av den 180-graders bue som er innspilt av de 16 kameraene.

Men forskerne bak ST-NeRF-artikkelen innrømmer i slutten at tid alltid løper i noen eller annen retning under dette systemet, og at det er vanskelig å endre lyssettingen og anvende effekter på miljøer som faktisk er video, snarere enn ‘statiske-mappet’ NeRF-miljøer som i seg selv ikke inneholder noen bevegelige komponenter, og ikke trenger å innspilles som video.

Ekstremt Redigérbar Statiske NeRF-Miljøer

Et statisk Neural Radiance Field-scene, nå isolert fra noen bevegelsesvideo-segmenter, er lettere å behandle og utvide på en rekke måter, inkludert omlysing, som foreslått tidligere i år av NeRV (Neural Reflectance and Visibility Fields for Relighting and View Synthesis), som tilbyr en første skritt i å endre lyssettingen og/eller teksturen av et NeRF-miljø eller objekt:

Relighting a NeRF object with NeRV. Source: https://www.youtube.com/watch?v=4XyDdvhhjVo

Relighting a NeRF object with NeRV. Source: https://www.youtube.com/watch?v=4XyDdvhhjVo

Retexturing in NeRV, even including photorealistic specular effects. Since the basis of the array of images is static, it is easier to process and augment a NeRF facet in this way than to encompass the effect across a range of video frames, making initial pre-processing and eventual training lighter and easier.

Retexturing in NeRV, even including photorealistic specular effects. Since the basis of the array of images is static, it is easier to process and augment a NeRF facet in this way than to encompass the effect across a range of video frames, making initial pre-processing and eventual training lighter and easier.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]