Andersons vinkel
NeRF: Facebook Co-Research Utvikler Blandet Statiske/Dynamiske Video-Syntese

Et samarbeid mellom Virginia Polytechnic Institute and State University og Facebook har løst en av de største utfordringene i NeRF-video-syntese: fritt å blande statiske og dynamiske bilder og videoer i Neural Radiance Fields (NeRF)-utdata.
Systemet kan generere navigerbare scener som inneholder både dynamiske video-elementer og statiske miljøer, hver innspilt på stedet, men skilt ut i kontrollerbare aspekter av en virtuell miljø:
Det oppnår dette fra ett enkelt synspunkt, uten behov for den type multi-kamera-oppsett som kan binde slike initiativer til et studio-miljø.
Den artikkelen, med tittelen Dynamic View Synthesis from Dynamic Monocular Video, er ikke den første til å utvikle en monokulær NeRF-arbeidsflyt, men ser ut til å være den første til å samtidig trene en tid-variabel og en tid-statiske modell fra samme inndata, og å generere en ramme som tillater bevegelsesvideo å eksistere innenfor en ‘forhåndsmappet’ NeRF-locale, lignende den type virtuelle miljøer som ofte omgir skuespillere i høy-budsjett SF-utgivelser.
Beyond D-NeRF
Forskerne har måttet i stor grad gjenskape fleksibiliteten til Dynamic NeRF (D-NeRF) med bare ett synspunkt, og ikke flertallet av kameraer som D-NeRF bruker. For å løse dette, har de forutsagt fremover- og bakover-scene-strøm og brukt denne informasjonen til å utvikle en vridd radians-felt som er tids-konsistent.
Med bare ett synspunkt, var det nødvendig å bruke 2D optisk strøm-analyse for å få 3D-punkter i referanse-rammer. Den beregnede 3D-punktet blir deretter matet tilbake til den virtuelle kameraet for å etablere en ‘scene-strøm’ som matcher den beregnede optiske strømmen med den estimerte optiske strømmen.
Ved treningstid, blir dynamiske elementer og statiske elementer forsonet i en fullstendig modell som separat tilgjengelige aspekter.
Ved å inkludere en beregning av dybde-orden-tap, og å anvende streng regularisering av scene-strøm-prediksjon i D-NeRF, blir problemet med bevegelses-uskarphet betydelig mildnet.

Selv om forskningen har mye å tilby når det gjelder å regularisere NeRF-beregning, og betydelig forbedrer evnen og fasiliteten til å utforske utdata fra ett enkelt synspunkt, er likeverdig å merke seg den nye separasjonen og gjen-sammenføringen av dynamiske og statiske NeRF-elementer.
Et slikt system, som bare har ett kamera, kan ikke gjenskape den panoptiske utsikten til multi-kamera-oppsett NeRF, men kan gå hvor som helst, og uten en lastebil.
NeRF – Statiske eller Video?
Nylig så vi på noen imponerende nye NeRF-forskning fra Kina som kan skille ut elementer i en dynamisk NeRF-scene innspilt med 16 kameraer.

ST-NeRF (ovenfor) tillater seeren å omplassere individuelle elementer i en innspilt scene, og sogar å endre størrelsen på dem, endre avspillingshastigheten, fryse dem eller kjøre dem bakover. I tillegg tillater ST-NeRF brukeren å ‘rulle’ gjennom noen del av den 180-graders bue som er innspilt av de 16 kameraene.
Men forskerne bak ST-NeRF-artikkelen innrømmer i slutten at tid alltid løper i noen eller annen retning under dette systemet, og at det er vanskelig å endre lyssettingen og anvende effekter på miljøer som faktisk er video, snarere enn ‘statiske-mappet’ NeRF-miljøer som i seg selv ikke inneholder noen bevegelige komponenter, og ikke trenger å innspilles som video.
Ekstremt Redigérbar Statiske NeRF-Miljøer
Et statisk Neural Radiance Field-scene, nå isolert fra noen bevegelsesvideo-segmenter, er lettere å behandle og utvide på en rekke måter, inkludert omlysing, som foreslått tidligere i år av NeRV (Neural Reflectance and Visibility Fields for Relighting and View Synthesis), som tilbyr en første skritt i å endre lyssettingen og/eller teksturen av et NeRF-miljø eller objekt:

Relighting a NeRF object with NeRV. Source: https://www.youtube.com/watch?v=4XyDdvhhjVo

Retexturing in NeRV, even including photorealistic specular effects. Since the basis of the array of images is static, it is easier to process and augment a NeRF facet in this way than to encompass the effect across a range of video frames, making initial pre-processing and eventual training lighter and easier.














