Andersons vinkel
NeRF: Facebook Co-Research Udvikler Blandet Statisk/Dynamisk Video-Syntese

Et samarbejde mellem Virginia Polytechnic Institute and State University og Facebook har løst en af de største udfordringer i NeRF video-syntese: frit at blande statisk og dynamisk billed- og video-materiale i Neural Radiance Fields (NeRF) output.
Systemet kan generere navigable scener, der indeholder både dynamiske video-elementer og statiske miljøer, hver optaget på stedet, men adskilt ud i kontrollerbare aspekter af en virtuel omgang:
Desuden opnår det dette fra ét synspunkt, uden behov for den type multi-kamera-array, der kan binde initiativer som denne til et studie-miljø.
Den artikel, med titlen Dynamic View Synthesis from Dynamic Monocular Video, er ikke den første til at udvikle en monokulær NeRF-workflow, men synes at være den første til samtidigt at træne en tidsvarierende og en tidsstatisk model fra samme input, og til at generere en ramme, der tillader bevægelsesvideo at eksistere inden for en ‘forhåndsmapperet’ NeRF-omgang, lignende den type virtuelle omgange, der ofte indeholder skuespillere i høj-budsjettet SF-udgivelser.
Beyond D-NeRF
Forskerne har måttet genskabe den fleksibilitet, der kendetegner Dynamic NeRF (D-NeRF), med kun ét synspunkt, og ikke den mangfoldighed af kameraer, som D-NeRF bruger. For at løse dette har de forudset fremad- og bagud-scene-flow og brugt denne information til at udvikle en vrideret radiance-felt, der er tidsmæssigt konsistent.
Med kun ét synspunkt var det nødvendigt at bruge 2D optisk flow-analyse til at opnå 3D-punkter i reference-rammer. Den beregnede 3D-punkt føres herefter tilbage til den virtuelle kamera for at etablere en ‘scene-flow’, der matcher den beregnede optiske flow med den estimerede optiske flow.
Ved træningstidpunkt bliver dynamiske elementer og statiske elementer forsonet til en fuld model som adskilt tilgængelige aspekter.
Ved at inkludere en beregning af dybde-ordre-tab og anvende streng regularisering af scene-flow-forudsigelse i D-NeRF, bliver problemet med bevægelses-blur kraftigt mildnet.

Selvom forskningen har meget at tilbyde i forhold til at regularisere NeRF-beregning, og kraftigt forbedrer på fleksibiliteten og faciliteten af udforskning af output fra ét synspunkt, er det mindst lige så væsentligt, at der sker en ny adskillelse og gen-sammenføring af dynamiske og statiske NeRF-elementer.
Et system, der afhænger af ét kamera, kan ikke reproducere den panoptiske udsigt over multi-kamera-array NeRF-sæt, men det kan gå hvor som helst, og uden en lastbil.
NeRF – Statisk Eller Video?
For nylig så vi på nogle imponerende nye NeRF-forskning fra Kina, der kan adskille elementer i en dynamisk NeRF-scene, optaget med 16 kameraer.

ST-NeRF (ovenfor) tillader betragteren at omplacere individuelle elementer i en optaget scene, og endda til at ændre deres størrelse, ændre deres afspilningshastighed, fryse dem eller køre dem baglæns. Desuden tillader ST-NeRF brugeren at ‘rulle’ gennem enhver del af den 180-graders bue, der er optaget af de 16 kameraer.
Men forskerne bag ST-NeRF artiklen indrømmer i afslutningen, at tid altid løber i en eller anden retning under dette system, og at det er svært at ændre belysning og anvende effekter til miljøer, der faktisk er video, snarere end ‘statisk-mappede’ NeRF-miljøer, der i sig selv indeholder ingen bevægelige komponenter og ikke behøver at blive optaget som video.
Meget Redigerbare Statisk NeRF-Miljøer
Et statisk Neural Radiance Field-scene, nu adskilt fra enhver bevægelsesvideo-segment, er lettere at behandle og udvide på en række måder, herunder relighting, som foreslået tidligere på året af NeRV (Neural Reflectance and Visibility Fields for Relighting and View Synthesis), der tilbyder en initial skridt i ændring af belysning og/eller tekstur af en NeRF-miljø eller objekt:

Relighting a NeRF object with NeRV. Source: https://www.youtube.com/watch?v=4XyDdvhhjVo

Retexturing in NeRV, even including photorealistic specular effects. Since the basis of the array of images is static, it is easier to process and augment a NeRF facet in this way than to encompass the effect across a range of video frames, making initial pre-processing and eventual training lighter and easier.














