Andersons vinkel
NeRF: Facebook Co-Research Utvecklar Blandad Statisk/Dynamisk Video-Syntes

Ett samarbete mellan Virginia Polytechnic Institute and State University och Facebook har löst en av de stora utmaningarna i NeRF-videosyntes: att fritt blanda statiska och dynamiska bilder och videor i Neural Radiance Fields (NeRF)-utdata.
Systemet kan generera navigerbara scener som innehåller både dynamiska videoelement och statiska miljöer, var och en inspelad på plats, men separerade ut i kontrollerbara aspekter av en virtuell miljö:
Dessutom uppnår det detta från en enda vy, utan behov av den typ av multi-kamera-array som kan binda initiativ som detta till en studio-miljö.
Den artikeln, med titeln Dynamic View Synthesis from Dynamic Monocular Video, är inte den första som utvecklar en monokulär NeRF-arbetsflöde, men verkar vara den första som samtidigt tränar en tidsvarierande och en tidsstatisk modell från samma indata, och genererar en ramverk som tillåter rörlig video att existera inom en “för-mappad” NeRF-lokal, liknande den typ av virtuella miljöer som ofta omfattar skådespelare i högbudget-SF-utflykter.
Bortom D-NeRF
Forskarna har varit tvungna att i princip återskapa flexibiliteten i Dynamic NeRF (D-NeRF) med bara en enda vy, och inte den multiplikation av kameror som D-NeRF använder. För att lösa detta, förutsåg de framåt och bakåt scenflöde och använde denna information för att utveckla en vrängd strålningsfält som är tidskonsekvent.
Med bara en vy, var det nödvändigt att använda 2D optisk flödesanalys för att erhålla 3D-punkter i referensramar. Den beräknade 3D-punkten matas sedan tillbaka in i den virtuella kameran för att etablera en “scenflöde” som matchar den beräknade optiska flödet med den uppskattade optiska flödet.
Vid tränningstid, försonas dynamiska element och statiska element till en fullständig modell som separat tillgängliga aspekter.
Genom att inkludera en beräkning av djupordningsförlust, modellen och tillämpa rigorös regularisering av scenflödesprediktion i D-NeRF, mitigeras problemet med rörelseoskärpa avsevärt.

Även om forskningen har mycket att erbjuda i termer av regularisering av NeRF-beräkning, och förbättrar avsevärt på flexibiliteten och faciliteten för utforskning av utdata från en enda vy, är den nya separationen och åter-integrationen av dynamiska och statiska NeRF-element av minst lika stor betydelse.
Beroende på en enda kamera, kan ett sådant system inte replikera den panoptiska vyn av multi-kamera-array NeRF- konfigurationer, men det kan gå var som helst, och utan en lastbil.
NeRF – Statiskt eller Video?
Nyligen tittade vi på några imponerande nya NeRF-forskning från Kina som kan separera ut element i en dynamisk NeRF-scen som inspelats med 16 kameror.

ST-NeRF (ovan) tillåter tittaren att ompositionera individuerade element i en inspelad scen, och även att ändra deras storlek, ändra deras uppspelningshastighet, frysa dem eller köra dem baklänges. Dessutom tillåter ST-NeRF användaren att “scrolla” genom valfri del av den 180-graders båge som inspelats av de 16 kamerorna.
Men forskarna i ST-NeRF- artikeln medger i slutet att tid alltid löper i någon eller annan riktning under detta system, och att det är svårt att ändra belysningen och applicera effekter på miljöer som faktiskt är video, snarare än “statiskt-mappade” NeRF-miljöer som i sig innehåller inga rörliga komponenter, och inte behöver inspelats som video.
Högt Redigerbara Statiska NeRF-Miljöer
En statisk Neural Radiance Field-scen, nu isolerad från några rörliga videosegment, är lättare att behandla och förbättra på ett antal sätt, inklusive om-belysning, som föreslogs tidigare i år av NeRV (Neural Reflectance and Visibility Fields for Relighting and View Synthesis), som erbjuder ett initialt steg i att ändra belysningen och/eller textureringen av en NeRF-miljö eller objekt:

Om-belysning av ett NeRF-objekt med NeRV. Källa: https://www.youtube.com/watch?v=4XyDdvhhjVo

Texturering i NeRV, även inklusive fotorealistiska spekuleffekter. Eftersom basen för bilden är statisk, är det lättare att behandla och förbättra en NeRF-aspekt på detta sätt än att omfatta effekten över ett antal videofrayer, vilket gör den initiala förbehandlingen och den eventuella träningsprocessen lättare.














