Kąt Andersona

NeRF: Facebook Co-Research Develops Mixed Static/Dynamic Video Synthesis

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Współpraca pomiędzy Virginia Polytechnic Institute and State University a Facebook rozwiązała jeden z głównych wyzwań w syntezie wideo NeRF: swobodne łączenie statycznych i dynamicznych obrazów oraz filmów w Neural Radiance Fields (NeRF) output.

System może generować nawigowalne sceny, które zawierają dynamiczne elementy wideo oraz statyczne środowiska, każde nagrane na miejscu, ale oddzielone od siebie jako kontrolowane aspekty wirtualnego środowiska:

Ponadto, osiąga to wszystko z jednego punktu widzenia, bez potrzeby użycia wielokamerowego zestawu, który mógłby ograniczyć inicjatywy tego typu do studia.

Artykuł paper, zatytułowany Dynamic View Synthesis from Dynamic Monocular Video, nie jest pierwszym, który opracował monocular NeRF workflow, ale wydaje się być pierwszym, który jednocześnie trenuje model czasowo-zmienny i czasowo-statyczny z tego samego wejścia, oraz generuje ramy, które pozwalają na istnienie filmu wideo wewnątrz ‘pre-mapped’ NeRF locale, podobnie jak wirtualne środowiska, które często otaczają aktorów w wysokobudżetowych filmach SF.

Poza D-NeRF

Badacze musieli praktycznie odtworzyć wszechstronność Dynamic NeRF (D-NeRF) z tylko jednego punktu widzenia, a nie z wielu kamer, które używa D-NeRF. Aby rozwiązać ten problem, przewidzieli przepływ sceny do przodu i do tyłu oraz użyli tej informacji do opracowania zniekształconego pola promieniowania, które jest czasowo spójne.

Z tylko jednym punktem widzenia, konieczne było użycie 2D analizy optycznego przepływu, aby uzyskać 3D punkty w ramach odniesienia. Obliczony 3D punkt jest następnie wprowadzany z powrotem do wirtualnej kamery w celu ustanowienia ‘przepływu sceny’, który dopasowuje obliczony optyczny przepływ z oszacowanym optycznym przepływem.

W czasie treningu, dynamiczne elementy i statyczne elementy są uzgodnione w pełnym modelu jako oddzielnie dostępne aspekty.

Poprzez uwzględnienie obliczenia straty głębi i zastosowanie rygorystycznej regulacji przewidywania przepływu sceny w D-NeRF, problem rozmycia ruchu jest znacznie zmniejszony.

Chociaż badanie ma wiele do zaoferowania w zakresie regulacji obliczeń NeRF, i znacznie poprawia zwinność i łatwość eksploracji danych wyjściowych z jednego punktu widzenia, co najmniej równie ważne jest nowe rozdzielenie i ponowne połączenie dynamicznych i statycznych elementów NeRF.

Opierając się na jednej kamerze, taki system nie może odtworzyć panoramicznego widoku zestawu wielokamerowego NeRF, ale może iść gdziekolwiek, i bez ciężarówki.

NeRF – Statyczne czy wideo?

Niedawno przyjrzeliśmy się imponującym nowym badaniom NeRF z Chin, które umożliwiają rozdzielenie elementów w dynamicznej scenie NeRF nagranej przy użyciu 16 kamer.

ST-NeRF

ST-NeRF (powyżej) pozwala widzowi przestawiać indywidualne elementy w scenie, oraz nawet zmieniać ich rozmiar, zmieniać szybkość odtwarzania, zatrzymywać je lub odtwarzać wstecz. Dodatkowo, ST-NeRF pozwala użytkownikowi ‘przewijać’ przez dowolną część 180-stopniowego łuku nagranego przez 16 kamer.

Jednakże, badacze artykułu ST-NeRF przyznają w podsumowaniu, że czas zawsze biegnie w jakimś kierunku w tym systemie, i że trudno jest zmienić oświetlenie i zastosować efekty do środowisk, które są naprawdę wideo, a nie ‘statycznie-mapped’ NeRF środowisk, które same w sobie nie zawierają ruchomych komponentów i nie muszą być nagrywane jako wideo.

Wysoko edytowalne statyczne środowiska NeRF

Statyczna scena Neural Radiance Field, teraz odizolowana od jakichkolwiek segmentów wideo, jest łatwiejsza do leczenia i uzupełnienia w wielu ways, w tym relighting, jak to proponuje NeRV (Neural Reflectance and Visibility Fields for Relighting and View Synthesis), które oferuje pierwszy krok w zmianie oświetlenia i/lub tekstury NeRF środowiska lub obiektu:

Relighting a NeRF object with NeRV. Source: https://www.youtube.com/watch?v=4XyDdvhhjVo

Relighting a NeRF object with NeRV. Source: https://www.youtube.com/watch?v=4XyDdvhhjVo

Retexturing in NeRV, even including photorealistic specular effects. Since the basis of the array of images is static, it is easier to process and augment a NeRF facet in this way than to encompass the effect across a range of video frames, making initial pre-processing and eventual training lighter and easier.

Retexturing in NeRV, even including photorealistic specular effects. Since the basis of the array of images is static, it is easier to process and augment a NeRF facet in this way than to encompass the effect across a range of video frames, making initial pre-processing and eventual training lighter and easier.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]