Kąt Andersona

ST-NeRF: Kompozycja i edycja dla syntezy wideo

mm
Dodaj Unite.AI do preferowanych źródeł w Google
ST-NeRF

Chinyjski konsorcjum badawcze rozwinęło techniki umożliwiające edycję i kompozycję w jednym z najgorętszych sektorów badań nad syntezą obrazu w ciągu ostatniego roku – Neural Radiance Fields (NeRF). System nosi nazwę ST-NeRF (Spatio-Temporal Coherent Neural Radiance Field).

To, co wydaje się fizycznym ruchem kamery w poniższym obrazie, jest w rzeczywistości tylko przewijaniem punktów widzenia na zawartości wideo, która istnieje w 4-wymiarowej przestrzeni. Punkt widzenia nie jest związany z wykonaniem osób przedstawionych w filmie, których ruchy można obserwować z dowolnej części 180-stopniowego promienia.

ST-NeRF

Każdy aspekt wideo jest dyskretnie przechwytywany element, składany w spójną scenę, która może być dynamicznie eksplorowana.

Aspekty mogą być swobodnie duplikowane w scenie lub zmieniane rozmiarem:

ST-NeRF

Ponadto, zachowanie czasowe każdego aspektu może być łatwo zmienione, spowolnione, odtworzone do tyłu lub manipulowane w dowolny sposób, otwierając drogę do architektur filtrów i ekstremalnie wysokiego poziomu interpretowalności.

Dwa oddzielne aspekty NeRF działające z różnymi prędkościami w tej samej scenie. Źródło: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Dwa oddzielne aspekty NeRF działające z różnymi prędkościami w tej samej scenie. Źródło: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Nie ma potrzeby rotoskopowania wykonawców lub środowisk, ani wykonawców nie muszą wykonywać swoich ruchów ślepo i poza kontekstem zamierzonej sceny. Zamiast tego, nagranie jest przechwytywane naturalnie za pomocą tablicy 16 kamer wideo, pokrywających 180 stopni:

16 kamer ST-NeRF

Trzy elementy przedstawione powyżej, dwie osoby i środowisko, są oddzielnymi, a zarysowane tylko dla celów ilustracyjnych. Każdy z nich może być wymieniony, a każdy może być wstawiony do sceny w dowolnym momencie ich indywidualnego harmonogramu przechwytywania.

Trzy elementy przedstawione powyżej, dwie osoby i środowisko, są oddzielnymi, a zarysowane tylko dla celów ilustracyjnych. Każdy z nich może być wymieniony, a każdy może być wstawiony do sceny w dowolnym momencie ich indywidualnego harmonogramu przechwytywania.

ST-NeRF jest innowacją w badaniach nad Neural Radiance Fields (NeRF), ramą machine learning, w której wiele punktów widzenia jest syntetyzowanych w nawigowalnej przestrzeni wirtualnej przez obszerny trening (chociaż pojedynczy punkt widzenia jest również podsektorem badań NeRF).

Neural Radiance Fields działają poprzez łączenie wielu punktów widzenia w jedną spójną i nawigowalną 3-wymiarową przestrzeń, z lukami między pokryciem oszacowanymi i wyrenderowanymi przez sieć neuronową. Gdzie używany jest film wideo (zamiast obrazów), potrzebne są często znaczne zasoby renderowania. Źródło: https://www.matthewtancik.com/nerf

Neural Radiance Fields działają poprzez łączenie wielu punktów widzenia w jedną spójną i nawigowalną 3-wymiarową przestrzeń, z lukami między pokryciem oszacowanymi i wyrenderowanymi przez sieć neuronową. Gdzie używany jest film wideo (zamiast obrazów), potrzebne są często znaczne zasoby renderowania. Źródło: https://www.matthewtancik.com/nerf

Zainteresowanie NeRF stało się intensywne w ciągu ostatnich dziewięciu miesięcy, a lista utrzymana przez Reddit projektów pochodnych lub eksploracyjnych NeRF obecnie zawiera sześćdziesiąt projektów.

 

Tylko kilka z wielu odnóg oryginalnego artykułu NeRF. Źródło: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Tylko kilka z wielu odnóg oryginalnego artykułu NeRF. Źródło: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Szkolenie w przystępnej cenie

Artykuł jest współpracą między badaczami z Uniwersytetu w Szanghaju i DGene Digital Technology, i został przyjęty z entuzjazmem w Open Review.

ST-NeRF oferuje wiele innowacji w porównaniu z poprzednimi inicjatywami w dziedzinie ML-wykorzystujących nawigowalnych przestrzeni wideo. Nie mniej, osiąga wysoki poziom realizmu z tylko 16 kamerami. Chociaż DyNeRF Facebooka używa tylko dwóch kamer więcej niż to, oferuje znacznie bardziej ograniczony nawigowalny łuk.

Przykład środowiska DyNeRF Facebooka, z bardziej ograniczonym polem ruchu, i więcej kamer na metr kwadratowy potrzebnych do odtworzenia sceny. Źródło: https://neural-3d-video.github.io

Przykład środowiska DyNeRF Facebooka, z bardziej ograniczonym polem ruchu, i więcej kamer na metr kwadratowy potrzebnych do odtworzenia sceny. Źródło: https://neural-3d-video.github.io

Ponadto, DyNeRF jest szczególnie drogi w kwestii zasobów obliczeniowych. W przeciwieństwie do tego, chińscy badacze stwierdzają, że koszt szkolenia ich danych wynosi około 900-3000 dolarów, w porównaniu z 30 000 dolarów za model generacji wideo DVDGAN i intensywne systemy takie jak DyNeRF.

Recenzenci zauważyli również, że ST-NeRF wprowadza znaczącą innowację w oddzieleniu procesu uczenia się ruchu od procesu syntezy obrazu. To rozdzielenie umożliwia edycję i kompozycję, przy czym poprzednie podejścia były ograniczone i liniowe w porównaniu.

Chociaż 16 kamer jest bardzo ograniczonym zestawem dla tak pełnego półkola widoku, badacze mają nadzieję, że będą mogli zmniejszyć tę liczbę w późniejszych pracach za pomocą proxy przedscanned statycznych tła i bardziej opartych na danych podejść do modelowania sceny. Chcą również włączyć możliwości ponownego oświetlenia, niedawną innowację w badaniach NeRF.

Rozwiązywanie ograniczeń ST-NeRF

W kontekście artykułów akademickich, które tendencję do wyrzucania rzeczywistej użyteczności nowego systemu w końcowym akapicie, nawet ograniczenia, które badacze uznają za ST-NeRF, są niezwykłe.

Zauważają, że system nie może obecnie indywidualizować i oddzielnie renderować poszczególnych obiektów w scenie, ponieważ ludzie w nagraniu są podzieleni na poszczególne jednostki za pomocą systemu zaprojektowanego do rozpoznawania ludzi, a nie obiektów – problem, który wydaje się łatwo rozwiązywalny za pomocą ramion YOLO i podobnych, z trudniejszą pracą ekstrakcji ludzkich filmów już wykonaną.

Chociaż badacze zauważają, że nie jest możliwe wygenerowanie zwolnionego tempa, wydaje się, że nie ma nic, co mogłoby uniemożliwić wdrożenie tego za pomocą istniejących innowacji w interpolacji klatek, takich jak DAIN i RIFE.

Podobnie jak we wszystkich wdrożeniach NeRF, a także w wielu innych sektorach badań nad widzeniem komputerowym, ST-NeRF może awariować w przypadku ciężkich zakryć, gdzie obiekt jest tymczasowo zasłonięty przez inną osobę lub obiekt, i może być trudno śledzić lub ponownie nabyć później. Jak gdzie indziej, ta trudność może musieć czekać na rozwiązania z góry. Tymczasem badacze przyznają, że interwencja ręczna jest konieczna w tych zakrytych klatkach.

Wreszcie, badacze zauważają, że procedury segmentacji ludzi obecnie polegają na różnicach kolorystycznych, co mogłoby prowadzić do niezamierzonego połączenia dwóch osób w jeden blok segmentacji – przeszkodę, która nie jest ograniczona do ST-NeRF, ale wewnętrzna dla biblioteki używanej, i która mogłaby być perhaps rozwiązana za pomocą analizy przepływu optycznego i innych pojawiających się technik.

Pierwotnie opublikowane 7 maja 2021.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai