Kąt Andersona
NeRF: Wyzwanie edycji zawartości Neural Radiance Fields

Na początku tego roku NVIDIA znacznie rozwinęła badania nad Neural Radiance Fields (NeRF) dzięki InstantNeRF, który wydaje się być w stanie generować eksplorowalne sceny neuronowe w zaledwie kilka sekund – z techniki, która, gdy pojawiła się w 2020 roku, często zajmowała kilka godzin lub nawet dni treningu.

NVIDIA’s InstantNeRF provides impressive and rapid results. Source: https://www.youtube.com/watch?v=DJ2hcC1orc4
Mimo że ten rodzaj interpolacji tworzy statyczną scenę, NeRF jest również w stanie przedstawiać ruch, oraz podstawową edycję “kopiuj-wklej”, gdzie poszczególne NeRF mogą być albo łączone w skomponowane sceny, albo wstawiane do istniejących scen.

Nested NeRFs, featured in 2021 research from Shanghai Tech University and DGene Digital Technology. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4
Jednakże, jeśli chcesz interweniować w obliczony NeRF i rzeczywiście zmienić coś, co się w nim dzieje (w tym samym sposób, w jaki możesz zmienić elementy w tradycyjnej scenie CGI), szybki tempa zainteresowania sektora doprowadził do bardzo niewielu rozwiązań do tej pory, i żadnego, który nawet zaczynałby dorównywać możliwościom przepływów pracy CGI.
Mimo że estymacja geometrii jest niezbędna do tworzenia sceny NeRF, ostateczny wynik składa się z dość “zamkniętych” wartości. Chociaż jest jakiś postęp w kierunku zmiany wartości tekstury w NeRF, rzeczywiste obiekty w scenie NeRF nie są parametrycznymi siatkami, które mogą być edytowane i manipulowane, ale raczej kruchymi i zamarzniętymi chmurami punktów.
W tym scenariuszu, wyrenderowana osoba w NeRF jest podstawowo posągiem (lub serią posągów, w przypadku NeRF wideo); cienie, które rzucają na siebie i inne obiekty, są teksturami, a nie elastycznymi obliczeniami opartymi na źródłach światła; oraz edytowalność zawartości NeRF jest ograniczona do wyborów dokonanych przez fotografa, który robi zdjęcia źródłowe, z których NeRF jest generowany. Parametry takie jak cienie i poza pozostają nieedytowalne w jakimkolwiek twórczym sensie.
Edycja NeRF
Nowe badanie akademickie, będące współpracą między Chinami a Wielką Brytanią, podejmuje to wyzwanie z Edycją NeRF, gdzie proxy-siatki CGI są wyodrębniane z NeRF, deformowane według uznania użytkownika, a deformacje są przekazywane z powrotem do obliczeń neuronalowych NeRF;

NeRF puppetry z Edycją NeRF, gdy deformacje obliczone z footage są stosowane do odpowiednich punktów wewnątrz reprezentacji NeRF. Source: http://geometrylearning.com/NeRFEditing/
Metoda adaptuje NeuS 2021 roku amerykańsko-chińską technikę rekonstrukcyjną, która wyodrębnia Funkcję Odległości Podpisanej (SDF, znacznie starszą metodę rekonstrukcji objętościowej), która jest w stanie nauczyć się geometrii reprezentowanej wewnątrz NeRF.
Ten obiekt SDF staje się podstawą rzeźbiarską dla użytkownika, z możliwościami zginania i kształtowania zapewnionymi przez starą technikę As-Rigid-As-Possible (ARAP).

ARAP pozwala użytkownikom deformować wyodrębnioną siatkę SDF, chociaż inne metody, takie jak podejścia szkieletowe i klatkowe (tj. NURBs), również mogłyby działać dobrze. Source: https://arxiv.org/pdf/2205.04978.pdf
Z zastosowanymi deformacjami, konieczne jest przetłumaczenie tej informacji z wektora na poziom RGB/piksel natywny dla NeRF, co jest nieco dłuższą podróżą.
Trójkątne wierzchołki siatki, które użytkownik zdeformował, są najpierw tłumaczone na siatkę tetrahedralną, która tworzy skórę wokół siatki użytkownika. Wyodrębniono dyskretny pole deformacji przestrzennego, a ostatecznie otrzymano ciągłe pole deformacji NeRF, które może być przekazane z powrotem do środowiska neuronalnego, odzwierciedlając zmiany i edycje użytkownika, oraz wpływając bezpośrednio na interpretowane promienie w docelowym NeRF.

Obiekty zdeformowane i zaanimowane nową metodą.
Artykuł stwierdza:
‘Po przeniesieniu deformacji powierzchni do siatki tetrahedralnej, możemy uzyskać dyskretne pole deformacji „skutecznego przestrzeni”. Teraz wykorzystujemy te dyskretne transformacje, aby zgiąć promienie. Aby wygenerować obraz deformowanego pola promieniowania, rzućmy promienie do przestrzeni zawierającej zdeformowaną siatkę tetrahedralną.’
Artykuł artykuł nosi tytuł Edycja NeRF: Edycja geometrii pól promieniowania neuronowych, i pochodzi od badaczy z trzech chińskich uniwersytetów i instytucji, wraz z badaczem ze Szkoły Informatyki i Nauk Komputerowych na Uniwersytecie w Cardiff, oraz dwoma innymi badaczami z Alibaba Group.
Ograniczenia
Jak wcześniej wspomniano, przekształcona geometria nie “zaktualizuje” żadnych powiązanych aspektów w NeRF, które nie zostały edytowane, ani nie odbije się w drugorzędnych konsekwencjach zdeformowanego elementu, takich jak cienie. Badacze przedstawiają przykład, w którym podcienie na ludzkiej figurze w NeRF pozostają niezmienione, nawet jeśli deformacja powinna zmienić oświetlenie:

Z artykułu: widzimy, że poziomy cień na ramieniu postaci pozostaje na miejscu, nawet gdy ramię jest poruszane do góry.
Eksperymenty
Autorzy zauważają, że nie ma obecnie porównywalnych metod do bezpośredniej interwencji w geometrię NeRF. Dlatego też eksperymenty przeprowadzone w ramach badań były bardziej eksploracyjne niż porównawcze.
Badacze zademonstrowali Edycję NeRF na kilku publicznych zestawach danych, w tym postaciach z Mixamo, oraz ikonicznym buldożerem Lego i krzesłem z oryginalnej implementacji NeRF. Eksperymentowali również na prawdziwie sfotografowanym posągu konia ze zestawu danych FVS, oraz ich własnych oryginalnych zdjęciach.

Głowa konia nachylona.
W przyszłej pracy autorzy planują rozwijać swój system w ramach just-in-time (JIT) skompilowanego frameworku machine learning Jittor.
Pierwotnie opublikowane 16 maja 2022.












