Kąt Andersona

Renderowanie Neuronalne: NeRF Wychodzi Na Świeże Powietrze

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Współpraca między Google Research a Harvard University doprowadziła do opracowania nowej metody tworzenia 360-stopniowych filmów wideo z użyciem Neural Radiance Fields (NeRF). Nowatorskie podejście przybliża NeRF do codziennego, abstrakcyjnego zastosowania w dowolnym środowisku, bez ograniczeń do modeli stołowych lub zamkniętych scenariuszy wewnętrznych.

Źródło: https://www.youtube.com/watch?v=YStDS2-Ln1s

Zobacz pełny film na końcu artykułu. Źródło: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 może obsługiwać rozszerzone tła i “nieskończone” obiekty, takie jak niebo, ponieważ, w przeciwieństwie do większości poprzednich wersji, ustawia ograniczenia na sposób interpretacji promieni świetlnych i tworzy granice uwagi, które racjonalizują długie czasy szkolenia. Zobacz nowy film dołączony na końcu tego artykułu, aby zobaczyć więcej przykładów i uzyskać głębsze zrozumienie procesu.

Nowy artykuł nosi tytuł Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields i jest prowadzony przez starszego naukowca badawczego w Google Research, Jona Barrona.

Aby zrozumieć przełom, konieczne jest posiadanie podstawowej wiedzy na temat funkcjonowania syntezy obrazu opartej na polach promieniowania neuronalnych.

Co to jest NeRF?

Trudno opisać sieć NeRF w kategoriach “filmu”, ponieważ jest to raczej w pełni zrealizowane, ale oparte na sztucznej inteligencji środowisko wirtualne, w którym wiele punktów widzenia z pojedynczych zdjęć (w tym klatek filmu) jest używanych do szycia sceny, która technicznie istnieje tylko w latentnym przestrzeni algorytmu uczenia maszynowego – ale z której można wyodrębnić nadzwyczajną liczbę punktów widzenia i filmów w dowolnym momencie.

Przedstawienie wielu punktów przechwycenia kamery, które dostarczają danych, które NeRF łączy w scenę neuronalną (po prawej).

Przedstawienie wielu punktów przechwycenia kamery, które dostarczają danych, które NeRF łączy w scenę neuronalną (po prawej).

Informacje pochodzące z przyczyniających się zdjęć są szkolone w macierzy, która jest podobna do tradycyjnej siatki voxelowej w przepływach CGI, ponieważ każdy punkt w przestrzeni 3D kończy się wartością, co sprawia, że scena jest nawigowalna.

Tradycyjna macierz voxelowa umieszcza informacje o pikselach (które zwykle istnieją w kontekście 2D, takim jak siatka pikseli pliku JPEG) w trójwymiarowej przestrzeni. Źródło: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Tradycyjna macierz voxelowa umieszcza informacje o pikselach (które zwykle istnieją w kontekście 2D, takim jak siatka pikseli pliku JPEG) w trójwymiarowej przestrzeni. Źródło: ResearchGate

Po obliczeniu przestrzeni między zdjęciami (jeśli jest to konieczne), ścieżka każdego możliwego piksela każdego przyczyniającego się zdjęcia jest efektywnie “śledzona” i przydzielona wartość koloru, w tym wartość przejrzystości (bez której macierz neuronalna byłaby całkowicie nieprzezroczysta lub całkowicie pusta).

Podobnie jak siatki voxelowe, a inaczej niż przestrzeń 3D oparta na CGI, “wnętrze” “zamkniętego” obiektu nie istnieje w macierzy NeRF. Można rozdzielić perkusję CGI i zajrzeć do środka; ale jeśli chodzi o NeRF, istnienie perkusji kończy się, gdy wartość nieprzezroczystości jej powierzchni wynosi “1”.

Szeroki Widok Piksela

Mip-NeRF 360 jest rozszerzeniem badań z marca 2021, które skutecznie wprowadziły efektywne przeciw-aliasowanie do NeRF bez wyczerpującego supersamplingu.

NeRF tradycyjnie oblicza tylko jeden ślad piksela, co skłania się do produkcji rodzaju ‘jaggies’, które charakteryzowały wczesne formaty graficzne internetowe, a także wcześniejsze systemy gier. Te kanciaste krawędzie zostały rozwiązane przez różne metody, zwykle za pomocą próbek sąsiednich pikseli i znalezienia średniej reprezentacji.

Ponieważ tradycyjny NeRF próbkuje tylko jeden ślad piksela, Mip-NeRF wprowadził “stożkową” strefę pochwytu, jak szeroki snop światła, który dostarcza wystarczających informacji o sąsiadujących pikselach, aby wyprodukować ekonomiczne przeciw-aliasowanie z poprawionymi szczegółami.

Stożkowa strefa pochwytu, którą Mip-NeRF używa, jest rozcięta na stożkowe frustumy (poniżej), które są dalej

Stożkowa strefa pochwytu, którą Mip-NeRF używa, jest rozcięta na stożkowe frustumy (poniżej), które są dalej “rozmyte”, aby reprezentować mglistą przestrzeń Gaussa, która może być użyta do obliczania dokładności i aliasingu piksela. Źródło: https://www.youtube.com/watch?v=EpH175PY1A0

Poprawa w porównaniu z standardową implementacją NeRF była znacząca:

Mip-NeRF (po prawej), wydany w marcu 2021, dostarcza poprawione szczegóły za pomocą bardziej kompleksowego, ale ekonomicznego potoku aliasowania, a nie tylko

Mip-NeRF (po prawej), wydany w marcu 2021, dostarcza poprawione szczegóły za pomocą bardziej kompleksowego, ale ekonomicznego potoku aliasowania, a nie tylko “rozmywania” pikseli, aby uniknąć kanciastych krawędzi. Źródło: https://jonbarron.info/mipnerf/

NeRF Bez Granic

Artykuł z marca pozostawił trzy problemy nierozwiązane w odniesieniu do korzystania z Mip-NeRF w nieograniczonych środowiskach, które mogą obejmować bardzo odległe obiekty, w tym niebo. Nowy artykuł rozwiązuje to, stosując Kalman-style zniekształcenie do Mip-NeRF Gaussians.

Drugim problemem jest to, że większe sceny wymagają większej mocy obliczeniowej i wydłużonych czasów szkolenia, które Mip-NeRF 360 rozwiązuje, “destylując” geometrię sceny za pomocą małego “propozycyjnego” wielowarstwowego perceptronu (MLP), który pre-ogranicza geometrię przewidywaną przez standardowy NeRF MLP. To przyspiesza szkolenie o czynnik trzy.

Wreszcie, większe sceny mają tendencję do powodowania niejednoznaczności dyskretyzacji interpretowanej geometrii, co skutkuje rodzajem artefaktów, z którymi gracze mogą być zaznajomieni, gdy wyjście gry “rozrywa się”. Nowy artykuł rozwiązuje to, tworząc nowy regularizator dla Mip-NeRF przedziałów promieni.

Po prawej widzimy niepożądane artefakty w Mip-NeRF ze względu na trudność w ograniczaniu tak dużej sceny. Po lewej widzimy, że nowy regularizator zoptymalizował scenę wystarczająco, aby usunąć te zakłócenia.

Po prawej widzimy niepożądane artefakty w Mip-NeRF ze względu na trudność w ograniczaniu tak dużej sceny. Po lewej widzimy, że nowy regularizator zoptymalizował scenę wystarczająco, aby usunąć te zakłócenia.

Aby dowiedzieć się więcej o nowym artykule, zobacz film poniżej, a także marcowy film wprowadzający do Mip-NeRF. Można również dowiedzieć się więcej o badaniach NeRF, sprawdzając nasze dotychczasowe relacje.

Pierwotnie opublikowane 25 listopada 2021
21 grudnia 2021, 12:25 – Zamieniono martwy film. – MA

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai