Kąt Andersona

Renderowanie neuronowe: NeRF wyrusza na świeże powietrze

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Współpraca Google Research i Uniwersytetu Harvarda opracowała nową metodę tworzenia 360‑stopniowego wideo neuronowego pełnych scen przy użyciu Neural Radiance Fields (NeRF). To nowatorskie podejście przybliża NeRF do swobodnego, abstrakcyjnego zastosowania w dowolnym otoczeniu, bez ograniczeń do modele stołowe lub zamknięte scenariusze wewnętrzne.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Zobacz koniec artykułu, aby obejrzeć pełne wideo. Źródło: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 może obsługiwać rozległe tła i „nieskończone” obiekty, takie jak niebo, ponieważ, w przeciwieństwie do większości poprzednich iteracji, ustawia limity interpretacji promieni świetlnych i tworzy granice uwagi, które usprawniają w przeciwnym razie długie czasy treningu. Zobacz nowy dołączony film zamieszczony na końcu tego artykułu, aby zobaczyć więcej przykładów oraz uzyskać rozszerzony wgląd w proces.

The nowy artykuł is titled Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, and is led by Senior Staff Research Scientist at Google Research Jon Barron.

Aby zrozumieć przełom, konieczne jest podstawowe zrozumienie, jak działa synteza obrazu oparta na polach promieniowania neuronowego.

Czym jest NeRF?

Trudno opisać sieć NeRF w kategoriach „wideo”, ponieważ jest ona bliższa w pełni zrealizowanemu, trójwymiarowemu, ale opartej na SI wirtualnej rzeczywistości, w której wiele punktów widzenia z pojedynczych zdjęć (w tym klatek wideo) jest używanych do łączenia sceny, która technicznie istnieje jedynie w przestrzeni ukrytej algorytmu uczenia maszynowego – ale z której można dowolnie wyodrębniać niezwykłą liczbę punktów widzenia i wideo.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Przedstawienie wielu punktów przechwytujących kamery, które dostarczają danych, które NeRF składa w scenę neuronową (po prawej).

Informacje pochodzące z dostarczonych zdjęć są trenowane do macierzy podobnej tradycyjnej voxel grid w przepływach CGI, w której każdy punkt w przestrzeni 3D otrzymuje wartość, co umożliwia nawigację po scenie.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Tradycyjna macierz voxeli umieszcza informacje o pikselach (zwykle istniejące w kontekście 2D, takim jak siatka pikseli pliku JPEG) w przestrzeni trójwymiarowej. Źródło: ResearchGate

Po obliczeniu przestrzeni między zdjęciami (jeśli to konieczne), ścieżka każdego możliwego piksela z każdego zdjęcia jest efektywnie „śledzona promieniowo” i przypisywana jest jej wartość koloru, w tym wartość przejrzystości (bez której macierz neuronowa byłaby całkowicie nieprzezroczysta lub całkowicie pusta).

Podobnie jak siatki voxeli, a w przeciwieństwie do przestrzeni współrzędnych 3D opartej na CGI, „wnętrze” „zamkniętego” obiektu nie istnieje w macierzy NeRF. Możesz rozdzielić wirtualny zestaw perkusyjny CGI i zajrzeć do środka, jeśli chcesz; jednak z perspektywy NeRF istnienie zestawu perkusyjnego kończy się, gdy wartość nieprzezroczystości jego powierzchni wynosi „1”.

Szerszy widok piksela

Mip-NeRF 360 jest rozszerzeniem badań z marca 2021, które skutecznie wprowadziło wydajne antyaliasowanie do NeRF bez wyczerpującego supersamplingu.

NeRF tradycyjnie oblicza tylko jedną ścieżkę piksela, co sprzyja powstawaniu tzw. ‘jaggies’, które charakteryzowały wczesne formaty obrazów internetowych, a także wcześniejsze systemy gier. Te ząbkowane krawędzie były rozwiązywane różnymi metodami, zwykle polegającymi na próbkowaniu sąsiednich pikseli i znajdowaniu średniej reprezentacji.

Ponieważ tradycyjny NeRF próbuje tylko jedną ścieżkę piksela, Mip-NeRF wprowadził „stożkowy” obszar łapania, podobny do szerokiego promienia latarki, który dostarcza wystarczających informacji o sąsiednich pikselach, aby uzyskać ekonomiczne antyaliasowanie z lepszą szczegółowością.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Stożkowy obszar łapania używany przez Mip-NeRF jest podzielony na stożkowe frustums (poniżej), które są dalej „rozmywane”, aby stworzyć rozmyte przestrzenie Gaussa, które mogą być użyte do obliczenia dokładności i aliasingu piksela. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Ulepszenie w porównaniu ze standardową implementacją NeRF było zauważalne:

Mip-NeRF (right), released in marzec 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (po prawej), wydany w marcu 2021, zapewnia lepszą szczegółowość dzięki bardziej kompleksowemu, ale ekonomicznemu procesowi aliasingu, zamiast jedynie „rozmywać” piksele, aby uniknąć ząbkowanych krawędzi. Source: https://jonbarron.info/mipnerf/

NeRF nieograniczony

Artykuł z marca pozostawił trzy problemy nierozwiązane w kontekście używania Mip-NeRF w nieograniczonych środowiskach, które mogą obejmować bardzo odległe obiekty, w tym niebo. Nowy artykuł rozwiązuje to, stosując stylu Kalmana deformację do Gaussów Mip-NeRF.

Po drugie, większe sceny wymagają większej mocy obliczeniowej i dłuższych czasów treningu, co Mip-NeRF 360 rozwiązuje poprzez „destylację” geometrii sceny przy użyciu małego „propozycyjnego” perceptronu wielowarstwowego (MLP), który wstępnie ogranicza geometrię przewidywaną przez duży standardowy MLP NeRF. To przyspiesza trening trzykrotnie.

Wreszcie, większe sceny mogą powodować niejasności w dyskretyzacji interpretowanej geometrii, skutkując rodzajem artefaktów, które gracze mogą znać z „rozrywanych” wyjść gry. Nowy artykuł rozwiązuje to, tworząc nowy regulator dla przedziałów promieni Mip-NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Po prawej widzimy niepożądane artefakty w Mip-NeRF spowodowane trudnością w ograniczaniu tak dużej sceny. Po lewej widzimy, że nowy regulator zoptymalizował scenę wystarczająco, aby usunąć te zakłócenia.

Aby dowiedzieć się więcej o nowym artykule, obejrzyj poniższy film, a także marcowy film wprowadzający z 2021 roku do Mip-NeRF. Możesz również dowiedzieć się więcej o badaniach nad NeRF, przeglądając nasze dotychczasowe materiały.

Oryginalnie opublikowano 25 listopada 2021
21 grudnia 2021, 12:25 – zamieniono nieaktywny film. – MA

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai