Kąt Andersona
NeRFocus: Przynosząc lekki kontrolę ostrości do pól promieniowania neuronowego

Nowe badania z Chin oferują metodę osiągnięcia przystępnego sterowania efektami głębi pola dla pól promieniowania neuronowego (NeRF), umożliwiając użytkownikowi sterowanie ostrością i dynamiczną zmianę konfiguracji wirtualnej soczewki w przestrzeni renderowania.
Zatytułowane NeRFocus, technika ta implementuje nowy podejście “cienkiej soczewki” do przechodzenia przez ostrość, oraz innowacyjne P-szkolenie, strategię szkolenia probabilistycznego, która eliminuje potrzebę dedykowanych zestawów danych głębi pola, oraz upraszcza przepływ pracy szkolenia z obsługą ostrości.

Artykuł artykuł zatytułowany NeRFocus: Pole promieniowania neuronowego dla syntetycznego rozmycia, pochodzi od czterech badaczy ze Szkoły Podyplomowej w Shenzhen na Uniwersytecie w Pekinie, oraz Laboratorium Peng Cheng w Shenzhen, instytutu finansowanego przez rząd prowincji Guangdong.
Adresowanie foweksjalnego locus uwagi w NeRF
Jeśli NeRF ma kiedykolwiek zająć swoje miejsce jako ważna technologia napędowa dla rzeczywistości wirtualnej i rozszerzonej, będzie musiał posiadać lekki sposób umożliwiający realizowanie realistycznego renderowania foweksjalnego, gdzie większość zasobów renderowania jest skupiona wokół spojrzenia użytkownika, a nie jest rozproszona w sposób nie rozróżnialny na niższej rozdzielczości w całej dostępnej przestrzeni wizualnej.

Z artykułu z 2021 roku Foveated Neural Radiance Fields for Real-Time and Egocentric Virtual Reality, widzimy locus uwagi w nowym schemacie renderowania foweksjalnego dla NeRF. Źródło: https://arxiv.org/pdf/2103.16365.pdf
Istotną częścią autentyczności przyszłych wdrożeń egocentrycznego NeRF będzie zdolność systemu do odzwierciedlenia własnej zdolności ludzkiego oka do przełączania ostrości na równym płaszczyźnie perspektywy (patrz pierwsze zdjęcie powyżej).
Ten gradient ostrości jest również wskaźnikiem percepcyjnym skali sceny; widok z helikoptera lecącego nad miastem nie będzie miał żadnych pól ostrości, ponieważ cała scena znajduje się poza zewnętrzną możliwością skupienia widoku, podczas gdy oglądanie miniatury lub “bliskiej” sceny nie tylko pozwoli na “racking focus”, ale również powinno, dla realizmu, zawierać wąskie pole głębi jako domyślne.
Poniżej znajduje się film demonstrujący początkowe możliwości NeRFocus, dostarczony nam przez autora artykułu:
Poza ograniczonymi płaszczyznami
Świadomi wymagań dotyczących kontroli ostrości, wiele projektów NeRF w ostatnich latach zapewniło możliwość jej realizacji, choć wszystkie dotychczasowe próby są skutecznie rozwiązaniami obejścia lub wymagają znaczących rutyn post-processingowych, które sprawiają, że są mało prawdopodobne do wkroczenia do środowisk czasu rzeczywistego, które ostatecznie są wyobrażane dla technologii pól promieniowania neuronowego.
Syntetyczna kontrola ostrości w ramach renderowania neuronowego była podejmowana przez różne metody w ciągu ostatnich 5-6 lat – na przykład, poprzez użycie sieci segmentacyjnej do oddzielenia danych przedniego i tylnego planu, a następnie do ogólnego rozmycia tła – powszechnego rozwiązania dla efektów ostrości dwupłaszczyznowych.

Z artykułu Automatic Portrait Segmentation for Image Stylization, banalne, animacyjne rozdzielenie płaszczyzn ostrości. Źródło: https://jiaya.me/papers/portrait_eg16.pdf
Wielopłaszczyznowe reprezentacje dodają kilka wirtualnych “komórek animacyjnych” do tego paradygmatu, na przykład poprzez użycie estymacji głębi do rozcięcia sceny na gradient ostrości, a następnie do orchestracji jąder zależnych od głębi w celu syntetyzowania rozmycia.
Ponadto, i bardzo istotnie dla potencjalnych środowisk AR/VR, różnica między dwoma punktami widzenia zestawu stereo może być wykorzystana jako pełnomocnik głębi – metoda zaproponowana przez Google Research w 2015 roku.

Z artykułu Google-led Fast Bilateral-Space Stereo for Synthetic Defocus, różnica między dwoma punktami widzenia dostarcza mapy głębi, która może ułatwić rozmycie. Jednakże, ten podejście jest niewiarygodne w sytuacji opisanej powyżej, gdzie zdjęcie jest wyraźnie wykonane z obiektywem 35-50mm (standard SLR), ale ekstremalne rozmycie tła występuje tylko w przypadku obiektywu przekraczającego 200mm, który ma taką samą płaszczyznę ostrości, jaka produkuje wąskie pole głębi w normalnych, ludzkich środowiskach. Źródło
Podejścia tego rodzaju mają tendencję do wykazywania artefaktów krawędzi, ponieważ próbują reprezentować dwie odrębne i ograniczone sfery ostrości jako ciągły gradient ostrości.
W 2021 roku inicjatywa RawNeRF oferowała funkcjonalność High Dynamic Range (HDR), z większą kontrolą nad sytuacjami o niskim świetle, oraz zdawała się mieć zdolność do sterowania ostrością:

RawNeRF steruje ostrością pięknie (choć w tym przypadku niewiarygodnie, ze względu na niewiarygodne płaszczyzny ostrości), ale wymaga wysokiego kosztu obliczeniowego. Źródło: https://bmild.github.io/rawnerf/
Jednak RawNeRF wymaga uciążliwych obliczeń wstępnych dla swoich wielopłaszczyznowych reprezentacji przeszkolonego NeRF, co skutkuje przepływem pracy, który nie może być łatwo dostosowany do lżejszych lub niższych wdrożeń NeRF.
Modelowanie wirtualnej soczewki
NeRF sam w sobie opiera się na modelu obiektywu punktowego, który renderuje całą scenę ostro w sposób podobny do domyślnego CGI (przed różnymi podejściami, które renderują rozmycie jako efekt post-processingowy lub wrodzony na podstawie głębi pola).
NeRFocus tworzy wirtualną “cienką soczewkę” (zamiast “bezszklanej” apertury), która oblicza ścieżkę promienia każdego wejściowego piksela i renderuje ją bezpośrednio, skutecznie odwracając standardowy proces przechwytywania obrazu, który działa post facto na światło wejściowe, które już zostało poddane wpływowi optycznym soczewki.

Ten model wprowadza szereg możliwości dla renderowania treści wewnątrz frustum (największy krąg wpływu przedstawiony na powyższym obrazie).
Obliczanie poprawnego koloru i gęstości dla każdego wielowarstwowego perceptronu (MLP) w tym szerszym zakresie możliwości jest dodatkowym zadaniem. To zostało rozwiązane wcześniej przez zastosowanie nadzorowanego szkolenia do dużej liczby zdjęć DLSR, wymagającego utworzenia dodatkowych zestawów danych dla probabilistycznego przepływu pracy szkolenia – skutecznie obejmującego pracochłonne przygotowanie i przechowywanie wielu możliwych obliczonych zasobów, które mogą lub nie mogą być potrzebne.
NeRFocus pokonuje to przez P-szkolenie, gdzie zestawy danych szkoleniowych są generowane na podstawie podstawowych operacji rozmycia. W ten sposób model jest tworzony z operacjami rozmycia wrodzonymi i możliwymi do nawigacji.

Średnica apertury jest ustawiona na zero podczas szkolenia, a wstępnie zdefiniowane prawdopodobieństwa są używane do wyboru jądra rozmycia losowo. Ten uzyskany średnica jest używany do skalowania każdej złożonej soczewki, pozwalając MLP dokładnie przewidzieć promieniowanie i gęstość frustum (szerokie kręgi na powyższych obrazach, reprezentujące maksymalną strefę transformacji dla każdego piksela)
Autorzy nowego artykułu zauważają, że NeRFocus jest potencjalnie kompatybilny z podejściem HDR-driven RawNeRF, co mogłoby potencjalnie pomóc w renderowaniu pewnych trudnych sekcji, takich jak rozmyte światła punktowe, oraz wiele innych efektów obliczeniowo intensywnych, które wyzwalały przepływy CGI przez trzydzieści lub więcej lat.
Proces ten nie wymaga dodatkowych wymagań czasowych i/lub parametrów w porównaniu z poprzednimi podejściami, takimi jak rdzeń NeRF i Mip-NeRF (i, przypuszczalnie Mip-NeRF 360, choć nie jest to omówione w artykule), i jest stosowalny jako ogólne rozszerzenie centralnej metodyki pól promieniowania neuronowego. Po raz pierwszy opublikowany 12 marca 2022.












