Kąt Andersona

W kierunku rzeczywistych ludzi z użyciem renderowania Neural Lumigraph

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Neural Lumigraph Rendering

Pomimo obecnej fali zainteresowania Neural Radiance Fields (NeRF), technologii zdolnej tworzyć środowiska i obiekty 3D generowane przez sztuczną inteligencję, ten nowy podejście do syntezy obrazu wymaga jeszcze dużej ilości czasu szkolenia i brakuje mu wdrożenia, które umożliwiałoby tworzenie interfejsów w czasie rzeczywistym i wysoko responsywnych.

Jednakże, współpraca między kilkoma imponującymi nazwami w przemyśle i akademii oferuje nowe spojrzenie na to wyzwanie (ogólnie znane jako Novel View Synthesis, lub NVS).

Badanie artykułu, zatytułowanego Neural Lumigraph Rendering, twierdzi, że jest to ulepszenie stanu sztuki o około dwa rzędy wielkości, reprezentujące kilka kroków w kierunku renderowania grafiki komputerowej w czasie rzeczywistym za pomocą potoków szkolenia maszynowego.

Neural Lumigraph Rendering (po prawej) oferuje lepszą rozdzielczość artefaktów mieszania i poprawione obsługiwanie zakrycia w porównaniu z poprzednimi metodami. Źródło: https://www.youtube.com/watch?v=maVF-7x9644

Neural Lumigraph Rendering (po prawej) oferuje lepszą rozdzielczość artefaktów mieszania i poprawione obsługiwanie zakrycia w porównaniu z poprzednimi metodami. Źródło.

Chociaż praca nad artykułem wymienia tylko Uniwersytet Stanforda i firmę Raxium (obecnie działającą w trybie stealth), współtwórcami są główny architekt maszynowego uczenia się w Google, naukowiec komputerowy w Adobe oraz dyrektor techniczny w StoryFile (która ostatnio zrobiła nagłówki z wersją AI Williama Shatnera).

W odniesieniu do ostatniej kampanii promocyjnej z udziałem Shatnera, StoryFile wydaje się wykorzystywać NLR w nowym procesie tworzenia interaktywnych, generowanych przez sztuczną inteligencję jednostek opartych na cechach i narracjach poszczególnych ludzi.

StoryFile wyobraża sobie użycie tej technologii w ekspozycjach muzealnych, interaktywnych narracjach online, wyświetlaczach holograficznych, rzeczywistości rozszerzonej (AR) i dokumentacji dziedzictwa – oraz wydaje się, że rozważa potencjalne nowe zastosowania NLR w rozmowach rekrutacyjnych i aplikacjach randkowych:

Zastosowania proponowane w filmie online przez StoryFile. Źródło: https://www.youtube.com/watch?v=2K9J6q5DqRc

Zastosowania proponowane w filmie online przez StoryFile. Źródło: https://www.youtube.com/watch?v=2K9J6q5DqRc

Pojemna rejestracja dla nowych interfejsów syntezy widoku i wideo

Zasada pojemnej rejestracji, w całym zakresie prac, jest pojęciem polegającym na robieniu zdjęć lub filmów obiektu i użyciu maszynowego uczenia się do “wypełnienia” punktów widzenia, które nie były objęte przez oryginalny zestaw kamer.

Źródło: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Źródło: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Na powyższym obrazie, pobranym z badań AI Facebooka z 2019 roku (patrz poniżej), widzimy cztery etapy pojemnej rejestracji: wiele kamer uzyskuje obrazy/fragmenty wideo; architektura kodera/dekodera (lub inna architektura) oblicza i łączy względność widoków; algorytmy ray-marching obliczają voxel (lub inne jednostki geometryczne XYZ) każdego punktu w przestrzeni pojemnej; i (w większości ostatnich prac) szkolenie odbywa się w celu zsyntetyzowania pełnej jednostki, która może być manipulowana w czasie rzeczywistym.

To często rozległe i wymagające danych szkoleniowe faza, która do tej pory utrzymywała nową syntezę widoku poza sferą czasu rzeczywistego lub wysoko responsywnego przechwytywania.

Fakt, że nowa synteza widoku tworzy pełną mapę 3D przestrzeni pojemnej, oznacza, że jest dość trywialne połączenie tych punktów w tradycyjną siatkę generowaną przez komputer, efektywnie przechwytując i artykułując człowieka generowanego przez komputer (lub inny relatywnie ograniczony obiekt) na żywo.

Podejścia, które wykorzystują NeRF, opierają się na chmurach punktów i mapach głębi, aby wygenerować interpolacje między rzadkimi punktami widzenia urządzeń przechwytujących:

NeRF może generować głębię pojemną poprzez obliczanie map głębi, a nie generowanie siatek CG. Źródło: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF może generować głębię pojemną poprzez obliczanie map głębi, a nie generowanie siatek CG. Źródło: https://www.youtube.com/watch?v=JuH79E8rdKc

Chociaż NeRF jest w stanie obliczać siatki, większość wdrożeń nie używa tego w celu generowania scen pojemnych.

Natomiast podejście Implicit Differentiable Renderer (IDR), opublikowane przez Instytut Nauki Weizmann w październiku 2020 roku, opiera się na wykorzystaniu informacji o siatce 3D automatycznie generowanej z tablic przechwytujących:

Przykłady przechwytów IDR przekształconych w interaktywne siatki CG. Źródło: https://www.youtube.com/watch?v=C55y7RhJ1fE

Przykłady przechwytów IDR przekształconych w interaktywne siatki CG. Źródło: https://www.youtube.com/watch?v=C55y7RhJ1fE

Pomimo że NeRF nie ma możliwości estymacji kształtu IDR, IDR nie może dorównać jakości obrazu NeRF, a oba wymagają rozległych zasobów do szkolenia i składania (chociaż ostatnie innowacje w NeRF zaczynają rozwiązywać ten problem).

Niestandardowa konstrukcja kamery NLR z 16 kamerami GoPro HERO7 i 6 centralnymi kamerami Back-Bone H7PRO. Do renderowania w czasie rzeczywistym te kamery działają z prędkością co najmniej 60 klatek na sekundę. Źródło: https://arxiv.org/pdf/2103.11571.pdf

Niestandardowa konstrukcja kamery NLR z 16 kamerami GoPro HERO7 i 6 centralnymi kamerami Back-Bone H7PRO. Do renderowania w czasie rzeczywistym te kamery działają z prędkością co najmniej 60 klatek na sekundę. Źródło: https://arxiv.org/pdf/2103.11571.pdf

Zamiast tego, Neural Lumigraph Rendering wykorzystuje SIREN (Sinusoidal Representation Networks), aby połączyć zalety każdego podejścia w ramach własnego frameworku, który ma na celu generowanie danych wyjściowych, które są bezpośrednio użyteczne w istniejących potokach grafiki w czasie rzeczywistym.

SIREN został wykorzystany w podobnych wdrożeniach w ciągu ostatniego roku i teraz reprezentuje popularne wywołanie API dla notesów Colab w społecznościach syntezy obrazu; jednak innowacja NLR polega na zastosowaniu SIREN do nadzoru obrazu wielowidokowego dwuwymiarowego, co jest problematyczne ze względu na stopień, w jakim SIREN produkuje wyniki przeszkalowane zamiast uogólnione.

Po wyodrębnieniu siatki CG z tablicy obrazów, siatka jest rastrowana za pomocą OpenGL, a pozycje wierzchołków siatki są mapowane na odpowiednie piksele, po czym obliczane jest mieszanie różnych map przyczyniających się:

Wynikowa siatka jest bardziej uogólniona i reprezentatywna niż ta z NeRF (patrz poniższy obraz), wymaga mniej obliczeń i nie nakłada nadmiernych szczegółów w obszarach (takich jak gładka skóra twarzy), które nie mogą skorzystać z tego:

Źródło: https://arxiv.org/pdf/2103.11571.pdf

Źródło: https://arxiv.org/pdf/2103.11571.pdf

Na minusie, NLR nie ma jeszcze możliwości dynamicznego oświetlenia lub prześwietlenia, a dane wyjściowe są ograniczone do map cieni i innych uwzględnionych rozważań oświetleniowych uzyskanych w czasie przechwytywania. Badacze planują rozwiązać ten problem w przyszłej pracy.

Dodatkowo, artykuł przyznaje, że kształty generowane przez NLR nie są tak dokładne, jak niektóre alternatywne podejścia, takie jak Pixelwise View Selection for Unstructured Multi-View Stereo, lub badania Instytutu Weizmann, o których wspomniano wcześniej.

Wzrost syntezy obrazu pojemnej

Pomysł tworzenia jednostek 3D z ograniczonej serii zdjęć za pomocą sieci neuronowych poprzedza NeRF, z wizjonerskimi artykułami sięgającymi 2007 roku lub wcześniej. W 2019 roku departament badań AI Facebooka wyprodukował przełomowy artykuł badawczy, Neural Volumes: Learning Dynamic Renderable Volumes from Images, który po raz pierwszy umożliwił tworzenie interaktywnych interfejsów dla ludzi syntetycznych generowanych przez pojemną rejestrację opartą na maszynowym uczeniu się.

Badania Facebooka z 2019 roku umożliwiły stworzenie responsywnego interfejsu użytkownika dla pojemnej osoby. Źródło: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Badania Facebooka z 2019 roku umożliwiły stworzenie responsywnego interfejsu użytkownika dla pojemnej osoby. Źródło: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]