Kąt Andersona

NeRF zbliÅža się o krok do zastąpienia CGI

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Badacze z MIT i Google dokonali duÅžego postępu w rozwiązaniu jednego z najbardziej fundamentalnych przeszkÃģd dla wschodzącej technologii opartej na sztucznej inteligencji, ktÃģra moÅže ostatecznie zastąpić CGI – oddzielenie obrazÃģw neural radiance field (NeRF) na ich składowe wizualne, tak aby obrazy mogły być ponownie teksturyzowane i oświetlone.

Nowy podejście, nazwane NeRFactor, skutecznie dzieli przechwytywane obrazy na per-objektowe normalne (na ktÃģre moÅžna przypisać tekstury), widoczność światła, albedo (proporcję światła przypadkowego, ktÃģre jest odbite od powierzchni) i Bidirectional Reflectance Distribution Functions (BRDFs).

Z tymi aspektami izolowanymi, moÅžliwe jest nie tylko przełączanie tekstur dla poszczegÃģlnych obiektÃģw lub grup obiektÃģw, ale rÃģwnieÅž dodawanie nowych i unikalnych ÅšrÃģdeł światła i implementacji cieni, dyskwalifikując te, ktÃģre zostały przechwycone przez wieloobiektywowe tablice, ktÃģre generują dane wejściowe dla obrazÃģw NeRF.

Normals, visibility, albedo and BRDF separated under NeRFactor. Source: https://www.youtube.com/watch?v=UUVSPJlwhPg

Normals, visibility, albedo and BRDF separated under NeRFactor. Source: https://www.youtube.com/watch?v=UUVSPJlwhPg

Model obsługuje miękkie lub twarde cienie z dowolnych, zdefiniowanych przez uÅžytkownika ÅšrÃģdeł światła i oddziela cztery aspekty przechwytywanego wideo programowo, przy uÅžyciu straty rekonstrukcji, danych z poprzednich obliczeń BRDF i podstawowej prostej regularyzacji gładkości.

NeRFactor’s work-flow, extracting separately actionable facets of imagery derived from multiple-camera arrays. Source: https://arxiv.org/pdf/2106.01970.pdf

NeRFactor wykorzystuje sondę światła HDR, dobrze ugruntowane podejście, ktÃģre od 1998 roku jest powszechnie stosowane w przemyśle wizualnym i artystycznym, do oceny moÅžliwych tras promieni, co umoÅžliwia dowolne oświetlenie. PoniewaÅž generuje to niekontrolowaną liczbę parametrÃģw, sonda światła jest filtrowana przez wielowarstwowy perceptron (MLP), ktÃģry mapuje postrzeganą geometrię na sondę bez prÃģby obliczania pełnej mapy objętości oświetlenia dla przestrzeni modelu.

Two neural radiance field models are used to demonstrate five lighting models possible under NeRFactor. Click image for higher resolution.

Przyczyna do refleksji

Nowe badanie jest być moÅže najbardziej istotne w oddzieleniu warstw przechwytywanych obrazÃģw, ktÃģre kontrolują odbicie. Pozostaje to jednym z największych wyzwań dla obrazÃģw neural radiance field, poniewaÅž prawdziwie nowy i elastyczny system NeRF będzie musiał nie tylko mÃģc zastąpić tekstury, ale rÃģwnieÅž będzie musiał znaleŚć sposÃģb na odbicie poruszających się obiektÃģw (poza tylko stałym środowiskiem), ktÃģre zwykle są uwzględnione w przepływie pracy CGI.

Ten problem został zauwaÅžony niedawno w odniesieniu do nowego badania Intelu przetwarzania filmÃģw wideo w celu uzyskania fotorealistycznych obrazÃģw za pomocą sieci neuronowych. W takich przepływach pracy wiele “upieczonych” aspektÃģw materiału ÅšrÃģdłowego musiałoby się stać dyskretnymi i wymiennymi, a to jest najprawdopodobniej łatwiejsze do rozwiązania dla oświetlenia (ktÃģre jest funkcją geometrii renderowanej w NeRF) niÅž dla odbić (ktÃģre wykorzystują “pozaekranową” geometrię, ktÃģra jest całkowicie poza zakresem modelu).

UÅžycie środowiska HDR juÅž rozwiązuje problem generowania odbić środowiska (tj. nieba, krajobrazu i innych “stałych” czynnikÃģw otoczenia), ale nowe podejścia będą potrzebne, aby wprowadzić poruszające się i dynamiczne odbicia.

Fotogrametria z NeRF

Obrazy Neural Radiance Field wykorzystują analizę z uÅžyciem sztucznej inteligencji do opracowania całkowicie objętościowej przestrzeni z sceny lub obiektu, ktÃģry został przechwycony z wielu kątÃģw.

RÃģÅžne schematy oparte na NeRF, ktÃģre pojawiły się w ciągu ostatniego roku, wykorzystywały rÃģÅžnorodną liczbę urządzeń kamery; niektÃģre uÅžywały 16 lub więcej kamer, inne tylko jednej lub dwÃģch. We wszystkich przypadkach pośrednie punkty widzenia są “wypełnione” (tj. interpretowane), aby scena lub obiekt mogły być płynnie nawigowane.

Wynikającą z tego jest całkowicie objętościowa przestrzeń, z wewnętrznym trÃģjwymiarowym zrozumieniem, ktÃģre moÅže być wykorzystane na wiele sposobÃģw, w tym moÅžliwość generowania tradycyjnych siatek CG z trÃģjwymiarowej sumy obrazÃģw wejściowych.

NeRF w kontekście nowego CGI

Obrazy neural radiance field są wykreślone bezpośrednio z obrazÃģw świata rzeczywistego, w tym poruszających się obrazÃģw ludzi, obiektÃģw i scen. W przeciwieństwie do tego, metodyka CGI “studiuje” i interpretuje świat, wymagając wykwalifikowanych pracownikÃģw do budowy siatek, szkieletÃģw i tekstur, ktÃģre wykorzystują obrazy świata rzeczywistego (tj. przechwytywanie twarzy i środowiska). Pozostaje to podstawowo interpretacyjnym i rzemieślniczym podejściem, ktÃģre jest drogie i pracochłonne.

Dodatkowo, CGI miało trwające problemy z efektem “doliną nieprzyjemności” w swoich prÃģbach odtworzenia podobieństw ludzkich, co nie stanowi ograniczenia dla podejścia opartego na NeRF, ktÃģre po prostu przechwytuje filmy wideo lub obrazy prawdziwych ludzi i manipuluje nimi.

Ponadto, NeRF moÅže generować tradycyjną geometrię siatki CGI bezpośrednio z fotografii, jeśli jest to konieczne, i w efekcie zastępuje wiele ręcznych procedur, ktÃģre zawsze były konieczne w generowanych komputerowo obrazach.

Wyzwania dla NeRF

To najnowsze badanie z MIT i Google pochodzi w kontekście wielu prac nad NeRF w ciągu ostatniego roku, z ktÃģrych wiele zaproponowało rozwiązania rÃģÅžnych wyzwań wynikających z pierwotnego artykułu z 2020 roku.

W kwietniu, innowacja chińskiego konsorcjum badawczego dostarczyła sposÃģb na oddzielenie poszczegÃģlnych czasowych linii aspektÃģw w scenie NeRF, w tym ludzi.

ST-NeRF

Chińskie badanie pozwala uÅžytkownikom na kopiowanie, wklejanie i zmianę rozmiaru przechwyconych elementÃģw, odłączając je od liniowego czasowego toku oryginalnego filmu wideo. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4

To podejście nie tylko umoÅžliwia wyobraÅženie sobie sceny z dowolnego kąta przechwyconego przez tablicę kamer (a nie tylko z jednego widoku reprezentowanego w typowym przechwytywaniu wideo), ale rÃģwnieÅž umoÅžliwia wszechstronne komponowanie – i nawet moÅžliwość reprezentowania dwÃģch aspektÃģw z tego samego filmu wideo, ktÃģre są uruchamiane w swoich własnych ramach czasowych (lub nawet biegną wstecz, jeśli jest to konieczne).

Two separate NeRF facets run at different speeds in the same scene. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Chińskie badanie pozwala uÅžytkownikom na kopiowanie, wklejanie i zmianę rozmiaru przechwyconych elementÃģw, odłączając je od liniowego czasowego toku oryginalnego filmu wideo. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Jednym z największych wyzwań dla NeRF jest obniÅženie znacznych zasobÃģw potrzebnych do szkolenia sceny, a to zostało zaadresowane w kilku ostatnich pracach. Na przykład, Instytut Maxa Plancka ds. SystemÃģw Inteligentnych wprowadził KiloNeRF, ktÃģry nie tylko przyspiesza czasy renderowania o czynnik 1000, ale rÃģwnieÅž umoÅžliwia NeRF działać interaktywnie.

KiloNeRF running an interactive environment at 50fps on a GTX 1080ti. Source: https://github.com/creiser/kilonerf

KiloNeRF running an interactive environment at 50fps on a GTX 1080ti. Source: https://github.com/creiser/kilonerf

Jednak innowacja NeRF, ktÃģra naprawdę zdobyła wyobraÅšnię badaczy i publiczności w 2021 roku, była PlenOctrees wspÃģłpracą, prowadzoną przez UC Berkeley, ktÃģra oferuje rendering w czasie rzeczywistym Neural Radiance Fields:

Wpływ interaktywnych moÅžliwości PlenOctrees został odtworzony w interaktywnym, internetowym interfejsie.

Live interactive movement of a PlenOctrees object in Firefox (movement is smoother and more dynamic than this GIF represents). Source: http://alexyu.net/plenoctrees/demo/

Live interactive movement of a PlenOctrees object in Firefox (movement is smoother and more dynamic than this GIF represents). Source: http://alexyu.net/plenoctrees/demo/

Dodatkowo, Recursive-NeRF (z maja 2021 roku pracy badawczej przez badaczy z Uniwersytetu Tsinghua) oferuje renderowanie o wysokiej jakości w sposÃģb rekursywny na Şądanie. Zamiast zmuszać uÅžytkownika do renderowania całych scen, w tym części, ktÃģre mogą nie być widoczne, Recursive-NeRF zapewnia coś w rodzaju kompresji stratnej JPEG, i moÅže generować dyskretne sub-NeRF, aby obsłuÅžyć dodatkowe obrazy na Şądanie – osiągając ogromne oszczędności w zasobach obliczeniowych.

Retaining detail while dumping unnecessary render calculations with Recursive-NeRF. Source: https://arxiv.org/pdf/2105.09103.pdf

Retaining detail while dumping unnecessary render calculations with Recursive-NeRF.  Click on image for higher resolution. Source: https://arxiv.org/pdf/2105.09103.pdf

Inne podejścia obejmują FastNeRF, ktÃģre twierdzi, Åže osiąga renderowanie neuronowe o wysokiej wierności przy 200 klatkach na sekundę.

ZauwaÅžono, Åže wiele technik optymalizacji NeRF obejmuje ‘upieczenie’ sceny, poprzez zobowiązanie się do aspektÃģw, ktÃģre mają być renderowane, i odrzucenie innych aspektÃģw, co ogranicza eksplorację, ale znacznie przyspiesza interakcję.

Wadą tego jest to, Åže stres przechodzi z procesora graficznego na pamięć, poniewaÅž upieczone sceny zajmują ogromną ilość miejsca na dysku; w pewnym stopniu moÅžna to złagodzić, zmniejszając rozdzielczość upieczonych danych, chociaÅž rÃģwnieÅž wymaga to pewnego zobowiązania, w zakresie zamykania drÃģg eksploracji lub interakcji.

Odnosząc się do przechwytywania ruchu i szkieletu, nowe podejście z UniwersytetÃģw Zheijang i Cornell, ujawnione w maju, zaproponowało metodę odtwarzania animowalnych ludzi przy uÅžyciu pÃģl wagowych i struktur szkieletowych interpretowanych z danych wejściowych wideo:

Derived skeletal structure in Animatable NeRF. Source: https://www.youtube.com/watch?v=eWOSWbmfJo4

Derived skeletal structure in Animatable NeRF. Source: https://www.youtube.com/watch?v=eWOSWbmfJo4

Kiedy NeRF będzie miał swÃģj moment ‘Parku Jurajskiego’?

Pomimo szybkiego tempa postępu z syntezą obrazu za pomocą pÃģl promieniowania neuronowego, jest to dopiero okres, w ktÃģrym jakiś rodzaj “prawa termodynamiki” zostanie ustalony dla tego, jak moÅžna wdroÅžyć NeRF. W kwestii chronologii podobnej do historii CGI, NeRF unoszą się obecnie wokÃģł 1973 roku, tuÅž przed pierwszym uÅžyciem CGI w Westworld.

To nie oznacza, Åže NeRF będzie musiał czekać dziewięć lat na swÃģj odpowiednik Wrath Of Khan kamień milowy, lub dziesięciolecia na przełomowe osiągnięcia, ktÃģre CGI osiągnęło pod entuzjastycznym patronatem Jamesa Camerona w 1989 roku w The Abyss lub w 1991 roku w Terminator 2 – a potem, prawdziwie rewolucyjny moment przełomowy w 1993 roku w Parku Jurajskim.

Scena obrazowa zmieniła się znacznie od długiego okresu stagnacji efektÃģw wizualnych fotochemicznych, ktÃģre dominowały produkcję filmową i telewizyjną od narodzin kina do wczesnych lat 90. XX wieku. Nadejście rewolucji komputerowej i przyspieszenie prawa Moore’a doprowadziło do rewolucji CGI, ktÃģra w przeciwnym razie mogłaby się wydarzyć juÅž w latach 60. XX wieku.

Nie wiadomo, czy istnieje jakaś bariera tak nieprzekraczalna, Åže mogłaby powstrzymać postęp NeRF przez tak długi czas – i czy pÃģÅšniejsze innowacje w dziedzinie widzenia komputerowego nie mogą w międzyczasie całkowicie przejąć NeRF jako głÃģwnego kandydata do korony CGI, charakteryzując pola promieniowania neuronowego jako krÃģtkotrwały “faks” syntezowania obrazu neuronowego.

Jak dotąd, NeRF nie został wykorzystany w Åžadnym kontekście poza badaniami akademickimi; jednak warto zauwaÅžyć, Åže głÃģwni gracze, tacy jak Google Research, oraz wiele z najbardziej prominentnych laboratoriÃģw badawczych widzenia komputerowego, konkurują o najnowsze przełomy NeRF.

Wiele z największych przeszkÃģd NeRF zaczęło być bezpośrednio zaadresowanych w tym roku; jeśli pÃģÅšniejsze badania zapewnią rozwiązanie problemu “odblasku”, a wiele wątkÃģw badań optymalizujących NeRF zjednoczy się w decydujące rozwiązanie ogromnych wymagań technologicznych i/lub magazynowania, NeRF naprawdę ma szansę stać się “nowym CGI” w ciągu najbliÅžszych pięciu lat.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]