KÄ t Andersona
NeRF zbliÅža siÄ o krok do zastÄ pienia CGI

Badacze z MIT i Google dokonali duÅžego postÄpu w rozwiÄ zaniu jednego z najbardziej fundamentalnych przeszkÃģd dla wschodzÄ cej technologii opartej na sztucznej inteligencji, ktÃģra moÅže ostatecznie zastÄ piÄ CGI â oddzielenie obrazÃģw neural radiance field (NeRF) na ich skÅadowe wizualne, tak aby obrazy mogÅy byÄ ponownie teksturyzowane i oÅwietlone.
Nowy podejÅcie, nazwane NeRFactor, skutecznie dzieli przechwytywane obrazy na per-objektowe normalne (na ktÃģre moÅžna przypisaÄ tekstury), widocznoÅÄ ÅwiatÅa, albedo (proporcjÄ ÅwiatÅa przypadkowego, ktÃģre jest odbite od powierzchni) i Bidirectional Reflectance Distribution Functions (BRDFs).
Z tymi aspektami izolowanymi, moÅžliwe jest nie tylko przeÅÄ czanie tekstur dla poszczegÃģlnych obiektÃģw lub grup obiektÃģw, ale rÃģwnieÅž dodawanie nowych i unikalnych ÅšrÃģdeÅ ÅwiatÅa i implementacji cieni, dyskwalifikujÄ c te, ktÃģre zostaÅy przechwycone przez wieloobiektywowe tablice, ktÃģre generujÄ dane wejÅciowe dla obrazÃģw NeRF.

Normals, visibility, albedo and BRDF separated under NeRFactor. Source: https://www.youtube.com/watch?v=UUVSPJlwhPg
Model obsÅuguje miÄkkie lub twarde cienie z dowolnych, zdefiniowanych przez uÅžytkownika ÅšrÃģdeÅ ÅwiatÅa i oddziela cztery aspekty przechwytywanego wideo programowo, przy uÅžyciu straty rekonstrukcji, danych z poprzednich obliczeÅ BRDF i podstawowej prostej regularyzacji gÅadkoÅci.


NeRFactorâs work-flow, extracting separately actionable facets of imagery derived from multiple-camera arrays. Source: https://arxiv.org/pdf/2106.01970.pdf
NeRFactor wykorzystuje sondÄ ÅwiatÅa HDR, dobrze ugruntowane podejÅcie, ktÃģre od 1998 roku jest powszechnie stosowane w przemyÅle wizualnym i artystycznym, do oceny moÅžliwych tras promieni, co umoÅžliwia dowolne oÅwietlenie. PoniewaÅž generuje to niekontrolowanÄ liczbÄ parametrÃģw, sonda ÅwiatÅa jest filtrowana przez wielowarstwowy perceptron (MLP), ktÃģry mapuje postrzeganÄ geometriÄ na sondÄ bez prÃģby obliczania peÅnej mapy objÄtoÅci oÅwietlenia dla przestrzeni modelu.

Two neural radiance field models are used to demonstrate five lighting models possible under NeRFactor. Click image for higher resolution.
Przyczyna do refleksji
Nowe badanie jest byÄ moÅže najbardziej istotne w oddzieleniu warstw przechwytywanych obrazÃģw, ktÃģre kontrolujÄ odbicie. Pozostaje to jednym z najwiÄkszych wyzwaÅ dla obrazÃģw neural radiance field, poniewaÅž prawdziwie nowy i elastyczny system NeRF bÄdzie musiaÅ nie tylko mÃģc zastÄ piÄ tekstury, ale rÃģwnieÅž bÄdzie musiaÅ znaleÅšÄ sposÃģb na odbicie poruszajÄ cych siÄ obiektÃģw (poza tylko staÅym Årodowiskiem), ktÃģre zwykle sÄ uwzglÄdnione w przepÅywie pracy CGI.

Ten problem zostaÅ zauwaÅžony niedawno w odniesieniu do nowego badania Intelu przetwarzania filmÃģw wideo w celu uzyskania fotorealistycznych obrazÃģw za pomocÄ sieci neuronowych. W takich przepÅywach pracy wiele âupieczonychâ aspektÃģw materiaÅu ÅšrÃģdÅowego musiaÅoby siÄ staÄ dyskretnymi i wymiennymi, a to jest najprawdopodobniej Åatwiejsze do rozwiÄ zania dla oÅwietlenia (ktÃģre jest funkcjÄ geometrii renderowanej w NeRF) niÅž dla odbiÄ (ktÃģre wykorzystujÄ âpozaekranowÄ â geometriÄ, ktÃģra jest caÅkowicie poza zakresem modelu).
UÅžycie Årodowiska HDR juÅž rozwiÄ zuje problem generowania odbiÄ Årodowiska (tj. nieba, krajobrazu i innych âstaÅychâ czynnikÃģw otoczenia), ale nowe podejÅcia bÄdÄ potrzebne, aby wprowadziÄ poruszajÄ ce siÄ i dynamiczne odbicia.
Fotogrametria z NeRF
Obrazy Neural Radiance Field wykorzystujÄ analizÄ z uÅžyciem sztucznej inteligencji do opracowania caÅkowicie objÄtoÅciowej przestrzeni z sceny lub obiektu, ktÃģry zostaÅ przechwycony z wielu kÄ tÃģw.

RÃģÅžne schematy oparte na NeRF, ktÃģre pojawiÅy siÄ w ciÄ gu ostatniego roku, wykorzystywaÅy rÃģÅžnorodnÄ liczbÄ urzÄ dzeÅ kamery; niektÃģre uÅžywaÅy 16 lub wiÄcej kamer, inne tylko jednej lub dwÃģch. We wszystkich przypadkach poÅrednie punkty widzenia sÄ âwypeÅnioneâ (tj. interpretowane), aby scena lub obiekt mogÅy byÄ pÅynnie nawigowane.
WynikajÄ cÄ z tego jest caÅkowicie objÄtoÅciowa przestrzeÅ, z wewnÄtrznym trÃģjwymiarowym zrozumieniem, ktÃģre moÅže byÄ wykorzystane na wiele sposobÃģw, w tym moÅžliwoÅÄ generowania tradycyjnych siatek CG z trÃģjwymiarowej sumy obrazÃģw wejÅciowych.
NeRF w kontekÅcie nowego CGI
Obrazy neural radiance field sÄ wykreÅlone bezpoÅrednio z obrazÃģw Åwiata rzeczywistego, w tym poruszajÄ cych siÄ obrazÃģw ludzi, obiektÃģw i scen. W przeciwieÅstwie do tego, metodyka CGI âstudiujeâ i interpretuje Åwiat, wymagajÄ c wykwalifikowanych pracownikÃģw do budowy siatek, szkieletÃģw i tekstur, ktÃģre wykorzystujÄ obrazy Åwiata rzeczywistego (tj. przechwytywanie twarzy i Årodowiska). Pozostaje to podstawowo interpretacyjnym i rzemieÅlniczym podejÅciem, ktÃģre jest drogie i pracochÅonne.
Dodatkowo, CGI miaÅo trwajÄ ce problemy z efektem âdolinÄ nieprzyjemnoÅciâ w swoich prÃģbach odtworzenia podobieÅstw ludzkich, co nie stanowi ograniczenia dla podejÅcia opartego na NeRF, ktÃģre po prostu przechwytuje filmy wideo lub obrazy prawdziwych ludzi i manipuluje nimi.
Ponadto, NeRF moÅže generowaÄ tradycyjnÄ geometriÄ siatki CGI bezpoÅrednio z fotografii, jeÅli jest to konieczne, i w efekcie zastÄpuje wiele rÄcznych procedur, ktÃģre zawsze byÅy konieczne w generowanych komputerowo obrazach.
Wyzwania dla NeRF
To najnowsze badanie z MIT i Google pochodzi w kontekÅcie wielu prac nad NeRF w ciÄ gu ostatniego roku, z ktÃģrych wiele zaproponowaÅo rozwiÄ zania rÃģÅžnych wyzwaÅ wynikajÄ cych z pierwotnego artykuÅu z 2020 roku.
W kwietniu, innowacja chiÅskiego konsorcjum badawczego dostarczyÅa sposÃģb na oddzielenie poszczegÃģlnych czasowych linii aspektÃģw w scenie NeRF, w tym ludzi.

ChiÅskie badanie pozwala uÅžytkownikom na kopiowanie, wklejanie i zmianÄ rozmiaru przechwyconych elementÃģw, odÅÄ czajÄ c je od liniowego czasowego toku oryginalnego filmu wideo. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4
To podejÅcie nie tylko umoÅžliwia wyobraÅženie sobie sceny z dowolnego kÄ ta przechwyconego przez tablicÄ kamer (a nie tylko z jednego widoku reprezentowanego w typowym przechwytywaniu wideo), ale rÃģwnieÅž umoÅžliwia wszechstronne komponowanie â i nawet moÅžliwoÅÄ reprezentowania dwÃģch aspektÃģw z tego samego filmu wideo, ktÃģre sÄ uruchamiane w swoich wÅasnych ramach czasowych (lub nawet biegnÄ wstecz, jeÅli jest to konieczne).

ChiÅskie badanie pozwala uÅžytkownikom na kopiowanie, wklejanie i zmianÄ rozmiaru przechwyconych elementÃģw, odÅÄ czajÄ c je od liniowego czasowego toku oryginalnego filmu wideo. Source: https://www.youtube.com/watch?v=Wp4HfOwFGP4
Jednym z najwiÄkszych wyzwaÅ dla NeRF jest obniÅženie znacznych zasobÃģw potrzebnych do szkolenia sceny, a to zostaÅo zaadresowane w kilku ostatnich pracach. Na przykÅad, Instytut Maxa Plancka ds. SystemÃģw Inteligentnych wprowadziÅ KiloNeRF, ktÃģry nie tylko przyspiesza czasy renderowania o czynnik 1000, ale rÃģwnieÅž umoÅžliwia NeRF dziaÅaÄ interaktywnie.

KiloNeRF running an interactive environment at 50fps on a GTX 1080ti. Source: https://github.com/creiser/kilonerf
Jednak innowacja NeRF, ktÃģra naprawdÄ zdobyÅa wyobraÅšniÄ badaczy i publicznoÅci w 2021 roku, byÅa PlenOctrees wspÃģÅpracÄ , prowadzonÄ przez UC Berkeley, ktÃģra oferuje rendering w czasie rzeczywistym Neural Radiance Fields:
WpÅyw interaktywnych moÅžliwoÅci PlenOctrees zostaÅ odtworzony w interaktywnym, internetowym interfejsie.

Live interactive movement of a PlenOctrees object in Firefox (movement is smoother and more dynamic than this GIF represents). Source: http://alexyu.net/plenoctrees/demo/
Dodatkowo, Recursive-NeRF (z maja 2021 roku pracy badawczej przez badaczy z Uniwersytetu Tsinghua) oferuje renderowanie o wysokiej jakoÅci w sposÃģb rekursywny na ÅžÄ danie. Zamiast zmuszaÄ uÅžytkownika do renderowania caÅych scen, w tym czÄÅci, ktÃģre mogÄ nie byÄ widoczne, Recursive-NeRF zapewnia coÅ w rodzaju kompresji stratnej JPEG, i moÅže generowaÄ dyskretne sub-NeRF, aby obsÅuÅžyÄ dodatkowe obrazy na ÅžÄ danie â osiÄ gajÄ c ogromne oszczÄdnoÅci w zasobach obliczeniowych.

Retaining detail while dumping unnecessary render calculations with Recursive-NeRF. Click on image for higher resolution. Source: https://arxiv.org/pdf/2105.09103.pdf
Inne podejÅcia obejmujÄ FastNeRF, ktÃģre twierdzi, Åže osiÄ ga renderowanie neuronowe o wysokiej wiernoÅci przy 200 klatkach na sekundÄ.
ZauwaÅžono, Åže wiele technik optymalizacji NeRF obejmuje âupieczenieâ sceny, poprzez zobowiÄ zanie siÄ do aspektÃģw, ktÃģre majÄ byÄ renderowane, i odrzucenie innych aspektÃģw, co ogranicza eksploracjÄ, ale znacznie przyspiesza interakcjÄ.
WadÄ tego jest to, Åže stres przechodzi z procesora graficznego na pamiÄÄ, poniewaÅž upieczone sceny zajmujÄ ogromnÄ iloÅÄ miejsca na dysku; w pewnym stopniu moÅžna to zÅagodziÄ, zmniejszajÄ c rozdzielczoÅÄ upieczonych danych, chociaÅž rÃģwnieÅž wymaga to pewnego zobowiÄ zania, w zakresie zamykania drÃģg eksploracji lub interakcji.
OdnoszÄ c siÄ do przechwytywania ruchu i szkieletu, nowe podejÅcie z UniwersytetÃģw Zheijang i Cornell, ujawnione w maju, zaproponowaÅo metodÄ odtwarzania animowalnych ludzi przy uÅžyciu pÃģl wagowych i struktur szkieletowych interpretowanych z danych wejÅciowych wideo:

Derived skeletal structure in Animatable NeRF. Source: https://www.youtube.com/watch?v=eWOSWbmfJo4

Kiedy NeRF bÄdzie miaÅ swÃģj moment âParku Jurajskiegoâ?
Pomimo szybkiego tempa postÄpu z syntezÄ obrazu za pomocÄ pÃģl promieniowania neuronowego, jest to dopiero okres, w ktÃģrym jakiÅ rodzaj âprawa termodynamikiâ zostanie ustalony dla tego, jak moÅžna wdroÅžyÄ NeRF. W kwestii chronologii podobnej do historii CGI, NeRF unoszÄ siÄ obecnie wokÃģÅ 1973 roku, tuÅž przed pierwszym uÅžyciem CGI w Westworld.
To nie oznacza, Åže NeRF bÄdzie musiaÅ czekaÄ dziewiÄÄ lat na swÃģj odpowiednik Wrath Of Khan kamieÅ milowy, lub dziesiÄciolecia na przeÅomowe osiÄ gniÄcia, ktÃģre CGI osiÄ gnÄÅo pod entuzjastycznym patronatem Jamesa Camerona w 1989 roku w The Abyss lub w 1991 roku w Terminator 2 â a potem, prawdziwie rewolucyjny moment przeÅomowy w 1993 roku w Parku Jurajskim.

Scena obrazowa zmieniÅa siÄ znacznie od dÅugiego okresu stagnacji efektÃģw wizualnych fotochemicznych, ktÃģre dominowaÅy produkcjÄ filmowÄ i telewizyjnÄ od narodzin kina do wczesnych lat 90. XX wieku. NadejÅcie rewolucji komputerowej i przyspieszenie prawa Mooreâa doprowadziÅo do rewolucji CGI, ktÃģra w przeciwnym razie mogÅaby siÄ wydarzyÄ juÅž w latach 60. XX wieku.
Nie wiadomo, czy istnieje jakaÅ bariera tak nieprzekraczalna, Åže mogÅaby powstrzymaÄ postÄp NeRF przez tak dÅugi czas â i czy pÃģÅšniejsze innowacje w dziedzinie widzenia komputerowego nie mogÄ w miÄdzyczasie caÅkowicie przejÄ Ä NeRF jako gÅÃģwnego kandydata do korony CGI, charakteryzujÄ c pola promieniowania neuronowego jako krÃģtkotrwaÅy âfaksâ syntezowania obrazu neuronowego.
Jak dotÄ d, NeRF nie zostaÅ wykorzystany w Åžadnym kontekÅcie poza badaniami akademickimi; jednak warto zauwaÅžyÄ, Åže gÅÃģwni gracze, tacy jak Google Research, oraz wiele z najbardziej prominentnych laboratoriÃģw badawczych widzenia komputerowego, konkurujÄ o najnowsze przeÅomy NeRF.
Wiele z najwiÄkszych przeszkÃģd NeRF zaczÄÅo byÄ bezpoÅrednio zaadresowanych w tym roku; jeÅli pÃģÅšniejsze badania zapewniÄ rozwiÄ zanie problemu âodblaskuâ, a wiele wÄ tkÃģw badaÅ optymalizujÄ cych NeRF zjednoczy siÄ w decydujÄ ce rozwiÄ zanie ogromnych wymagaÅ technologicznych i/lub magazynowania, NeRF naprawdÄ ma szansÄ staÄ siÄ ânowym CGIâ w ciÄ gu najbliÅžszych piÄciu lat.












