Andersonin kulma
Kohti Reaaliaikaisia AI-Ihmisiä Neurologisen Lumigrafi-Renderoinnin Avulla

Vaikka nykyinen Neural Radiance Fields -tekniikka (NeRF) on herättänyt suurta kiinnostusta, se edellyttää edelleen paljon koulutusaikaa ja puuttuu toteutus, joka mahdollistaisi reaaliaikaiset ja erittäin vastaanottavat käyttöliittymät.
Tämä uusi lähestymistapa kuvansynteesitekniikkaan edellyttää edelleen paljon koulutusaikaa ja puuttuu toteutus, joka mahdollistaisi reaaliaikaiset ja erittäin vastaanottavat käyttöliittymät.
Tutkimus artikkeli, jonka otsikko on Neural Lumigraph Rendering, väittää parantavansa tilannetta noin kahden kertaluokan verran, edistäen reaaliaikaisen tietokonegrafiikan tuottamista koneoppimisputkien avulla.

Neural Lumigraph Rendering (oikea) tarjoaa paremman resoluution sekoittumisvirheille ja parannetun peittämisen käsittelemisen edeltäviin menetelmiin verrattuna. Lähde.
Vaikka artikkelin tekijöiksi mainitaan vain Stanfordin yliopisto ja holografisen näyttöteknologian yritys Raxium (joka toimii tällä hetkellä salassa), tutkijaryhmään kuuluvat myös Googlen koneoppimisen arkkitehti, Adoben tietokonetieteilijä ja StoryFile-nimisen yrityksen CTO (joka on aiheuttanut huomiota vastikään luomallaan AI-versiolla William Shatnerista).
StoryFile näyttää käyttävän NLR:ää uudessa prosessissaan, jossa luodaan interaktiivisia, tekoälypohjaisia entiteettejä yksilöiden ominaisuuksien ja kertomusten perusteella.
StoryFile näkee tätä teknologiaa käytettävän museoissa, interaktiivisissa verkkokertomuksissa, holografisissa näytöissä, lisätyn todellisuuden sovelluksissa ja kulttuuriperinnön dokumentoinnissa – ja näyttää myös tutkivan uusia sovellusmahdollisuuksia NLR:lle rekrytointihenkilöhaastatteluissa ja virtuaalitreffeissä:

Ehdotettuja käyttökohteita StoryFile-nimisen yrityksen verkkovideosta. Lähde: https://www.youtube.com/watch?v=2K9J6q5DqRc
Tilavuuden Kaappaus Uusien Näkymien Synteesin Käyttöliittymille ja Videolle
Tilavuuden kaappauksen periaate, jota käsitellään useissa tutkimusartikkeleissa, on ideana ottaa kuvia tai videoita kohteesta ja käyttää koneoppimista “täyttämään” näkökulmia, joita alkuperäinen kameraryhmä ei kattanut.

Lähde: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
Yllä olevassa kuvassa, joka on otettu Facebookin AI-tutkimuksesta vuodelta 2019 (ks. alla), nähdään tilavuuden kaappauksen neljä vaihetta: useat kamerat ottavat kuvia/materiaalia; koodaus/dekoodaus-arkkitehtuuri (tai muut arkkitehtuurit) laskee ja yhdistää näkökulmien suhteellisuuden; säteenmarssimisalgoritmit laskevat jokaisen tilavuuden pisteiden voxelit (tai muut XYZ-avaruudelliset geometriset yksiköt); ja (useimmissa viimeaikaisissa tutkimuksissa) koulutus tapahtuu syntetisoidakseen täydellisen entiteetin, jota voidaan muokata reaaliajassa.
Tämä usein laaja ja data-intensiivinen koulutusvaihe on pitänyt uusien näkymien synteesin pois reaaliajasta tai erittäin vastaanottavasta kaappauksesta.
Se, että uusien näkymien synteesi luo täydellisen 3D-kartan tilavuudesta, tekee siitä suhteellisen helppoa yhdistää nämä pisteet perinteiseksi tietokonegrafiikaksi luomalla CGI-ihmisen (tai minkä tahansa toisen suhteellisen rajatun kohteen) lennossa.
Lähestymistavat, jotka käyttävät NeRF:ää, riippuvat piste-pilvistä ja syvyyden kartasta interpoloidakseen harvojen näkökulmien välillä:

NeRF voi luoda tilavuuden syvyyden laskemalla syvyyden karttoja sen sijaan, että luotaisiin tietokonegrafiikkamalleja. Lähde: https://www.youtube.com/watch?v=JuH79E8rdKc
Vaikka NeRF on kykenevä laskemaan malloja, useimmat toteutukset eivät käytä tätä tilavuuden luomiseen.
Sen sijaan Implicit Differentiable Renderer (IDR) -lähestymistapa, joka julkaistiin Weizmannin tiede-instituutissa lokakuussa 2020, perustuu hyödyntämään 3D-mallitietoa, joka luodaan automaattisesti kameraryhmistä:

IDR-kuvia, jotka on muunnettu interaktiivisiksi tietokonegrafiikkamalleiksi. Lähde: https://www.youtube.com/watch?v=C55y7RhJ1fE
NeRF:ää ei voida verrata IDR:n muotoinvestointikykyyn, mutta IDR ei voi kilpailla NeRF:n kuvanlaadussa, ja molemmat vaativat laajoja resursseja koulutuksen ja kokoamisen vuoksi (vaikka NeRF:iin liittyvät viimeaikaiset innovaatiot alkavat ratkaista tätä ongelmaa).

NLR:n mukainen kustomoitu kamerarunko, jossa on 16 GoPro HERO7 -kameraa ja 6 keskellä olevaa Back-Bone H7PRO-kameraa. ‘Reaaliaikaisessa’ renderöinnissä nämä toimivat vähintään 60 kuvan sekuntivauhtia. Lähde: https://arxiv.org/pdf/2103.11571.pdf
Sen sijaan Neural Lumigraph Rendering käyttää SIREN:iä (Sinusoidaalisia Esitysverkkoja) yhdistämään kumpaankin lähestymistapaan liittyvät vahvuudet omaan viitekehykseensä, joka on tarkoitettu tuottamaan suoraan käytettävissä olevaa tulosta olemassa oleviin reaaliaikaisiin grafiikkaputkiin.
SIREN on käytetty samankaltaisissa toteutuksissa viime vuoden aikana, ja se edustaa nyt suositun API-kutsun kuvansynteesiyhteisöjen harrastajien Colab-kirjastoissa; kuitenkin NLR:n innovaatio on soveltaa SIREN:ia kaksiulotteiseen moninäkökulmaiseen kuvavalvontaan, mikä on ongelmallista SIREN:in tuottaman ylisopeutuneen sijaan yleistyneen tulosteen vuoksi.
Kun tietokonegrafiikkamalli on poistettu kamerakuvista, malli rasteroidaan OpenGL:llä, ja mallin vertex-koordinaatit määritetään asianmukaisiin pikseleihin, minkä jälkeen lasketaan eri karttojen sekoittumista:
Tuloksena oleva malli on yleisempi ja edustavampi kuin NeRF:n (ks. alla oleva kuva), vaatii vähemmän laskentaa eikä sovellakaan liiallista yksityiskohtaisuutta alueille (kuten sileälle kasvojen iholle), joilta se ei voi hyötyä:
Toisaalta NLR:llä ei ole vielä dynaamisen valaistuksen tai uudelleenvalaistuksen ominaisuutta, ja tuloste on rajoitettu varjokarttoihin ja muihin valaistus huomioon ottaen aikaisemmin saatuun valaistukseen. Tutkijat aikovat käsitellä tämän tulevassa työssä.
Lisäksi artikkeli myöntää, että NLR:llä luodut muodot eivät ole yhtä tarkkoja kuin joissakin vaihtoehtoisissa lähestymistavoissa, kuten Pixelwise View Selection for Unstructured Multi-View Stereo tai Weizmannin instituutin tutkimuksessa mainittu.
Tilavuuden Kuvansynteesin Nousu
Idea 3D-entiteettien luomisesta rajoitetusta valokuvien sarjasta neuroverkkojen avulla edeltää NeRF:iä, ja visionääriset tutkimukset ulottuvat vuoteen 2007 tai aiemmaksi. Vuonna 2019 Facebookin AI-tutkimuslaitos julkaisi merkittävän tutkimuksen, Neural Volumes: Learning Dynamic Renderable Volumes from Images, joka mahdollisti ensimmäisen kerran vastaanottavat käyttöliittymät tekoälyllä luoduille ihmisille tilavuuden kaappauksen avulla.

Facebookin vuoden 2019 tutkimus mahdollisti vastaanottavan käyttöliittymän luomisen tilavuudelle. Lähde: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/













