Andersonin kulma

Neural Rendering: NeRF kävelee raikkaassa ilmassa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Google Researchin ja Harvardin yliopiston välinen yhteistyö on kehittänyt uuden menetelmän, jonka avulla voidaan luoda 360‑asteen neurovideo kokonaisista kohtauksista käyttäen Neuraaliset säteilykentät (NeRF). Tämä uusi lähestymistapa vie NeRF:ia askeleen lähemmäs satunnaista abstraktia käyttöä missä tahansa ympäristössä, ilman että se on rajoitettu pöytämallit tai suljetut sisätilaskenaariot.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

See end of article for full video. Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 pystyy käsittelemään laajennettuja taustoja ja “äärettömiä” kohteita, kuten taivasta, koska se, toisin kuin useimmat aikaisemmat versiot, asettaa rajoja valonsäteiden tulkinnalle ja luo tarkennuksen rajoja, jotka selittävät muuten pitkät koulutusaikataulut. Katso artikkelin lopussa oleva uusi liitetty video saadaksesi lisää esimerkkejä ja laajemman katsauksen prosessiin.

Uusi julkaisu on nimeltään Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, ja sen johdossa on Google Researchin vanhempi henkilökunnan tutkimustieteilijä Jon Barron.

Jotta läpimurto olisi ymmärrettävissä, on tarpeen tuntea perusperiaatteet, joilla neuro‑säteilykenttään perustuva kuvagenerointi toimii.

Mikä on NeRF?

NeRF‑verkoston kuvaaminen “videona” on ongelmallista, sillä se on lähempänä täysin 3‑dimensiota toteutettua, mutta tekoälypohjaista virtuaaliympäristöä, jossa useita näkökulmia yhdestä valokuvasta (myös videokehys) käytetään saumattomaan kohtauksen kokoamiseen, joka teknisesti on olemassa vain koneoppimisalgoritmin latenttialueella – mutta josta voidaan halutessaan poimia poikkeuksellisen suuri määrä näkökulmia ja videoita.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Tietoa, joka on johdettu kontribuoivista valokuvista, koulutetaan matriisiin, joka muistuttaa perinteistä voxel-ruudukkoa CGI‑työnkuluissa, sillä jokaisella pisteellä 3‑dimensiosta tilassa on arvo, mikä tekee kohtauksesta navigoitavan.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: ResearchGate

Kun valokuvien välinen väli lasketaan (tarvittaessa), jokaisen mahdollisen pikselin polku kunkin kontribuoivan valokuvan osalta “säde‑jäljitetään” ja sille annetaan väriarvo, mukaan lukien läpinäkyvyysarvo (ilman sitä neuro‑matriisi olisi täysin läpinäkymätön tai täysin tyhjä).

Kuten voxel‑ruudukot, ja toisin kuin CGI‑pohjainen 3‑dimensioinen koordinaatisto, “suljetun” kohteen “sisäpuolella” ei ole olemassa NeRF‑matriisissa. Voit avata CGI‑rumpusetin ja kurkistaa sisälle, jos haluat; mutta NeRF:n näkökulmasta rumpusetin olemassaolo päättyy, kun sen pinnan läpinäkyvyysarvo on “1”.

Laajempi näkymä pikseliin

Mip-NeRF 360 on laajennus maaliskuun 2021 tutkimuksesta, joka tehokkaasti esitteli tehokkaan anti‑aliasoinnin NeRF:iin ilman laajaa supersamplausta.

NeRF laskee perinteisesti vain yhden pikselipolun, mikä johtaa usein reunaviivoihin, jotka olivat tyypillisiä varhaisten internet‑kuvaformaatin ja aikaisempien pelijärjestelmien yhteydessä. Nämä sahalaitaiset reunat ratkottiin erilaisilla menetelmillä, yleensä näytteistämällä viereisiä pikseleitä ja laskemalla keskiarvo.

Koska perinteinen NeRF näytteistää vain sen yhden pikselipolun, Mip-NeRF esitteli “kartion” kaltaisen keräysalueen, kuin leveä valojuova, joka tarjoaa riittävästi tietoa viereisistä pikseleistä taloudellisen anti‑aliasoinnin tuottamiseksi paremmalla yksityiskohdilla.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (lower image), which are further ‘blurred’ to create vague Gaussian spaces that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Parannus tavalliseen NeRF‑toteutukseen verrattuna oli merkittävä:

Mip-NeRF (right), released in maaliskuu 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (right), released in maaliskuu 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just ‘blurring’ pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

NeRF rajoittamaton

Maalis-julkaisu jätti kolme ongelmaa ratkaisematta Mip-NeRF:n käytössä rajoittamattomissa ympäristöissä, joissa voi olla hyvin kaukana olevia kohteita, kuten taivaat. Uusi julkaisu ratkaisee tämän Kalman‑tyylisellä vääristymällä Mip-NeRF‑Gaussien päälle.

Toiseksi, suuremmat kohtaukset vaativat enemmän laskentatehoa ja pidempiä koulutusaikoja, minkä Mip-NeRF 360 ratkaisee “tiivistämällä” kohtauksen geometriaa pienellä “ehdotus” monikerroksisella perceptronilla (MLP), joka ennakkoon rajoittaa suuren perinteisen NeRF‑MLP:n ennustaman geometrian. Tämä nopeuttaa koulutusta kolminkertaisesti.

Lopuksi, suuremmat kohtaukset tekevät tulkittujen geometrioiden diskretisoinnista epäselvää, mikä johtaa sellaisiin artefakteihin, joihin pelien harrastajat ovat tottuneet, kun pelin ulostulo “repeää”. Uusi julkaisu käsittelee tätä luomalla uuden regularisoijan Mip-NeRF‑säde‑väleille.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Saadaksesi lisätietoja uudesta julkaisusta, katso alla oleva video, ja myös maaliskuun 2021 videoesittely Mip-NeRF:stä. Voit myös tutustua NeRF‑tutkimukseen tarkastelemalla kattavuutta tähän mennessä.

Alun perin julkaistu 25. marraskuuta 2021

21. joulukuuta 2021, 12:25pm – Korvattu rikkinäinen video. – MA

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai