AI-mallit ja alustat

Splatter Image: Yli-nopea Yksinäkymän 3D-Rekonstruktio

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Yksinäkymän 3D-objektin rekonstruktio konvoluutioverkoilla on osoittanut merkittäviä kykyjä. Yksinäkymän 3D-rekonstruktio-mallit generoivat 3D-mallin mistä tahansa objektista käyttäen yhtä kuvaa viiteenä, mikä tekee siitä yhden kuumin tutkimusaiheita tietokoneen näön alalla.

Esimerkiksi, tarkastellaan moottoripyörää edellisessä kuvassa. Sen 3D-rakenteen generointi vaatii monimutkaisen putken, joka yhdistää vihjeitä matalatasoisista kuvista korkean tason semanttiseen tietoon ja tietoon osien rakenteellisesta järjestelystä.

Yksinäkymän 3D-rekonstruktio on ollut suuri haaste tietokoneen näön alalla. Yritettäessä parantaa yksinäkymän 3D-rekonstruktioon liittyvän tehokkuutta, kehittäjät ovat työskennelleet Splatter Image -menetelmällä, joka pyrkii saavuttamaan yli-nopean yksinäkymän 3D-muodon ja 3D-ulkönäön rakentamisen objekteille. Sen ytimessä Splatter Image -kehyksessä käytetään Gaussian Splatting -menetelmää analysoimaan 3D-esityksiä, hyödyntäen sen tarjoamaa nopeutta ja laatua.

Viime aikoina Gaussian Splatting -menetelmää on toteutettu useilla moninäkymä-rekonstruktio-malleilla varten reaaliaikaisen renderöinnin, parannetun skaalautuvuuden ja nopean koulutuksen vuoksi. Splatter Image on kuitenkin ensimmäinen kehys, joka toteuttaa Gaussian Splatting -menetelmää yksinäkymä-rekonstruktio-tehtäviin.

Tässä artikkelissa tarkastelemme, miten Splatter Image -kehyksessä käytetään Gaussian Splattingia saavuttamaan yli-nopea yksinäkymän 3D-rekonstruktio. Aloita siis.

Splatter Image: Yli-nopea Yksinäkymän 3D-Rekonstruktio

Kuten mainittiin aiemmin, Splatter Image on yli-nopea lähestymistapa yksinäkymän 3D-objektin rekonstruktioon perustuen Gaussian Splatting -menetelmään. Splatter Image on ensimmäinen tietokoneen näön kehys, joka toteuttaa Gaussian Splattingin monokulaarisen 3D-objektin generointiin, koska perinteisesti Gaussian Splatting on voimannut moninäkymä-3D-objektin rekonstruktio-kehyksiä. Kuitenkin se, mikä erottaa Splatter Image -kehyksen aiemmista menetelmistä, on se, että se on oppimiseen perustuva lähestymistapa, ja rekonstruktio testauksessa vaatii vain neuroverkon eteenpäin suuntaisen arvioinnin.

Splatter Image perustuu olennaisesti Gaussian Splattingin renderöintiominaisuuksiin ja korkeaan prosessointinopeuteen generoidakseen 3D-rekonstruktioita. Splatter Image -kehyksessä on suoraviivainen suunnittelu: kehys käyttää 2D-kuva-kuva-neuroverkkoa ennustamaan 3D-Gaussian jokaiselle syötekuvan pikselille ja kartoittaa syötekuvan yhteen 3D-Gaussianiin pikseliä kohden. Tuloksena olevat 3D-Gaussit ovat muodoltaan kuvan, jota kutsutaan Splatter Imageksi, ja Gaussit tarjoavat myös 360 asteen esityksen kuvasta. Prosessi on esitetty seuraavassa kuvassa.

Vaikka prosessi on yksinkertainen ja suoraviivainen, Splatter Image -kehyksessä on joitakin avainhaasteita, kun käytetään Gaussian Splattingia generoimaan 3D-Gaussit yksinäkymä-3D-esityksille. Ensimmäinen suuri este on suunnitella neuroverkko, joka hyväksyy objektin kuvan syötteenä ja generoi vastaavan Gaussian-seoksen, joka edustaa kaikkia kuvan puolia tulostusarvona. Tätä varten Splatter Image hyödyntää sitä, että vaikka generoitu Gaussian-seos on joukko tai järjestyksessä oleva kokoelma kohteita, se voidaan silti tallentaa järjestyksessä olevaan tietorakenteeseen. Vastaavasti kehys käyttää 2D-kuvaa 3D-Gaussien säiliönä, josta jokainen pikseli säiliössä sisältää yhden Gaussianin parametreja, mukaan lukien sen ominaisuudet kuten muoto, peittävyys ja väri.

Tallentamalla 3D-Gaussian-joukkoja kuvaan Splatter Image -kehyksessä voidaan vähentää rekonstruktio-esteitä, joita kohtaa kuvan ja kuvan neuroverkon oppimisessa. Käyttämällä tätä lähestymistapaa rekonstruktio-prosessi voidaan toteuttaa vain hyödyntämällä tehokkaita 2D-operaattoreita riippumatta 3D-operaattoreista. Lisäksi Splatter Image -kehyksessä 3D-esitys on seos 3D-Gaussit, jolloin se voi hyödyntää Gaussian Splattingin tarjoamaa renderöintinopeuden ja muistin tehokkuuden etuja, jotka parantavat tehokkuutta sekä koulutuksessa että päättelyssä. Jatkamalla Splatter Image -kehyksessä voidaan generoida sekä yksinäkymä-3D-esityksiä että se voi osoittaa merkittävää tehokkuutta, sillä se voidaan kouluttaa jopa yhdellä GPU:lla standardi-3D-objektin benchmarkkeja vasten. Lisäksi Splatter Image -kehyksessä voidaan laajentaa useiden kuvien syötteenä. Se voidaan toteuttaa rekisteröimällä yksittäiset Gaussian-seokset yhteiseen viiteen ja ottamalla yhdistelmä Gaussian-seoksia, jotka ennustetaan yksittäisistä näkymistä. Kehyksessä voidaan myös injektoida kevyet ristiriitaiset kerrokset arkkitehtuuriin, jolloin eri näkymät voivat viestiä toistensa kanssa ennustettaessa.

Empiirisestä näkökulmasta on huomionarvoista, että Splatter Image -kehyksessä voidaan tuottaa 360 asteen rekonstruktio objektista, vaikka se näkee vain yhden puolen objektista. Kehys sijoittaa eri Gaussit 2D-naapuruuteen eri osiin 3D-objektista koodataksesi generoidun 360 asteen tiedon 2D-kuvassa. Lisäksi kehys asettaa useiden Gaussien peittävyyden nollaksi, mikä deaktivoi ne, jolloin ne voidaan poistaa jälkikäsittelyssä.

Yhteenvetona Splatter Image -kehyksessä on

  1. Uusi lähestymistapa generoida yksinäkymä-3D-objektin rekonstruktioita siirtämällä Gaussian Splatting -lähestymistapaa.
  2. Laajentaa menetelmää moninäkymä-3D-objektin rekonstruktioon.
  3. Saavuttaa huipputason 3D-objektin rekonstruktio-suorituskyvyn standardibenchmarkkeja vasten poikkeuksellisen nopeuden ja laadun kanssa.

Splatter Image: Menetelmä ja Arkkitehtuuri

Gaussian Splatting

Kuten mainittiin aiemmin, Gaussian Splatting on ensisijainen menetelmä, jota Splatter Image -kehyksessä käytetään generoimaan yksinäkymä-3D-objektin rekonstruktioita. Yksinkertaisesti sanottuna Gaussian Splatting on rasterointimenetelmä 3D-kuvien rekonstruktioon ja reaaliaikaisen renderöinnin, ja se renderöi kuvia, joilla on useita näkymän pisteitä. 3D-avaruus kuvassa viittaa Gaussit, ja koneoppimismenetelmiä käytetään oppimaan kunkin Gaussian parametreja. Gaussian Splatting ei vaadi koulutusta renderöintivaiheessa, mikä mahdollistaa nopeamman renderöintiajan. Seuraava kuva yhteenvetää 3D-Gaussian Splattingin arkkitehtuurin.

3D-Gaussian Splatting käyttää syötekuvaan perustuen generoimaan pilvipallon. Gaussian Splatting käyttää syötekuvaan arvioidakseen kameran ulkoiset parametreja, kuten kallistusta ja sijaintia, vastaamalla kuvien välisiä pikseleitä, ja nämä parametreja käytetään laskemaan pilvipallon. Käyttämällä erilaisia koneoppimismenetelmiä Gaussian Splatting optimoi neljä parametria kullekin Gaussianille: Sijainti (missä se sijaitsee), Kovarianssi (sen venymisen tai skaalautumisen laajuus 3×3-matriisissa), Väri (mitä on RGB-väri) ja Alfa (miten läpinäkyvä se on). Optimointiprosessi renderöi kuvan kameran sijainnista ja käyttää sitä määrittämään parametreja, jotka ovat lähempänä alkuperäistä kuvaa. Tuloksena oleva 3D-Gaussian Splattingin tuloste on kuva, jota kutsutaan Splatter Imageksi, joka muistuttaa eniten alkuperäistä kuvaa, josta se otettiin.

Lisäksi Gaussian Splattingin läpinäisyysfunktio ja väri-funktio antavat säteilykentän 3D-pisteen näkymäsuunnasta. Kehys renderöi säteilykentän kuvaksi integroimalla värejä, jotka havaitaan säteen pituudella, joka kulkee pikselin läpi. Gaussian Splatting edustaa nämä funktiot värillisten Gaussien yhdistelmänä, jossa Gaussian keskiarvo tai keskipiste sekä Gaussian kovarianssi auttavat määrittämään sen muodon ja koon. Jokaisella Gaussianilla on myös läpinäisyysominaisuus ja näkymäriippuvainen väriominaisuus, jotka yhdessä määrittävät säteilykentän.

Splatter Image

Renderöintikomponentti kartoittaa 3D-Gaussien joukon kuvaksi. Suorittaakseen yksinäkymä-3D-rekonstruktioita kehys etsii käänteisfunktion 3D-Gaussille, joka rekonstruoii 3D-Gaussien seoksen kuvasta. Avainasia on ehdottaa tehokas ja yksinkertainen suunnittelu käänteisfunktiolle. Nimenomaan syötekuvan kohdalla kehys ennustaa Gaussianin jokaiselle yksittäiselle pikselille käyttäen kuva-kuva-neuroverkkorakennetta tulostaakseen kuvan, Splatter Image. Verkko ennustaa myös muodon, läpinäisyyden ja värin.

Nyt voi spekuloida, miten Splatter Image -kehyksessä voidaan rekonstruktio 3D-esitystä objektista, vaikka se pääsee käsiksi vain yhteen sen näkymään? Reaaliajassa Splatter Image -kehyksessä opitaan käyttämään joitakin Gaussit rekonstruktioon ja käyttämään loput Gaussit automaattisesti näkemättömien osien rekonstruktioon. Maksimoidakseen tehokkuutensa kehys voi automaattisesti sammuttaa Gaussit ennustamalla, onko läpinäisyys nolla. Jos läpinäisyys on nolla, Gaussit sammutetaan, eikä kehys renderöi näitä pisteitä, vaan ne poistetaan jälkikäsittelyssä.

Kuvan Taso Laskenta

Gaussian Splatting -menetelmän nopeuden ja tehokkuuden hyödyntämisestä on suuri etu, että kehyksessä voidaan renderöidä kaikki kuvat jokaisessa iteraatiossa, jopa suuremmilla eräkoolla. Tämä tarkoittaa myös, että kehys voi käyttää hajottuvia menetelmiä ja kuvan tasolla laskentoja, jotka eivät hajoa menetelmiin pikselikohtaisesti.

MITAN Normalisointi

On haastavaa arvioida objektin kokoa yhdestä näkymästä, ja se on haasteellinen tehtävä ratkaista epäselvyyttä, kun se koulutetaan menetelmällä. Sama ongelma ei havaita syntetisissä tietokannoissa, koska kaikki objektit renderöidään samalla kameran sisäisillä ja objektit ovat kiinteällä etäisyydellä kamerasta, mikä lopulta auttaa ratkaisemaan epäselvyyttä. Kuitenkin kuvissa, jotka ovat peräisin todellisista kuvista, epäselvyyttä on havaittavissa, ja Splatter Image -kehyksessä käytetään useita esikäsittelymenetelmiä määrittämään objektien koon.

Näkymäriippuvainen Väri

Edustamaan näkymäriippuvaisia värejä Splatter Image -kehyksessä käytetään sfäärin harmonisia yleistämään värejä Lambertin värimallin ulkopuolelle. Kunkin Gaussian kohdalla malli määrittää kertoimet, jotka verkko ennustaa ja sfäärin harmoniset. Näkymän muutos muuttaa näkymäsuunnan kameran lähteestä sen viitekehykseen. Malli löytää vastaavat kertoimet määrittämään muunnetun väri-funktion. Malli pystyy tähän, koska sfäärin harmoniset ovat suljettuja, kuten kaikki muutkin.

Neuroverkkorakenne

Suurin osa ennustusfunktion arkkitehtuurista, joka kartoittaa syötekuvan Gaussian-seokseksi, on identtinen prosessiin, jota käytetään SongUNet-kehyksessä. Viimeinen kerros arkkitehtuurissa on korvattu 1×1 konvoluutio-kerroksella, jonka värimalli määrittää tulostuskanavien leveyden. Annettaessa syötekuvaa, verkko tuottaa tulostuskanavien tenoria tuloksena, ja kunkin pikselikanavan koodaa parametreja, jotka muunnetaan siirtymäksi, läpinäisyydeksi, rotaatioksi, syvyydeksi ja väriryhmäksi. Kehys käyttää epälineaarisia funktioita aktivoimaan parametreja ja saamaan Gaussian-parametrit.

Rekonstruoitaessa 3D-esityksiä moninäkymästä Splatter Image -kehyksessä sovelletaan samaa verkkoa kuhunkin syötekuvan näkymään ja käytetään näkymän lähestymistapaa yhdistämään yksittäiset rekonstruktioit. Lisäksi kehys tekee kaksi muutosta verkossa mahdollistaakseen tehokkaan koordinoinnin ja tiedonvaihdon näkymien välillä. Ensinnäkin kehys ehdollistaa mallin kameran asennolla ja koodaa kunkin kirjaimen sinusoidaalisella sijaintitunnisteella useisiin ulottuvuuksiin. Toiseksi kehys lisää ristiriitaiset kerrokset mahdollistaakseen viestinnän eri näkymien ominaisuuksien välillä.

Splatter Image: Kokeet ja Tulokset

Splatter Image -kehyksessä mitataan rekonstruktioitten laatu arvioimalla uuden näkymän synteesin laatua, koska kehys käyttää lähdennäkymää ja renderöi 3D-muodon kohdistamattomiin näkymiin rekonstruktioita varten. Kehys arvioi suorituskykyään mittaamalla SSIM (Structural Similarity), PSNR (Peak Signal to Noise Ratio) ja LPIPS (Perceptual Quality) -arvoja.

Yksinäkymä-3D-Rekonstruktio Suorituskyky

Seuraava taulukko osoittaa Splatter Image -mallin suorituskyvyn yksinäkymä-3D-rekonstruktio-tehtävässä ShapeNet-benchmarkissa.

Kuten voidaan havaita, Splatter Image -kehyksessä ylittää kaikki deterministiset rekonstruktio-menetelmät LPIPS- ja SSIM-pisteissä. Pisteet osoittavat, että Splatter Image -malli generoi kuvia, joilla on terävämmät rekonstruktioit. Lisäksi Splatter Image -malli ylittää myös kaikki deterministiset vertailumallit PSNR-pisteissä, mikä osoittaa, että generoidut rekonstruktioit ovat myös tarkin. Lisäksi ylittäessään kaikki deterministiset menetelmät Splatter Image -kehyksessä vaatii vain suhteellisia kameran asentoja parantamaan tehokkuutta sekä koulutuksessa että testauksessa.

Seuraava kuva osoittaa Splatter Image -kehyksen laadullisen kyvyn, ja kuten voidaan havaita, malli generoi rekonstruktioita, joilla on ohuet ja mielenkiintoiset geometriat, ja se sieppaa ehdotusnäkymien yksityiskohdat.

Seuraava kuva osoittaa, että Splatter Image -kehyksen rekonstruktio on terävämpi ja tarkin kuin aiemmat mallit, erityisesti epätyypillisissä olosuhteissa, joissa on ohuita rakenteita ja rajoitettu näkyvyys.

Moninäkymä-3D-Rekonstruktio

Arvioimaan moninäkymä-3D-rekonstruktio-kykyjään Splatter Image -kehyksessä koulutetaan SpaneNet-SRN Cars -tietokannassa kahden näkymän ennustamiseksi. Olemassa olevat menetelmät käyttävät absoluuttista kameran asennon ehdollistamista moninäkymä-3D-rekonstruktio-tehtävissä, mikä tarkoittaa, että malli oppii luottamaan ennen kaikkea objektin kanoniseen suuntautumiseen objektissa. Vaikka se tekee työn, se rajoittaa mallien soveltamista, koska absoluuttinen kameran asento on usein tuntematon uudelle objektin kuvalle.

Lopputajat

Tässä artikkelissa olemme puhuneet Splatter Image -menetelmästä, joka pyrkii saavuttamaan yli-nopean yksinäkymän 3D-muodon ja 3D-ulkönäön rakentamisen objekteille. Sen ytimessä Splatter Image -kehyksessä käytetään Gaussian Splatting -menetelmää analysoimaan 3D-esityksiä, hyödyntäen sen tarjoamaa nopeutta ja laatua. Splatter Image -kehyksessä prosessoidaan kuvia käyttäen valmiita 2D-CNN-arkkitehtuureja ennustamaan pseudo-kuvaa, joka sisältää yhden värillisen Gaussianin jokaiselle pikselille. Käyttämällä Gaussian Splatting -menetelmää Splatter Image -kehyksessä voidaan yhdistää nopea renderöinti nopeaan päättelyyn, mikä johtaa nopeaan koulutukseen ja nopeampaan arviointiin sekä todellisissa että syntetisissä benchmarkkeissa.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.