AI-modeller og plattformer
Splatter Image: Ultra-rask enkeltvisnings 3D-rekonstruksjon
Enkeltvisnings 3D-objekt rekonstruksjon med konvolusjonsnetverk har vist bemerkelsesverdige evner. Enkeltvisnings 3D-rekonstruksjonsmodeller genererer 3D-modellen av et hvilket som helst objekt ved å bruke ett enkelt bilde som referansen, og gjør det til ett av de heteste forskningsemnene i datavisjon.

For eksempel, la oss betrakte motorsykkelen i bildet ovenfor. Generering av dens 3D-struktur krever en kompleks pipeline som først kombinerer hint fra lav-nivå bilder med høy-nivå semantisk informasjon, og kunnskap om den strukturelle arrangementen av deler.
På grunn av den komplekse prosessen, har enkeltvisnings 3D-rekonstruksjon vært en stor utfordring i datavisjon. I et forsøk på å forbedre effektiviteten av enkeltvisnings 3D-rekonstruksjon, har utviklere arbeidet med Splatter Image, en metode som har som mål å oppnå ultra-rask enkeltvisnings 3D-form og 3D-utseende konstruksjon av objekter. I kjernen av Splatter Image-rammen, brukes Gaussian Splatting-metoden til å analysere 3D-representasjoner, og utnytte hastigheten og kvaliteten den tilbyr.
Nylig har Gaussian Splatting-metoden blitt implementert av flere multi-visnings rekonstruksjonsmodeller for sanntids-rendering, forbedret skalerbarhet og rask trening. Med det sagt, er Splatter Image den første rammen som implementerer Gaussian Splatting-metoden for enkeltvisnings rekonstruksjonsoppgaver.
I denne artikkelen, vil vi utforske hvordan Splatter Image-rammen bruker Gaussian Splatting for å oppnå ultra-rask enkeltvisnings 3D-rekonstruksjon. La oss begynne.
Splatter Image: Et forsøk på ultra-rask enkeltvisnings 3D-rekonstruksjon
Som nevnt tidligere, er Splatter Image en ultra-rask tilnærming for enkeltvisnings 3D-objekt rekonstruksjon basert på Gaussian Splatting-metoden. Splatter Image er den første datavisjonsrammen som implementerer Gaussian Splatting for monokulær 3D-objektgenerering, siden tradisjonelt har Gaussian Splatting vært en del av multi-visnings 3D-objekt rekonstruksjonsrammer. Imidlertid, hva skiller Splatter Image-rammen fra tidligere metoder, er at det er en læring-basert tilnærming, og rekonstruksjon i testing krever bare feed-forward evaluering av neuralt nettverk.
Splatter Image-rammen er avhengig av Gaussian Splatting sine rendering-egenskaper, og høy prosesseringshastighet for å generere 3D-rekonstruksjoner. Splatter Image-rammen har en enkel design: rammen bruker et 2D-bilde-til-bilde neuralt nettverk for å forutsi et 3D-Gaussian per inngangsbilde-piksel, og kartlegger inngangsbildet til ett 3D-Gaussian per piksel. De resulterende 3D-Gaussians har formen av et bilde, kjent som Splatter Image, og disse Gaussians gir også 360 graders representasjon av bildet. Prosessen demonstreres i følgende bilde.

Selv om prosessen er enkel og rett frem, er det noen nøkkelutfordringer som Splatter Image-rammen møter når den bruker Gaussian Splatting for å generere 3D-Gaussians for enkeltvisnings 3D-representasjoner. Den første store hindringen er å designe et neuralt nettverk som aksepterer bildet av et objekt som inngang, og genererer en tilsvarende Gaussian-blandning som representerer alle sider av bildet som utgang. For å takle dette, tar Splatter Image-rammen i bruk det faktum at selv om den genererte Gaussian-blandingen er en samling eller en usortert samling av elementer, kan den likevel lagres i en ordnet datastruktur. Derfor bruker rammen et 2D-bilde som en container for 3D-Gaussians, som et resultat av at hver piksel i containeren inneholder parameterne for en Gaussian, inkludert egenskaper som form, dekkning, og farge.
Ved å lagre 3D-Gaussian-samlinger i et bilde, er Splatter Image-rammen i stand til å redusere rekonstruksjons-hindringene som møtes når man lærer et bilde-til-bilde neuralt nettverk. Ved å bruke denne tilnærmingen, kan rekonstruksjonsprosessen implementeres bare ved å bruke effektive 2D-operatører i stedet for å avhenge av 3D-operatører. Videre, i Splatter Image-rammen, er 3D-representasjonen en blandning av 3D-Gaussians, som gjør det mulig å utnytte rendering-hastigheten og minnehastigheten som tilbys av Gaussian Splatting, som forbedrer effektiviteten i både trening og inferens.
Fra et empirisk synspunkt, er det verdt å merke seg at Splatter Image-rammen kan produsere 360 graders rekonstruksjon av objektet, selv om det bare ser en side av objektet. Rammen tildeler da forskjellige Gaussians i en 2D-nabolag til forskjellige deler av 3D-objektet for å kode den genererte 360 graders informasjonen i 2D-bildet. Videre setter rammen dekningseffekten for flere Gaussians til null, som deaktiverer dem, og tillater dem å bli fjernet under etterbehandling.
For å sammenfatte, er Splatter Image-rammen
- En ny tilnærming for å generere enkeltvisnings 3D-objekt rekonstruksjoner ved å bruke Gaussian Splatting-metoden.
- Utvider metoden for multi-visnings 3D-objekt rekonstruksjon.
- Oppnår statisk 3D-objekt rekonstruksjons-ytelse på standard-benchmark med unik hastighet og kvalitet.
Splatter Image: Metodologi og Arkitektur
Gaussian Splatting
Som nevnt tidligere, er Gaussian Splatting den primære metoden som implementeres av Splatter Image-rammen for å generere enkeltvisnings 3D-objekt rekonstruksjoner. I enkle termer, er Gaussian Splatting en rasterisering-metode for å rekonstruere 3D-bilder og sanntids-rendering av bilder med flere visninger. 3D-rommet i bildet kalles Gaussians, og maskinlærings-teknikker implementeres for å lære parameterne for hver Gaussian. Gaussian Splatting krever ikke trening under rendering, noe som muliggjør raskere rendering-tider. Følgende bilde summerer arkitekturen for 3D-Gaussian Splatting.

3D-Gaussian Splatting bruker først en samling av inngangsbilder for å generere en punktsky. Gaussian Splatting bruker deretter inngangsbildene for å estimere de eksterne parameterne for kameraet, som inkluderer vinkel og posisjon, ved å matche pikslene mellom bildene, og disse parameterne brukes deretter til å beregne punktskyen. Ved å bruke ulike maskinlærings-metoder, optimerer Gaussian Splatting deretter fire parametre for hver Gaussian, nemlig: Posisjon (hvor er det plassert), Kovarians (utstrekningen av dens strekning eller skaleringsmatrise), Farge (hva er RGB-fargeskjemaet), og Alfa (måling av gjennomsiktighet). Optimeringsprosessen renderer bildet for hver kamera-posisjon og bruker det til å bestemme parameterne nærmere det opprinnelige bildet. Som et resultat, er det resulterende 3D-Gaussian Splatting-utgangen et bilde, kjent som Splatter Image, som ligner det opprinnelige bildet mest ved kamera-posisjonen fra hvilken det ble tatt.

Videre, gir dekningseffekten og fargefunksjonen i Gaussian Splatting en strålingsfelt med visningsretningen av 3D-punktet. Rammen renderer deretter strålingsfeltet på et bilde ved å integrere fargene observert langs strålen som passerer gjennom pikselen. Gaussian Splatting representerer disse funksjonene som en kombinasjon av fargede Gaussians, hvor Gaussian-gjennomsnittet eller sentrum, sammen med Gaussian-kovariansen, hjelper til å bestemme dens form og størrelse. Hver Gaussian har også en dekningseffekt og en visnings-avhengig farge-egenskap som sammen definerer strålingsfeltet.
Splatter Image
Renderer-komponenten kartlegger en samling av 3D-Gaussians til et bilde. For å utføre enkeltvisnings 3D-rekonstruksjon, søker rammen deretter etter en invers funksjon for 3D-Gaussians som rekonstruerer blandingen av 3D-Gaussians fra et bilde. Den nøkkelaktige inklusjonen her er å foreslå en effektiv, men enkel design for den inverse funksjonen. Spesifikt, for et inngangsbilde, forutsier nettverket en Gaussian for hver enkelt piksel ved å bruke et bilde-til-bilde neuralt nettverks-arkitektur for å produsere et bilde, Splatter Image. Nettverket forutsier også formen, dekningseffekten og fargen.
Nå, kan det spekuleres om hvordan Splatter Image-rammen kan rekonstruere 3D-representasjonen av et objekt, selv om det bare har tilgang til en av dens visninger? I sanntid, lærer Splatter Image-rammen å bruke noen av de tilgjengelige Gaussians til å rekonstruere visningen, og bruker de resterende Gaussians til å automatisk rekonstruere usette deler av bildet. For å maksimere sin effektivitet, kan rammen automatisk slå av noen Gaussians ved å forutsi om dekningseffekten er null. Hvis dekningseffekten er null, slås Gaussians av, og rammen renderer ikke disse punktene, men fjerner dem i stedet under etterbehandling.
Bilde-nivå Tap
En stor fordel med å utnytte hastigheten og effektiviteten som tilbys av Gaussian Splatting-metoden, er at det muliggjør rammen å rendre alle bildene ved hver iterasjon, selv for batcher med relativt større batch-størrelse. Videre, impliserer det at rammen ikke bare kan bruke dekomponerbare tap, men også bilde-nivå tap som ikke dekomponerer seg i tap per piksel.
Skala-normalisering
Det er utfordrende å estimere størrelsen på et objekt ved å se på en enkelt visning, og det er en utfordrende oppgave å løse denne usikkerheten når det er trent med et tap. Den samme problematikken observeres ikke i syntetiske datasamlinger, da alle objektene renderes med identiske kamera-intrinsikker og objektene er på en fast avstand fra kameraet, noe som til slutt hjelper til å løse usikkerheten. Imidlertid, i datasamlinger med virkelige bilder, er usikkerheten ganske tydelig, og Splatter Image-rammen bruker flere forbehandlingsmetoder for å omtrentlig fikse skalaen på alle objekter.
Visnings-avhengig Farge
For å representere visnings-avhengige farger, bruker Splatter Image-rammen sfærisk harmoni for å generalisere fargene beyond Lambertisk farge-modell. For hver enkelt Gaussian, definerer modellen koeffisienter som forutsies av nettverket og sfærisk harmoni. Visningsretningen endrer en visningsretning i kamera-kilden til dens tilsvarende visningsretning i ramme-referansen. Modellen finner deretter de tilsvarende koeffisientene for å finne den transformerte farge-funksjonen. Modellen kan gjøre dette fordi sfærisk harmoni er lukket under rotasjon, sammen med hver andre orden.
Neuralt Nettverks-Arkitektur
En majoritet av arkitekturen til prediktor-mappingen som kartlegger inngangsbildet til en kombinasjon av Gaussian, er identisk med prosessen brukt i SongUNet-rammen. Den siste laget i arkitekturen erstattes av et 1×1 konvolusjonslag med farge-modellen som bestemmer bredden på utgangs-kanalene. Gitt inngangsbildet, produserer nettverket en utgangs-kanal-tensor som utgang, og for hver piksel-kanal, koder parameterne som deretter transformeres til offset, dekningseffekt, rotasjon, dybde og farge. Rammen bruker deretter ikke-lineære funksjoner for å aktivere parameterne og oppnå Gaussian-parameterne.
For å rekonstruere 3D-representasjoner med multi-visning, bruker Splatter Image-rammen samme nettverk til hver enkelt inngang-visning, og deretter bruker visnings-tilnærmingen til å kombinere de enkelte rekonstruksjonene. Videre, for å muliggjøre effektiv koordinasjon og utveksling av informasjon mellom visningene i nettverket, gjør Splatter Image-rammen to modifikasjoner i nettverket. Først, betingelsen modellen med dens respektive kamera-pose, og passer vektorer ved å kode hver inngang ved å bruke en sinusoid posisjons-embedding, noe som resulterer i flere dimensjoner. Andre, legger rammen til cross-attention-lag for å muliggjøre kommunikasjon mellom funksjonene til forskjellige visninger.
Splatter Image: Eksperimenter og Resultater
Splatter Image-rammen måler kvaliteten på sine rekonstruksjoner ved å evaluere Ny Visnings-Syntese-kvaliteten, siden rammen bruker kilde-visningen og renderer 3D-formen til mål-usette visninger for å utføre rekonstruksjoner. Rammen evaluerer sin ytelse ved å måle SSIM eller Strukturell Likhet, Peak Signal til Støy-forhold eller PSNR, og Perseptuell Kvalitet eller LPIPS-poeng.
Enkeltvisnings 3D-Rekonstruksjons-Ytelse
Følgende tabell demonstrerer ytelsen til Splatter Image-modellen i enkeltvisnings 3D-rekonstruksjons-oppgaven på ShapeNet-benchmarken.

Som det kan observeres, overgår Splatter Image-rammen alle deterministiske rekonstruksjonsmetoder over LPIPS- og SSIM-poeng. Poengene indikerer at Splatter Image-modellen genererer bilder med skarpere rekonstruksjoner. Videre, overgår Splatter Image-modellen også alle deterministiske baseline i forhold til PSNR-poeng, noe som indikerer at de genererte rekonstruksjonene er mer nøyaktige. Videre, i tillegg til å overgå alle deterministiske metoder, krever Splatter Image-rammen bare relative kamera-poser for å forbedre sin effektivitet i både trening- og testing-faser.
Følgende bilde demonstrerer den kvalitative dyktigheten til Splatter Image-rammen, og som det kan sees, genererer modellen rekonstruksjoner med tynne og interessante geometrier, og fanger detaljene til kondisjons-visningene.

Følgende bilde viser at rekonstruksjonene generert av Splatter Image-rammen ikke bare er skarpere, men også mer nøyaktige enn tidligere modeller, spesielt i uvanlige forhold med tynne strukturer og begrensede visninger.

Multi-Visnings 3D-Rekonstruksjon
For å evaluere sin multi-visnings 3D-rekonstruksjons-evne, er Splatter Image-rammen trent på SpaneNet-SRN Cars-datasettet for to-visnings-prediksjoner. Eksisterende metoder bruker absolutt kamera-pose-betingelse for multi-visnings 3D-rekonstruksjons-oppgaver, noe som betyr at modellen lærer å avhenge primært av objektets kanoniske orientering i objektet. Selv om det gjør jobben, begrenser det anvendeligheten av modellene, da den absolutte kamera-posisjonen ofte er ukjent for et nytt bilde av et objekt.

Slutt-tanker
I denne artikkelen, har vi talt om Splatter Image, en metode som har som mål å oppnå ultra-rask enkeltvisnings 3D-form og 3D-utseende konstruksjon av objekter. I kjernen av Splatter Image-rammen, brukes Gaussian Splatting-metoden til å analysere 3D-representasjoner, og utnytte hastigheten og kvaliteten den tilbyr. Splatter Image-rammen prosesserer bilder ved å bruke en standard 2D-CNN-arkitektur for å forutsi et pseudo-bilde som inneholder ett farget Gaussian per hver piksel. Ved å bruke Gaussian Splatting-metoden, er Splatter Image-rammen i stand til å kombinere rask rendering med rask inferens, noe som resulterer i rask trening og raskere evaluering på virkelige og syntetiske benchmark.












