AI-modeller og plattformer

Splatter Image: Ultra-rask enkeltvisnings 3D-rekonstruksjon

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Enkeltvisnings 3D-objekt rekonstruksjon med konvolusjonsnetverk har vist bemerkelsesverdige evner. Enkeltvisnings 3D-rekonstruksjonsmodeller genererer 3D-modellen av et hvilket som helst objekt ved å bruke ett enkelt bilde som referansen, og gjør det til ett av de heteste forskningsemnene i datavisjon. 

For eksempel, la oss betrakte motorsykkelen i bildet ovenfor. Generering av dens 3D-struktur krever en kompleks pipeline som først kombinerer hint fra lav-nivå bilder med høy-nivå semantisk informasjon, og kunnskap om den strukturelle arrangementen av deler. 

På grunn av den komplekse prosessen, har enkeltvisnings 3D-rekonstruksjon vært en stor utfordring i datavisjon. I et forsøk på å forbedre effektiviteten av enkeltvisnings 3D-rekonstruksjon, har utviklere arbeidet med Splatter Image, en metode som har som mål å oppnå ultra-rask enkeltvisnings 3D-form og 3D-utseende konstruksjon av objekter. I kjernen av Splatter Image-rammen, brukes Gaussian Splatting-metoden til å analysere 3D-representasjoner, og utnytte hastigheten og kvaliteten den tilbyr. 

Nylig har Gaussian Splatting-metoden blitt implementert av flere multi-visnings rekonstruksjonsmodeller for sanntids-rendering, forbedret skalerbarhet og rask trening. Med det sagt, er Splatter Image den første rammen som implementerer Gaussian Splatting-metoden for enkeltvisnings rekonstruksjonsoppgaver. 

I denne artikkelen, vil vi utforske hvordan Splatter Image-rammen bruker Gaussian Splatting for å oppnå ultra-rask enkeltvisnings 3D-rekonstruksjon. La oss begynne. 

Splatter Image: Et forsøk på ultra-rask enkeltvisnings 3D-rekonstruksjon

Som nevnt tidligere, er Splatter Image en ultra-rask tilnærming for enkeltvisnings 3D-objekt rekonstruksjon basert på Gaussian Splatting-metoden. Splatter Image er den første datavisjonsrammen som implementerer Gaussian Splatting for monokulær 3D-objektgenerering, siden tradisjonelt har Gaussian Splatting vært en del av multi-visnings 3D-objekt rekonstruksjonsrammer. Imidlertid, hva skiller Splatter Image-rammen fra tidligere metoder, er at det er en læring-basert tilnærming, og rekonstruksjon i testing krever bare feed-forward evaluering av neuralt nettverk. 

Splatter Image-rammen er avhengig av Gaussian Splatting sine rendering-egenskaper, og høy prosesseringshastighet for å generere 3D-rekonstruksjoner. Splatter Image-rammen har en enkel design: rammen bruker et 2D-bilde-til-bilde neuralt nettverk for å forutsi et 3D-Gaussian per inngangsbilde-piksel, og kartlegger inngangsbildet til ett 3D-Gaussian per piksel. De resulterende 3D-Gaussians har formen av et bilde, kjent som Splatter Image, og disse Gaussians gir også 360 graders representasjon av bildet. Prosessen demonstreres i følgende bilde. 

Selv om prosessen er enkel og rett frem, er det noen nøkkelutfordringer som Splatter Image-rammen møter når den bruker Gaussian Splatting for å generere 3D-Gaussians for enkeltvisnings 3D-representasjoner. Den første store hindringen er å designe et neuralt nettverk som aksepterer bildet av et objekt som inngang, og genererer en tilsvarende Gaussian-blandning som representerer alle sider av bildet som utgang. For å takle dette, tar Splatter Image-rammen i bruk det faktum at selv om den genererte Gaussian-blandingen er en samling eller en usortert samling av elementer, kan den likevel lagres i en ordnet datastruktur. Derfor bruker rammen et 2D-bilde som en container for 3D-Gaussians, som et resultat av at hver piksel i containeren inneholder parameterne for en Gaussian, inkludert egenskaper som form, dekkning, og farge. 

Ved å lagre 3D-Gaussian-samlinger i et bilde, er Splatter Image-rammen i stand til å redusere rekonstruksjons-hindringene som møtes når man lærer et bilde-til-bilde neuralt nettverk. Ved å bruke denne tilnærmingen, kan rekonstruksjonsprosessen implementeres bare ved å bruke effektive 2D-operatører i stedet for å avhenge av 3D-operatører. Videre, i Splatter Image-rammen, er 3D-representasjonen en blandning av 3D-Gaussians, som gjør det mulig å utnytte rendering-hastigheten og minnehastigheten som tilbys av Gaussian Splatting, som forbedrer effektiviteten i både trening og inferens. 

Fra et empirisk synspunkt, er det verdt å merke seg at Splatter Image-rammen kan produsere 360 graders rekonstruksjon av objektet, selv om det bare ser en side av objektet. Rammen tildeler da forskjellige Gaussians i en 2D-nabolag til forskjellige deler av 3D-objektet for å kode den genererte 360 graders informasjonen i 2D-bildet. Videre setter rammen dekningseffekten for flere Gaussians til null, som deaktiverer dem, og tillater dem å bli fjernet under etterbehandling. 

For å sammenfatte, er Splatter Image-rammen

  1. En ny tilnærming for å generere enkeltvisnings 3D-objekt rekonstruksjoner ved å bruke Gaussian Splatting-metoden. 
  2. Utvider metoden for multi-visnings 3D-objekt rekonstruksjon. 
  3. Oppnår statisk 3D-objekt rekonstruksjons-ytelse på standard-benchmark med unik hastighet og kvalitet. 

Splatter Image: Metodologi og Arkitektur

Gaussian Splatting

Som nevnt tidligere, er Gaussian Splatting den primære metoden som implementeres av Splatter Image-rammen for å generere enkeltvisnings 3D-objekt rekonstruksjoner. I enkle termer, er Gaussian Splatting en rasterisering-metode for å rekonstruere 3D-bilder og sanntids-rendering av bilder med flere visninger. 3D-rommet i bildet kalles Gaussians, og maskinlærings-teknikker implementeres for å lære parameterne for hver Gaussian. Gaussian Splatting krever ikke trening under rendering, noe som muliggjør raskere rendering-tider. Følgende bilde summerer arkitekturen for 3D-Gaussian Splatting. 

3D-Gaussian Splatting bruker først en samling av inngangsbilder for å generere en punktsky. Gaussian Splatting bruker deretter inngangsbildene for å estimere de eksterne parameterne for kameraet, som inkluderer vinkel og posisjon, ved å matche pikslene mellom bildene, og disse parameterne brukes deretter til å beregne punktskyen. Ved å bruke ulike maskinlærings-metoder, optimerer Gaussian Splatting deretter fire parametre for hver Gaussian, nemlig: Posisjon (hvor er det plassert), Kovarians (utstrekningen av dens strekning eller skaleringsmatrise), Farge (hva er RGB-fargeskjemaet), og Alfa (måling av gjennomsiktighet). Optimeringsprosessen renderer bildet for hver kamera-posisjon og bruker det til å bestemme parameterne nærmere det opprinnelige bildet. Som et resultat, er det resulterende 3D-Gaussian Splatting-utgangen et bilde, kjent som Splatter Image, som ligner det opprinnelige bildet mest ved kamera-posisjonen fra hvilken det ble tatt. 

Videre, gir dekningseffekten og fargefunksjonen i Gaussian Splatting en strålingsfelt med visningsretningen av 3D-punktet. Rammen renderer deretter strålingsfeltet på et bilde ved å integrere fargene observert langs strålen som passerer gjennom pikselen. Gaussian Splatting representerer disse funksjonene som en kombinasjon av fargede Gaussians, hvor Gaussian-gjennomsnittet eller sentrum, sammen med Gaussian-kovariansen, hjelper til å bestemme dens form og størrelse. Hver Gaussian har også en dekningseffekt og en visnings-avhengig farge-egenskap som sammen definerer strålingsfeltet. 

Splatter Image

Renderer-komponenten kartlegger en samling av 3D-Gaussians til et bilde. For å utføre enkeltvisnings 3D-rekonstruksjon, søker rammen deretter etter en invers funksjon for 3D-Gaussians som rekonstruerer blandingen av 3D-Gaussians fra et bilde. Den nøkkelaktige inklusjonen her er å foreslå en effektiv, men enkel design for den inverse funksjonen. Spesifikt, for et inngangsbilde, forutsier nettverket en Gaussian for hver enkelt piksel ved å bruke et bilde-til-bilde neuralt nettverks-arkitektur for å produsere et bilde, Splatter Image. Nettverket forutsier også formen, dekningseffekten og fargen. 

Nå, kan det spekuleres om hvordan Splatter Image-rammen kan rekonstruere 3D-representasjonen av et objekt, selv om det bare har tilgang til en av dens visninger? I sanntid, lærer Splatter Image-rammen å bruke noen av de tilgjengelige Gaussians til å rekonstruere visningen, og bruker de resterende Gaussians til å automatisk rekonstruere usette deler av bildet. For å maksimere sin effektivitet, kan rammen automatisk slå av noen Gaussians ved å forutsi om dekningseffekten er null. Hvis dekningseffekten er null, slås Gaussians av, og rammen renderer ikke disse punktene, men fjerner dem i stedet under etterbehandling. 

Bilde-nivå Tap

En stor fordel med å utnytte hastigheten og effektiviteten som tilbys av Gaussian Splatting-metoden, er at det muliggjør rammen å rendre alle bildene ved hver iterasjon, selv for batcher med relativt større batch-størrelse. Videre, impliserer det at rammen ikke bare kan bruke dekomponerbare tap, men også bilde-nivå tap som ikke dekomponerer seg i tap per piksel. 

Skala-normalisering

Det er utfordrende å estimere størrelsen på et objekt ved å se på en enkelt visning, og det er en utfordrende oppgave å løse denne usikkerheten når det er trent med et tap. Den samme problematikken observeres ikke i syntetiske datasamlinger, da alle objektene renderes med identiske kamera-intrinsikker og objektene er på en fast avstand fra kameraet, noe som til slutt hjelper til å løse usikkerheten. Imidlertid, i datasamlinger med virkelige bilder, er usikkerheten ganske tydelig, og Splatter Image-rammen bruker flere forbehandlingsmetoder for å omtrentlig fikse skalaen på alle objekter. 

Visnings-avhengig Farge

For å representere visnings-avhengige farger, bruker Splatter Image-rammen sfærisk harmoni for å generalisere fargene beyond Lambertisk farge-modell. For hver enkelt Gaussian, definerer modellen koeffisienter som forutsies av nettverket og sfærisk harmoni. Visningsretningen endrer en visningsretning i kamera-kilden til dens tilsvarende visningsretning i ramme-referansen. Modellen finner deretter de tilsvarende koeffisientene for å finne den transformerte farge-funksjonen. Modellen kan gjøre dette fordi sfærisk harmoni er lukket under rotasjon, sammen med hver andre orden. 

Neuralt Nettverks-Arkitektur

En majoritet av arkitekturen til prediktor-mappingen som kartlegger inngangsbildet til en kombinasjon av Gaussian, er identisk med prosessen brukt i SongUNet-rammen. Den siste laget i arkitekturen erstattes av et 1×1 konvolusjonslag med farge-modellen som bestemmer bredden på utgangs-kanalene. Gitt inngangsbildet, produserer nettverket en utgangs-kanal-tensor som utgang, og for hver piksel-kanal, koder parameterne som deretter transformeres til offset, dekningseffekt, rotasjon, dybde og farge. Rammen bruker deretter ikke-lineære funksjoner for å aktivere parameterne og oppnå Gaussian-parameterne. 

For å rekonstruere 3D-representasjoner med multi-visning, bruker Splatter Image-rammen samme nettverk til hver enkelt inngang-visning, og deretter bruker visnings-tilnærmingen til å kombinere de enkelte rekonstruksjonene. Videre, for å muliggjøre effektiv koordinasjon og utveksling av informasjon mellom visningene i nettverket, gjør Splatter Image-rammen to modifikasjoner i nettverket. Først, betingelsen modellen med dens respektive kamera-pose, og passer vektorer ved å kode hver inngang ved å bruke en sinusoid posisjons-embedding, noe som resulterer i flere dimensjoner. Andre, legger rammen til cross-attention-lag for å muliggjøre kommunikasjon mellom funksjonene til forskjellige visninger. 

Splatter Image: Eksperimenter og Resultater

Splatter Image-rammen måler kvaliteten på sine rekonstruksjoner ved å evaluere Ny Visnings-Syntese-kvaliteten, siden rammen bruker kilde-visningen og renderer 3D-formen til mål-usette visninger for å utføre rekonstruksjoner. Rammen evaluerer sin ytelse ved å måle SSIM eller Strukturell Likhet, Peak Signal til Støy-forhold eller PSNR, og Perseptuell Kvalitet eller LPIPS-poeng. 

Enkeltvisnings 3D-Rekonstruksjons-Ytelse

Følgende tabell demonstrerer ytelsen til Splatter Image-modellen i enkeltvisnings 3D-rekonstruksjons-oppgaven på ShapeNet-benchmarken. 

Som det kan observeres, overgår Splatter Image-rammen alle deterministiske rekonstruksjonsmetoder over LPIPS- og SSIM-poeng. Poengene indikerer at Splatter Image-modellen genererer bilder med skarpere rekonstruksjoner. Videre, overgår Splatter Image-modellen også alle deterministiske baseline i forhold til PSNR-poeng, noe som indikerer at de genererte rekonstruksjonene er mer nøyaktige. Videre, i tillegg til å overgå alle deterministiske metoder, krever Splatter Image-rammen bare relative kamera-poser for å forbedre sin effektivitet i både trening- og testing-faser. 

Følgende bilde demonstrerer den kvalitative dyktigheten til Splatter Image-rammen, og som det kan sees, genererer modellen rekonstruksjoner med tynne og interessante geometrier, og fanger detaljene til kondisjons-visningene. 

Følgende bilde viser at rekonstruksjonene generert av Splatter Image-rammen ikke bare er skarpere, men også mer nøyaktige enn tidligere modeller, spesielt i uvanlige forhold med tynne strukturer og begrensede visninger. 

Multi-Visnings 3D-Rekonstruksjon

For å evaluere sin multi-visnings 3D-rekonstruksjons-evne, er Splatter Image-rammen trent på SpaneNet-SRN Cars-datasettet for to-visnings-prediksjoner. Eksisterende metoder bruker absolutt kamera-pose-betingelse for multi-visnings 3D-rekonstruksjons-oppgaver, noe som betyr at modellen lærer å avhenge primært av objektets kanoniske orientering i objektet. Selv om det gjør jobben, begrenser det anvendeligheten av modellene, da den absolutte kamera-posisjonen ofte er ukjent for et nytt bilde av et objekt. 

Slutt-tanker

I denne artikkelen, har vi talt om Splatter Image, en metode som har som mål å oppnå ultra-rask enkeltvisnings 3D-form og 3D-utseende konstruksjon av objekter. I kjernen av Splatter Image-rammen, brukes Gaussian Splatting-metoden til å analysere 3D-representasjoner, og utnytte hastigheten og kvaliteten den tilbyr. Splatter Image-rammen prosesserer bilder ved å bruke en standard 2D-CNN-arkitektur for å forutsi et pseudo-bilde som inneholder ett farget Gaussian per hver piksel. Ved å bruke Gaussian Splatting-metoden, er Splatter Image-rammen i stand til å kombinere rask rendering med rask inferens, noe som resulterer i rask trening og raskere evaluering på virkelige og syntetiske benchmark. 

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.