AI-modeller og platforme

Splatter Image: Et forsøg på ultra-hurtig enkelt-vinkel 3D-rekonstruktion

mm
Føj Unite.AI til dine foretrukne kilder på Google

Enkelt-vinkel 3D-objektrekonstruktion med convolutionelle netværk har demonstreret bemærkelsesværdige evner. Enkelt-vinkel 3D-rekonstruktionsmodeller genererer 3D-modellen af ethvert objekt ved hjælp af et enkelt billede som reference, hvilket gør det til et af de hotteste forskningsemner i computer vision.

For eksempel, lad os overveje motorcyklen i billedet ovenfor. Generering af dens 3D-struktur kræver en kompleks pipeline, der først kombinerer hints fra lavniveaubilleder med højniveausemantisk information og viden om den strukturelle arrangement af dele.

På grund af den komplekse proces har enkelt-vinkel 3D-rekonstruktion været en stor udfordring i computer vision. I et forsøg på at forbedre effektiviteten af enkelt-vinkel 3D-rekonstruktion har udviklere arbejdet på Splatter Image, en metode, der sigter mod at opnå ultra-hurtig enkelt-vinkel 3D-form og 3D-udseende af objekter. I dens kerne bruger Splatter Image-rammen Gaussian Splatting-metoden til at analysere 3D-repræsentationer, hvilket udnytter hastigheden og kvaliteten, det tilbyder.

For nylig er Gaussian Splatting-metoden blevet implementeret af mange multi-vinkel rekonstruktionsmodeller til realtids-rendering, forbedret skalerbarhed og hurtig træning. Med det sagt er Splatter Image den første ramme, der implementerer Gaussian Splatting-metoden til enkelt-vinkel rekonstruktionsopgaver.

I denne artikel vil vi udforske, hvordan Splatter Image-rammen udnytter Gaussian Splatting til at opnå ultra-hurtig enkelt-vinkel 3D-rekonstruktion. Så lad os komme i gang.

Splatter Image: Et forsøg på ultra-hurtig enkelt-vinkel 3D-rekonstruktion

Som nævnt tidligere er Splatter Image en ultra-hurtig tilgang til enkelt-vinkel 3D-objektrekonstruktion baseret på Gaussian Splatting-metoden. Splatter Image er den første computer vision-ramme, der implementerer Gaussian Splatting til monokulær 3D-objektgenerering, da Gaussian Splatting traditionelt har været brugt til multi-vinkel 3D-objektrekonstruktionsrammer. Imidlertid er det, der adskiller Splatter Image-rammen fra tidligere metoder, at det er en læring-baseret tilgang, og rekonstruktion under test kun kræver feed-forward-evaluering af neuralt netværk.

Splatter Image afhænger fundamentalt af Gaussian Splatting’s renderingskvaliteter og høj proceshastighed til at generere 3D-rekonstruktioner. Splatter Image-rammen har en simpel design: rammen bruger et 2D-billede-til-billede neuralt netværk til at forudsige et 3D-Gaussian per inputbilledepixel og mapper inputbilledet til et 3D-Gaussian per pixel. De resulterende 3D-Gaussians har formen af et billede, kendt som Splatter Image, og Gaussians giver også en 360-graders repræsentation af billedet. Processen demonstreres i følgende billede.

Selvom processen er simpel og direkte, er der nogle nøgleudfordringer, som Splatter Image-rammen står over for, når den bruger Gaussian Splatting til at generere 3D-Gaussians til enkelt-vinkel 3D-repræsentationer. Den første store forhindring er at designe et neuralt netværk, der accepterer billedet af et objekt som input og genererer en tilsvarende Gaussian-blanding, der repræsenterer alle sider af billedet som output. For at tackle dette udnytter Splatter Image, at selvom den genererede Gaussian-blanding er en samling eller en usorteret samling af elementer, kan den stadig gemmes i en sorteret datastruktur. Herefter bruger rammen et 2D-billede som en beholder for 3D-Gaussians, som resultat af, at hvert pixel i beholderen indeholder parametrene for en Gaussian, herunder egenskaber som form, gennemsigtighed og farve.

Ved at gemme 3D-Gaussian-sæt i et billede er Splatter Image-rammen i stand til at reducere rekonstruktionshinderne, der mødes, når man lærer et billede-til-billede neuralt netværk. Ved at bruge denne tilgang kan rekonstruktionsprocessen implementeres kun ved at anvende effektive 2D-operatører i stedet for at afhænge af 3D-operatører. Desuden kan 3D-repræsentationen i Splatter Image-rammen være en blanding af 3D-Gaussians, hvilket giver mulighed for at udnytte renderingshastigheden og hukommelseseffektiviteten, der tilbydes af Gaussian Splatting, hvilket forbedrer effektiviteten i både træning og inferens. Fremover kan Splatter Image-rammen ikke kun generere enkelt-vinkel 3D-repræsentationer, men den demonstrerer også bemærkelsesværdig effektivitet, da den kan trænes selv på en enkelt GPU på standard 3D-objektbenchmark. Desuden kan Splatter Image-rammen udvides til at tage flere billeder som input. Den kan opnå dette ved at registrere de enkelte Gaussian-blandinger til en fælles reference og derefter kombinere Gaussian-blandingerne, der forudses fra enkeltvisninger. Rammen indsætter også lette cross-attention-lag i sin arkitektur, hvilket giver mulighed for, at forskellige visninger kan kommunikere med hinanden under forudsigelse.

Fra et empirisk synspunkt er det værd at bemærke, at Splatter Image-rammen kan producere 360-graders rekonstruktion af objektet, selvom den kun ser én side af objektet. Rammen allokerer derefter forskellige Gaussians i en 2D-nabolag til forskellige dele af 3D-objektet for at kode den genererede 360-graders information i 2D-billedet. Desuden sætter rammen gennemsigtigheden af flere Gaussians til nul, hvilket deaktiverer dem, så de kan fjernes under efterbehandling.

For at sammenfatte er Splatter Image-rammen

  1. En ny tilgang til at generere enkelt-vinkel 3D-objektrekonstruktioner ved at overføre Gaussian Splatting-tilgangen.
  2. Udvider metoden til multi-vinkel 3D-objektrekonstruktion.
  3. Opnår state-of-the-art 3D-objektrekonstruktionspræstation på standardbenchmark med exceptionel hastighed og kvalitet.

Splatter Image: Metodologi og Arkitektur

Gaussian Splatting

Som nævnt tidligere er Gaussian Splatting den primære metode, der implementeres af Splatter Image-rammen til at generere enkelt-vinkel 3D-objektrekonstruktioner. I simple termer er Gaussian Splatting en rasteriseringsmetode til rekonstruktion af 3D-billeder og realtids-rendering af billeder med flere visninger. 3D-rummet i billedet kaldes Gaussians, og maskinlærings-teknikker implementeres for at lære parametrene for hver Gaussian. Gaussian Splatting kræver ikke træning under rendering, hvilket giver mulighed for hurtigere renderingshastighed.

3D-Gaussian Splatting genererer først en punktsky af inputbillederne. Gaussian Splatting bruger derefter inputbillederne til at estimere de eksterne parametre for kameraet, såsom hældning og position, ved at matche pixel mellem billederne, og disse parametre bruges derefter til at beregne punktskyen. Ved hjælp af forskellige maskinlæringsmetoder optimerer Gaussian Splatting derefter fire parametre for hver Gaussian, nemlig: Position (hvor er det placeret), Kovarians (omfanget af dets strækning eller skaleringsmatrix), Farve (hvilken RGB-farveskema) og Alpha (måling af gennemsigtighed). Optimeringsprocessen renderingsbilledet for hver kameraposition og bruger det til at bestemme parametrene, der er tættere på det originale billede. Som resultat er det resulterende 3D-Gaussian Splatting-udgangspunkt et billede, der kaldes Splatter Image, som ligner det originale billede mest ved kamerapositionen, det blev fanget fra.

Desuden giver gennemsigtighedsfunktionen og farvefunktionen i Gaussian Splatting en radiancefelt med visningsretningen af 3D-punktet. Rammen renderingsbilledet derefter på et billede ved at integrere farverne, der observeres langs strålen, der passerer gennem pixlen. Gaussian Splatting repræsenterer disse funktioner som en kombination af farvede Gaussians, hvor Gaussian-gennemsnit eller center sammen med Gaussian-kovarians hjælper med at bestemme dets form og størrelse. Hver Gaussian har også en gennemsigtigheds-egenskab og en visningsafhængig farve-egenskab, der sammen definerer radiancefeltet.

Splatter Image

Renderer-komponenten mapper sættet af 3D-Gaussians til et billede. For at udføre enkelt-vinkel 3D-rekonstruktion søger rammen derefter efter en inversfunktion for 3D-Gaussians, der rekonstruerer blandingen af 3D-Gaussians fra et billede. Den vigtigste inklusion her er at foreslå en effektiv, men enkel design for den inverse funktion. Specifikt for et inputbillede forudser netværket en Gaussian for hver enkelt pixel ved hjælp af et billede-til-billede neuralt netværksarkitektur til at outputte et billede, Splatter Image. Netværket forudser også formen, gennemsigtigheden og farven.

Nu kan det spekuleres, hvordan Splatter Image-rammen kan rekonstruerer 3D-repræsentationen af et objekt, selvom den kun har adgang til én af dets visninger? I realtid lærer Splatter Image-rammen at bruge nogle af de tilgængelige Gaussians til at rekonstruerer visningen og bruger de resterende Gaussians til automatisk at rekonstruer usete dele af billedet. For at maksimere sin effektivitet kan rammen automatisk slukke for Gaussians ved at forudsige, om gennemsigtigheden er nul. Hvis gennemsigtigheden er nul, slukkes Gaussians, og rammen renderingsbilledet ikke disse punkter, men de fjernes i stedet under efterbehandling.

Billede niveau tab

En stor fordel ved at udnytte hastigheden og effektiviteten, der tilbydes af Gaussian Splatting-metoden, er, at det giver mulighed for, at rammen kan renderingsbillederne alle på én gang, selv for batch med relativt stor batch-størrelse. Desuden giver det mulighed for, at rammen kan bruge dekomponerlige tab og billede-niveau-tab, der ikke dekomponerer i tab per pixel.

Skala normalisering

Det er en udfordring at estimere størrelsen af et objekt ved at se på ét enkelt billede, og det er en udfordring at løse denne usikkerhed, når det trænes med en tab. Det samme problem observeres ikke i syntetiske datasæt, da alle objekter renderes med identiske kamera-intrinsik og objekterne er på en fast afstand fra kameraet, hvilket giver mulighed for at løse usikkerheden. Imidlertid er usikkerheden meget tydelig i datasæt med rigtige billeder, og Splatter Image-rammen anvender flere forbehandlingsmetoder til at fastlægge størrelsen af alle objekter.

Visningsafhængig farve

For at repræsentere visningsafhængige farver bruger Splatter Image-rammen sfæriske harmonier til at generalisere farverne ud over den lambertianske farvemodell. For hver enkelt Gaussian definerer modellen koefficienter, der forudses af netværket og sfæriske harmonier. Visningsretningen ændrer en visningsretning i kameraets kilde til dens tilsvarende visningsretning i ramme af reference. Modellen finder derefter de tilsvarende koefficienter for at finde den transformerende farvefunktion. Modellen kan gøre dette, fordi sfæriske harmonier er lukkede under rotation, sammen med hver anden orden.

Neuralt netværksarkitektur

En større del af arkitekturen af forudsigelses-mappingen af inputbilledet til kombinationen af Gaussian er identisk med processen, der bruges i SongUNet-rammen. Den sidste lag i arkitekturen erstattes af et 1×1 konvolutionslag med farvemodellen, der bestemmer bredden af outputkanalerne. Givet inputbilledet producerer netværket en outputkanal-tensor som output, og for hver pixel-kanal koder parametrene, der derefter transformerer offset, gennemsigtighed, rotation, dybde og farve. Rammen bruger derefter ikke-lineære funktioner til at aktivere parametrene og få Gaussian-parametrene.

For at rekonstruerer 3D-repræsentationer med multi-visninger anvender Splatter Image-rammen det samme netværk til hver input-visning og bruger derefter visnings-tilgangen til at kombinere de enkelte rekonstruktioner. Desuden til at facilitere effektiv koordination og udveksling af information mellem visningerne i netværket gør Splatter Image-rammen to ændringer i netværket. Først betinger rammen modellen med dens respektive kameraposition og passer vektorer ved at kode hver indgang ved hjælp af en sinusoidal position-embedding, hvilket resulterer i flere dimensioner. Anden tilføjer rammen cross-attention-lag til at facilitere kommunikation mellem funktionerne af forskellige visninger.

Splatter Image: Eksperimenter og Resultater

Splatter Image-rammen måler kvaliteten af sine rekonstruktioner ved at evaluere Novel View Synthesis-kvaliteten, da rammen bruger kildevisningen og renderings-3D-formen til at udføre rekonstruktioner til mål, der ikke er set. Rammen evaluerer sin præstation ved at måle SSIM eller Structural Similarity, Peak Signal to Noise Ratio eller PSNR og Perceptual Quality eller LPIPS-scores.

Enkelt-vinkel 3D-rekonstruktionspræstation

Følgende tabel demonstrerer præstationen af Splatter Image-modellen i enkelt-vinkel 3D-rekonstruktionsopgaven på ShapeNet-benchmark.

Som det kan ses, overgår Splatter Image-rammen alle deterministiske rekonstruktionsmetoder på tværs af LPIPS- og SSIM-scores. Scoresne angiver, at Splatter Image-modellen genererer billeder med skarpere rekonstruktioner. Desuden overgår Splatter Image-modellen også alle deterministiske baseline i forhold til PSNR-scoren, hvilket angiver, at de genererede rekonstruktioner er mere nøjagtige. Desuden, ud over at overgå alle deterministiske metoder, kræver Splatter Image-rammen kun relative kamerapositioner for at forbedre sin effektivitet i både trænings- og testfaser.

Følgende billede demonstrerer den kvalitative dygtighed af Splatter Image-rammen, og som det kan ses, genererer modellen rekonstruktioner med tynde og interessante geometrier og fanger detaljerne af konditioneringsvisningerne.

Følgende billede viser, at rekonstruktionerne, der genereres af Splatter Image-rammen, ikke kun er skarpere, men også har bedre nøjagtighed end tidligere modeller, især under usædvanlige betingelser med tynde strukturer og begrænset synlighed.

Multi-vinkel 3D-rekonstruktion

For at evaluere sin multi-vinkel 3D-rekonstruktionskapacitet trænes Splatter Image-rammen på SpaneNet-SRN Cars-datasættet til to-visningsforudsigelser. Eksisterende metoder bruger absolut kameraposition-betingelse til multi-vinkel 3D-rekonstruktionsopgaver, hvilket betyder, at modellen lærer at afhænge primært af objekts kanoniske orientering i objektet. Selvom det gør arbejdet, begrænser det anvendeligheden af modellerne, da den absolutte kameraposition ofte er ukendt for et nyt billede af et objekt.

Endelige tanker

I denne artikel har vi talt om Splatter Image, en metode, der sigter mod at opnå ultra-hurtig enkelt-vinkel 3D-form og 3D-udseende af objekter. I dens kerne bruger Splatter Image-rammen Gaussian Splatting-metoden til at analysere 3D-repræsentationer, hvilket udnytter hastigheden og kvaliteten, det tilbyder. Splatter Image-rammen behandler billeder ved hjælp af en standard 2D-CNN-arkitektur til at forudsige et pseudo-billede, der indeholder en farvet Gaussian per pixel. Ved at bruge Gaussian Splatting-metoden kan Splatter Image-rammen kombinere hurtig rendering med hurtig inferens, hvilket resulterer i hurtig træning og hurtigere evaluering på både rigtige og syntetiske benchmark.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.