AI-modellen en platforms

Splatter Image: Ultra-Snelle Enkele-View 3D-Reconstructie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Enkele-view 3D-objectreconstructie met convolutionele netwerken heeft opmerkelijke mogelijkheden aangetoond. Enkele-view 3D-reconstructiemodellen genereren het 3D-model van elk object met behulp van één afbeelding als referentie, waardoor het een van de meest onderzochte onderwerpen is in computerzicht.

Laten we bijvoorbeeld de motorfiets in de bovenstaande afbeelding bekijken. Het genereren van zijn 3D-structuur vereist een complexe pijplijn die eerst cues van lage-niveau-afbeeldingen combineert met hoge-niveau-semantische informatie en kennis over de structuur van onderdelen.

Vanwege het complexe proces is enkele-view 3D-reconstructie een grote uitdaging geweest in computerzicht. In een poging om de efficiëntie van enkele-view 3D-reconstructie te verbeteren, hebben ontwikkelaars gewerkt aan Splatter Image, een methode die ernaar streeft om ultra-snelle enkele-view 3D-vorm- en 3D-uiterlijkconstructie van objecten te bereiken. In zijn kern gebruikt het Splatter Image-framework de Gaussian Splatting-methode om 3D-weergaven te analyseren, waarbij het profiteert van de snelheid en kwaliteit die het biedt.

Onlangs is de Gaussian Splatting-methode geïmplementeerd door verschillende multi-view reconstructiemodellen voor real-time rendering, verbeterde schaling en snelle training. Met dat gezegd hebbende, is Splatter Image het eerste framework dat de Gaussian Splatting-methode implementeert voor enkele-view reconstructietaken.

In dit artikel zullen we onderzoeken hoe het Splatter Image-framework Gaussian Splatting gebruikt om ultra-snelle enkele-view 3D-reconstructie te bereiken. Laten we dus beginnen.

Splatter Image: Een Poging tot Ultra-Snelle Enkele-View 3D-Reconstructie

Zoals eerder vermeld, is Splatter Image een ultra-snelle benadering voor enkele-view 3D-objectreconstructie op basis van de Gaussian Splatting-methode. Splatter Image is het eerste computerzichtframework dat Gaussian Splatting implementeert voor monocular 3D-objectgeneratie, aangezien traditioneel Gaussian Splatting de kracht achter multi-view 3D-objectreconstructieframeworks is geweest. Echter, wat het Splatter Image-framework onderscheidt van eerdere methoden, is dat het een leerling-gebaseerde benadering is, en reconstructie tijdens testen vereist alleen de feed-forward evaluatie van het neurale netwerk.

Splatter Image is fundamenteel afhankelijk van de renderkwaliteiten van Gaussian Splatting en hoge verwerkingssnelheid om 3D-reconstructies te genereren. Het Splatter Image-framework heeft een eenvoudig ontwerp: het framework gebruikt een 2D image-to-image neurale netwerkarchitectuur om een 3D-Gaussian per invoerbeeldpixel te voorspellen en kaart het invoerbeeld naar één 3D-Gaussian per pixel. De resulterende 3D-Gaussians hebben de vorm van een afbeelding, bekend als de Splatter Image, en deze Gaussians bieden ook een 360-gradenweergave van de afbeelding. Het proces wordt gedemonstreerd in de volgende afbeelding.

Hoewel het proces eenvoudig en rechttoe rechtaan is, zijn er enkele belangrijke uitdagingen waarmee het Splatter Image-framework te maken krijgt bij het gebruik van Gaussian Splatting om 3D-Gaussians te genereren voor enkele-view 3D-weergaven. De eerste grote hindernis is het ontwerpen van een neurale netwerk dat de afbeelding van een object als invoer accepteert en een overeenkomstige Gaussian-mengsel produceert dat alle zijden van de afbeelding vertegenwoordigt als uitvoer. Om dit aan te pakken, maakt het Splatter Image-framework gebruik van het feit dat, zelfs als het gegenereerde Gaussian-mengsel een verzameling of een ongeordende verzameling items is, het nog steeds kan worden opgeslagen in een geordende gegevensstructuur. Dienvolgens gebruikt het framework een 2D-afbeelding als container voor de 3D-Gaussians, waardoor elke pixel in de container de parameters van één Gaussian bevat, inclusief eigenschappen zoals vorm, dekking en kleur.

Door 3D-Gaussian-sets op te slaan in een afbeelding, kan het Splatter Image-framework de reconstructiehinderpalen verminderen die optreden bij het leren van een image-to-image neurale netwerk. Door deze benadering te gebruiken, kan het reconstructieproces worden geïmplementeerd met behulp van efficiënte 2D-operators in plaats van te vertrouwen op 3D-operators. Bovendien biedt het Splatter Image-framework in het Splatter Image-framework een 3D-weergave die een mengsel van 3D-Gaussians is, waardoor het de renderingsnelheid en geheugenefficiëntievoordelen van Gaussian Splatting kan exploiteren, wat de efficiëntie in zowel training als inferentie verbetert. Verder gaat het Splatter Image-framework niet alleen enkele-view 3D-weergaven genereren, maar het toont ook opmerkelijke efficiëntie, aangezien het getraind kan worden op slechts één GPU op standaard 3D-objectbenchmarks. Bovendien kan het Splatter Image-framework worden uitgebreid om meerdere afbeeldingen als invoer te accepteren. Het doet dit door de individuele Gaussian-mengsels te registreren op een gemeenschappelijke referentie en vervolgens door de combinatie van de Gaussian-mengsels te nemen die zijn voorspeld vanuit individuele weergaven. Het framework injecteert ook lichtgewicht cross-attention-lagen in zijn architectuur, waardoor verschillende weergaven met elkaar kunnen communiceren tijdens voorspelling.

Vanuit een empirisch oogpunt is het de moeite waard om op te merken dat het Splatter Image-framework 360-gradenreconstructie van het object kan produceren, zelfs als het slechts één zijde van het object ziet. Het framework wijst vervolgens verschillende Gaussians toe in een 2D-buurten aan verschillende delen van het 3D-object om de gegenereerde 360-gradeninformatie in de 2D-afbeelding te coderen. Bovendien stelt het framework de dekking van verschillende Gaussians in op nul, waardoor ze worden gedeactiveerd, waardoor ze tijdens nabewerking kunnen worden uitgesloten.

Om samen te vatten, is het Splatter Image-framework

  1. Een novatieve benadering om enkele-view 3D-objectreconstructies te genereren door de Gaussian Splatting-benadering over te nemen.
  2. Breidt de methode uit voor multi-view 3D-objectreconstructie.
  3. Bereikt state-of-the-art 3D-objectreconstructieprestaties op standaardbenchmarks met uitzonderlijke snelheid en kwaliteit.

Splatter Image: Methodologie en Architectuur

Gaussian Splatting

Zoals eerder vermeld, is Gaussian Splatting de primaire methode die wordt geïmplementeerd door het Splatter Image-framework om enkele-view 3D-objectreconstructies te genereren. In eenvoudige bewoordingen is Gaussian Splatting een rasterisatiemethode voor het reconstrueren van 3D-afbeeldingen en real-time rendering van afbeeldingen met meerdere gezichtspunten. De 3D-ruimte in de afbeelding wordt aangeduid als Gaussians, en machine learning-technieken worden geïmplementeerd om de parameters van elke Gaussian te leren. Gaussian Splatting vereist geen training tijdens rendering, waardoor snellere rendertijden mogelijk zijn. De volgende afbeelding vat de architectuur van 3D-Gaussian Splatting samen.

3D-Gaussian Splatting gebruikt eerst de set van invoerbeeld om een puntwolk te genereren. Gaussian Splatting gebruikt vervolgens de invoerbeeld om de externe parameters van de camera te schatten, zoals de helling en positie, door pixels tussen de afbeeldingen te matchen, en deze parameters worden vervolgens gebruikt om de puntwolk te berekenen. Met behulp van verschillende machine learning-methoden optimaliseert Gaussian Splatting vervolgens vier parameters voor elke Gaussian, namelijk: positie (waar is het gelegen), covariantie (de mate van uitrekking of schaling in een 3×3-matrix), kleur (wat is de RGB-kleurschema) en alfa (meting van de transparantie). Het optimalisatieproces rendert de afbeelding voor elke camera positie en gebruikt deze om de parameters dichter bij de oorspronkelijke afbeelding te bepalen. Als resultaat is de resulterende 3D-Gaussian Splatting-uitvoer een afbeelding, genaamd de Splatter Image, die de oorspronkelijke afbeelding het meest lijkt op de camera positie van waaruit het is vastgelegd.

Bovendien bieden de dekkingfunctie en de kleurfunctie in Gaussian Splatting een stralingsveld met het gezichtspunt van de 3D-punt. Het framework rendert vervolgens het stralingsveld op een afbeelding door de kleuren te integreren die langs de straal worden waargenomen die door het pixel gaat. Gaussian Splatting vertegenwoordigt deze functies als een combinatie van gekleurde Gaussians, waarbij de Gaussian-gemiddelde of -centrum, evenals de Gaussian-covariantie, helpt bij het bepalen van de vorm en de grootte. Elke Gaussian heeft ook een dekkingseigenschap en een gezichtsafhankelijke kleureigenschap die samen het stralingsveld definiëren.

Splatter Image

De renderer-component kaart de set van 3D-Gaussians naar een afbeelding. Om enkele-view 3D-reconstructie uit te voeren, zoekt het framework vervolgens een inverse functie voor 3D-Gaussians die het mengsel van 3D-Gaussians uit een afbeelding reconstrueert. De belangrijkste inclusie hier is om een effectieve maar eenvoudige ontwerp voor de inverse functie voor te stellen. Specifiek, voor een invoerbeeld, voorspelt het framework een Gaussian voor elk individueel pixel met behulp van een image-to-image neurale netwerkarchitectuur om een afbeelding te produceren, de Splatter Image. Het netwerk voorspelt ook de vorm, de dekking en de kleur.

Nu kan men zich afvragen hoe het Splatter Image-framework de 3D-weergave van een object kan reconstrueren zelfs als het alleen toegang heeft tot één van zijn weergaven? In real-time leert het Splatter Image-framework om enkele van de beschikbare Gaussians te gebruiken om de weergave te reconstrueren en gebruikt de resterende Gaussians om onzichtbare delen van de afbeelding automatisch te reconstrueren. Om zijn efficiëntie te maximaliseren, kan het framework elk moment Gaussians uitschakelen door te voorspellen of de dekking nul is. Als de dekking nul is, worden de Gaussians uitgeschakeld en het framework rendert deze punten niet, maar worden ze in plaats daarvan uitgesloten tijdens nabewerking.

Afbeeldingsniveau Verlies

Een groot voordeel van het exploiteren van de snelheid en efficiëntie die wordt aangeboden door de Splatter Gaussian-methode is dat het het framework in staat stelt om alle afbeeldingen te renderen bij elke iteratie, zelfs voor batches met relatief grote batchgrootte. Bovendien impliceert dit dat het framework niet alleen decomponeren verliezen kan gebruiken, maar ook afbeeldingsniveauverliezen die niet decomponeren in verliezen per pixel.

Schaalnormalisatie

Het is moeilijk om de grootte van een object te schatten door naar één weergave te kijken, en het is een moeilijke taak om deze ambiguïteit op te lossen wanneer het wordt getraind met een verlies. Hetzelfde probleem wordt niet waargenomen in synthetische datasets, aangezien alle objecten worden weergegeven met identieke cameraintrinsieken en de objecten op een vaste afstand van de camera staan, wat uiteindelijk helpt bij het oplossen van de ambiguïteit. Echter, in datasets met echte afbeeldingen is de ambiguïteit erg duidelijk, en het Splatter Image-framework gebruikt verschillende voorverwerkingsmethoden om de schaal van alle objecten ongeveer vast te stellen.

Gezichtsafhankelijke Kleur

Om gezichtsafhankelijke kleuren te representeren, gebruikt het Splatter Image-framework sferische harmonieën om kleuren te generaliseren voorbij het Lambertiaanse kleurmodel. Voor elke specifieke Gaussian definieert het model coëfficiënten die door het netwerk worden voorspeld en de sferische harmonieën. De wijziging van het gezichtspunt transformeert een kijkrichting in de camerabron naar de overeenkomstige kijkrichting in het referentiekader. Het model vindt vervolgens de overeenkomstige coëfficiënten om de getransformeerde kleurfunctie te vinden. Het model kan dit doen omdat de sferische harmonieën gesloten zijn onder rotatie, evenals elke andere orde.

Neurale Netwerkarchitectuur

Het grootste deel van de architectuur van de predictor die de invoerbeeld kaart naar het mengsel van Gaussian is identiek aan het proces dat wordt gebruikt in het SongUNet-framework. De laatste laag in de architectuur wordt vervangen door een 1×1 convolutionele laag met de kleurmodel die de breedte van de uitvoerkanaal bepaalt. Gegeven de invoerbeeld, produceert het netwerk een uitvoerkanaal tensor als uitvoer, en voor elk pixelkanaal codeert het de parameters die vervolgens worden getransformeerd in offset, dekking, rotatie, diepte en kleur. Het framework gebruikt vervolgens niet-lineaire functies om de parameters te activeren en de Gaussian parameters te verkrijgen.

Voor het reconstrueren van 3D-weergaven met multi-view, past het Splatter Image-framework hetzelfde netwerk toe op elke invoerweergave en gebruikt vervolgens de gezichtspuntbenadering om de individuele reconstructies te combineren. Bovendien, om efficiënte coördinatie en uitwisseling van informatie tussen de weergaven in het netwerk te faciliteren, voert het Splatter Image-framework twee wijzigingen uit in het netwerk. Ten eerste, conditioneert het framework het model met zijn respectieve camerahouding en doorgeeft vectors door elke entry te coderen met behulp van een sinusoidale positie-embeddingsresultaat in meerdere dimensies. Ten tweede, voegt het framework cross-attention-lagen toe om communicatie tussen de functies van verschillende weergaven te faciliteren.

Splatter Image: Experimenten en Resultaten

Het Splatter Image-framework meet de kwaliteit van zijn reconstructies door de Novel View Synthesis-kwaliteit te evalueren, aangezien het framework de bronweergave gebruikt en de 3D-vorm rendert naar doel onzichtbare weergaven om reconstructies uit te voeren. Het framework evalueert zijn prestaties door de SSIM of Structurele Overeenkomst, Peak Signaal-ruisverhouding of PSNR en Perceptuele Kwaliteit of LPIPS-scores te meten.

Enkele-View 3D-Reconstructieprestaties

De volgende tabel toont de prestaties van het Splatter Image-model in enkele-view 3D-reconstructietaken op de ShapeNet-benchmark.

Zoals te zien is, overtreft het Splatter Image-framework alle deterministische reconstructiemethoden over de LPIPS- en SSIM-scores. De scores geven aan dat het Splatter Image-model afbeeldingen met scherpere reconstructies genereert. Bovendien overtreft het Splatter Image-model alle deterministische baseline in termen van de PSNR-score, wat aangeeft dat de gegenereerde reconstructies ook nauwkeuriger zijn. Bovendien, naast het overtreffen van alle deterministische methoden, vereist het Splatter Image-framework alleen de relatieve cameraposities om zijn efficiëntie in zowel de trainings- als testfasen te verbeteren.

De volgende afbeelding toont de kwalitatieve kracht van het Splatter Image-framework, en zoals te zien is, genereert het model reconstructies met dunne en interessante geometrieën en vangt het de details van de conditionerende weergaven.

De volgende afbeelding toont aan dat de reconstructies gegenereerd door het Splatter Image-framework niet alleen scherper zijn, maar ook betere nauwkeurigheid hebben dan eerdere modellen, vooral in ongebruikelijke omstandigheden met dunne structuren en beperkte zichtbaarheid.

Multi-View 3D-Reconstructie

Om zijn multi-view 3D-reconstructiecapaciteiten te evalueren, wordt het Splatter Image-framework getraind op de SpaneNet-SRN Cars-dataset voor twee weergavevoorspellingen. Bestaande methoden gebruiken absolute camerapositieconditionering voor multi-view 3D-reconstructietaken, wat betekent dat het model leert om voornamelijk te vertrouwen op de canonieke oriëntatie van het object in het object. Hoewel het de taak doet, beperkt het de toepasbaarheid van de modellen, aangezien de absolute camerapositie vaak onbekend is voor een nieuwe afbeelding van een object.

Slotgedachten

In dit artikel hebben we het over Splatter Image gehad, een methode die ernaar streeft om ultra-snelle enkele-view 3D-vorm- en 3D-uiterlijkconstructie van objecten te bereiken. In zijn kern gebruikt het Splatter Image-framework de Gaussian Splatting-methode om 3D-weergaven te analyseren, waarbij het profiteert van de snelheid en kwaliteit die het biedt. Het Splatter Image-framework verwerkt afbeeldingen met behulp van een standaard 2D-CNN-architectuur om een pseudo-afbeelding te voorspellen die één gekleurde Gaussian per pixel bevat. Door de Gaussian Splatting-methode te gebruiken, kan het Splatter Image-framework snelle rendering combineren met snelle inferentie, wat resulteert in snelle training en snellere evaluatie op echte en synthetische benchmarks.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.