AI-modellen en platforms

Hoe werkt Single-View 3D Reconstructie?

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Traditioneel hebben modellen voor single-view objectreconstructie, die zijn gebaseerd op convolutionele neurale netwerken, een opmerkelijke prestatie laten zien in reconstructietaken. In recente jaren is single-view 3D reconstructie een populair onderzoeksgebied geworden in de AI-gemeenschap. Ongeacht de specifieke methodologie die wordt gebruikt, delen alle single-view 3D reconstructiemodellen de gemeenschappelijke benadering van het incorporeren van een encoder-decoder-netwerk binnen hun kader. Dit netwerk voert complexe redeneringen uit over de 3D-structuur in de uitvoerruimte.

In dit artikel zullen we onderzoeken hoe single-view 3D reconstructie in real-time werkt en de huidige uitdagingen waar deze kaders mee te maken krijgen bij reconstructietaken. We zullen verschillende sleutelcomponenten en methoden bespreken die worden gebruikt door single-view 3D reconstructiemodellen en strategieën onderzoeken die de prestaties van deze kaders kunnen verbeteren. Bovendien zullen we de resultaten analyseren die zijn gegenereerd door state-of-the-art-kaders die encoder-decoder-methoden gebruiken. Laten we erin duiken.

Single-View 3D Object Reconstructie

Single-view 3D objectreconstructie houdt in dat een 3D-model van een object wordt gegenereerd vanuit een enkel gezichtspunt, of met andere woorden, vanuit een enkele afbeelding. Bijvoorbeeld, het afleiden van de 3D-structuur van een object, zoals een motorfiets, vanuit een afbeelding, is een complex proces. Het combineert kennis van de structurele rangschikking van onderdelen, laag-niveau-beeldsignalen en hoog-niveau-semantische informatie. Dit spectrum omvat twee belangrijke aspecten: reconstructie en herkenning. Het reconstructieproces onderscheidt de 3D-structuur van de invoerbeeld met behulp van signalen zoals schaduw, textuur en visuele effecten. In tegenstelling tot het herkenningproces, dat de invoerbeeld classificeert en een geschikt 3D-model ophaalt uit een database.

Huidige single-view 3D objectreconstructiemodellen kunnen variëren in architectuur, maar ze worden verenigd door de inclusie van een encoder-decoderstructuur in hun kader. In deze structuur kaart de encoder de invoerbeeld naar een latenterepresentatie, terwijl de decoder complexe inferenties maakt over de 3D-structuur van de uitvoerruimte. Om deze taak succesvol uit te voeren, moet het netwerk zowel hoog-niveau- als laag-niveau-informatie integreren. Bovendien vertrouwen veel state-of-the-art encoder-decoder-methoden op herkenning voor single-view 3D reconstructietaken, wat hun reconstructiecapaciteiten beperkt. Bovendien kan de prestatie van moderne convolutionele neurale netwerken in single-view 3D objectreconstructie worden overtroffen zonder expliciet de 3D-objectstructuur af te leiden. Echter, de dominantie van herkenning in convolutionele netwerken in single-view objectreconstructietaken wordt beïnvloed door verschillende experimentele procedures, waaronder evaluatieprotocollen en dataset-samenstelling. Deze factoren stellen het kader in staat om een shortcut-oplossing te vinden, in dit geval beeldherkenning.

Traditioneel nemen single-view 3D objectreconstructiekaders de reconstructietaken aan met de shape from shading-benadering, met textuur en defocus als exotische weergaven voor de reconstructietaken. Aangezien deze technieken één enkele dieptesignaal gebruiken, zijn ze in staat om redeneringen te bieden voor de zichtbare delen van een oppervlak. Bovendien gebruiken veel single-view 3D reconstructiekaders meerdere signalen samen met structurele kennis om diepte te schatten vanuit een enkel monochroom beeld, een combinatie die deze kaders in staat stelt om de diepte van de zichtbare oppervlakken te voorspellen. Meer recente diepteschattingkaders gebruiken convolutionele neurale netwerkstructuren om diepte te extraheren uit een monochroom beeld.

Echter, voor effectieve single-view 3D reconstructie, moeten modellen niet alleen redeneren over de 3D-structuur van de zichtbare objecten in de afbeelding, maar moeten ze ook hallucineren over de onzichtbare delen in de afbeelding met behulp van bepaalde priors die zijn geleerd van de data. Om dit te bereiken, gebruiken de meeste modellen getrainde convolutionele neurale netwerkstructuren om 2D-afbeeldingen om te zetten in 3D-vormen met behulp van directe 3D-supervisie, terwijl veel andere kaders een voxel-gebaseerde weergave van 3D-vorm gebruiken en een latenterepresentatie gebruiken om 3D-up-convoluties te genereren. Bepaalde kaders partitioneren de uitvoerruimte ook hiërarchisch om computationele en geheugenefficiëntie te verbeteren, waardoor het model hogeresolutie-3D-vormen kan voorspellen. Recent onderzoek richt zich op het gebruik van zwakkere vormen van supervisie voor single-view 3D-vormvoorspellingen met convolutionele neurale netwerken, hetzij door voorspelde vormen en hun grondwaarheidsvoorspellingen te vergelijken om vormregressors te trainen, hetzij door meerdere leersignalen te gebruiken om gemiddelde vormen te trainen die het model helpen om vervormingen te voorspellen. Een andere reden achter de beperkte vooruitgang in single-view 3D reconstructie is de beperkte hoeveelheid trainingsdata die beschikbaar is voor de taak.

Verder is single view 3D reconstructie een complexe taak, omdat het niet alleen visuele data geometrisch interpreteert, maar ook semantisch. Hoewel ze niet volledig verschillend zijn, beslaan ze verschillende spectra van geometrische reconstructie tot semantische herkenning. Reconstructietaken vereisen per-pixel-redenering van de 3D-structuur van het object in de afbeelding. Reconstructietaken vereisen geen semantische kennis van de inhoud van de afbeelding en kunnen worden bereikt met behulp van laag-niveau-beeldsignalen, waaronder textuur, kleur, schaduw, schaduwen, perspectief en focus. Herkenning daarentegen is een extreme vorm van het gebruik van beeldsemantiek, omdat herkenningstaken hele objecten gebruiken en neerkomen op het classificeren van het object in de invoer en het ophalen van de corresponderende vorm uit de database. Hoewel herkenningstaken robuuste redeneringen over de delen van het object die niet zichtbaar zijn in de afbeeldingen kunnen bieden, is de semantische oplossing alleen haalbaar als deze kan worden verklaard door een object dat aanwezig is in de database.

Hoewel herkenning- en reconstructietaken mogelijk aanzienlijk van elkaar verschillen, negeren ze beide waardevolle informatie die is opgenomen in de invoerbeeld. Het is aan te raden om beide taken in combinatie met elkaar te gebruiken om de beste mogelijke resultaten te behalen, en nauwkeurige 3D-vormen voor objectreconstructie, d.w.z. voor optimale single-view 3D reconstructietaken, moet het model structurele kennis, laag-niveau-beeldsignalen en hoog-niveau-begrip van het object gebruiken.

Single-View 3D Reconstructie: Conventionele Opstelling

Om de conventionele opstelling en de opstelling van een single-view 3D reconstructiekader te verklaren, zullen we een standaardopstelling gebruiken voor het schatten van de 3D-vorm met behulp van een enkel beeld of afbeelding van het object. De dataset die wordt gebruikt voor trainingsdoeleinden is de ShapeNet-dataset, en de prestaties worden geëvalueerd over 13 klassen, wat het model in staat stelt om te begrijpen hoe het aantal klassen in een dataset de vormschattingprestaties van het model beïnvloedt.

De meeste moderne convolutionele neurale netwerken gebruiken een enkel beeld om hoogresolutie-3D-modellen te voorspellen, en deze kaders kunnen worden gecategoriseerd op basis van de weergave van hun uitvoer: dieptekaarten, puntenwolken en voxelroosters. Het model gebruikt OGN of Octree Generating Networks als zijn representatieve methode, die historisch gezien de voxelroosterbenadering heeft overtroffen, en/of kan de dominante uitvoerweergaven dekken. In tegenstelling tot bestaande methoden die uitvoerweergaven gebruiken, stelt de OGN-benadering het model in staat om hoogresolutie-vormen te voorspellen en gebruikt octrees om de bezette ruimte efficiënt te representeren.

Baselines

Om de resultaten te evalueren, gebruikt het model twee baselines die het probleem puur als een herkenningstaak beschouwen. De eerste baseline is gebaseerd op clustering, terwijl de tweede baseline database-opzoekingen uitvoert.

Clustering

In de clustering-baseline gebruikt het model de K-Means-algoritme om de trainingsvormen in K subcategorieën te clusteren, en voert het algoritme uit op 32*32*32 voxelisaties die zijn platgedrukt in een vector. Nadat de clustertoewijzingen zijn bepaald, schakelt het model terug naar het werken met modellen met hogere resolutie. Het model berekent vervolgens de gemiddelde vorm binnen elke cluster en drempelt de gemiddelde vormen waar de optimale waarde wordt berekend door de gemiddelde IoU of Intersection over Union over de modellen te maximaliseren. Aangezien het model de relatie tussen de 3D-vormen en de afbeeldingen in de trainingsdata kent, kan het model de afbeelding gemakkelijk matchen met de corresponderende cluster.

Opzoekingen

De opzoekingsbaseline leert om vormen en afbeeldingen in een gezamenlijke ruimte te embedden. Het model beschouwt de paarsgewijze overeenkomst van 3D-matrixvormen in de trainingsset om de embedruimte te construeren. Het model bereikt dit door de Multi-Dimensional Scaling met Sammon-mapping-benadering te gebruiken om elke rij in de matrix te comprimeren tot een laagdimensionale descriptor. Bovendien, om de overeenkomst tussen twee willekeurige vormen te berekenen, gebruikt het model de light field descriptor. Daarnaast traint het model een convolutioneel neurale netwerk om afbeeldingen naar een descriptor te kaarten om de afbeeldingen in de ruimte te embedden.

Analyse

Single-view 3D reconstructiemodellen volgen verschillende strategieën, waardoor ze in sommige gebieden beter presteren dan andere modellen, terwijl ze in andere gebieden tekortschieten. Om verschillende kaders te vergelijken en hun prestaties te evalueren, hebben we verschillende metrieken, waaronder de gemiddelde IoU-score.

Zoals te zien is in de bovenstaande afbeelding, ondanks dat ze verschillende architectuur hebben, leveren de huidige state-of-the-art 3D reconstructiemodellen bijna dezelfde prestaties. Echter, het is interessant om op te merken dat, ondanks dat het een pure herkenningmethode is, de opzoekingsframework de andere modellen overtreft in termen van gemiddelde en mediaan IoU-scores. De clusteringframework levert solide resultaten en overtreft de AtlasNet-, de OGN- en de Matryoshka-frameworks. Echter, de meest onverwachte uitkomst van deze analyse is dat de Oracle (ORCL ) NN-opzoekingsarchitectuur alle andere methoden overtreft, ondanks dat het een perfecte opzoekingsarchitectuur gebruikt. Hoewel het berekenen van de gemiddelde IoU-score helpt bij de vergelijking, geeft het geen volledig beeld, aangezien de variantie in de resultaten hoog is, ongeacht het model.

Algemene Evaluatiemetrieken

Single-view 3D reconstructiemodellen gebruiken vaak verschillende evaluatiemetrieken om hun prestaties op een breed scala aan taken te analyseren. Hieronder volgen enkele van de meest gebruikte evaluatiemetrieken.

Intersectie Over Unie

De gemiddelde Intersectie Over Unie is een metriek die vaak wordt gebruikt als een kwantitatieve maatstaf om als benchmark voor single-view 3D reconstructiemodellen te dienen. Hoewel IoU enige inzicht geeft in de prestaties van het model, wordt het niet beschouwd als de enige metriek om een methode te evalueren, aangezien het alleen de kwaliteit van de voorspelde vorm aangeeft als de waarden voldoende hoog zijn, met een aanzienlijk verschil tussen de lage en middenbereikscores voor twee gegeven vormen.

Chamfer Afstand

Chamfer Afstand is gedefinieerd op puntenwolken en is ontworpen om op verschillende 3D-weergaven toe te passen. Echter, de Chamfer Afstand-evaluatiemetriek is zeer gevoelig voor uitbijters, waardoor het een problematische maatstaf is om de prestaties van het model te evalueren, met de afstand van de uitbiter tot de referentievorm die de kwaliteit van de generatie aanzienlijk bepaalt.

F-Score

De F-Score is een veelgebruikte evaluatiemetriek die actief wordt gebruikt door de meeste multi-view 3D reconstructiemodellen. De F-Score-metriek wordt gedefinieerd als de harmonische gemiddelde tussen recall en precisie en evalueert de afstand tussen de oppervlakken van de objecten expliciet. Precisie telt het percentage van gereconstrueerde punten dat binnen een vooraf gedefinieerde afstand tot de grondwaarheid ligt, om de nauwkeurigheid van de reconstructie te meten. Recall daarentegen telt het percentage van punten op de grondwaarheid dat binnen een vooraf gedefinieerde afstand tot de reconstructie ligt, om de volledigheid van de reconstructie te meten. Bovendien kunnen ontwikkelaars de strengheid van de F-Score-metriek controleren door de afstandsdrempel te variëren.

Per-Klasse Analyse

De overeenkomst in prestaties die door de bovenstaande kaders worden geleverd, kan niet het resultaat zijn van methoden die op verschillende subset van klassen worden uitgevoerd, en de volgende figuur toont de consistente relatieve prestaties over verschillende klassen, met de Oracle NN-opzoekingsbaseline die de beste resultaten behaalt, en alle methoden observeren een hoge variantie voor alle klassen.

Bovendien zou men kunnen denken dat het aantal trainingsvoorbeelden dat beschikbaar is voor een klasse de per-klasseprestaties beïnvloedt. Echter, zoals wordt aangetoond in de volgende figuur, beïnvloedt het aantal trainingsvoorbeelden dat beschikbaar is voor een klasse de per-klasseprestaties niet, en zijn het aantal voorbeelden in een klasse en de gemiddelde IoU-score niet gecorreleerd.

Kwalitatieve Analyse

De kwantitatieve resultaten die in de bovenstaande sectie worden besproken, worden ondersteund door kwalitatieve resultaten, zoals wordt getoond in de volgende afbeelding.

Voor de meeste klassen is er geen aanzienlijk verschil tussen de clustering-baseline en de voorspellingen die worden gedaan door decoder-gebaseerde methoden. De clusteringbenadering faalt bij het leveren van resultaten wanneer de afstand tussen het voorbeeld en de gemiddelde cluster-vorm hoog is, of in situaties waarin de gemiddelde vorm zelf de cluster niet goed genoeg kan beschrijven. Aan de andere kant leveren kaders die decoder-gebaseerde methoden en opzoekingsarchitectuur gebruiken de meest nauwkeurige en aantrekkelijke resultaten, aangezien ze in staat zijn om fijne details in het gegenereerde 3D-model op te nemen.

Single View 3D Reconstructie: Eindgedachten

In dit artikel hebben we het over Single View 3D Object Reconstructie gehad en besproken hoe het werkt, en hebben we twee baselines besproken: Opzoekingen en Clustering, waarbij de opzoekingsbaseline de huidige state-of-the-art-modellen overtreft. Ten slotte, hoewel Single View 3D Object Reconstructie een van de meest onderzochte onderwerpen is in de AI-gemeenschap, en ondanks de aanzienlijke vooruitgang die in de afgelopen jaren is geboekt, is Single View 3D Object Reconstructie verre van perfect en zijn er nog aanzienlijke uitdagingen te overwinnen in de komende jaren.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.