AI-modeller og plattformer

Hvordan fungerer Single-View 3D-Rekonstruksjon?

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Tradisjonelt har modeller for single-view-objektrekonstruksjon basert på konvolusjonsneurale nettverk vist bemerkelsesverdig ytelse i rekonstruksjonsoppgaver. I de senere årene har single-view 3D-rekonstruksjon blitt et populært forskningsemne i AI-samfunnet. Uavhengig av den spesifikke metoden som brukes, deler alle single-view 3D-rekonstruksjonsmodeller den vanlige tilnærmingen til å inkorporere et encoder-decoder-nettverk i deres rammeverk. Dette nettverket utfører kompleks resonnering om 3D-strukturen i utgangsrommet.

I denne artikkelen vil vi utforske hvordan single-view 3D-rekonstruksjon opererer i sanntid og de nåværende utfordringene disse rammeverkene møter i rekonstruksjonsoppgaver. Vi vil diskutere ulike nøkkelkomponenter og metoder som brukes av single-view 3D-rekonstruksjonsmodeller og utforske strategier som kan forbedre ytelsen til disse rammeverkene. I tillegg vil vi analysere resultater produsert av state-of-the-art-rammeverk som bruker encoder-decoder-metoder. La oss dykke inn.

Single-View 3D-Objektrekonstruksjon

Single-view 3D-objektrekonstruksjon innebærer å generere en 3D-modell av et objekt fra ett enkelt synspunkt, eller i enklere termer, fra ett enkelt bilde. For eksempel å slutte seg til 3D-strukturen til et objekt, som en motorsykkel fra et bilde, er en kompleks prosess. Den kombinerer kunnskap om den strukturelle ordningen av deler, lav-nivå-bildehint og høy-nivå-semantisk informasjon. Dette spekteret omfatter to hovedaspekter: rekonstruksjon og gjenkjenning. Rekonstruksjonsprosessen skiller 3D-strukturen til inngangsbildet ved hjelp av hint som skygging, tekstur og visuelle effekter. I motsetning klassifiserer gjenkjenningprosessen inngangsbildet og henter en passende 3D-modell fra en database.

Nåværende single-view 3D-objektrekonstruksjonsmodeller kan variere i arkitektur, men de er forent av inklusjonen av en encoder-decoder-struktur i deres rammeverk. I denne strukturen kartlegger encoderen inngangsbildet til en latent representasjon, mens decoderen gjør komplekse slutninger om 3D-strukturen i utgangsrommet. For å utføre denne oppgaven må nettverket integrere både høy-nivå- og lav-nivå-informasjon. I tillegg er mange state-of-the-art encoder-decoder-metoder avhengige av gjenkjenning for single-view 3D-rekonstruksjonsoppgaver, noe som begrenser deres rekonstruksjonskapasiteter. Dessuten kan ytelsen til moderne konvolusjonsneurale nettverk i single-view 3D-objektrekonstruksjon overgås uten å eksplisitt slutte seg til 3D-objektstrukturen. Imidlertid er dominansen av gjenkjenning i konvolusjonsneurale nettverk i single-view-objektrekonstruksjonsoppgaver påvirket av ulike eksperimentelle prosedyrer, inkludert evalueringprotokoller og datasettsammensetning. Slike faktorer gjør at rammeverket kan finne en kortvei-løsning, i dette tilfelle bildegjenkjenning.

Tradisjonelt nærmer single-view 3D-objektrekonstruksjonsrammeverk rekonstruksjonsoppgavene ved hjelp av shape-from-shading-tilnærmingen, med tekstur og defokus som eksotiske visninger for rekonstruksjonsoppgavene. Disse teknikkene bruker ett enkelt dybdehint og er i stand til å gi grunn til de synlige delene av en overflate. Dessuten bruker mange single-view 3D-rekonstruksjonsrammeverk flere hint sammen med strukturell kunnskap for å anslå dybde fra ett enkelt monokulært bilde, en kombinasjon som gjør at disse rammeverkene kan forutsi dybden til de synlige overflatene. Mer nylige dybdeanslagsrammeverk setter konvolusjonsneurale nettverksstrukturer i bruk for å trekke ut dybde i ett monokulært bilde.

Imidlertid, for effektiv single-view 3D-rekonstruksjon, må modellene ikke bare slutte seg til 3D-strukturen til de synlige objektene i bildet, men de må også hallucinere de usynlige delene i bildet ved hjelp av visse priorer lært fra dataene. For å oppnå dette, setter de fleste modellene i dag inn trenede konvolusjonsneurale nettverksstrukturer i bruk for å kartlegge 2D-bilder til 3D-former ved hjelp av direkte 3D-overvåking, mens mange andre rammeverk setter en voxel-basert representasjon av 3D-form i bruk og bruker en latent representasjon for å generere 3D-opphøydinger. Visse rammeverk partitionerer også utgangsrommet hierarkisk for å forbedre beregnings- og minneeffektivitet, noe som gjør at modellen kan forutsi høyere-oppløste 3D-former. Nyere forskning fokuserer på å bruke svakere former for overvåking for single-view 3D-formforutsigelser ved hjelp av konvolusjonsneurale nettverk, enten ved å sammenligne forutsagte former og deres grunntruth-forutsigelser for å trene formregressorer eller ved å bruke flere læringsignaler for å trene gjennomsnittsformer som hjelper modellen å forutsi deformasjoner. En annen grunn til de begrensede fremgangene i single-view 3D-rekonstruksjon er den begrensede mengden treningdata tilgjengelig for oppgaven.

Videre er single-view 3D-rekonstruksjon en kompleks oppgave som ikke bare tolker visuell data geometrisk, men også semantisk. Selv om de ikke er helt forskjellige, dekker de forskjellige spekter fra geometrisk rekonstruksjon til semantisk gjenkjenning. Rekonstruksjonsoppgaver per-pixel-resonnering av 3D-strukturen til objektet i bildet. Rekonstruksjonsoppgaver krever ikke semantisk forståelse av bildets innhold og kan oppnås ved hjelp av lav-nivå-bildehint, inkludert tekstur, farge, skygging, skygger, perspektiv og fokus. Gjenkjenning på den andre siden er en ekstrem tilfelle av å bruke bilde-semantikk, fordi gjenkjenningoppgaver bruker hele objekter og klassifiserer objektet i inngangen og henter den tilsvarende formen fra databasen. Selv om gjenkjenningoppgaver kan gi robust resonnering om objektets usynlige deler, er den semantiske løsningen bare mulig hvis den kan forklares av et objekt til stede i databasen.

Selv om gjenkjenning- og rekonstruksjonsoppgaver kan være forskjellige fra hverandre, ignorerer de begge verdifull informasjon i inngangsbildet. Det er å anbefale å bruke begge disse oppgavene i samspill med hverandre for å oppnå de beste mulige resultater og nøyaktige 3D-former for objektrekonstruksjon, dvs. for optimal single-view 3D-rekonstruksjon, bør modellen bruke strukturell kunnskap, lav-nivå-bildehint og høy-nivå-forståelse av objektet.

Single-View 3D-Rekonstruksjon: Konvensjonell Oppsett

For å forklare det konvensjonelle oppsettet og analysere oppsettet til et single-view 3D-rekonstruksjonsrammeverk, vil vi bruke et standardoppsett for å anslå 3D-formen ved hjelp av ett enkelt synspunkt eller bilde av objektet. Datasettet som brukes til trening er ShapeNet-datasettet, og evalueringen skjer over 13 klasser, noe som gjør at modellen kan forstå hvordan antallet klasser i et datasett bestemmer formanslagsytelsen til modellen.

De fleste moderne konvolusjonsneurale nettverk bruker ett enkelt bilde for å forutsi høyoppløste 3D-modeller, og disse rammeverkene kan kategoriseres basert på representasjonen av deres utgang: dybdekart, punktskyer og voxelruter. Modellen bruker OGN eller Octree Generating Networks som sin representative metode, som historisk sett har overgått voxelrute-tilnærmingen og/eller kan dekke de dominante utgangsrepresentasjonene. I motsetning til eksisterende metoder som bruker utgangsrepresentasjoner, tillater OGN-tilnærmingen modellen å forutsi høyoppløste former og bruker oktrær for å representere det okkuperte rommet effektivt.

Baselines

For å evaluere resultater, setter modellen to baselines som betrakter problemet som en ren gjenkjenningoppgave. Den første baseline er basert på klastering, mens den andre baseline utfører databasehenting.

Klastering

I klasteringsbaselinen, bruker modellen K-Means-algoritmen for å klasse eller gruppere treningssformene i K underkategorier og kjører algoritmen på 32*32*32-voxeliseringer flattet ut i en vektor. Etter å ha bestemt klaster tilordningene, bytter modellen tilbake til å arbeide med modeller med høyere oppløsning. Modellen beregner deretter gjennomsnittsformen innen hver klasse og grenser gjennomsnittsformene der den optimale verdien beregnes ved å maksimere gjennomsnittlig IoU eller Intersection over Union over modellene. Ettersom modellen kjenner til forholdet mellom 3D-formene og bildene i treningdataene, kan modellen lett sammenligne bildet med sin tilsvarende klasse.

Henting

Hentingsbaselinen lærer å innbædde former og bilder i et felles rom. Modellen betrakter den parvise likheten mellom 3D-matrisformer i treningsssettet for å konstruere innbæddingsrommet. Modellen oppnår dette ved å bruke Multi-Dimensional Scaling med Sammon-mapping-tilnærming for å komprimere hver rad i matrisen til en lavdimensjonal beskrivelse. Dessuten, for å beregne likheten mellom to vilkårlige former, bruker modellen lysfeltbeskrivelsen. I tillegg trener modellen et konvolusjonsneuralt nettverk for å kartlegge bilder til en beskrivelse for å innbædde bildene i rommet.

Analys

Single-view 3D-rekonstruksjonsmodeller følger ulike strategier som et resultat av at de overgår andre modeller i noen områder, mens de ikke holder mål i andre. For å sammenligne ulike rammeverk og evaluere deres ytelse, har vi ulike metrikker, en av dem er gjennomsnittlig IoU-score.

Som det kan ses i bildet over, til tross for å ha ulike arkitekturer, leverer nåværende state-of-the-art 3D-rekonstruksjonsmodeller nesten like god ytelse. Imidlertid er det interessant å merke seg at til tross for å være en ren gjenkjenningmetode, overgår hentingsrammeverket andre modeller i termer av gjennomsnittlig og median IoU-poeng. Klasteringsrammeverket leverer solide resultater og overgår AtlasNet-, OGN- og Matryoshka-rammeverkene. Imidlertid er det mest uventede resultatet av denne analysen at Oracle (ORCL ) NN overgår alle andre metoder til tross for å bruke en perfekt hentingsarkitektur. Selv om beregning av gjennomsnittlig IoU-poeng hjelper i sammenligningen, gir det ikke et fullstendig bilde, siden variasjonen i resultater er høy uavhengig av modellen.

Felles Evalueringmetrikker

Single-view 3D-rekonstruksjonsmodeller bruker ofte ulike evalueringmetrikker for å analysere deres ytelse på en rekke oppgaver. Følgende er noen av de vanligste evalueringmetrikker.

Intersection Over Union

Gjennomsnittlig Intersection Over Union er en metrikk som vanligvis brukes som en kvantitativ måling for å tjene som en benchmark for single-view 3D-rekonstruksjonsmodeller. Selv om IoU gir noen innsikt i modellens ytelse, betraktes det ikke som den eneste metrikken for å evaluere en metode, siden det indikerer kvaliteten på formen som forutsagt av modellen bare hvis verdiene er tilstrekkelig høye med en betydelig diskrepans observert mellom lav- og midtrengs-poeng for to gitt former.

Chamfer Avstand

Chamfer avstand er definert på punktskyer og er designet for å kunne brukes til ulike 3D-representasjoner tilfredsstillende. Imidlertid er Chamfer avstand-metrikken svært følsom for outliers, noe som gjør det til en problematisk måte å evaluere modellens ytelse, med avstanden til outlier fra referanseformen bestemmer genereringskvaliteten betydelig.

F-Score

F-Score er en vanlig evalueringmetrikk som aktivt brukes av de fleste multi-view 3D-rekonstruksjonsmodeller. F-Score-metrikken er definert som den harmoniske gjennomsnittet mellom recall og presisjon, og den evaluerer avstanden mellom overflatene til objektene eksplisitt. Presisjon teller prosentandelen av rekonstruerte punkter som ligger innen en forhåndsdefinert avstand til grunntruthen, for å måle nøyaktigheten til rekonstruksjonen. Recall på den andre siden teller prosentandelen av punkter på grunntruthen som ligger innen en forhåndsdefinert avstand til rekonstruksjonen for å måle fullstendigheten til rekonstruksjonen. Dessuten kan utviklere kontrollere strengheten til F-Score-metrikken ved å variere avstandsverdien.

Per-Klasse Analyse

Likheten i ytelse levert av ovennevnte rammeverk kan ikke være et resultat av metoder som kjører på ulike underkategorier, og følgende figur demonstrerer den konsistente relative ytelsen over ulike klasser, med Oracle NN-hentingsbaselinen som oppnår det beste resultatet av dem alle, og alle metoder observerer høy variasjon for alle klasser.

Dessuten kan antallet treningseksemplarer tilgjengelige for en klasse føre en til å anta at det påvirker per-klasse-ytelsen. Imidlertid, som vist i følgende figur, påvirker antallet treningseksemplarer tilgjengelige for en klasse ikke per-klasse-ytelsen, og antallet eksemplarer i en klasse og dens gjennomsnittlige IoU-poeng er ikke korrelert.

Kvalitativ Analyse

De kvantitative resultater diskutert i seksjonen over støttes av kvalitative resultater, som vist i følgende bilde.

For de fleste klasser er det ingen betydelig forskjell mellom klasteringsbaselinen og forutsagelsene gjort av decoder-baserte metoder. Klasteringsmetoden feiler i å levere resultater når avstanden mellom eksemplaret og gjennomsnittsformen er høy, eller når gjennomsnittsformen ikke kan beskrive klassen godt nok. På den andre siden leverer rammeverk som bruker decoder-baserte metoder og hentingsarkitektur de mest nøyaktige og tiltalende resultater, siden de kan inkludere fine detaljer i den genererte 3D-modellen.

Single-View 3D-Rekonstruksjon: Sluttkommentarer

I denne artikkelen har vi talt om Single-View 3D-Objektrekonstruksjon og hvordan det fungerer, og talt om to baselines: Henting og Klastering, med hentingsbaselinen som overgår nåværende state-of-the-art-modeller. Til slutt, selv om Single-View 3D-Objektrekonstruksjon er ett av de heteste emnene og mest forskede emnene i AI-samfunnet, og til tross for å ha gjort betydelige fremskritt i de siste årene, er Single-View 3D-Objektrekonstruksjon langt ifra å være perfekt, med betydelige hindringer å overvinne i de kommende årene.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.