AI-modeller og plattformer
Uni3D: Utforsking av Unified 3D-Representasjon på Storskala
Skalering av tekst- og visuelle representasjoner har vært et viktig fokusområde for forskning i de senere årene. Utvikling og forskning som er gjennomført i de senere årene har ført til flere revolusjoner i språklæring og visjon. Imidlertid, til tross for populariteten til å skale tekst- og visuelle representasjoner, har skalering av representasjoner for 3D-scener og objekter ikke blitt tilstrekkelig diskutert.
I dag skal vi diskutere Uni3D, en 3D-grunnmodell som har som mål å utforske unified 3D-representasjoner. Uni3D-rammenverket bruker en 2D-inisialisert ViT-ramme, som er forhåndstrengt fra ende til ende, for å justere bilde-tekst-egenskaper med deres tilhørende 3D-punktsky-egenskaper.
Uni3D-rammenverket bruker pretext-oppdrag og en enkel arkitektur for å utnytte overfloden av forhåndstrengte 2D-modeller og bilde-tekst-justerte modeller som initialisering og mål, henholdsvis. Dette tilnærmingen løser fullt potensialet til 2D-modeller og strategier for å skale dem opp til 3D-verdenen.
I denne artikkelen skal vi dykke dyptere inn i 3D-datamaskinsyn og Uni3D-rammenverket, og utforske de essensielle konseptene og arkitekturen til modellen. Så, la oss begynne.
Uni3D og 3D-Representasjonslæring: En Introduksjon
I de senere årene har datamaskinsyn oppstått som ett av de mest investerte områdene i AI-industrien. Etter betydelige fremgang i 2D-datamaskinsynsrammer, har utviklerne skiftet fokus til 3D-datamaskinsyn. Dette feltet, spesielt 3D-representasjonslæring, kombinerer aspekter av datagrafikk, maskinlæring, datamaskinsyn og matematikk for å automatisere prosessering og forståelse av 3D-geometri. Den raske utviklingen av 3D-sensorene som LiDAR, sammen med deres vidstrakte anvendelser i AR/VR-industrien, har resultert i at 3D-representasjonslæring har fått økt oppmerksomhet. Dens potensielle anvendelser vokser daglig.
Selv om eksisterende rammer har vist bemerkelsesverdig fremgang i 3D-modellarkitektur, oppgave-orientert modellering og læringsmål, utforsker de fleste 3D-arkitektur på en relativt liten skala med begrensede data, parametre og oppgavescenarier. Utfordringen med å lære skalerbare 3D-representasjoner, som kan anvendes i sanntidsapplikasjoner i ulike miljøer, forblir stort sett uutforsket.
Ved å gå videre, i de senere årene, har skaleringsstore språkmodeller som er forhåndstrengt, hjulpet til å revolusjonere det naturlige språkbehandlingsdomenet, og nyere arbeider har indikert en oversettelse av fremgangen fra språk til 2D ved hjelp av datascale og modellskaleringsmetoder, som åpner vei for utviklere til å prøve og gjenta denne suksessen for å lære en 3D-representasjon som kan skaleres og overføres til sanntidsapplikasjoner i den virkelige verden.
Uni3D er en skalerbar og forent forhåndstrening 3D-ramme utviklet med mål om å lære store 3D-representasjoner som tester grensene på en skala over en milliard parametre, over 10 millioner bilder parret med over 70 millioner tekster og over en million 3D-former. Figuren under sammenligner nullskuddnøyaktigheten mot parametre i Uni3D-rammenverket. Uni3D-rammenverket skalerer med suksess 3D-representasjoner fra 6 millioner til over en milliard.

Uni3D-rammenverket består av en 2D-ViT eller en visjonstransformator som 3D-encoder, som deretter er forhåndstrengt fra ende til ende for å justere bilde-tekst-egenskaper med 3D-punktsky-egenskaper. Uni3D-rammenverket bruker pretext-oppdrag og en enkel arkitektur for å utnytte overfloden av forhåndstrengte 2D-modeller og bilde-tekst-justerte modeller som initialisering og mål, henholdsvis, og løser dermed fullt potensialet til 2D-modeller og strategier for å skale dem opp til 3D-verdenen. Fleksibiliteten og skalerbarheten til Uni3D-rammenverket måles i form av
- Skalering av modellen fra 6M til over en milliard parametre.
- 2D-inisialisering til tekst-overvåket fra visuell selv-overvåket læring.
- Tekst-bilde-målmodell-skaleringsfra 150 millioner til over en milliard parametre.
Under den fleksible og forente rammen tilbudt av Uni3D, observerer utviklerne en samstemt økning i ytelsen når det gjelder å skale hver komponent. Den store 3D-representasjonslæringen nyter også storparten av de delbare 2D- og skaleringsstrategier.
Som det kan ses i figuren under, viser Uni3D-rammenverket en økning i ytelsen sammenlignet med tidligere kunstverk i få-skudd- og nullskudd-innstillinger. Det er verdt å merke seg at Uni3D-rammenverket returnerer en nullskudd-klassifiseringsnøyaktighet på over 88% på ModelNet, som er på linje med ytelsen til flere statiske overvåkingsmetoder.

Videre leverer Uni3D-rammenverket også toppnivå-nøyaktighet og ytelse når det utfører andre representative 3D-oppdrag som del-segmentering og åpen verden-forståelse. Uni3D-rammenverket har som mål å lukke gapet mellom 2D-syn og 3D-syn ved å skale 3D-grunnmodeller med en forent, men enkel forhåndstreningstilnærming for å lære mer robuste 3D-representasjoner på tvers av en rekke oppdrag, som kan hjelpe til å konvergere 2D- og 3D-syn på tvers av en rekke modaliteter.
Uni3D: Relatert Arbeid
Uni3D-rammenverket trekker inspirasjon og lærer fra utviklingene som er gjort av tidligere 3D-representasjonslæring og grunnmodeller, spesielt under ulike modaliteter.
3D-Representasjonslæring
3D-representasjonslæringsmetoden bruker skyttenpunkter for 3D-forståelse av objektet, og dette feltet har vært utforsket av utviklere mye i de senere årene, og det har blitt observert at disse skyttenpunkter kan være forhåndstrengt under selv-overvåking ved hjelp av bestemte 3D-pretext-oppdrag, inkludert maskespunktmodellering, selv-rekonstruksjon og kontrastiv læring.
Det er verdt å merke seg at disse metodene fungerer med begrensede data, og de undersøker ofte ikke multimodale representasjoner til 3D fra 2D eller NLP. Imidlertid har det nylige suksessen til CLIP-rammenverket, som returnerer høy effisiens i å lære visuelle konsepter fra rå tekst ved hjelp av kontrastiv læring, og videre søker å lære 3D-representasjoner ved å justere bilde-, tekst- og skyttenpunkts-egenskaper ved hjelp av samme kontrastive læring.
Grunnmodeller
Utviklere har uttømmende arbeidet med å designe grunnmodeller for å skale opp og forene multimodale representasjoner. For eksempel, i NLP-domenet, har utviklere arbeidet med rammer som kan skale opp forhåndstrengte språkmodeller, og det har revolusjonert NLP-industrien. Videre har det blitt observert fremgang i 2D-syn-domenet også, fordi utviklere arbeider med rammer som bruker datascale og modellskaleringsmetoder for å hjelpe til å fremme språk til 2D-modeller, selv om slike rammer er vanskelige å replikere for 3D-modeller på grunn av begrensede 3D-data og utfordringer som oppstår når man forener og skalerer 3D-rammer.
Ved å lære fra disse to arbeidsområdene, har utviklere skapt Uni3D-rammenverket, den første 3D-grunnmodellen med over en milliard parametre som bruker en forent ViT- eller visjonstransformator-arkitektur som tillater utviklere å skale Uni3D-rammenverket ved hjelp av forente 3D- eller NLP-strategier for å skale opp modellen. Utviklere håper at denne metoden vil tillate Uni3D-rammenverket å lukke gapet som skiller 2D- og 3D-syn, samt å fasilitere multimodal konvergens.
Uni3D: Metode og Arkitektur

Bildet ovenfor viser en generell oversikt over Uni3D-rammenverket, en skalerbar og forent forhåndstrening 3D-ramme for stor skala 3D-representasjonslæring. Utviklere bruker over 70 millioner tekster og 10 millioner bilder parret med over en million 3D-former for å skale Uni3D-rammenverket til over en milliard parametre. Uni3D-rammenverket bruker en 2D-ViT eller visjonstransformator som 3D-encoder, som deretter er forhåndstrengt fra ende til ende for å justere tekst-bilde-data med 3D-punktsky-egenskaper, og tillater Uni3D-rammenverket å levere ønsket effisiens og nøyaktighet på tvers av en rekke benchmark.
Skalering av Uni3D-Rammenverket
Tidligere studier om skyttenpunktsrepresentasjonslæring har tradisjonelt fokusert på å designe bestemte modellarkitekturer som leverer bedre ytelse på tvers av en rekke applikasjoner, og arbeider på en begrenset mengde data på grunn av små skala-datasett. Imidlertid har nyere studier prøvd å utforske muligheten til å bruke skalerbar forhåndstrening i 3D, men det har ikke vært noen store resultater på grunn av begrensede 3D-data. For å løse skalerbarhetsproblemet til 3D-rammer, utnytter Uni3D-rammenverket kraften til en vanlig transformatorstruktur som nesten speiler en visjonstransformator, og kan løse skaleringsproblemer ved hjelp av forente 2D- eller NLP-skaleringsstrategier for å skale opp modellstørrelsen.

Tidligere studier om skyttenpunktsrepresentasjonslæring har tradisjonelt fokusert på å designe bestemte modellarkitekturer som leverer bedre ytelse på tvers av en rekke applikasjoner, og arbeider på en begrenset mengde data på grunn av små skala-datasett. Imidlertid har nyere studier prøvd å utforske muligheten til å bruke skalerbar forhåndstrening i 3D, men det har ikke vært noen store resultater på grunn av begrensede 3D-data. For å løse skalerbarhetsproblemet til 3D-rammer, utnytter Uni3D-rammenverket kraften til en vanlig transformatorstruktur som nesten speiler en visjonstransformator, og kan løse skaleringsproblemer ved hjelp av forente 2D- eller NLP-skaleringsstrategier for å skale opp modellstørrelsen.
Initialisering av Uni3D
En annen stor utfordring som tidligere arbeid om skalerings-3D-representasjoner har møtt, er vanskelighetene med konvergens og overfitting som var et resultat av den store størrelsen på modellene. En effektiv tilnærming for å overvinne denne hindringen er å forhåndstrege individuelle 3D-rygger med bestemte 3D-pretext-oppdrag, og initialisere forhåndstrengte parametre. Imidlertid er denne tilnærmingen ledsaget av høye treningskostnader, og det er også vanskelig å etablere en robust initialisering for kryssmodell-læring på grunn av den begrensede mengden 3D-data som er tilgjengelig for treningsformål.
Uni3D-rammenverket utnytter en vanlig transformator, hvis struktur ligner ViT. Med denne tilnærmingen kan Uni3D-rammenverket naturlig adoptere forhåndstrengte store modeller med andre modaliteter for å initialisere Uni3D-rammenverket.
Multi-Modal Justering
Uni3D-rammenverket forsøker å lære multi-modale justeringer på tvers av bilde, språk og punktskytter ved hjelp av paradigmer som ligner OpenShape og ULIP-rammer. Videre, for å sikre en rettferdig sammenligning med andre metoder, bruker Uni3D-rammenverket det ensemblet 3D-datasett fra OpenShape for treningsformål. Dette ensemblet datasett fra OpenShape består av 4 3D-datasett:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Eksperimenter og Resultater
Uni3D-rammenverket er testet på tvers av ulike innstillinger og på tvers av ulike klassifiseringsoppdrag, inkludert ytelsen i nullskudd- og få-skudd-innstillinger, resultater rundt åpen verden-forståelse og mer. La oss se nærmere på disse resultatene.
Nullskudd Form-Klassifisering
For å evaluere ytelsen til Uni3D-rammenverket på tvers av nullskudd form-klassifisering, gjennomfører utviklerne eksperimenter på tvers av tre benchmark-datasett, inkludert ModelNet, ScanObjNN og Objaverse-LVIS-benchmark-datasett. ModelNet og ScanObjNN er datasett som vanligvis brukes for klassifisering, og de består av 15 og 40 objekt-kategorier, henholdsvis, mens Objaverse-LVIS-benchmark er et rent og annotert datasett som består av over 40 000 objekter på tvers av 1 100+ kategorier. Sammenligningen mellom rammer er vist i bildet under, og som det kan ses, overgår Uni3D-rammenverket tidligere kunstverk på tvers av ulike innstillinger.

Få-Skudd Lineær Prøving
I AI, er lineær prøving en vanlig metode som brukes for å evaluere representasjonene som en ramme eller modell lærer. For å evaluere Uni3D-rammenverkets lineær prøvings-evne, fryser utviklerne parameterne til Uni3D-rammenverket ved hjelp av vanlige innstillinger som OpenShape. Deretter trener utviklerne en lineær klassifikator for Uni3D ved hjelp av få-skudd-klassifikasjons-etiketter. Figuren under viser lineær prøvings-evnen til ulike rammer på Objaverse-LVIS-datasett, og viser gjennomsnittlig ytelse til modellen på tvers av 10 tilfeldige frø. Som det kan ses, overgår Uni3D-rammenverket eksisterende metoder betydelig på tvers av ulike få-skudd-innstilling.

Åpen Verden-Forståelse
For å evaluere evnen til Uni3D-rammenverket til å forstå sanntidsformer og objekter i sanntid, bruker utviklerne ScanNet og CLIP-datasett for å utforske Uni3D-rammenverkets ytelse. Det er verdt å merke seg at bakgrunns-instant-segmentering er tilgjengelig, og hovedmålet er å gjenkjenne kategorien til hver scenes individuelle instant i en nullskudd-innstilling. Resultatene er vist i bildet under. Som det kan ses, leverer Uni3D-rammenverket usedvanlige resultater når det gjelder åpen verden-forståelse og gjenkjennelse. Uni3D-rammenverket overgår eksisterende rammer med en betydelig margin, til tross for at det aldri har blitt trent på sanntids-datasett.

Kryss-Modal Retrievering
De multimodale representasjonene som Uni3D-rammenverket lærer, kan tillate rammenverket å hente 3D-former naturlig fra tekst eller bilder. For å hente 3D-former, beregner modellen kosinus-lignende mellom 3D-form-embedninger og embedninger av en tekst- eller bilde-spørring. Rammenverket bruker deretter KNN eller K-nærmeste nabo-algoritmen for å generere 3D-former som ligner spørringen mest, og resultatene er vist i figuren under. Som det kan ses, bruker Uni3D-rammenverket sanntids-bilder for å hente 3D-former. Videre er det verdt å merke seg at trening-bilder bare brukes til rendering-formål, og gapet mellom sanntids- og trening-bilder er betydelig. I tillegg henter modellen to input-bilder og henter former som ligner begge input-bilder ved hjelp av kosinus-lignende mellom embedninger av begge bildene og deres embedderte 3D-former. Resultatene er interessante, da de viser Uni3D-rammenverkets evne til å lære diverse 3D-representasjoner og oppfatte flere 2D-signaler.

I den første kolonnen, bruker rammenverket to spørrings-bilder for å returnere 3D-former som er mest like spørrings-bildene. I den andre kolonnen, henter rammenverket to input-bilder og henter former som ligner begge input-bilder. Til slutt, i den siste kolonnen, bruker modellen tekst-spørringer og returnerer 3D-former som ligner tekst-spørringen mest.
Slutt tanker
I denne artikkelen har vi diskutert Uni3D, en skalerbar og forent forhåndstrening 3D-ramme utviklet med mål om å lære store 3D-representasjoner som tester grensene på en skala over en milliard parametre, over 10 millioner bilder parret med over 70 millioner tekster og over en million 3D-former. Utviklerne av rammenverket har inkludert en vanlig transformator med en struktur som ligner ViT, som tillater dem å skale opp Uni3D-rammenverket ved hjelp av forente 2D- eller NLP-skaleringsstrategier. Videre kan Uni3D-rammenverket utnytte en rekke forhåndstrengte 2D-rammer og 2D-strategier i 3D-verdenen. De eksperimentelle resultatene har allerede demonstrert det store potensialet til Uni3D-rammenverket, da Uni3D-rammenverket returnerer nøyaktige og effektive resultater på tvers av en rekke innstillinger og overgår eksisterende statiske rammer.












