AI-modeller og plattformer

Uni3D: Utforsking av Unified 3D-Representasjon på Storskala

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Skalering av tekst- og visuelle representasjoner har vært et viktig fokusområde for forskning i de senere årene. Utvikling og forskning som er gjennomført i de senere årene har ført til flere revolusjoner i språklæring og visjon. Imidlertid, til tross for populariteten til å skale tekst- og visuelle representasjoner, har skalering av representasjoner for 3D-scener og objekter ikke blitt tilstrekkelig diskutert.

I dag skal vi diskutere Uni3D, en 3D-grunnmodell som har som mål å utforske unified 3D-representasjoner. Uni3D-rammenverket bruker en 2D-inisialisert ViT-ramme, som er forhåndstrengt fra ende til ende, for å justere bilde-tekst-egenskaper med deres tilhørende 3D-punktsky-egenskaper.

Uni3D-rammenverket bruker pretext-oppdrag og en enkel arkitektur for å utnytte overfloden av forhåndstrengte 2D-modeller og bilde-tekst-justerte modeller som initialisering og mål, henholdsvis. Dette tilnærmingen løser fullt potensialet til 2D-modeller og strategier for å skale dem opp til 3D-verdenen.

I denne artikkelen skal vi dykke dyptere inn i 3D-datamaskinsyn og Uni3D-rammenverket, og utforske de essensielle konseptene og arkitekturen til modellen. Så, la oss begynne.

Uni3D og 3D-Representasjonslæring: En Introduksjon

I de senere årene har datamaskinsyn oppstått som ett av de mest investerte områdene i AI-industrien. Etter betydelige fremgang i 2D-datamaskinsynsrammer, har utviklerne skiftet fokus til 3D-datamaskinsyn. Dette feltet, spesielt 3D-representasjonslæring, kombinerer aspekter av datagrafikk, maskinlæring, datamaskinsyn og matematikk for å automatisere prosessering og forståelse av 3D-geometri. Den raske utviklingen av 3D-sensorene som LiDAR, sammen med deres vidstrakte anvendelser i AR/VR-industrien, har resultert i at 3D-representasjonslæring har fått økt oppmerksomhet. Dens potensielle anvendelser vokser daglig.

Selv om eksisterende rammer har vist bemerkelsesverdig fremgang i 3D-modellarkitektur, oppgave-orientert modellering og læringsmål, utforsker de fleste 3D-arkitektur på en relativt liten skala med begrensede data, parametre og oppgavescenarier. Utfordringen med å lære skalerbare 3D-representasjoner, som kan anvendes i sanntidsapplikasjoner i ulike miljøer, forblir stort sett uutforsket.

Ved å gå videre, i de senere årene, har skaleringsstore språkmodeller som er forhåndstrengt, hjulpet til å revolusjonere det naturlige språkbehandlingsdomenet, og nyere arbeider har indikert en oversettelse av fremgangen fra språk til 2D ved hjelp av datascale og modellskaleringsmetoder, som åpner vei for utviklere til å prøve og gjenta denne suksessen for å lære en 3D-representasjon som kan skaleres og overføres til sanntidsapplikasjoner i den virkelige verden.

Uni3D er en skalerbar og forent forhåndstrening 3D-ramme utviklet med mål om å lære store 3D-representasjoner som tester grensene på en skala over en milliard parametre, over 10 millioner bilder parret med over 70 millioner tekster og over en million 3D-former. Figuren under sammenligner nullskuddnøyaktigheten mot parametre i Uni3D-rammenverket. Uni3D-rammenverket skalerer med suksess 3D-representasjoner fra 6 millioner til over en milliard.

Uni3D-rammenverket består av en 2D-ViT eller en visjonstransformator som 3D-encoder, som deretter er forhåndstrengt fra ende til ende for å justere bilde-tekst-egenskaper med 3D-punktsky-egenskaper. Uni3D-rammenverket bruker pretext-oppdrag og en enkel arkitektur for å utnytte overfloden av forhåndstrengte 2D-modeller og bilde-tekst-justerte modeller som initialisering og mål, henholdsvis, og løser dermed fullt potensialet til 2D-modeller og strategier for å skale dem opp til 3D-verdenen. Fleksibiliteten og skalerbarheten til Uni3D-rammenverket måles i form av

  1. Skalering av modellen fra 6M til over en milliard parametre.
  2. 2D-inisialisering til tekst-overvåket fra visuell selv-overvåket læring.
  3. Tekst-bilde-målmodell-skaleringsfra 150 millioner til over en milliard parametre.

Under den fleksible og forente rammen tilbudt av Uni3D, observerer utviklerne en samstemt økning i ytelsen når det gjelder å skale hver komponent. Den store 3D-representasjonslæringen nyter også storparten av de delbare 2D- og skaleringsstrategier.

Som det kan ses i figuren under, viser Uni3D-rammenverket en økning i ytelsen sammenlignet med tidligere kunstverk i få-skudd- og nullskudd-innstillinger. Det er verdt å merke seg at Uni3D-rammenverket returnerer en nullskudd-klassifiseringsnøyaktighet på over 88% på ModelNet, som er på linje med ytelsen til flere statiske overvåkingsmetoder.

Videre leverer Uni3D-rammenverket også toppnivå-nøyaktighet og ytelse når det utfører andre representative 3D-oppdrag som del-segmentering og åpen verden-forståelse. Uni3D-rammenverket har som mål å lukke gapet mellom 2D-syn og 3D-syn ved å skale 3D-grunnmodeller med en forent, men enkel forhåndstreningstilnærming for å lære mer robuste 3D-representasjoner på tvers av en rekke oppdrag, som kan hjelpe til å konvergere 2D- og 3D-syn på tvers av en rekke modaliteter.

Uni3D: Relatert Arbeid

Uni3D-rammenverket trekker inspirasjon og lærer fra utviklingene som er gjort av tidligere 3D-representasjonslæring og grunnmodeller, spesielt under ulike modaliteter.

3D-Representasjonslæring

3D-representasjonslæringsmetoden bruker skyttenpunkter for 3D-forståelse av objektet, og dette feltet har vært utforsket av utviklere mye i de senere årene, og det har blitt observert at disse skyttenpunkter kan være forhåndstrengt under selv-overvåking ved hjelp av bestemte 3D-pretext-oppdrag, inkludert maskespunktmodellering, selv-rekonstruksjon og kontrastiv læring.

Det er verdt å merke seg at disse metodene fungerer med begrensede data, og de undersøker ofte ikke multimodale representasjoner til 3D fra 2D eller NLP. Imidlertid har det nylige suksessen til CLIP-rammenverket, som returnerer høy effisiens i å lære visuelle konsepter fra rå tekst ved hjelp av kontrastiv læring, og videre søker å lære 3D-representasjoner ved å justere bilde-, tekst- og skyttenpunkts-egenskaper ved hjelp av samme kontrastive læring.

Grunnmodeller

Utviklere har uttømmende arbeidet med å designe grunnmodeller for å skale opp og forene multimodale representasjoner. For eksempel, i NLP-domenet, har utviklere arbeidet med rammer som kan skale opp forhåndstrengte språkmodeller, og det har revolusjonert NLP-industrien. Videre har det blitt observert fremgang i 2D-syn-domenet også, fordi utviklere arbeider med rammer som bruker datascale og modellskaleringsmetoder for å hjelpe til å fremme språk til 2D-modeller, selv om slike rammer er vanskelige å replikere for 3D-modeller på grunn av begrensede 3D-data og utfordringer som oppstår når man forener og skalerer 3D-rammer.

Ved å lære fra disse to arbeidsområdene, har utviklere skapt Uni3D-rammenverket, den første 3D-grunnmodellen med over en milliard parametre som bruker en forent ViT- eller visjonstransformator-arkitektur som tillater utviklere å skale Uni3D-rammenverket ved hjelp av forente 3D- eller NLP-strategier for å skale opp modellen. Utviklere håper at denne metoden vil tillate Uni3D-rammenverket å lukke gapet som skiller 2D- og 3D-syn, samt å fasilitere multimodal konvergens.

Uni3D: Metode og Arkitektur

Bildet ovenfor viser en generell oversikt over Uni3D-rammenverket, en skalerbar og forent forhåndstrening 3D-ramme for stor skala 3D-representasjonslæring. Utviklere bruker over 70 millioner tekster og 10 millioner bilder parret med over en million 3D-former for å skale Uni3D-rammenverket til over en milliard parametre. Uni3D-rammenverket bruker en 2D-ViT eller visjonstransformator som 3D-encoder, som deretter er forhåndstrengt fra ende til ende for å justere tekst-bilde-data med 3D-punktsky-egenskaper, og tillater Uni3D-rammenverket å levere ønsket effisiens og nøyaktighet på tvers av en rekke benchmark.

Skalering av Uni3D-Rammenverket

Tidligere studier om skyttenpunktsrepresentasjonslæring har tradisjonelt fokusert på å designe bestemte modellarkitekturer som leverer bedre ytelse på tvers av en rekke applikasjoner, og arbeider på en begrenset mengde data på grunn av små skala-datasett. Imidlertid har nyere studier prøvd å utforske muligheten til å bruke skalerbar forhåndstrening i 3D, men det har ikke vært noen store resultater på grunn av begrensede 3D-data. For å løse skalerbarhetsproblemet til 3D-rammer, utnytter Uni3D-rammenverket kraften til en vanlig transformatorstruktur som nesten speiler en visjonstransformator, og kan løse skaleringsproblemer ved hjelp av forente 2D- eller NLP-skaleringsstrategier for å skale opp modellstørrelsen.

Tidligere studier om skyttenpunktsrepresentasjonslæring har tradisjonelt fokusert på å designe bestemte modellarkitekturer som leverer bedre ytelse på tvers av en rekke applikasjoner, og arbeider på en begrenset mengde data på grunn av små skala-datasett. Imidlertid har nyere studier prøvd å utforske muligheten til å bruke skalerbar forhåndstrening i 3D, men det har ikke vært noen store resultater på grunn av begrensede 3D-data. For å løse skalerbarhetsproblemet til 3D-rammer, utnytter Uni3D-rammenverket kraften til en vanlig transformatorstruktur som nesten speiler en visjonstransformator, og kan løse skaleringsproblemer ved hjelp av forente 2D- eller NLP-skaleringsstrategier for å skale opp modellstørrelsen.

Initialisering av Uni3D

En annen stor utfordring som tidligere arbeid om skalerings-3D-representasjoner har møtt, er vanskelighetene med konvergens og overfitting som var et resultat av den store størrelsen på modellene. En effektiv tilnærming for å overvinne denne hindringen er å forhåndstrege individuelle 3D-rygger med bestemte 3D-pretext-oppdrag, og initialisere forhåndstrengte parametre. Imidlertid er denne tilnærmingen ledsaget av høye treningskostnader, og det er også vanskelig å etablere en robust initialisering for kryssmodell-læring på grunn av den begrensede mengden 3D-data som er tilgjengelig for treningsformål.

Uni3D-rammenverket utnytter en vanlig transformator, hvis struktur ligner ViT. Med denne tilnærmingen kan Uni3D-rammenverket naturlig adoptere forhåndstrengte store modeller med andre modaliteter for å initialisere Uni3D-rammenverket.

Multi-Modal Justering

Uni3D-rammenverket forsøker å lære multi-modale justeringer på tvers av bilde, språk og punktskytter ved hjelp av paradigmer som ligner OpenShape og ULIP-rammer. Videre, for å sikre en rettferdig sammenligning med andre metoder, bruker Uni3D-rammenverket det ensemblet 3D-datasett fra OpenShape for treningsformål. Dette ensemblet datasett fra OpenShape består av 4 3D-datasett:

  1. Objaverse.
  2. ShapeNet.
  3. 3D-FUTURE.
  4. ABO.

Eksperimenter og Resultater

Uni3D-rammenverket er testet på tvers av ulike innstillinger og på tvers av ulike klassifiseringsoppdrag, inkludert ytelsen i nullskudd- og få-skudd-innstillinger, resultater rundt åpen verden-forståelse og mer. La oss se nærmere på disse resultatene.

Nullskudd Form-Klassifisering

For å evaluere ytelsen til Uni3D-rammenverket på tvers av nullskudd form-klassifisering, gjennomfører utviklerne eksperimenter på tvers av tre benchmark-datasett, inkludert ModelNet, ScanObjNN og Objaverse-LVIS-benchmark-datasett. ModelNet og ScanObjNN er datasett som vanligvis brukes for klassifisering, og de består av 15 og 40 objekt-kategorier, henholdsvis, mens Objaverse-LVIS-benchmark er et rent og annotert datasett som består av over 40 000 objekter på tvers av 1 100+ kategorier. Sammenligningen mellom rammer er vist i bildet under, og som det kan ses, overgår Uni3D-rammenverket tidligere kunstverk på tvers av ulike innstillinger.

Få-Skudd Lineær Prøving

I AI, er lineær prøving en vanlig metode som brukes for å evaluere representasjonene som en ramme eller modell lærer. For å evaluere Uni3D-rammenverkets lineær prøvings-evne, fryser utviklerne parameterne til Uni3D-rammenverket ved hjelp av vanlige innstillinger som OpenShape. Deretter trener utviklerne en lineær klassifikator for Uni3D ved hjelp av få-skudd-klassifikasjons-etiketter. Figuren under viser lineær prøvings-evnen til ulike rammer på Objaverse-LVIS-datasett, og viser gjennomsnittlig ytelse til modellen på tvers av 10 tilfeldige frø. Som det kan ses, overgår Uni3D-rammenverket eksisterende metoder betydelig på tvers av ulike få-skudd-innstilling.

Åpen Verden-Forståelse

For å evaluere evnen til Uni3D-rammenverket til å forstå sanntidsformer og objekter i sanntid, bruker utviklerne ScanNet og CLIP-datasett for å utforske Uni3D-rammenverkets ytelse. Det er verdt å merke seg at bakgrunns-instant-segmentering er tilgjengelig, og hovedmålet er å gjenkjenne kategorien til hver scenes individuelle instant i en nullskudd-innstilling. Resultatene er vist i bildet under. Som det kan ses, leverer Uni3D-rammenverket usedvanlige resultater når det gjelder åpen verden-forståelse og gjenkjennelse. Uni3D-rammenverket overgår eksisterende rammer med en betydelig margin, til tross for at det aldri har blitt trent på sanntids-datasett.

Kryss-Modal Retrievering

De multimodale representasjonene som Uni3D-rammenverket lærer, kan tillate rammenverket å hente 3D-former naturlig fra tekst eller bilder. For å hente 3D-former, beregner modellen kosinus-lignende mellom 3D-form-embedninger og embedninger av en tekst- eller bilde-spørring. Rammenverket bruker deretter KNN eller K-nærmeste nabo-algoritmen for å generere 3D-former som ligner spørringen mest, og resultatene er vist i figuren under. Som det kan ses, bruker Uni3D-rammenverket sanntids-bilder for å hente 3D-former. Videre er det verdt å merke seg at trening-bilder bare brukes til rendering-formål, og gapet mellom sanntids- og trening-bilder er betydelig. I tillegg henter modellen to input-bilder og henter former som ligner begge input-bilder ved hjelp av kosinus-lignende mellom embedninger av begge bildene og deres embedderte 3D-former. Resultatene er interessante, da de viser Uni3D-rammenverkets evne til å lære diverse 3D-representasjoner og oppfatte flere 2D-signaler.

I den første kolonnen, bruker rammenverket to spørrings-bilder for å returnere 3D-former som er mest like spørrings-bildene. I den andre kolonnen, henter rammenverket to input-bilder og henter former som ligner begge input-bilder. Til slutt, i den siste kolonnen, bruker modellen tekst-spørringer og returnerer 3D-former som ligner tekst-spørringen mest.

Slutt tanker

I denne artikkelen har vi diskutert Uni3D, en skalerbar og forent forhåndstrening 3D-ramme utviklet med mål om å lære store 3D-representasjoner som tester grensene på en skala over en milliard parametre, over 10 millioner bilder parret med over 70 millioner tekster og over en million 3D-former. Utviklerne av rammenverket har inkludert en vanlig transformator med en struktur som ligner ViT, som tillater dem å skale opp Uni3D-rammenverket ved hjelp av forente 2D- eller NLP-skaleringsstrategier. Videre kan Uni3D-rammenverket utnytte en rekke forhåndstrengte 2D-rammer og 2D-strategier i 3D-verdenen. De eksperimentelle resultatene har allerede demonstrert det store potensialet til Uni3D-rammenverket, da Uni3D-rammenverket returnerer nøyaktige og effektive resultater på tvers av en rekke innstillinger og overgår eksisterende statiske rammer.

Kunal Kejriwal er en backend‑ingeniør som spesialiserer seg på Python, PostgreSQL, Redis og skyinfrastruktur på GCP og AWS. Med tre års erfaring med å bygge og skalere produksjonssystemer skriver han om AI‑infrastruktur, distribuerte systemer og arkitekturen bak utrulling av maskinlæringsarbeidsbelastninger.