AI-modeller och plattformar

Uni3D: Utforska enhetlig 3D-representation i stor skala

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Att skala upp representationer av text och visuella element har varit ett stort fokus för forskning på senare tid. Utvecklingar och forskning som har genomförts under de senaste åren har lett till flera revolutioner inom språkinlärning och syn. Men trots populariteten för att skala text- och visuella representationer, har skalan av representationer för 3D-scener och objekt inte diskuterats tillräckligt.

Idag kommer vi att diskutera Uni3D, en 3D-fundamentsmodell som syftar till att utforska enhetliga 3D-representationer. Uni3D-ramverket använder en 2D-initierad ViT-ram (Vision Transformer) som förtränas slutpunkt-till-slutpunkt för att justera bild-textfunktioner med motsvarande 3D-punktmolnsfunktioner.

Uni3D-ramverket använder pretextuppgifter och en enkel arkitektur för att utnyttja överflödet av förtränade 2D-modeller och bild-textjusterade modeller som initialiseringar och mål, respectively. Detta tillvägagångssätt frigör det fulla potentialen hos 2D-modeller och strategier för att skala dem till 3D-världen.

I den här artikeln kommer vi att dyka djupare in i 3D-datorseende och Uni3D-ramverket, och utforska de viktigaste begreppen och modellens arkitektur. Så, låt oss börja.

Uni3D och 3D-representation: En introduktion

Under de senaste åren har datorseende utvecklats till ett av de mest investerade områdena inom AI-branschen. Efter betydande framsteg inom 2D-datorseende har utvecklare flyttat fokus till 3D-datorseende. Detta område, särskilt 3D-representation, kombinerar aspekter av datormaskin, maskinlärning, datorseende och matematik för att automatisera bearbetning och förståelse av 3D-geometri. Den snabba utvecklingen av 3D-sensorer som LiDAR, tillsammans med deras omfattande tillämpningar inom AR/VR-industrin, har resulterat i att 3D-representation har fått ökad uppmärksamhet. Dess potentiala tillämpningar fortsätter att växa dagligen.

Även om befintliga ramverk har visat på imponerande framsteg inom 3D-modellarkitektur, uppgiftsorienterad modellering och lärandemål, har de flesta utforskat 3D-arkitektur på en relativt liten skala med begränsad data, parametrar och uppgiftsscenarier. Utmaningen att lära sig skalbara 3D-representationer, som sedan kan tillämpas i realtidsapplikationer i olika miljöer, förblir i stort sett outforskad.

Vidare, under de senaste åren, har skalan av stora språkmodeller som förtränats hjälpt till att revolutionera det naturliga språkbehandlingsområdet, och nyliga arbeten har indikerat en översättning av framstegen från språk till 2D med hjälp av data- och modellskalning, vilket möjliggör för utvecklare att försöka och återförsöka denna framgång för att lära sig en 3D-representation som kan skalas och överföras till applikationer i den verkliga världen.

Uni3D är ett skalbart och enhetligt förtränings-3D-ramverk som utvecklats med målet att lära sig storskaliga 3D-representationer som testar gränserna vid en skala av över en miljard parametrar, över 10 miljoner bilder parade med över 70 miljoner texter och över en miljon 3D-former. Figuren nedan jämför nollskottsstyrkan mot parametrar i Uni3D-ramverket. Uni3D-ramverket skalar framgångsrikt 3D-representationer från 6 miljoner till över en miljard.

Uni3D-ramverket består av en 2D-ViT eller Vision Transformer som 3D-kodare som sedan förtränas slutpunkt-till-slutpunkt för att justera bild-textfunktioner med 3D-punktmolnsfunktioner. Uni3D-ramverket använder pretextuppgifter och en enkel arkitektur för att utnyttja överflödet av förtränade 2D-modeller och bild-textjusterade modeller som initialiseringar och mål, respectively, vilket frigör det fulla potentialen hos 2D-modeller och strategier för att skala dem till 3D-världen. Flexibiliteten och skalbarheten hos Uni3D-ramverket mäts i form av

  1. Att skala modellen från 6M till över en miljard parametrar.
  2. 2D-initiering till textövervakad från visuell självövervakad inlärning.
  3. Text-bildmålmodellskalning från 150 miljoner till över en miljard parametrar.

Under det flexibla och enhetliga ramverket som erbjuds av Uni3D, observerar utvecklare en sammanhängande förbättring av prestandan när det gäller att skala varje komponent. Den storskaliga 3D-representationen lär sig också enormt mycket från de delbara 2D- och skalförhöjningsstrategierna.

Som det kan ses i figuren nedan, visar Uni3D-ramverket en förbättring av prestandan jämfört med tidigare konstverk i fåskott- och nollskottssättningar. Det är värt att notera att Uni3D-ramverket returnerar en nollskottsklassificeringsnoggrannhet på över 88% på ModelNet, vilket är jämförbart med prestandan hos flera state-of-the-art-övervakningsmetoder.

Dessutom levererar Uni3D-ramverket toppklassnoggrannhet och prestanda när det utför andra representativa 3D-uppgifter som delsegmentering och öppenvärldsförståelse. Uni3D-ramverket syftar till att överbrygga gapet mellan 2D-syn och 3D-syn genom att skala 3D-fundamentala modeller med en enhetlig men enkel förträningsmetod för att lära sig mer robusta 3D-representationer över en mängd olika uppgifter, vilket kan hjälpa till att konvergera 2D- och 3D-syn över en mängd olika modaliteter.

Uni3D: Relaterat arbete

Uni3D-ramverket hämtar inspiration och lär av utvecklingarna som gjorts av tidigare 3D-representation och fundamentala modeller, särskilt under olika modaliteter.

3D-representation

3D-representationmetoden använder molnpunkter för 3D-förståelse av objekt, och detta område har utforskats av utvecklare i stor utsträckning under de senaste åren, och det har observerats att dessa molnpunkter kan förtränas under självövervakning med hjälp av specifika 3D-pretextuppgifter, inklusive maskpunktmodellering, självrekonstruktion och kontrastiv inlärning.

Det är värt att notera att dessa metoder fungerar med begränsad data och de undersöker ofta inte multimodala representationer till 3D från 2D eller NLP. Men den senaste framgången med CLIP-ramverket som returnerar hög effektivitet i att lära sig visuella koncept från rå text med hjälp av kontrastiv inlärning, och som syftar till att lära sig 3D-representationer genom att justera bild-, text- och molnpunktsfunktioner med hjälp av samma kontrastiva inlärning.

Fundamentala modeller

Utvecklare har arbetat intensivt med att designa fundamentala modeller för att skala upp och enhetliga multimodala representationer. Till exempel, inom NLP-domänen, har utvecklare arbetat med ramverk som kan skala upp förtränade språkmodeller, och det revolutionerar långsamt NLP-industrin. Dessutom har framsteg observerats inom 2D-syndomänen, eftersom utvecklare arbetar med ramverk som använder data- och modellskalningstekniker för att hjälpa till att göra framsteg i språk till 2D-modeller, även om sådana ramverk är svåra att replikera för 3D-modeller på grund av den begränsade tillgängligheten av 3D-data och utmaningarna som uppstår när man försöker enhetliga och skala upp 3D-ramverken.

Genom att lära av dessa två arbetsområden har utvecklare skapat Uni3D-ramverket, den första 3D-fundamentala modellen med över en miljard parametrar som använder en enhetlig ViT- eller Vision Transformer-arkitektur som tillåter utvecklare att skala Uni3D-ramverket med hjälp av enhetliga 3D- eller NLP-strategier för att skala upp modellerna. Utvecklare hoppas att denna metod kommer att tillåta Uni3D-ramverket att överbrygga gapet som för närvarande separerar 2D- och 3D-syn, samt att underlätta multimodal konvergens.

Uni3D: Metod och arkitektur

Bilden ovan visar en generell översikt av Uni3D-ramverket, ett skalbart och enhetligt förtränings-3D-ramverk för storskalig 3D-representation. Utvecklare använder över 70 miljoner texter och 10 miljoner bilder parade med över en miljon 3D-former för att skala Uni3D-ramverket till över en miljard parametrar. Uni3D-ramverket använder en 2D-ViT eller Vision Transformer som 3D-kodare som sedan förtränas slutpunkt-till-slutpunkt för att justera text-bilddata med 3D-molnpunktsfunktioner, vilket tillåter Uni3D-ramverket att leverera önskad effektivitet och noggrannhet över en mängd olika benchmark.

Att skala Uni3D-ramverket

Tidigare studier om molnpunktsrepresentation har traditionellt fokuserat på att designa specifika modellarkitekturer som levererar bättre prestanda över en mängd olika applikationer och fungerar med en begränsad mängd data på grund av småskaliga datamängder. Men nyliga studier har försökt att utforska möjligheten att använda skalbar förträningsinlärning i 3D, men det fanns inga stora resultat på grund av den begränsade tillgängligheten av 3D-data. För att lösa skalbarhetsproblemet hos 3D-ramverk, använder Uni3D-ramverket kraften hos en vaniljtransformatorstruktur som nästan speglar en Vision Transformer, och kan lösa skalbarhetsproblemen genom att använda enhetliga 2D- eller NLP-skalförhöjningsstrategier för att skala modellstorleken.

Tidigare studier om molnpunktsrepresentation har traditionellt fokuserat på att designa specifika modellarkitekturer som levererar bättre prestanda över en mängd olika applikationer och fungerar med en begränsad mängd data på grund av småskaliga datamängder. Men nyliga studier har försökt att utforska möjligheten att använda skalbar förträningsinlärning i 3D, men det fanns inga stora resultat på grund av den begränsade tillgängligheten av 3D-data. För att lösa skalbarhetsproblemet hos 3D-ramverk, använder Uni3D-ramverket kraften hos en vaniljtransformatorstruktur som nästan speglar en Vision Transformer, och kan lösa skalbarhetsproblemen genom att använda enhetliga 2D- eller NLP-skalförhöjningsstrategier för att skala modellstorleken.

Initiera Uni3D

En annan stor utmaning som tidigare arbeten som syftar till att skala 3D-representationer har mött, är svårigheterna med konvergens och överanpassning som är ett resultat av den stora storleken på modellerna. En effektiv metod för att övervinna detta hinder är att förträna individuella 3D-ryggradsstrukturer med specifika 3D-pretextuppgifter och initiera förtränade parametrar. Men denna metod åtföljs av höga träningskostnader, och det är också svårt att etablera en robust initiering för cross-modalt lärande på grund av den begränsade mängden 3D-data som är tillgänglig för träningsändamål.

Uni3D-ramverket använder en vaniljtransformator, vars struktur liknar ViT. Med detta tillvägagångssätt kan Uni3D-ramverket naturligt anta förtränade stora modeller med andra modaliteter för att initiera Uni3D-ramverket.

Multi-modalt justering

Uni3D-ramverket försöker lära sig multi-modalt justering över bild, språk och punktmoln genom att använda paradigmer som liknar OpenShape och ULIP-ramverken. Dessutom, för att säkerställa en rättvis jämförelse med andra metoder, använder Uni3D-ramverket den sammanslagna 3D-databasen från OpenShape för träningsändamål. Denna sammanslagna databas från OpenShape består av 4 3D-databaser:

  1. Objaverse.
  2. ShapeNet.
  3. 3D-FUTURE.
  4. ABO.

Experiment och resultat

Uni3D-ramverket testas i olika inställningar och över olika klassificeringsuppgifter, inklusive dess prestanda i nollskott- och fåskottssättningar, resultat kring öppenvärldsförståelse och mer. Låt oss ta en närmare titt på dessa resultat.

Nollskott formklassificering

För att utvärdera prestandan hos Uni3D-ramverket över nollskott formklassificeringsuppgifter, genomför utvecklarna experiment över tre benchmark-databaser, inklusive ModelNet, ScanObjNN och Objaverse-LVIS-benchmark-databaserna. ModelNet och ScanObjNN är databaser som vanligtvis används för klassificeringsuppgifter och består av 15 respektive 40 objekt kategorier, medan Objaverse-LVIS-benchmark är en ren och annoterad databas som består av över 40 000 objekt över 1 100+ kategorier. Jämförelsen mellan ramverken visas i bilden nedan, och som det kan ses, överträffar Uni3D-ramverket tidigare state-of-the-art-ramverk i olika inställningar.

Fåskott linjär provning

I AI är linjär provning en vanlig metod som används för att utvärdera representationer som ett ramverk eller en modell lär sig. För att utvärdera Uni3D:s linjär provningsförmåga, fryser utvecklarna parametrarna i Uni3D-ramverket med hjälp av vanliga inställningar som OpenShape. Därefter tränar utvecklarna en linjär klassificerare för Uni3D med hjälp av fåskottsklassetiketter. Figuren nedan visar den linjära provningsförmågan hos olika ramverk på Objaverse-LVIS-databasen och visar den genomsnittliga prestandan hos modellen över 10 slumpmässiga frön. Som det kan ses, överträffar Uni3D-ramverket befintliga metoder avsevärt i olika fåskottssättningar.

Öppenvärldsförståelse

För att utvärdera Uni3D-ramverkets förmåga att förstå verkliga världens former och objekt i realtid, använder utvecklarna ScanNet och CLIP-databaserna för att utforska Uni3D:s prestanda. Det är värt att notera att den faktiska instantsegmenteringen är tillgänglig, och det primära målet är att känna igen kategorin för varje scens individuella instant i en nollskottssättning. Resultaten visas i bilden nedan. Som det kan ses, levererar Uni3D-ramverket exceptionella resultat när det utför öppenvärldsförståelse och igenkänning. Uni3D-ramverket överträffar befintliga ramverk med en betydande marginal, trots att det aldrig har tränats på verkliga världens databaser.

Cross-modalt återställande

De multi-modala representationer som Uni3D-ramverket lär sig kan tillåta ramverket att återställa 3D-former naturligt antingen från text eller bilder. För att återställa 3D-formerna, beräknar modellen kosinlikheten mellan 3D-formernas inbäddningar och inbäddningarna av en frågetext eller en frågebild. Ramverket använder sedan KNN eller K Nearest Neighbour-algoritmen för att generera 3D-former som liknar frågan mest, och resultaten visas i figuren nedan. Som det kan ses, använder Uni3D-ramverket verkliga världens bilder för att återställa 3D-former. Dessutom är det värt att notera att träningsbilderna endast används för rendering, och gapet mellan verkliga världens bilder och träningsbilderna är betydande. Dessutom tar modellen två inmatningsbilder och återställer former som liknar båda inmatningsbilderna genom att använda kosinlikheten mellan genomsnittet av båda bildernas inbäddningar och deras inbäddade 3D-former. Resultaten är intressanta, eftersom de visar Uni3D:s förmåga att lära sig olika 3D-representationer och uppfatta flera 2D-signal.

I den första kolumnen, använder ramverket två frågebilder för att returnera 3D-former som är mest lika frågebilderna. I den andra kolumnen, använder ramverket två inmatningsbilder för att återställa 3D-former som liknar båda inmatningsbilderna. Slutligen, i den sista kolumnen, använder modellen frågetexter och returnerar 3D-former som liknar frågetexten mest.

Slutliga tankar

I den här artikeln har vi diskuterat Uni3D, ett skalbart och enhetligt förtränings-3D-ramverk som utvecklats med målet att lära sig storskaliga 3D-representationer som testar gränserna vid en skala av över en miljard parametrar, över 10 miljoner bilder parade med över 70 miljoner texter och över en miljon 3D-former. Utvecklarna av ramverket har inkluderat en vaniljtransformator med en struktur som liknar ViT, vilket tillåter dem att skala Uni3D-ramverket med hjälp av enhetliga 2D- eller NLP-skalförhöjningsstrategier. Dessutom kan Uni3D-ramverket utnyttja ett brett utbud av förtränade 2D-ramverk och 2D-strategier till 3D-världen. De experimentella resultaten har redan visat på det enorma potentialen hos Uni3D-ramverket, eftersom Uni3D-ramverket returnerar precisa och effektiva resultat över en mängd olika inställningar och överträffar befintliga state-of-the-art-ramverk.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.