AI-mallit ja alustat
Uni3D: Tutkimalla YhdistettyÃĪ 3D-Edustusta Suurimittakaavaisesti
Tekstien ja visuaalisten esitysten skaalaaminen on ollut merkittÃĪvÃĪ tutkimuksen kohteena viime vuosina. Viimeaikaiset kehitysaskeleet ja tutkimukset ovat johtaneet useisiin mullistuksiin kielenoppimisessa ja nÃĪkemisessÃĪ. Kuitenkin, vaikka teksti- ja visuaalisten esitysten skaalaaminen on ollut suosittua, 3D-kohteiden ja -kohtauksien esitysten skaalaaminen ei ole ollut riittÃĪvÃĪsti keskustelun aiheena.
TÃĪnÃĪÃĪn, tarkastelemme Uni3D:ÃĪ, 3D-perusmallia, jonka tavoitteena on tutkia yhdistettyjÃĪ 3D-esityksiÃĪ. Uni3D-runko kÃĪyttÃĪÃĪ 2D-aloitettua ViT-runkoa, joka on esikoulutettu loppuun asti, jotta voidaan kohdistaa kuva-teksti-ominaisuudet vastaavien 3D-pilvipistekohtaisiin ominaisuuksiin.
Uni3D-runko kÃĪyttÃĪÃĪ esitehtÃĪviÃĪ ja yksinkertaista arkkitehtuuria hyÃķdyntÃĪÃĪkseen runsaan mÃĪÃĪrÃĪn esikoulutettuja 2D-malleja ja kuva-teksti-kohdistettuja malleja aloituksina ja kohderyhmÃĪnÃĪ. TÃĪmÃĪ lÃĪhestymistapa vapauttaa 2D-mallien ja -strategioiden tÃĪyden potentiaalin skaalata 3D-maailmaan.
TÃĪssÃĪ artikkelissa, tarkastelemme syvemmÃĪlle 3D-tietokoneen nÃĪkemiseen ja Uni3D-runkoon, tutkimalla olennaiset kÃĪsitteet ja mallin arkkitehtuuria. Joten, aloitetaan.
Uni3D ja 3D-Edustusoppi: Johdanto
Viime vuosina, tietokonenÃĪkeminen on kehittynyt yhdeksi eniten sijoitetuksi alaksi tekoÃĪlyteollisuudessa. MerkittÃĪvien edistysten jÃĪlkeen 2D-tietokonenÃĪkemisessÃĪ, kehittÃĪjÃĪt ovat siirtÃĪneet fokuksensa 3D-tietokonenÃĪkemiseen. TÃĪmÃĪ ala, erityisesti 3D-edustusoppi, yhdistÃĪÃĪ tietokonegrafiikan, koneoppimisen, tietokonenÃĪkemisen ja matematiikan jotta voidaan automatisoida 3D-geometrian kÃĪsittely ja ymmÃĪrtÃĪminen. 3D-sensoreiden, kuten LiDARin, nopea kehitys ja laaja soveltaminen AR/VR-teollisuudessa on johtanut siihen, ettÃĪ 3D-edustusoppi on saanut lisÃĪÃĪntynyttÃĪ huomiota. Sen soveltamismahdollisuudet kasvavat joka pÃĪivÃĪ.
Vaikka olemassa olevat rungot ovat osoittaneet merkittÃĪvÃĪÃĪ edistystÃĪ 3D-mallin arkkitehtuurissa, tehtÃĪvÃĪorientoituneessa mallinnuksessa ja oppimistavoitteissa, useimmat tutkivat 3D-arkkitehtuuria suhteellisen pienellÃĪ mittakaavalla rajoitettujen datojen, parametterien ja tehtÃĪvÃĪtilanteiden kanssa. Haaste skaalattavien 3D-edustusten oppimisessa, joita voidaan soveltaa reaaliaikaisiin sovelluksiin erilaisissa ympÃĪristÃķissÃĪ, on edelleen pÃĪÃĪosin tutkimatta.
Jatkamalla, viime vuosina, suurten kielimallien skaalaaminen, jotka on esikoulutettu, on auttanut vallankumouksellisesti luonnollisen kielen prosessoinnin alalla, ja viimeaikaiset tyÃķt ovat osoittaneet, ettÃĪ edistys kielestÃĪ 2D-malleihin on mahdollista datan ja mallin skaalaamisen avulla, mikÃĪ mahdollistaa kehittÃĪjille kokeilla ja uudelleenyritys oppia 3D-edustusta, joka voidaan skaalata ja siirtÃĪÃĪ sovelluksiin reaalielÃĪmÃĪssÃĪ.
Uni3D on skaalautuva ja yhdistetty esikoulutus 3D-runko, joka on kehitetty oppiakseen suurimittakaavaisia 3D-edustuksia, jotka testaavat rajojaan yli miljardin parametrin, yli 10 miljoonan kuvan ja yli 70 miljoonan tekstin, sekÃĪ yli miljoonan 3D-muodon kanssa. Alla oleva kuva vertaa nollasuorituskykyÃĪ parametreja Uni3D-rungossa. Uni3D-runko skaalautuu onnistuneesti 3D-edustuksia 6 miljoonasta yli miljardiin.

Uni3D-runko koostuu 2D ViT:stÃĪ tai Vision Transformerista, jota kÃĪytetÃĪÃĪn 3D-kooderina, joka on sitten esikoulutettu loppuun asti kohdistamaan kuva-teksti-ominaisuudet 3D-pilvipistekohtaisiin ominaisuuksiin. Uni3D-runko kÃĪyttÃĪÃĪ esitehtÃĪviÃĪ ja yksinkertaista arkkitehtuuria hyÃķdyntÃĪÃĪkseen runsaan mÃĪÃĪrÃĪn esikoulutettuja 2D-malleja ja kuva-teksti-kohdistettuja malleja aloituksina ja kohderyhmÃĪnÃĪ, vapauttaen 2D-mallien ja -strategioiden tÃĪyden potentiaalin skaalata 3D-maailmaan. Joustavuus ja skaalautuvuus Uni3D-rungossa mitataan seuraavilla:
- Skaalauttamalla mallia 6M:sta yli miljardiin parametriin.
- 2D-aloitus tekstiin valvottuna visuaalisesta itsevalvottavasta oppimisesta.
- Teksti-kuvatarkkuusmallin skaalaaminen 150 miljoonasta yli miljardiin parametriin.
Joustavan ja yhdistetyn rungon alla, jota Uni3D tarjoaa, kehittÃĪjÃĪt havaitsevat yhtenÃĪisen suorituskyvyn parantumisen jokaisen komponentin skaalautuessa. Suurimittakaavainen 3D-edustusoppi hyÃķtyy myÃķs merkittÃĪvÃĪsti jaettavista 2D- ja skaalautusstrategioista.
Kuten alla olevasta kuvasta voidaan nÃĪhdÃĪ, Uni3D-runko nÃĪyttÃĪÃĪ suorituskyvyn parantumisen verrattuna aiempiin tutkimuksiin sekÃĪ vÃĪhÃĪ- ja nollasuorituskykytilanteissa. On huomattava, ettÃĪ Uni3D-runko saavuttaa yli 88%:n nollasuorituskykyluokituksen ModelNetissÃĪ, joka on vertailukelpoinen useiden valvottujen menetelmien suorituskyvyn kanssa.

LisÃĪksi, Uni3D-runko toimii erinomaisesti myÃķs muissa edustavissa 3D-tehtÃĪvissÃĪ, kuten osien segmentoinnissa ja avoimessa maailman ymmÃĪrtÃĪmisessÃĪ. Uni3D-runko pyrkii silittÃĪmÃĪÃĪn 2D-nÃĪkemisen ja 3D-nÃĪkemisen vÃĪlistÃĪ kuilua skaalauttamalla 3D-perusmalleja yhdistetyllÃĪ ja yksinkertaisella esikoulutuslÃĪhestymistavalla, jotta voidaan oppia vahvempia 3D-edustuksia laajalla valikoimalla tehtÃĪviÃĪ, mikÃĪ lopulta auttaa 2D- ja 3D-nÃĪkemisen yhdistymisessÃĪ laajalla valikoimalla modaaleja.
Uni3D: Aiheeseen LiittyvÃĪ TyÃķ
Uni3D-runko ammentaa inspiraatiota ja oppii aiemman 3D-edustusoppimisen ja perusmallien kehityksistÃĪ, erityisesti eri modaaleissa.
3D-Edustusoppi
3D-edustusoppi kÃĪyttÃĪÃĪ pilvipisteitÃĪ 3D-kohteiden ymmÃĪrtÃĪmiseen, ja tÃĪmÃĪ ala on ollut kehittÃĪjien tutkimisen kohteena viime aikoina. On havaittu, ettÃĪ pilvipisteet voidaan esikoulutus itsevalvottavilla 3D-esitehtÃĪvillÃĪ, mukaan lukien maskipistemallinnus, itse-uudelleenrakennus ja kontrastiivinen oppiminen.
On huomattava, ettÃĪ nÃĪmÃĪ menetelmÃĪt toimivat rajoitetulla datalla, eivÃĪtkÃĪ ne yleensÃĪ tutki multimodaalisia edustuksia 3D:sta 2D:hen tai NLP:hen. Viimeaikaisen CLIP-runkoon perustuvan menetelmÃĪn on kuitenkin osoitettu olevan hyvin tehokas oppimassa visuaalisia kÃĪsitteitÃĪ raakatekstistÃĪ kontrastiivisen oppimismenetelmÃĪn avulla, ja se pyrkii oppimaan 3D-edustuksia kohdistamalla kuva-, teksti- ja pilvipistekohtaiset ominaisuudet samalla kontrastiivisella oppimismenetelmÃĪllÃĪ.
Perusmallit
KehittÃĪjÃĪt ovat tehneet tyÃķtÃĪ perusmallien suunnittelussa skaalauttamalla ja yhdistÃĪmÃĪllÃĪ multimodaalisia edustuksia. Esimerkiksi NLP-alalla kehittÃĪjÃĪt ovat tyÃķskennelleet kehittÃĪÃĪkseen runkoja, jotka voivat skaalata esikoulutettuja kielimalleja, ja se on vallankumouksellisesti muuttanut NLP-alaa. EdistystÃĪ on myÃķs havaittu 2D-nÃĪkemisen alalla, koska kehittÃĪjÃĪt tyÃķskentelevÃĪt runkojen parissa, jotka kÃĪyttÃĪvÃĪt datan ja mallin skaalaamisen menetelmiÃĪ edistÃĪÃĪkseen kielenoppimista 2D-malleihin, vaikka tÃĪllaiset rungot ovat haasteellisia replikoida 3D-malleihin rajoitetun 3D-datan ja 3D-runkojen yhdistÃĪmisen haasteiden vuoksi.
Opittuaan nÃĪistÃĪ kahdesta tyÃķalasta, kehittÃĪjÃĪt ovat luoneet Uni3D-rungon, ensimmÃĪisen 3D-perusmallin, jolla on yli miljardi parametriÃĪ, joka kÃĪyttÃĪÃĪ yhdistettyÃĪ ViT- tai Vision Transformer -arkkitehtuuria, joka mahdollistaa kehittÃĪjille skaalata Uni3D-runkoa yhdistetyillÃĪ 3D- tai NLP-strategioilla. KehittÃĪjÃĪt toivovat, ettÃĪ tÃĪmÃĪ menetelmÃĪ auttaa Uni3D-runkoa silittÃĪmÃĪÃĪn 2D- ja 3D-nÃĪkemisen vÃĪlistÃĪ kuilua ja edistÃĪmÃĪÃĪn multimodaalista yhdistymistÃĪ.
Uni3D: MenetelmÃĪ ja Arkkitehtuuri

YllÃĪ oleva kuva esittÃĪÃĪ yleiskatsauksen Uni3D-rungosta, skaalautuvasta ja yhdistetystÃĪ 3D-esikoulutusmallista suurimittakaavaiselle 3D-edustusoppimiselle. KehittÃĪjÃĪt kÃĪyttÃĪvÃĪt yli 70 miljoonaa tekstiÃĪ ja 10 miljoonaa kuvaa, jotka on parittu yli miljoonan 3D-muodon kanssa, skaalatakseen Uni3D-runkoa yli miljardiin parametriin. Uni3D-runko kÃĪyttÃĪÃĪ 2D ViT:ÃĪ tai Vision Transformeria 3D-kooderina, joka on sitten esikoulutettu loppuun asti kohdistamaan teksti-kuvatiedot 3D-pilvipistekohtaisiin ominaisuuksiin, mahdollistaen Uni3D-rungolle toimia tehokkaasti ja tarkasti laajalla valikoimalla mittareita.
Skaalauttaminen Uni3D-Rungossa
Aiemmat tutkimukset pilvipisteen edustusoppimisesta ovat perinteisesti keskittyneet suunnittelemaan erityisiÃĪ mallin arkkitehtuureja, jotka toimivat paremmin laajalla valikoimalla sovelluksia, ja ne toimivat rajoitetulla datalla pienissÃĪ datatiloissa. Viimeaikaiset tutkimukset ovat kuitenkin pyrkineet tutkimaan skaalautuvan esikoulutuksen mahdollisuuksia 3D:ssÃĪ, mutta niissÃĪ ei ole ollut merkittÃĪviÃĪ tuloksia rajoitetun 3D-datan vuoksi. Ratkaistakseen 3D-runkojen skaalautuvuuden ongelman, Uni3D-runko hyÃķdyntÃĪÃĪ perusTransformer-rakennetta, joka muistuttaa Vision Transformeria, ja se voi ratkaista skaalautuvuuden ongelman kÃĪyttÃĪmÃĪllÃĪ yhdistettyjÃĪ 2D- tai NLP-strategioita skaalatakseen mallin kokoa.

Aiemmat tutkimukset pilvipisteen edustusoppimisesta ovat perinteisesti keskittyneet suunnittelemaan erityisiÃĪ mallin arkkitehtuureja, jotka toimivat paremmin laajalla valikoimalla sovelluksia, ja ne toimivat rajoitetulla datalla pienissÃĪ datatiloissa. Viimeaikaiset tutkimukset ovat kuitenkin pyrkineet tutkimaan skaalautuvan esikoulutuksen mahdollisuuksia 3D:ssÃĪ, mutta niissÃĪ ei ole ollut merkittÃĪviÃĪ tuloksia rajoitetun 3D-datan vuoksi. Ratkaistakseen 3D-runkojen skaalautuvuuden ongelman, Uni3D-runko hyÃķdyntÃĪÃĪ perusTransformer-rakennetta, joka muistuttaa Vision Transformeria, ja se voi ratkaista skaalautuvuuden ongelman kÃĪyttÃĪmÃĪllÃĪ yhdistettyjÃĪ 2D- tai NLP-strategioita skaalatakseen mallin kokoa.
AloitussÃĪÃĪtely Uni3D:ssÃĪ
Toinen merkittÃĪvÃĪ haaste, joka liittyy aiempiin 3D-edustusten skaalauttamiseen, on vaikeus saavuttaa konvergenssi ja ylissopiminen, jotka johtuvat mallin suuresta koosta. Tehokas lÃĪhestymistapa tÃĪhÃĪn ongelmaan on esikoulutus yksittÃĪisiÃĪ 3D-runkoja mÃĪÃĪrÃĪttyjen 3D-esitehtÃĪvien kanssa ja aloittaminen esikoulutetuilla parametreillÃĪ. TÃĪmÃĪ lÃĪhestymistapa on kuitenkin yhdistettynÃĪ suuriin koulutuskustannuksiin, ja se on myÃķs haasteellista luoda vankka aloitus monimodaaliseen oppimiseen rajoitetun 3D-datan vuoksi.
Uni3D-runko hyÃķdyntÃĪÃĪ perusTransformeria, jonka rakenne muistuttaa ViT:ÃĪ. TÃĪmÃĪn lÃĪhestymistavan avulla Uni3D-runko voi luonnollisesti omaksua esikoulutetut suuret mallit muiden modaaleiden kanssa aloittaakseen Uni3D-rungon.
Monimodaalinen Kohdistus
Uni3D-runko pyrkii oppimaan monimodaalisia kohdistuksia kuvan, kielen ja pilvipisteen vÃĪlillÃĪ kÃĪyttÃĪmÃĪllÃĪ lÃĪhestymistapoja, jotka muistuttavat OpenShapen ja ULIP-runkojen lÃĪhestymistapoja. LisÃĪksi, oikeudenmukaisen vertailun vuoksi muihin menetelmiin, Uni3D-runko kÃĪyttÃĪÃĪ OpenShapen yhdistettyÃĪ 3D-datasettiÃĪ koulutusdatana. TÃĪmÃĪ yhdistetty datasetti koostuu neljÃĪstÃĪ 3D-datasetistÃĪ:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Kokeet ja Tulokset
Uni3D-runko on testattu eri asetelmissa ja eri luokittelutehtÃĪvissÃĪ, mukaan lukien sen suorituskyky nollasuorituskyky- ja vÃĪhÃĪsuorituskykytilanteissa, tulokset avoimessa maailman ymmÃĪrtÃĪmisessÃĪ ja muissa. Tarkastellaan nyt nÃĪitÃĪ tuloksia yksityiskohtaisemmin.
Nollasuorituskyky Muodon Luokittelu
Arvioidakseen Uni3D-rungon suorituskykyÃĪ nollasuorituskyky-muodon luokittelussa, kehittÃĪjÃĪt suorittavat kokeita kolmessa benchmark-datasetissÃĪ: ModelNet, ScanObjNN ja Objaverse-LVIS-benchmark. ModelNet ja ScanObjNN ovat laajasti kÃĪytettyjÃĪ luokitteludatasettejÃĪ, jotka koostuvat 15 ja 40 luokasta, kun taas Objaverse-LVIS-benchmark on puhdistettu ja annotoitu datasetti, joka koostuu yli 40 000 kohteesta yli 1 100 luokassa. Vertailu eri runkojen vÃĪlillÃĪ on esitetty alla olevassa kuvassa, ja siitÃĪ voidaan nÃĪhdÃĪ, ettÃĪ Uni3D-runko ylittÃĪÃĪ merkittÃĪvÃĪsti aiemmat tutkimukset eri asetelmissa.

VÃĪhÃĪsuorituskyky Linjainen Tutkimus
TekoÃĪlyssÃĪ linjainen tutkimus on yleinen menetelmÃĪ, jota kÃĪytetÃĪÃĪn arvioimaan edustuksia, jotka malli tai runko oppii. Arvioimaan Uni3D:n linjaisen tutkimuksen kykyÃĪ, kehittÃĪjÃĪt jÃĪÃĪdyttÃĪvÃĪt Uni3D-rungon parametreit kÃĪyttÃĪen yleisiÃĪ asetuksia OpenShapen kanssa. TÃĪmÃĪn jÃĪlkeen kehittÃĪjÃĪt kouluttavat lineaarisen luokittelijan Uni3D:lle vÃĪhÃĪsuorituskyky-luokkalogoilla. Alla oleva kuva esittÃĪÃĪ eri runkojen linjaisen tutkimuksen kyvyn Objaverse-LVIS-datasetissÃĪ ja esittÃĪÃĪ mallin keskimÃĪÃĪrÃĪisen suorituskyvyn 10 satunnaisen siemenen yli. Voidaan nÃĪhdÃĪ, ettÃĪ Uni3D-runko ylittÃĪÃĪ olemassa olevat menetelmÃĪt merkittÃĪvÃĪsti eri vÃĪhÃĪsuorituskyky-asetelmissa.

Avoimen Maailman YmmÃĪrtÃĪminen
Arvioimaan Uni3D-rungon kykyÃĪ ymmÃĪrtÃĪÃĪ reaalielÃĪmÃĪn muotoja ja kohteita reaaliajassa, kehittÃĪjÃĪt kÃĪyttÃĪvÃĪt ScanNet- ja CLIP-datasettejÃĪ tutkimaan Uni3D:n suorituskykyÃĪ. On huomattava, ettÃĪ maailman instant-tarkka segmentointi on saatavilla, ja pÃĪÃĪasiallinen tavoite on tunnistaa kunkin kohtauksen yksittÃĪisen instantin luokka nollasuorituskyky-asetelmissa. Tulokset on esitetty alla olevassa kuvassa. Voidaan nÃĪhdÃĪ, ettÃĪ Uni3D-runko toimii erinomaisesti reaalielÃĪmÃĪn ymmÃĪrtÃĪmisessÃĪ ja tunnistamisessa. Uni3D-runko ylittÃĪÃĪ olemassa olevat menetelmÃĪt merkittÃĪvÃĪsti, vaikka se ei ole koulutettu reaalielÃĪmÃĪn dataseteilla.

Ristimodaalinen Hakeminen
Monimodaaliset edustukset, jotka Uni3D-runko oppii, voivat mahdollistaa rungon hakemisen 3D-muotoja luonnollisesti joko teksteistÃĪ tai kuvista. Hakemaan 3D-muotoja, malli laskee kosini-samankaltaisuuden 3D-muotojen ja kyselytekstin tai -kuvan vÃĪlillÃĪ. Runko kÃĪyttÃĪÃĪ sitten KNN- (K Nearest Neighbour) -algoritmiÃĪ generoimaan 3D-muotoja, jotka muistuttavat eniten kyselyÃĪ, ja tulokset on esitetty alla olevassa kuvassa. Voidaan nÃĪhdÃĪ, ettÃĪ Uni3D-runko onnistuneesti kÃĪyttÃĪÃĪ reaalielÃĪmÃĪn kuvia hakemaan 3D-muotoja. On myÃķs huomattava, ettÃĪ koulutuskuvat ovat ainoastaan renderÃķintitarkoituksiin, ja ero reaalielÃĪmÃĪn ja koulutuskuvien vÃĪlillÃĪ on merkittÃĪvÃĪ. LisÃĪksi, malli ottaa kaksi syÃķtekuvaa ja hakee muotoja, jotka muistuttavat molempia syÃķtekuvia, kÃĪyttÃĪmÃĪllÃĪ kosini-samankaltaisuutta kuvien ja 3D-muotojen vÃĪlillÃĪ. Tulokset ovat mielenkiintoisia, koska ne osoittavat Uni3D:n kyvyn oppia monimuotoinen 3D-edustukset ja havaita useita 2D-signaaleja.

EnsimmÃĪisessÃĪ sarakkeessa, runko kÃĪyttÃĪÃĪ kahta kyselykuvaa palauttaakseen 3D-muotoja, jotka muistuttavat eniten kyselykuvia. Toisessa sarakkeessa, runko kÃĪyttÃĪÃĪ kahta syÃķtekuvaa hakemaan muotoja, jotka muistuttavat molempia syÃķtekuvia. Lopulta, viimeisessÃĪ sarakkeessa, malli kÃĪyttÃĪÃĪ kyselytekstiÃĪ ja palauttaa 3D-muotoja, jotka muistuttavat eniten kyselytekstiÃĪ.
Loppusanat
TÃĪssÃĪ artikkelissa, olemme keskustelleet Uni3D:stÃĪ, skaalautuvasta ja yhdistetystÃĪ 3D-esikoulutusmallista, joka on kehitetty oppiakseen suurimittakaavaisia 3D-edustuksia, jotka testaavat rajojaan yli miljardin parametrin, yli 10 miljoonan kuvan ja yli 70 miljoonan tekstin, sekÃĪ yli miljoonan 3D-muodon kanssa. Uni3D-rungon kehittÃĪjÃĪt ovat sisÃĪllyttÃĪneet perusTransformerin, jonka rakenne vastaa ViT:ÃĪ, jotta he voivat skaalata Uni3D-runkoa yhdistetyillÃĪ 2D- tai NLP-strategioilla. LisÃĪksi, Uni3D-runko voi hyÃķdyntÃĪÃĪ laajan valikoiman esikoulutettuja 2D-runkoja ja 2D-strategioita 3D-maailmaan. Kokeelliset tulokset ovat jo osoittaneet Uni3D-rungon valtavan potentiaalin, koska se palauttaa tarkan ja tehokkaan suorituskyvyn laajalla valikoimalla mittareita ja ylittÃĪÃĪ olemassa olevat valtavirta-rungot.












