AI-mallit ja alustat

Uni3D: Tutkimalla Yhdistettyä 3D-Edustusta Suurimittakaavaisesti

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekstien ja visuaalisten esitysten skaalaaminen on ollut merkittävä tutkimuksen kohteena viime vuosina. Viimeaikaiset kehitysaskeleet ja tutkimukset ovat johtaneet useisiin mullistuksiin kielenoppimisessa ja näkemisessä. Kuitenkin, vaikka teksti- ja visuaalisten esitysten skaalaaminen on ollut suosittua, 3D-kohteiden ja -kohtauksien esitysten skaalaaminen ei ole ollut riittävästi keskustelun aiheena.

Tänään, tarkastelemme Uni3D:ä, 3D-perusmallia, jonka tavoitteena on tutkia yhdistettyjä 3D-esityksiä. Uni3D-runko käyttää 2D-aloitettua ViT-runkoa, joka on esikoulutettu loppuun asti, jotta voidaan kohdistaa kuva-teksti-ominaisuudet vastaavien 3D-pilvipistekohtaisiin ominaisuuksiin.

Uni3D-runko käyttää esitehtäviä ja yksinkertaista arkkitehtuuria hyödyntääkseen runsaan määrän esikoulutettuja 2D-malleja ja kuva-teksti-kohdistettuja malleja aloituksina ja kohderyhmänä. Tämä lähestymistapa vapauttaa 2D-mallien ja -strategioiden täyden potentiaalin skaalata 3D-maailmaan.

Tässä artikkelissa, tarkastelemme syvemmälle 3D-tietokoneen näkemiseen ja Uni3D-runkoon, tutkimalla olennaiset käsitteet ja mallin arkkitehtuuria. Joten, aloitetaan.

Uni3D ja 3D-Edustusoppi: Johdanto

Viime vuosina, tietokonenäkeminen on kehittynyt yhdeksi eniten sijoitetuksi alaksi tekoälyteollisuudessa. Merkittävien edistysten jälkeen 2D-tietokonenäkemisessä, kehittäjät ovat siirtäneet fokuksensa 3D-tietokonenäkemiseen. Tämä ala, erityisesti 3D-edustusoppi, yhdistää tietokonegrafiikan, koneoppimisen, tietokonenäkemisen ja matematiikan jotta voidaan automatisoida 3D-geometrian käsittely ja ymmärtäminen. 3D-sensoreiden, kuten LiDARin, nopea kehitys ja laaja soveltaminen AR/VR-teollisuudessa on johtanut siihen, että 3D-edustusoppi on saanut lisääntynyttä huomiota. Sen soveltamismahdollisuudet kasvavat joka päivä.

Vaikka olemassa olevat rungot ovat osoittaneet merkittävää edistystä 3D-mallin arkkitehtuurissa, tehtäväorientoituneessa mallinnuksessa ja oppimistavoitteissa, useimmat tutkivat 3D-arkkitehtuuria suhteellisen pienellä mittakaavalla rajoitettujen datojen, parametterien ja tehtävätilanteiden kanssa. Haaste skaalattavien 3D-edustusten oppimisessa, joita voidaan soveltaa reaaliaikaisiin sovelluksiin erilaisissa ympäristöissä, on edelleen pääosin tutkimatta.

Jatkamalla, viime vuosina, suurten kielimallien skaalaaminen, jotka on esikoulutettu, on auttanut vallankumouksellisesti luonnollisen kielen prosessoinnin alalla, ja viimeaikaiset työt ovat osoittaneet, että edistys kielestä 2D-malleihin on mahdollista datan ja mallin skaalaamisen avulla, mikä mahdollistaa kehittäjille kokeilla ja uudelleenyritys oppia 3D-edustusta, joka voidaan skaalata ja siirtää sovelluksiin reaalielämässä.

Uni3D on skaalautuva ja yhdistetty esikoulutus 3D-runko, joka on kehitetty oppiakseen suurimittakaavaisia 3D-edustuksia, jotka testaavat rajojaan yli miljardin parametrin, yli 10 miljoonan kuvan ja yli 70 miljoonan tekstin, sekä yli miljoonan 3D-muodon kanssa. Alla oleva kuva vertaa nollasuorituskykyä parametreja Uni3D-rungossa. Uni3D-runko skaalautuu onnistuneesti 3D-edustuksia 6 miljoonasta yli miljardiin.

Uni3D-runko koostuu 2D ViT:stä tai Vision Transformerista, jota käytetään 3D-kooderina, joka on sitten esikoulutettu loppuun asti kohdistamaan kuva-teksti-ominaisuudet 3D-pilvipistekohtaisiin ominaisuuksiin. Uni3D-runko käyttää esitehtäviä ja yksinkertaista arkkitehtuuria hyödyntääkseen runsaan määrän esikoulutettuja 2D-malleja ja kuva-teksti-kohdistettuja malleja aloituksina ja kohderyhmänä, vapauttaen 2D-mallien ja -strategioiden täyden potentiaalin skaalata 3D-maailmaan. Joustavuus ja skaalautuvuus Uni3D-rungossa mitataan seuraavilla:

  1. Skaalauttamalla mallia 6M:sta yli miljardiin parametriin.
  2. 2D-aloitus tekstiin valvottuna visuaalisesta itsevalvottavasta oppimisesta.
  3. Teksti-kuvatarkkuusmallin skaalaaminen 150 miljoonasta yli miljardiin parametriin.

Joustavan ja yhdistetyn rungon alla, jota Uni3D tarjoaa, kehittäjät havaitsevat yhtenäisen suorituskyvyn parantumisen jokaisen komponentin skaalautuessa. Suurimittakaavainen 3D-edustusoppi hyötyy myös merkittävästi jaettavista 2D- ja skaalautusstrategioista.

Kuten alla olevasta kuvasta voidaan nähdä, Uni3D-runko näyttää suorituskyvyn parantumisen verrattuna aiempiin tutkimuksiin sekä vähä- ja nollasuorituskykytilanteissa. On huomattava, että Uni3D-runko saavuttaa yli 88%:n nollasuorituskykyluokituksen ModelNetissä, joka on vertailukelpoinen useiden valvottujen menetelmien suorituskyvyn kanssa.

Lisäksi, Uni3D-runko toimii erinomaisesti myös muissa edustavissa 3D-tehtävissä, kuten osien segmentoinnissa ja avoimessa maailman ymmärtämisessä. Uni3D-runko pyrkii silittämään 2D-näkemisen ja 3D-näkemisen välistä kuilua skaalauttamalla 3D-perusmalleja yhdistetyllä ja yksinkertaisella esikoulutuslähestymistavalla, jotta voidaan oppia vahvempia 3D-edustuksia laajalla valikoimalla tehtäviä, mikä lopulta auttaa 2D- ja 3D-näkemisen yhdistymisessä laajalla valikoimalla modaaleja.

Uni3D: Aiheeseen Liittyvä Työ

Uni3D-runko ammentaa inspiraatiota ja oppii aiemman 3D-edustusoppimisen ja perusmallien kehityksistä, erityisesti eri modaaleissa.

3D-Edustusoppi

3D-edustusoppi käyttää pilvipisteitä 3D-kohteiden ymmärtämiseen, ja tämä ala on ollut kehittäjien tutkimisen kohteena viime aikoina. On havaittu, että pilvipisteet voidaan esikoulutus itsevalvottavilla 3D-esitehtävillä, mukaan lukien maskipistemallinnus, itse-uudelleenrakennus ja kontrastiivinen oppiminen.

On huomattava, että nämä menetelmät toimivat rajoitetulla datalla, eivätkä ne yleensä tutki multimodaalisia edustuksia 3D:sta 2D:hen tai NLP:hen. Viimeaikaisen CLIP-runkoon perustuvan menetelmän on kuitenkin osoitettu olevan hyvin tehokas oppimassa visuaalisia käsitteitä raakatekstistä kontrastiivisen oppimismenetelmän avulla, ja se pyrkii oppimaan 3D-edustuksia kohdistamalla kuva-, teksti- ja pilvipistekohtaiset ominaisuudet samalla kontrastiivisella oppimismenetelmällä.

Perusmallit

Kehittäjät ovat tehneet työtä perusmallien suunnittelussa skaalauttamalla ja yhdistämällä multimodaalisia edustuksia. Esimerkiksi NLP-alalla kehittäjät ovat työskennelleet kehittääkseen runkoja, jotka voivat skaalata esikoulutettuja kielimalleja, ja se on vallankumouksellisesti muuttanut NLP-alaa. Edistystä on myös havaittu 2D-näkemisen alalla, koska kehittäjät työskentelevät runkojen parissa, jotka käyttävät datan ja mallin skaalaamisen menetelmiä edistääkseen kielenoppimista 2D-malleihin, vaikka tällaiset rungot ovat haasteellisia replikoida 3D-malleihin rajoitetun 3D-datan ja 3D-runkojen yhdistämisen haasteiden vuoksi.

Opittuaan näistä kahdesta työalasta, kehittäjät ovat luoneet Uni3D-rungon, ensimmäisen 3D-perusmallin, jolla on yli miljardi parametriä, joka käyttää yhdistettyä ViT- tai Vision Transformer -arkkitehtuuria, joka mahdollistaa kehittäjille skaalata Uni3D-runkoa yhdistetyillä 3D- tai NLP-strategioilla. Kehittäjät toivovat, että tämä menetelmä auttaa Uni3D-runkoa silittämään 2D- ja 3D-näkemisen välistä kuilua ja edistämään multimodaalista yhdistymistä.

Uni3D: Menetelmä ja Arkkitehtuuri

Yllä oleva kuva esittää yleiskatsauksen Uni3D-rungosta, skaalautuvasta ja yhdistetystä 3D-esikoulutusmallista suurimittakaavaiselle 3D-edustusoppimiselle. Kehittäjät käyttävät yli 70 miljoonaa tekstiä ja 10 miljoonaa kuvaa, jotka on parittu yli miljoonan 3D-muodon kanssa, skaalatakseen Uni3D-runkoa yli miljardiin parametriin. Uni3D-runko käyttää 2D ViT:ä tai Vision Transformeria 3D-kooderina, joka on sitten esikoulutettu loppuun asti kohdistamaan teksti-kuvatiedot 3D-pilvipistekohtaisiin ominaisuuksiin, mahdollistaen Uni3D-rungolle toimia tehokkaasti ja tarkasti laajalla valikoimalla mittareita.

Skaalauttaminen Uni3D-Rungossa

Aiemmat tutkimukset pilvipisteen edustusoppimisesta ovat perinteisesti keskittyneet suunnittelemaan erityisiä mallin arkkitehtuureja, jotka toimivat paremmin laajalla valikoimalla sovelluksia, ja ne toimivat rajoitetulla datalla pienissä datatiloissa. Viimeaikaiset tutkimukset ovat kuitenkin pyrkineet tutkimaan skaalautuvan esikoulutuksen mahdollisuuksia 3D:ssä, mutta niissä ei ole ollut merkittäviä tuloksia rajoitetun 3D-datan vuoksi. Ratkaistakseen 3D-runkojen skaalautuvuuden ongelman, Uni3D-runko hyödyntää perusTransformer-rakennetta, joka muistuttaa Vision Transformeria, ja se voi ratkaista skaalautuvuuden ongelman käyttämällä yhdistettyjä 2D- tai NLP-strategioita skaalatakseen mallin kokoa.

Aiemmat tutkimukset pilvipisteen edustusoppimisesta ovat perinteisesti keskittyneet suunnittelemaan erityisiä mallin arkkitehtuureja, jotka toimivat paremmin laajalla valikoimalla sovelluksia, ja ne toimivat rajoitetulla datalla pienissä datatiloissa. Viimeaikaiset tutkimukset ovat kuitenkin pyrkineet tutkimaan skaalautuvan esikoulutuksen mahdollisuuksia 3D:ssä, mutta niissä ei ole ollut merkittäviä tuloksia rajoitetun 3D-datan vuoksi. Ratkaistakseen 3D-runkojen skaalautuvuuden ongelman, Uni3D-runko hyödyntää perusTransformer-rakennetta, joka muistuttaa Vision Transformeria, ja se voi ratkaista skaalautuvuuden ongelman käyttämällä yhdistettyjä 2D- tai NLP-strategioita skaalatakseen mallin kokoa.

Aloitussäätely Uni3D:ssä

Toinen merkittävä haaste, joka liittyy aiempiin 3D-edustusten skaalauttamiseen, on vaikeus saavuttaa konvergenssi ja ylissopiminen, jotka johtuvat mallin suuresta koosta. Tehokas lähestymistapa tähän ongelmaan on esikoulutus yksittäisiä 3D-runkoja määrättyjen 3D-esitehtävien kanssa ja aloittaminen esikoulutetuilla parametreillä. Tämä lähestymistapa on kuitenkin yhdistettynä suuriin koulutuskustannuksiin, ja se on myös haasteellista luoda vankka aloitus monimodaaliseen oppimiseen rajoitetun 3D-datan vuoksi.

Uni3D-runko hyödyntää perusTransformeria, jonka rakenne muistuttaa ViT:ä. Tämän lähestymistavan avulla Uni3D-runko voi luonnollisesti omaksua esikoulutetut suuret mallit muiden modaaleiden kanssa aloittaakseen Uni3D-rungon.

Monimodaalinen Kohdistus

Uni3D-runko pyrkii oppimaan monimodaalisia kohdistuksia kuvan, kielen ja pilvipisteen välillä käyttämällä lähestymistapoja, jotka muistuttavat OpenShapen ja ULIP-runkojen lähestymistapoja. Lisäksi, oikeudenmukaisen vertailun vuoksi muihin menetelmiin, Uni3D-runko käyttää OpenShapen yhdistettyä 3D-datasettiä koulutusdatana. Tämä yhdistetty datasetti koostuu neljästä 3D-datasetistä:

  1. Objaverse.
  2. ShapeNet.
  3. 3D-FUTURE.
  4. ABO.

Kokeet ja Tulokset

Uni3D-runko on testattu eri asetelmissa ja eri luokittelutehtävissä, mukaan lukien sen suorituskyky nollasuorituskyky- ja vähäsuorituskykytilanteissa, tulokset avoimessa maailman ymmärtämisessä ja muissa. Tarkastellaan nyt näitä tuloksia yksityiskohtaisemmin.

Nollasuorituskyky Muodon Luokittelu

Arvioidakseen Uni3D-rungon suorituskykyä nollasuorituskyky-muodon luokittelussa, kehittäjät suorittavat kokeita kolmessa benchmark-datasetissä: ModelNet, ScanObjNN ja Objaverse-LVIS-benchmark. ModelNet ja ScanObjNN ovat laajasti käytettyjä luokitteludatasettejä, jotka koostuvat 15 ja 40 luokasta, kun taas Objaverse-LVIS-benchmark on puhdistettu ja annotoitu datasetti, joka koostuu yli 40 000 kohteesta yli 1 100 luokassa. Vertailu eri runkojen välillä on esitetty alla olevassa kuvassa, ja siitä voidaan nähdä, että Uni3D-runko ylittää merkittävästi aiemmat tutkimukset eri asetelmissa.

Vähäsuorituskyky Linjainen Tutkimus

Tekoälyssä linjainen tutkimus on yleinen menetelmä, jota käytetään arvioimaan edustuksia, jotka malli tai runko oppii. Arvioimaan Uni3D:n linjaisen tutkimuksen kykyä, kehittäjät jäädyttävät Uni3D-rungon parametreit käyttäen yleisiä asetuksia OpenShapen kanssa. Tämän jälkeen kehittäjät kouluttavat lineaarisen luokittelijan Uni3D:lle vähäsuorituskyky-luokkalogoilla. Alla oleva kuva esittää eri runkojen linjaisen tutkimuksen kyvyn Objaverse-LVIS-datasetissä ja esittää mallin keskimääräisen suorituskyvyn 10 satunnaisen siemenen yli. Voidaan nähdä, että Uni3D-runko ylittää olemassa olevat menetelmät merkittävästi eri vähäsuorituskyky-asetelmissa.

Avoimen Maailman Ymmärtäminen

Arvioimaan Uni3D-rungon kykyä ymmärtää reaalielämän muotoja ja kohteita reaaliajassa, kehittäjät käyttävät ScanNet- ja CLIP-datasettejä tutkimaan Uni3D:n suorituskykyä. On huomattava, että maailman instant-tarkka segmentointi on saatavilla, ja pääasiallinen tavoite on tunnistaa kunkin kohtauksen yksittäisen instantin luokka nollasuorituskyky-asetelmissa. Tulokset on esitetty alla olevassa kuvassa. Voidaan nähdä, että Uni3D-runko toimii erinomaisesti reaalielämän ymmärtämisessä ja tunnistamisessa. Uni3D-runko ylittää olemassa olevat menetelmät merkittävästi, vaikka se ei ole koulutettu reaalielämän dataseteilla.

Ristimodaalinen Hakeminen

Monimodaaliset edustukset, jotka Uni3D-runko oppii, voivat mahdollistaa rungon hakemisen 3D-muotoja luonnollisesti joko teksteistä tai kuvista. Hakemaan 3D-muotoja, malli laskee kosini-samankaltaisuuden 3D-muotojen ja kyselytekstin tai -kuvan välillä. Runko käyttää sitten KNN- (K Nearest Neighbour) -algoritmiä generoimaan 3D-muotoja, jotka muistuttavat eniten kyselyä, ja tulokset on esitetty alla olevassa kuvassa. Voidaan nähdä, että Uni3D-runko onnistuneesti käyttää reaalielämän kuvia hakemaan 3D-muotoja. On myös huomattava, että koulutuskuvat ovat ainoastaan renderöintitarkoituksiin, ja ero reaalielämän ja koulutuskuvien välillä on merkittävä. Lisäksi, malli ottaa kaksi syötekuvaa ja hakee muotoja, jotka muistuttavat molempia syötekuvia, käyttämällä kosini-samankaltaisuutta kuvien ja 3D-muotojen välillä. Tulokset ovat mielenkiintoisia, koska ne osoittavat Uni3D:n kyvyn oppia monimuotoinen 3D-edustukset ja havaita useita 2D-signaaleja.

Ensimmäisessä sarakkeessa, runko käyttää kahta kyselykuvaa palauttaakseen 3D-muotoja, jotka muistuttavat eniten kyselykuvia. Toisessa sarakkeessa, runko käyttää kahta syötekuvaa hakemaan muotoja, jotka muistuttavat molempia syötekuvia. Lopulta, viimeisessä sarakkeessa, malli käyttää kyselytekstiä ja palauttaa 3D-muotoja, jotka muistuttavat eniten kyselytekstiä.

Loppusanat

Tässä artikkelissa, olemme keskustelleet Uni3D:stä, skaalautuvasta ja yhdistetystä 3D-esikoulutusmallista, joka on kehitetty oppiakseen suurimittakaavaisia 3D-edustuksia, jotka testaavat rajojaan yli miljardin parametrin, yli 10 miljoonan kuvan ja yli 70 miljoonan tekstin, sekä yli miljoonan 3D-muodon kanssa. Uni3D-rungon kehittäjät ovat sisällyttäneet perusTransformerin, jonka rakenne vastaa ViT:ä, jotta he voivat skaalata Uni3D-runkoa yhdistetyillä 2D- tai NLP-strategioilla. Lisäksi, Uni3D-runko voi hyödyntää laajan valikoiman esikoulutettuja 2D-runkoja ja 2D-strategioita 3D-maailmaan. Kokeelliset tulokset ovat jo osoittaneet Uni3D-rungon valtavan potentiaalin, koska se palauttaa tarkan ja tehokkaan suorituskyvyn laajalla valikoimalla mittareita ja ylittää olemassa olevat valtavirta-rungot.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.