Modele și platforme AI

Uni3D: Explorarea reprezentării 3D unificate la scară

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Scalarea reprezentărilor de text și imagini a fost un focus major de cercetare în ultimii ani. Dezvoltările și cercetările efectuate în trecutul recent au condus la numeroase revoluții în învățarea limbajului și viziune. Cu toate acestea, în ciuda popularității scalării reprezentărilor textului și imaginilor, scalarea reprezentărilor pentru scene și obiecte 3D nu a fost suficient discutată.

Astăzi, vom discuta despre Uni3D, un model de bază 3D care își propune să exploreze reprezentările 3D unificate. Framework-ul Uni3D utilizează un cadru ViT inițializat în 2D, antrenat de la capăt, pentru a alinia caracteristicile imaginilor și textului cu caracteristicile norului de puncte 3D.

Framework-ul Uni3D folosește sarcini pretext și o arhitectură simplă pentru a valorifica abundența modelelor preantrenate 2D și a modelelor aliniate imagine-text ca inițializări și ținte, respectiv. Acest abordaj deblochează potențialul deplin al modelelor 2D și strategiilor pentru a le scala la lumea 3D.

În acest articol, vom explora mai în profunzime viziunea computerizată 3D și framework-ul Uni3D, explorând conceptele esențiale și arhitectura modelului. Așadar, să începem.

Uni3D și învățarea reprezentării 3D: O introducere

În ultimii ani, viziunea computerizată a devenit unul dintre cele mai investite domenii din industria AI. După progresele semnificative în cadrul framework-urilor de viziune 2D, dezvoltatorii și-au îndreptat atenția către viziunea 3D. Acest domeniu, în special învățarea reprezentării 3D, combină aspecte de grafică computerizată, învățare automată, viziune computerizată și matematică pentru a automatiza procesarea și înțelegerea geometriei 3D. Dezvoltarea rapidă a senzorilor 3D, cum ar fi LiDAR, împreună cu aplicațiile lor largi în industria AR/VR, a condus la o atenție crescută asupra învățării reprezentării 3D. Aplicațiile sale potențiale continuă să crească zilnic.

Deși framework-urile existente au arătat progrese remarcabile în arhitectura modelului 3D, modelarea orientată spre sarcini și obiective de învățare, majoritatea explorează arhitectura 3D la o scară relativ mică, cu date limitate, parametri și scenarii de sarcini. Provocarea de a învăța reprezentări 3D scalabile, care pot fi apoi aplicate în aplicații în timp real, în medii diverse, rămâne în mare măsură neexplorată.

În continuare, în ultimii ani, scalarea modelului de limbaj mare care este preantrenat a ajutat la revoluționarea domeniului procesării limbajului natural, iar lucrările recente au indicat o traducere a progresului de la limbaj la 2D, folosind date și scalare a modelului, ceea ce deschide calea dezvoltatorilor să încerce și să reîncerce acest succes pentru a învăța o reprezentare 3D care poate fi scalată și transferată în aplicații din lumea reală.

Uni3D este un framework de preantrenare 3D scalabil și unificat, dezvoltat cu scopul de a învăța reprezentări 3D la scară largă, care testează limitele la o scară de peste un miliard de parametri, peste 10 milioane de imagini împerecheate cu peste 70 de milioane de texte și peste un milion de forme 3D. Figura de mai jos compară acuratețea zero-shot împotriva parametrilor în framework-ul Uni3D. Framework-ul Uni3D reușește să scaleze reprezentările 3D de la 6 milioane la peste un miliard.

Framework-ul Uni3D constă dintr-un ViT 2D sau un transformator de viziune ca encoder 3D, care este apoi preantrenat de la capăt pentru a alinia caracteristicile imaginilor și textului cu caracteristicile norului de puncte 3D. Framework-ul Uni3D utilizează sarcini pretext și o arhitectură simplă pentru a valorifica abundența modelelor preantrenate 2D și a modelelor aliniate imagine-text ca inițializări și ținte, respectiv, deblocând astfel potențialul deplin al modelelor 2D și strategiilor pentru a le scala la lumea 3D. Flexibilitatea și scalabilitatea framework-ului Uni3D sunt măsurate în termeni de

  1. Scalarea modelului de la 6M la peste un miliard de parametri.
  2. Inițializarea 2D pentru textul supravegheat de la învățarea auto-supervizată vizuală.
  3. Scalarea modelului țintă text-imagine de la 150 de milioane la peste un miliard de parametri.

Sub framework-ul unificat oferit de Uni3D, dezvoltatorii observă o creștere coerentă a performanței atunci când se scalează fiecare component. Învățarea reprezentării 3D la scară largă beneficiază și de strategiile 2D și de scalare.

După cum se poate vedea în figura de mai jos, framework-ul Uni3D prezintă o creștere a performanței în comparație cu lucrările anterioare în setări cu zero-shot și few-shot. Este demn de remarcat faptul că framework-ul Uni3D returnează un scor de acuratețe de clasificare zero-shot de peste 88% pe ModelNet, ceea ce este la nivelul performanței mai multor metode de supraveghere de stat.

Mai mult, framework-ul Uni3D oferă și o acuratețe și o performanță de top atunci când efectuează alte sarcini reprezentative 3D, cum ar fi segmentarea părților și înțelegerea lumii deschise. Framework-ul Uni3D își propune să pună poduri între viziunea 2D și viziunea 3D, scalând modelele fundamentale 3D cu o abordare de preantrenare unificată și simplă pentru a învăța reprezentări 3D mai robuste într-o gamă largă de sarcini, ceea ce ar putea ajuta în convergența viziunii 2D și 3D într-o gamă largă de modalități.

Uni3D: Lucrări conexe

Framework-ul Uni3D se inspiră și învață din dezvoltările realizate de lucrările anterioare de învățare a reprezentării 3D și de modele fundamentale, în special sub diferite modalități.

Învățarea reprezentării 3D

Metoda de învățare a reprezentării 3D utilizează nori de puncte pentru înțelegerea 3D a obiectului, și acest domeniu a fost explorat de dezvoltatori în mod semnificativ în trecutul recent, și s-a observat că acești nori de puncte pot fi preantrenați sub supraveghere folosind sarcini pretext specifice 3D, incluzând modelarea punctelor mascate, reconstrucția auto și învățarea contrastivă.

Este demn de remarcat faptul că aceste metode lucrează cu date limitate și nu investighează, de obicei, reprezentările multimodale de la 2D sau NLP. Cu toate acestea, succesele recente ale framework-ului CLIP, care returnează o eficiență ridicată în învățarea conceptelor vizuale din textul brut folosind metoda de învățare contrastivă, și care își propune să învețe reprezentări 3D prin alinierea caracteristicilor imaginilor, textului și norului de puncte folosind aceeași metodă de învățare contrastivă.

Modele fundamentale

Dezvoltatorii au lucrat intens la proiectarea modelelor fundamentale pentru a scala și unifica reprezentările multimodale. De exemplu, în domeniul NLP, dezvoltatorii au lucrat la framework-uri care pot scala modelele de limbaj preantrenate, și aceasta a revoluționat treptat industria NLP. Mai mult, progresele pot fi observate și în domeniul viziunii 2D, deoarece dezvoltatorii lucrează la framework-uri care utilizează tehnici de scalare a datelor și a modelului pentru a ajuta la progresul de la limbaj la modele 2D, deși astfel de framework-uri sunt dificil de replicat pentru modele 3D din cauza lipsei de date 3D și a provocărilor întâmpinate la unificarea și scalarea framework-urilor 3D.

Învățând din cele două domenii de lucru, dezvoltatorii au creat framework-ul Uni3D, primul model fundamental 3D cu peste un miliard de parametri, care utilizează o arhitectură unificată ViT sau transformator de viziune, care permite dezvoltatorilor să scaleze framework-ul Uni3D folosind strategii 3D unificate sau NLP pentru scalarea modelului. Dezvoltatorii speră că această metodă va permite framework-ului Uni3D să pună poduri între viziunea 2D și viziunea 3D, facilitând convergența multimodală.

Uni3D: Metodă și arhitectură

Imaginea de mai sus prezintă o vedere generală a framework-ului Uni3D, un framework de preantrenare 3D scalabil și unificat pentru învățarea reprezentării 3D la scară largă. Dezvoltatorii utilizează peste 70 de milioane de texte și 10 milioane de imagini împerecheate cu peste un milion de forme 3D pentru a scala framework-ul Uni3D la peste un miliard de parametri. Framework-ul Uni3D utilizează un ViT 2D sau un transformator de viziune ca encoder 3D, care este apoi antrenat de la capăt pentru a alinia datele text-imagine cu caracteristicile norului de puncte 3D, permițând framework-ului Uni3D să ofere eficiență și acuratețe ridicată într-o gamă largă de benchmark-uri. Să aruncăm o privire mai atentă asupra funcționării framework-ului Uni3D.

Scalarea framework-ului Uni3D

Studiile anterioare despre învățarea reprezentării norului de puncte s-au concentrat, în mod tradițional, pe proiectarea unor arhitecturi de modele specifice care să ofere o performanță mai bună într-o gamă largă de aplicații și să lucreze cu o cantitate limitată de date, datorită seturilor de date de scară mică. Cu toate acestea, studiile recente au încercat să exploreze posibilitatea utilizării preantrenării scalabile în 3D, dar nu au existat rezultate majore datorită lipsei de date 3D. Pentru a rezolva problema scalabilității framework-urilor 3D, framework-ul Uni3D utilizează o structură de transformator vanilla care seamănă cu un transformator de viziune și poate rezolva problemele de scalare folosind strategii 2D unificate sau NLP pentru a scala dimensiunea modelului.

Studiile anterioare despre învățarea reprezentării norului de puncte s-au concentrat, în mod tradițional, pe proiectarea unor arhitecturi de modele specifice care să ofere o performanță mai bună într-o gamă largă de aplicații și să lucreze cu o cantitate limitată de date, datorită seturilor de date de scară mică. Cu toate acestea, studiile recente au încercat să exploreze posibilitatea utilizării preantrenării scalabile în 3D, dar nu au existat rezultate majore datorită lipsei de date 3D. Pentru a rezolva problema scalabilității framework-urilor 3D, framework-ul Uni3D utilizează o structură de transformator vanilla care seamănă cu un transformator de viziune și poate rezolva problemele de scalare folosind strategii 2D unificate sau NLP pentru a scala dimensiunea modelului.

Inițializarea Uni3D

O altă provocare majoră întâmpinată de lucrările anterioare care au încercat să scaleze reprezentările 3D a fost dificultatea de a converge și de a evita suprareglarea, care a fost cauzată de dimensiunea mare a modelelor. O abordare eficientă pentru a depăși acest obstacol este să se preantreneze individual spatele 3D cu sarcini pretext specifice 3D și să se initializeze parametrii preantrenați. Cu toate acestea, această abordare este însoțită de costuri de antrenare ridicate și este dificil să se stabilească o inițializare robustă pentru învățarea cross-modală, datorită lipsei de date 3D disponibile pentru antrenare.

Framework-ul Uni3D utilizează un transformator vanilla, a cărui structură seamănă cu cea a ViT. Cu această abordare, framework-ul Uni3D poate adopta în mod natural modele preantrenate cu alte modalități pentru a inițializa framework-ul Uni3D.

Alinierea multimodală

Framework-ul Uni3D încearcă să învețe alinieri multimodale între imagine, limbaj și nor de puncte, utilizând paradigme similare cu OpenShape și ULIP. Mai mult, pentru a asigura o comparație corectă cu alte metode, framework-ul Uni3D utilizează setul de date ensembles 3D de la OpenShape pentru antrenare. Acest set de date ensembles de la OpenShape conține 4 seturi de date 3D:

  1. Objaverse.
  2. ShapeNet.
  3. 3D-FUTURE.
  4. ABO.

Experimente și rezultate

Framework-ul Uni3D este testat în diferite setări și în diferite sarcini de clasificare, incluzând performanța sa în setări zero-shot și few-shot, rezultatele în înțelegerea lumii deschise și altele. Să aruncăm o privire mai atentă asupra acestor rezultate.

Clasificarea formelor zero-shot

Pentru a evalua performanța framework-ului Uni3D în sarcinile de clasificare a formelor zero-shot, dezvoltatorii efectuează experimente pe trei benchmark-uri, incluzând ModelNet, ScanObjNN și Objaverse-LVIS. ModelNet și ScanObjNN sunt seturi de date larg utilizate pentru sarcinile de clasificare și conțin 15, respectiv 40 de categorii de obiecte, în timp ce benchmark-ul Objaverse-LVIS este un set de date curățat și annotat, conținând peste 40.000 de obiecte în peste 1.100 de categorii. Comparația între framework-uri este prezentată în imaginea de mai jos, și, după cum se poate vedea, framework-ul Uni3D depășește semnificativ framework-urile anterioare în diferite setări.

Sondarea liniară few-shot

În AI, sondarea liniară este o metodă comună utilizată pentru a evalua reprezentările pe care le învață un framework sau un model. Pentru a evalua capacitatea de sondare liniară a Uni3D, dezvoltatorii îngheață parametrii framework-ului Uni3D, utilizând setări comune cu OpenShape. Apoi, dezvoltatorii antrenează un clasificator liniar pentru Uni3D, utilizând etichete de clasă few-shot. Figura de mai jos prezintă capacitatea de sondare liniară a diferitelor framework-uri pe setul de date Objaverse-LVIS, și prezintă performanța medie a modelului pe 10 semințe aleatorii. După cum se poate vedea, framework-ul Uni3D depășește semnificativ metodele existente în diferite setări few-shot.

Înțelegerea lumii deschise

Pentru a evalua capacitatea framework-ului Uni3D de a înțelege forme și obiecte din lumea reală în timp real, dezvoltatorii utilizează seturile de date ScanNet și CLIP pentru a explora performanța Uni3D. Este demn de remarcat faptul că segmentarea instantanee a adevărului este disponibilă, și obiectivul principal este de a recunoaște categoria fiecărui instant dintr-o scenă într-un setare zero-shot. Rezultatele sunt prezentate în imaginea de mai jos. După cum se poate vedea, framework-ul Uni3D oferă rezultate excepționale atunci când efectuează înțelegerea lumii deschise și recunoașterea. Framework-ul Uni3D depășește framework-urile existente cu o marjă semnificativă, chiar dacă nu a fost antrenat pe seturi de date din lumea reală.

Recuperarea cross-modală

Reprezentările multimodale învățate de framework-ul Uni3D pot permite framework-ului să recupereze forme 3D în mod natural, fie din texte, fie din imagini. Pentru a recupera forme 3D, modelul calculează similaritatea cosinusoidală între încorporările formelor 3D și încorporările unui prompt de text sau a unei imagini de cerere. Apoi, framework-ul utilizează algoritmul KNN sau K cel mai apropiat vecin pentru a genera forme 3D care seamănă cel mai mult cu cererea, și rezultatele sunt prezentate în figura de mai jos. După cum se poate vedea, framework-ul Uni3D reușește să utilizeze imagini din lumea reală pentru a recupera forme 3D. Mai mult, este demn de remarcat faptul că imaginile de antrenare sunt utilizate doar pentru renderizare, și există o diferență semnificativă între imaginile din lumea reală și cele de antrenare. În plus, modelul poate lua două imagini de intrare și recupera forme care seamănă cu ambele imagini de intrare, utilizând similaritatea cosinusoidală între încorporările medii ale ambelor imagini și încorporările formelor 3D. Rezultatele sunt interesante, deoarece demonstrează capacitatea Uni3D de a învăța reprezentări 3D diverse și de a percepe multiple semnale 2D.

În prima coloană, framework-ul utilizează două imagini de cerere pentru a returna forme 3D care seamănă cel mai mult cu imaginile de cerere. În a doua coloană, framework-ul utilizează două imagini de intrare pentru a recupera forme care seamănă cu ambele imagini de intrare. În final, în a treia coloană, modelul utilizează un prompt de text și returnează forme 3D care seamănă cel mai mult cu promptul de text.

Gânduri finale

În acest articol, am discutat despre Uni3D, un framework de preantrenare 3D scalabil și unificat, dezvoltat cu scopul de a învăța reprezentări 3D la scară largă, care testează limitele la o scară de peste un miliard de parametri, peste 10 milioane de imagini împerecheate cu peste 70 de milioane de texte și peste un milion de forme 3D. Dezvoltatorii framework-ului au inclus o structură de transformator vanilla, a cărei structură seamănă cu cea a ViT, care le permite să scaleze framework-ul Uni3D utilizând strategii 2D unificate sau NLP pentru a scala dimensiunea modelului. Mai mult, framework-ul Uni3D poate valorifica o gamă largă de framework-uri 2D preantrenate și strategii 2D pentru a le scala la lumea 3D. Rezultatele experimentale au demonstrat deja potențialul imens al framework-ului Uni3D, deoarece framework-ul Uni3D returnează rezultate precise și eficiente într-o gamă largă de setări și depășește framework-urile existente de stat.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.