Modele i platformy AI
Uni3D: Eksploracja Zjednoczonej Reprezentacji 3D w Skali
Skalowanie reprezentacji tekstu i wizualnych danych było głównym celem badań w ostatnich latach. Rozwój i badania przeprowadzone w niedawnej przeszłości doprowadziły do licznych rewolucji w dziedzinie nauki języka i wizji. Jednak pomimo popularności skalowania reprezentacji tekstu i wizualnych danych, skalowanie reprezentacji dla scen i obiektów 3D nie zostało wystarczająco omówione.
Dziś będziemy omawiać Uni3D, model podstawowy 3D, który ma na celu eksplorację zjednoczonej reprezentacji 3D. Ramy Uni3D wykorzystują 2D-zainicjowaną architekturę ViT, wstępnie wytrenowaną, aby wyalignować funkcje obrazu i tekstu z odpowiadającymi funkcjami chmury punktów 3D.
Ramy Uni3D wykorzystują zadania pretextowe i prostą architekturę, aby wykorzystać obfitość wstępnie wytrenowanych modeli 2D i modeli wyrównanych obraz-tekst jako inicjacje i cele. Ten podejście uwalnia pełny potencjał modeli 2D i strategii, aby skalować je do świata 3D.
W tym artykule będziemy głębiej omawiać komputerowe widzenie 3D i ramy Uni3D, eksplorując podstawowe pojęcia i architekturę modelu. Zatem, zacznijmy.
Uni3D i Nauka Reprezentacji 3D: Wprowadzenie
W ostatnich latach, komputerowe widzenie stało się jedną z najbardziej zainwestowanych dziedzin w branży AI. Po znaczących postępach w ramach 2D komputerowego widzenia, deweloperzy przenieśli swoją uwagę na komputerowe widzenie 3D. Ta dziedzina, w szczególności nauka reprezentacji 3D, łączy aspekty grafiki komputerowej, uczenia maszynowego, komputerowego widzenia i matematyki, aby zautomatyzować przetwarzanie i zrozumienie geometrii 3D. Szybki rozwój czujników 3D, takich jak LiDAR, wraz z ich szerokim zastosowaniem w branży AR/VR, spowodował, że nauka reprezentacji 3D zyskała coraz większą uwagę. Jej potencjalne zastosowania rosną każdego dnia.
Chociaż istniejące ramy pokazały znaczny postęp w architekturze modelu 3D, modelowaniu zorientowanym na zadania i celach uczenia, większość z nich bada architekturę 3D w relatywnie małej skali, z ograniczonymi danymi, parametrami i scenariuszami zadań. Wyzwanie nauki skalowalnych reprezentacji 3D, które mogą być następnie stosowane w aplikacjach w czasie rzeczywistym w różnych środowiskach, pozostaje w dużej mierze niezbadane.
Przechodząc dalej, w ostatnich latach, skalowanie dużych modeli językowych, które są wstępnie wytrenowane, pomogło w rewolucjonizacji dziedziny przetwarzania języka naturalnego, a niedawne prace wskazały na tłumaczenie postępu z 2D na język przy użyciu skalowania danych i modelu, co umożliwia deweloperom spróbować i ponowić ten sukces, aby nauczyć reprezentację 3D, która może być skalowana i przenoszona do aplikacji w świecie rzeczywistym.
Uni3D jest skalowalnym i zjednoczonym frameworkiem wstępnego treningu 3D, opracowanym w celu nauki dużych reprezentacji 3D, które testują swoje limity na poziomie ponad miliarda parametrów, ponad 10 milionów obrazów sparowanych z ponad 70 milionami tekstów i ponad milionem kształtów 3D. Poniższy rysunek porównuje dokładność klasyfikacji zero-shot w ramach Uni3D. Ramy Uni3D skutecznie skalują reprezentacje 3D od 6 milionów do ponad miliarda.

Ramy Uni3D składają się z 2D ViT lub Vision Transformer jako kodera 3D, który jest następnie wytrenowany w sposób końcowy, aby wyalignować funkcje obrazu i tekstu z funkcjami chmury punktów 3D. Ramy Uni3D wykorzystują zadania pretextowe i prostą architekturę, aby wykorzystać obfitość wstępnie wytrenowanych modeli 2D i modeli wyrównanych obraz-tekst jako inicjacje i cele, co uwalnia pełny potencjał modeli 2D i strategii, aby skalować je do świata 3D. Elastyczność i skalowalność ram Uni3D są mierzone pod względem
- Skalowania modelu od 6M do ponad miliarda parametrów.
- 2D inicjacji do tekstu nadzorowanego z wizualnym samouczym się.
- Tekst-obraz celu modelu skalowania od 150 milionów do ponad miliarda parametrów.
W ramach elastycznego i zjednoczonego frameworku oferowanego przez Uni3D, deweloperzy obserwują spójny wzrost wydajności podczas skalowania każdego komponentu. Nauka dużych reprezentacji 3D również korzysta ogromnie z dzielonych strategii 2D i skalowania.
Jak widać na poniższym rysunku, ramy Uni3D wykazują wzrost wydajności w porównaniu z poprzednim stanem sztuki w ustawieniach few-shot i zero-shot. Warto zauważyć, że ramy Uni3D zwracają wynik klasyfikacji zero-shot na poziomie ponad 88% w ModelNet, co jest porównywalne z wynikami kilku metod nadzorowanych.

Ponadto, ramy Uni3D również dostarczają najlepszą dokładność i wydajność podczas wykonywania innych reprezentatywnych zadań 3D, takich jak segmentacja części i zrozumienie świata otwartego. Ramy Uni3D mają na celu zmostkowanie lukę między wizją 2D a 3D, skalując podstawowe modele 3D przy użyciu zjednoczonej, ale prostej metody wstępnego treningu, aby nauczyć bardziej wytrzymałe reprezentacje 3D w szerokim zakresie zadań, co może ostatecznie pomóc w zbieżności wizji 2D i 3D w szerokim zakresie modalności.
Uni3D: Powiązane Prace
Ramy Uni3D czerpią inspirację i uczą się z rozwoju wcześniejszych prac nad nauką reprezentacji 3D i modelami podstawowymi, szczególnie w różnych modalnościach.
Nauka Reprezentacji 3D
Metoda nauki reprezentacji 3D wykorzystuje chmury punktów do zrozumienia obiektu 3D, a ta dziedzina była intensywnie badana przez deweloperów w ostatnim czasie, i stwierdzono, że te chmury punktów mogą być wstępnie wytrenowane przy użyciu samonadzorowanych zadań pretextowych, w tym modelowania punktów, samorekonstrukcji i uczenia kontrastowego.
Warto zauważyć, że te metody działają z ograniczonymi danymi i często nie badają reprezentacji multimodalnych do 3D z 2D lub NLP. Jednak niedawne sukcesy frameworku CLIP, który zwraca wysoką wydajność w nauce pojęć wizualnych z surowego tekstu przy użyciu metody uczenia kontrastowego, i dalej stara się nauczyć reprezentacje 3D, wyalignowując funkcje obrazu, tekstu i chmury punktów przy użyciu tej samej metody uczenia kontrastowego.
Modele Podstawowe
Deweloperzy intensywnie pracowali nad opracowaniem modeli podstawowych, aby skalować i ujednolicić reprezentacje multimodalne. Na przykład w dziedzinie NLP, deweloperzy pracowali nad frameworkami, które mogą skalować wstępnie wytrenowane modele językowe, i to powoli rewolucjonizuje przemysł NLP. Ponadto, postępy można obserwować w dziedzinie wizji 2D, ponieważ deweloperzy pracują nad frameworkami, które wykorzystują techniki skalowania danych i modelu, aby pomóc w postępie języka do modeli 2D, chociaż takie frameworki są trudne do odtworzenia dla modeli 3D ze względu na ograniczoną dostępność danych 3D i wyzwania związane z ujednoliceniem i skalowaniem frameworków 3D.
Ucząc się z powyższych dwóch dziedzin, deweloperzy stworzyli ramy Uni3D, pierwszy model podstawowy 3D z ponad miliardem parametrów, który wykorzystuje zjednoczoną architekturę ViT lub Vision Transformer, co pozwala deweloperom skalować ramy Uni3D przy użyciu zjednoczonych strategii 3D lub NLP do skalowania modelu. Deweloperzy mają nadzieję, że ta metoda pozwoli ramom Uni3D zmostkować lukę, która obecnie dzieli wizję 2D i 3D, oraz ułatwić zbieżność multimodalną.
Uni3D: Metoda i Architektura

Powyższy rysunek pokazuje ogólny przegląd ram Uni3D, skalowalnego i zjednoczonego frameworku wstępnego treningu 3D dla nauki dużych reprezentacji 3D. Deweloperzy wykorzystują ponad 70 milionów tekstów i 10 milionów obrazów sparowanych z ponad milionem kształtów 3D, aby skalować ramy Uni3D do ponad miliarda parametrów. Ramy Uni3D wykorzystują 2D ViT lub Vision Transformer jako koder 3D, który jest następnie wytrenowany w sposób końcowy, aby wyalignować dane obraz-tekst z funkcjami chmury punktów 3D, co pozwala ramom Uni3D dostarczyć pożądaną wydajność i dokładność w szerokim zakresie benchmarków. Teraz przyjrzyjmy się bliżej działaniu ram Uni3D.
Skalowanie Ram Uni3D
Poprzednie badania nad nauką reprezentacji chmury punktów tradycyjnie koncentrowały się na projektowaniu szczególnych architektur modeli, które dostarczają lepszą wydajność w szerokim zakresie aplikacji, i pracują na ograniczonej ilości danych dzięki małym zbiorom danych. Jednak niedawne badania próbowały eksplorować możliwość wykorzystania skalowalnego wstępnego treningu w 3D, ale nie było znaczących wyników ze względu na ograniczoną dostępność danych 3D. Aby rozwiązać problem skalowalności frameworków 3D, ramy Uni3D wykorzystują strukturę vanilla transformer, która prawie lustrzanie odbija Vision Transformer, i może rozwiązać problemy skalowania przy użyciu zjednoczonych strategii 2D lub NLP do skalowania modelu.

Poprzednie badania nad nauką reprezentacji chmury punktów tradycyjnie koncentrowały się na projektowaniu szczególnych architektur modeli, które dostarczają lepszą wydajność w szerokim zakresie aplikacji, i pracują na ograniczonej ilości danych dzięki małym zbiorom danych. Jednak niedawne badania próbowały eksplorować możliwość wykorzystania skalowalnego wstępnego treningu w 3D, ale nie było znaczących wyników ze względu na ograniczoną dostępność danych 3D. Aby rozwiązać problem skalowalności frameworków 3D, ramy Uni3D wykorzystują strukturę vanilla transformer, która prawie lustrzanie odbija Vision Transformer, i może rozwiązać problemy skalowania przy użyciu zjednoczonych strategii 2D lub NLP do skalowania modelu.
Inicjowanie Uni3D
Innym znaczącym wyzwaniem, które spotkało poprzednie prace nad skalowaniem reprezentacji 3D, były trudności w zbieżności i przeuczeniu, które wynikały z dużego rozmiaru modeli. Skutecznym podejściem do pokonania tego wyzwania jest wstępne treningowanie poszczególnych trzonów 3D z określonymi zadaniami pretextowymi i inicjowanie wstępnie wytrenowanych parametrów. Jednak ten podejście jest acompañowane wysokimi kosztami treningu, i jest również trudne do ustalenia solidnej inicjacji dla uczenia krzyżowego ze względu na ograniczoną ilość danych 3D dostępnych do celów treningu.
Ramy Uni3D wykorzystują strukturę vanilla transformer, która ściśle przypomina ViT. Z tym podejściem, ramy Uni3D mogą naturalnie przyjąć wstępnie wytrenowane duże modele z innymi modalnościami, aby zainicjować ramy Uni3D.
Wyrównanie Multimodalne
Ramy Uni3D próbują nauczyć wyrównania multimodalnych między obrazem, językiem i chmurą punktów, wykorzystując paradygmaty podobne do OpenShape i ULIP. Ponadto, aby zapewnić uczciwe porównanie z innymi metodami, ramy Uni3D wykorzystują zbiór danych OpenShape do celów treningu. Ten zbiór danych OpenShape składa się z 4 zbiorów danych 3D:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Eksperymenty i Wyniki
Ramy Uni3D są testowane w różnych ustawieniach i zadaniach klasyfikacji, w tym ich wydajności w ustawieniach zero-shot i few-shot, wynikach w zrozumieniu świata otwartego i więcej. Przyjrzyjmy się bliżej tym wynikom.
Klasyfikacja Kształtów Zero-Shot
Aby ocenić wydajność ram Uni3D w zadaniach klasyfikacji kształtów zero-shot, deweloperzy przeprowadzili eksperymenty w trzech benchmarkach, w tym ModelNet, ScanObjNN i Objaverse-LVIS. ModelNet i ScanObjNN są zbiorami danych powszechnie wykorzystywanymi do zadań klasyfikacji, i składają się z 15 i 40 kategorii obiektów odpowiednio, podczas gdy benchmark Objaverse-LVIS jest oczyszczonym i opatrzonym etykietami zbiorem danych, składającym się z ponad 40 000 obiektów w ponad 1 100 kategoriach. Porównanie między ramami jest pokazane na poniższym rysunku, i jak widać, ramy Uni3D znacząco przewyższają poprzedni stan sztuki w różnych ustawieniach.

Sondowanie Liniowe Few-Shot
W AI, sondowanie liniowe jest powszechną metodą wykorzystywaną do oceny reprezentacji, które framework lub model uczą. Aby ocenić zdolność ram Uni3D do sondowania liniowego, deweloperzy zamarzają parametry ram Uni3D, wykorzystując standardowe ustawienia, takie jak OpenShape. Następnie, deweloperzy trenują liniowy klasyfikator dla ram Uni3D, wykorzystując etykiety klasy few-shot. Poniższy rysunek pokazuje zdolność sondowania liniowego różnych frameworków w zbiorze danych Objaverse-LVIS, i pokazuje średnią wydajność modelu w 10 losowych nasionach. Jak widać, ramy Uni3D przewyższają istniejące metody w różnych ustawieniach few-shot.

Zrozumienie Świata Otwartego
Aby ocenić zdolność ram Uni3D do zrozumienia kształtów i obiektów w świecie rzeczywistym w czasie rzeczywistym, deweloperzy wykorzystują zbiory danych ScanNet i CLIP, aby zbadać wydajność ram Uni3D. Warto zauważyć, że dostępna jest segmentacja instancji, a głównym celem jest rozpoznanie kategorii każdej instancji w scenie w ustawieniu zero-shot. Poniższy rysunek pokazuje wyniki. Jak widać, ramy Uni3D dostarczają wyjątkowe wyniki podczas zrozumienia świata rzeczywistego i rozpoznawania.

Pobieranie Krzyżowe
Reprezentacje multimodalne, które ramy Uni3D uczą, mogą umożliwić ramom pobieranie kształtów 3D z tekstu lub obrazu. Aby pobrać kształty 3D, model oblicza podobieństwo kosinusowe między wektorami kształtów 3D i wektorami tekstu lub obrazu. Następnie, ramy wykorzystują algorytm KNN, aby wygenerować kształty 3D, które najbardziej przypominają zapytanie, i wyniki są pokazane na poniższym rysunku. Jak widać, ramy Uni3D skutecznie wykorzystują obrazy świata rzeczywistego do pobierania kształtów 3D. Ponadto, warto zauważyć, że obrazy treningowe są wykorzystywane tylko do celów renderowania, i luka między obrazami świata rzeczywistego a treningowymi jest znaczna. Dodatkowo, model może również przyjmować dwa obrazy wejściowe i pobrać kształty podobne do obu obrazów wejściowych, wykorzystując podobieństwo kosinusowe między średnimi wektorami obrazów i wektorami kształtów 3D.

W pierwszej kolumnie, ramy wykorzystują dwa obrazy zapytania, aby zwrócić kształty 3D, które są najbardziej podobne do zapytania. W drugiej kolumnie, ramy wykorzystują dwa obrazy wejściowe, aby pobrać kształty, które przypominają oba obrazy wejściowe. W końcu, w trzeciej kolumnie, model wykorzystuje zapytanie tekstowe, aby zwrócić kształty 3D, które najbardziej przypominają zapytanie tekstowe.
Podsumowanie
W tym artykule omówiliśmy ramy Uni3D, skalowalny i zjednoczony framework wstępnego treningu 3D, opracowany w celu nauki dużych reprezentacji 3D, które testują swoje limity na poziomie ponad miliarda parametrów, ponad 10 milionów obrazów sparowanych z ponad 70 milionami tekstów i ponad milionem kształtów 3D. Deweloperzy ram Uni3D włączyli strukturę vanilla transformer, której struktura jest równa ViT. Ponadto, ramy Uni3D mogą wykorzystać szeroki zakres wstępnie wytrenowanych frameworków 2D i strategii 2D do świata 3D. Wyniki eksperymentalne już pokazały ogromny potencjał ram Uni3D, ponieważ ramy Uni3D zwracają dokładne i wydajne wyniki w szerokim zakresie ustawień i przewyższają istniejące frameworki stanu sztuki.












