Modely a platformy AI

Uni3D: Prozkoumání sjednocené 3D reprezentace ve velkém měřítku

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Škálování reprezentací textu a vizuálů bylo v posledních letech hlavním zaměřením výzkumu. Vývoj a výzkum provedený v nedávné minulosti vedly k mnoha revolucím v oblasti učení jazyka a vidění. Nicméně, navzdory popularitě škálování textových a vizuálních reprezentací, škálování reprezentací pro 3D scény a objekty nebylo dostatečně diskutováno.

Dnes budeme diskutovat o Uni3D, 3D základním modelu, který má za cíl prozkoumat sjednocené 3D reprezentace. Rámec Uni3D využívá 2D inicializovaný ViT rámec, který je předtrénován end-to-end, aby zarovnal obraz-textové funkce s odpovídajícími 3D bodovými mraky.

Rámec Uni3D využívá pretextové úkoly a jednoduchou architekturu, aby využil hojnost předtrénovaných 2D modelů a obraz-textově zarovnaných modelů jako inicializací a cílů. Tento přístup uvolňuje plný potenciál 2D modelů a strategií pro škálování do 3D světa.

V tomto článku budeme hlouběji prozkoumávat 3D počítačové vidění a rámec Uni3D, zkoumající základní koncepty a architekturu modelu. Takže, pojďme začít.

Uni3D a 3D reprezentace učení: Úvod

V posledních letech se počítačové vidění stalo jednou z nejvíce investovaných oblastí v oblasti umělé inteligence. Následující významné pokroky ve 2D počítačovém vidění, vývojáři se zaměřili na 3D počítačové vidění. Tato oblast, zejména 3D reprezentace učení, spojuje aspekty počítačové grafiky, strojového učení, počítačového vidění a matematiky pro automatizaci zpracování a porozumění 3D geometrii. Rychlý rozvoj 3D senzorů, jako je LiDAR, spolu s jejich širokým uplatněním v oblasti AR/VR, vedl k tomu, že 3D reprezentace učení získala zvýšenou pozornost. Její potenciální aplikace rostou denně.

Navzdory tomu, že existující rámce ukázaly významný pokrok v 3D modelové architektuře, úkolově orientovaném modelování a učení cílech, většina z nich prozkoumává 3D architekturu na relativně malé škále s omezenými daty, parametry a úkolovými scénáři. Výzva spočívající v učení škálovatelných 3D reprezentací, které lze poté aplikovat na reálné aplikace v různých prostředích, zůstává převážně neprozkoumaná.

Pokračujme, v posledních letech, škálování velkých jazykových modelů, které jsou předtrénovány, pomohlo revolucionalizovat oblast přirozeného jazykového zpracování, a recentní práce ukázala překlad pokroku z jazyka do 2D pomocí škálování dat a modelů, což umožňuje vývojářům pokusit se o úspěch v učení 3D reprezentace, která může být škálována a přenesena do aplikací v reálném světě.

Uni3D je škálovatelný a sjednocený předtrénovací 3D rámec vyvinutý s cílem naučit se velkým 3D reprezentacím, které testují jeho limity na škále více než miliardy parametrů, více než 10 milionů obrazů spárovaných s více než 70 miliony textů a více než milionem 3D tvarů. Níže uvedená figura srovnává nulovou šanci na přesnost proti parametrům v rámci Uni3D. Rámec Uni3D úspěšně škáluje 3D reprezentace z 6 milionů na více než miliardu.

Rámec Uni3D se skládá z 2D ViT nebo Vision Transformer jako 3D kódéru, který je poté předtrénován end-to-end, aby zarovnal obraz-textové funkce s 3D bodovými mraky. Rámec Uni3D využívá pretextové úkoly a jednoduchou architekturu, aby využil hojnost předtrénovaných 2D modelů a obraz-textově zarovnaných modelů jako inicializací a cílů, a tím uvolňuje plný potenciál 2D modelů a strategií pro škálování do 3D světa. Flexibilita a škálovatelnost rámce Uni3D jsou měřeny v termínech

  1. Škálování modelu z 6M na více než miliardu parametrů.
  2. 2D inicializace na text dohledaný z vizuálního samoučícího se učení.
  3. Text-obrázkový cíl model škálování z 150 milionů na více než miliardu parametrů.

Pod flexibilním a sjednoceným rámcem nabízeným Uni3D, vývojáři pozorují koherentní zvýšení výkonu při škálování každého komponentu. Velkoměřítkové 3D reprezentace učení také enormně profitují ze sdílených 2D a škálovacích strategií.

Jak je vidět na obrázku níže, rámec Uni3D zobrazuje zvýšení výkonu ve srovnání s předchozími uměleckými díly v few-shot a zero-shot nastaveních. Je worth noting, že rámec Uni3D vrací zero-shot klasifikační přesnost skóre více než 88% na ModelNet, což je srovnatelné s výkonem několika stávajících supervizních metod.

Navíc, rámec Uni3D také dodává špičkovou přesnost a výkon při provádění dalších reprezentativních 3D úkolů, jako je část segmentace a otevřené pochopení světa. Rámec Uni3D má za cíl most mezi 2D viděním a 3D viděním škálováním 3D základních modelů s jednoduchým předtrénovacím přístupem pro učení robustnějších 3D reprezentací napříč širokou škálou úkolů, které mohou nakonec pomoci v konvergenci 2D a 3D vidění napříč širokou škálou modalit.

Uni3D: Související práce

Rámec Uni3D čerpá inspiraci a učí se z vývoje provedeného předchozími 3D reprezentací učení a základními modely, zejména pod různými modalitami.

3D reprezentace učení

Metoda 3D reprezentace učení používá cloud body pro 3D pochopení objektu, a tato oblast byla prozkoumána vývojáři hodně v nedávné minulosti, a bylo pozorováno, že tyto cloud body mohou být předtrénovány pod samoučícím se učením pomocí specifických 3D pretextových úkolů, včetně masky bodového modelování, samo-rekonstrukce a kontrastního učení.

Je worth noting, že tyto metody pracují s omezenými daty a často nezjišťují multimodální reprezentace z 2D nebo NLP. Nicméně, recentní úspěch rámce CLIP, který vrací vysokou efektivitu při učení vizuálních konceptů z raw textu pomocí kontrastního učení, a dále se snaží naučit 3D reprezentace zarovnáním obrazu, textu a cloud bodů pomocí stejného kontrastního učení.

Základní modely

Vývojáři byli vyčerpáni návrhem základních modelů pro škálování a sjednocení multimodálních reprezentací. Například v oblasti NLP, vývojáři pracovali na rámcích, které mohou škálovat předtrénované jazykové modely, a to pomalu revolucionalizuje oblast NLP. Navíc, pokroky lze pozorovat v oblasti 2D vidění, protože vývojáři pracují na rámcích, které využívají data a modelová škálovací technika pro pomoc v pokroku jazyka do 2D modelů, ačkoli takové rámce jsou obtížné replikovat pro 3D modely kvůli omezené dostupnosti 3D dat a výzvám spojeným se sjednocením a škálováním 3D rámců.

Z učení z výše uvedených dvou oblastí práce, vývojáři vytvořili rámec Uni3D, první 3D základný model s více než miliardou parametrů, který využívá sjednocenou ViT nebo Vision Transformer architekturu, která umožňuje vývojářům škálovat rámec Uni3D pomocí sjednocených 3D nebo NLP škálovacích strategií pro škálování modelů. Vývojáři doufají, že tato metoda umožní rámcu Uni3D most mezi 2D a 3D viděním a také usnadní multimodální konvergenci.

Uni3D: Metoda a architektura

Obrázek výše ukazuje obecný přehled rámce Uni3D, škálovatelného a sjednoceného předtrénovacího 3D rámce pro velkýměřítkové 3D reprezentace učení. Vývojáři využívají více než 70 milionů textů a 10 milionů obrazů spárovaných s více než milionem 3D tvarů pro škálování rámce Uni3D na více než miliardu parametrů. Rámec Uni3D využívá 2D ViT nebo Vision Transformer jako 3D kódér, který je poté předtrénován end-to-end, aby zarovnal text-obrázkové funkce s 3D bodovými mraky, umožňující rámcu Uni3D dodávat požadovanou efektivitu a přesnost napříč širokou škálou benchmarků. Pojďme se nyní podívat na podrobnosti o fungování rámce Uni3D.

Škálování rámce Uni3D

Předchozí studie o cloud bodovém učení tradičně zaměřily na návrh specifických modelových architektur, které dodávají lepší výkon napříč širokou škálou aplikací, a pracují s omezeným množstvím dat díky malým datovým sadám. Nicméně, recentní studie se pokusily prozkoumat možnost využití škálovatelného předtrénování v 3D, ale nebyly žádné významné výsledky díky omezené dostupnosti 3D dat. Pro řešení problému škálovatelnosti 3D rámců, rámec Uni3D využívá vanilkový transformerový strukturu, která téměř odráží Vision Transformer, a může řešit škálovací problémy pomocí sjednocených 2D nebo NLP škálovacích strategií pro škálování modelové velikosti.

Předchozí studie o cloud bodovém učení tradičně zaměřily na návrh specifických modelových architektur, které dodávají lepší výkon napříč širokou škálou aplikací, a pracují s omezeným množstvím dat díky malým datovým sadám. Nicméně, recentní studie se pokusily prozkoumat možnost využití škálovatelného předtrénování v 3D, ale nebyly žádné významné výsledky díky omezené dostupnosti 3D dat. Pro řešení problému škálovatelnosti 3D rámců, rámec Uni3D využívá vanilkový transformerový strukturu, která téměř odráží Vision Transformer, a může řešit škálovací problémy pomocí sjednocených 2D nebo NLP škálovacích strategií pro škálování modelové velikosti.

Inicializace Uni3D

Jinou významnou výzvou, se kterou se setkaly předchozí práce, spojené se škálováním 3D reprezentací, byly obtíže s konvergencí a přeučením, které byly výsledkem velké velikosti modelů. Účinný přístup k překonání této bariéry je předtrénovat jednotlivé 3D záda s specifickými 3D pretextovými úkoly a inicializovat předtrénované parametry. Nicméně, tento přístup je doprovázen vysokými trénovacími náklady a je také obtížné stanovit robustní inicializaci pro cross-modální učení díky omezené dostupnosti 3D dat pro trénovací účely.

Rámec Uni3D využívá vanilkový transformer, jehož struktura se blízce podobá ViT. S tímto přístupem může rámec Uni3D přirozeně adoptovat předtrénované velké modely s jinými modalitami pro inicializaci rámce Uni3D.

Multi-modální zarovnání

Rámec Uni3D se snaží naučit multi-modální zarovnání napříč obrazem, jazykem a body cloudů pomocí paradigmat podobných OpenShape a ULIP rámcům. Navíc, pro zajištění spravedlivého srovnání s jinými metodami, rámec Uni3D využívá ensemblovou 3D datovou sadu od OpenShape pro trénovací účely. Tato ensemblová datová sada od OpenShape se skládá z 4 3D datových sad:

  1. Objaverse.
  2. ShapeNet.
  3. 3D-FUTURE.
  4. ABO.

Experimenty a výsledky

Rámec Uni3D je testován napříč různými nastaveními a napříč různými klasifikačními úkoly, včetně jeho výkonu v zero-shot a few-shot nastaveních, výsledků kolem otevřeného pochopení světa a více. Pojďme se podívat na tyto výsledky.

Nulová šance tvarové klasifikace

Pro vyhodnocení výkonu rámce Uni3D napříč zero-shot tvarové klasifikací, vývojáři provádějí experimenty napříč třemi benchmarky, včetně ModelNet, ScanObjNN a Objaverse-LVIS benchmark datových sad. ModelNet a ScanObjNN jsou datové sady široce používány pro klasifikační úkoly a skládají se z 15 a 40 objektových kategorií, zatímco Objaverse-LVIS benchmark je čištěná a anotovaná datová sada skládající se z více než 40 000 objektů napříč 1 100+ kategoriemi. Srovnání mezi rámci je ukázáno na obrázku níže a je vidět, že rámec Uni3D významně překonává předchozí umělecká díla napříč různými nastaveními.

Few-shot lineární sondování

V AI, lineární sondování je běžnou metodou pro vyhodnocení reprezentací, které rámec nebo model učí. Pro vyhodnocení lineárního sondování rámce Uni3D, vývojáři zmrazí parametry rámce Uni3D pomocí běžných nastavení jako OpenShape. Následně, vývojáři trénují lineární klasifikátor pro Uni3D pomocí few-shot třídových štítků. Obrázek níže ukazuje lineární sondování různých rámců na datovou sadu Objaverse-LVIS, a ukazuje průměrný výkon modelu napříč 10 náhodnými semeny. Je vidět, že rámec Uni3D překonává existující metody významně napříč různými few-shot nastaveními.

Otevřené pochopení světa

Pro vyhodnocení schopnosti rámce Uni3D pochopit reálné tvary a objekty v reálném čase, vývojáři využívají datové sady ScanNet a CLIP pro prozkoumání výkonu Uni3D. Je worth noting, že ground truth instant segmentace je dostupná, a primárním cílem je rozpoznat kategorii každé scény individuálně v zero-shot nastavení. Výsledky jsou ukázány na obrázku níže. Je vidět, že rámec Uni3D dodává výjimečné výsledky při provádění reálného pochopení a rozpoznání. Rámec Uni3D překonává existující rámce významně, navzdory tomu, že nebyl trénován na reálných datech.

Přechodné načtení

Multi-modální reprezentace, naučené rámcem Uni3D, mohou umožnit rámcu načíst 3D tvary přirozeně buď z textů nebo obrazů. Pro načtení 3D tvarů, model vypočítá kosinovou podobnost mezi vložením 3D tvarů a vložením dotazu textu nebo obrazu. Rámec poté využívá KNN nebo K Nearest Neighbour algoritmus pro generování 3D tvarů, které se nejvíce podobají dotazu, a výsledky jsou ukázány na obrázku níže. Je vidět, že rámec Uni3D úspěšně využívá reálné obrazy pro načtení 3D tvarů. Navíc, je worth noting, že trénovací obrazy jsou pouze pro renderovací účely, a mezera mezi reálnými a trénovacími obrázky je podstatná. Navíc, model také bere dva vstupní obrazy a načítá tvary podobné oběma vstupním obrazům pomocí kosinové podobnosti mezi průměrnými vložením obou obrazů a jejich vložením 3D tvarů. Výsledky jsou zajímavé, protože ukazují schopnost rámce Uni3D naučit se rozmanité 3D reprezentace a vnímat více 2D signálů.

V první sloupci, rámec využívá 2 dotazové obrazy pro návrat 3D tvarů, které se nejvíce podobají dotazu. Ve druhém sloupci, rámec využívá dva vstupní obrazy pro načtení 3D tvarů, které se podobají oběma vstupním obrazům. Nakonec, v posledním sloupci, model využívá dotazové texty a vrací 3D tvary, které se nejvíce podobají dotazu.

Závěrečné myšlenky

V tomto článku, jsme mluvili o Uni3D, škálovatelném a sjednoceném předtrénovacím 3D rámcu vyvinutém s cílem naučit se velkým 3D reprezentacím, které testují jeho limity na škále více než miliardy parametrů, více než 10 milionů obrazů spárovaných s více než 70 miliony textů a více než milionem 3D tvarů. Vývojáři rámce zahrnuli vanilkový transformer s jeho strukturou ekvivalentní ViT, která umožňuje škálovat rámec Uni3D pomocí sjednocených 2D nebo NLP škálovacích strategií. Navíc, rámec Uni3D může využít širokou škálu předtrénovaných 2D rámců a 2D strategií pro 3D svět. Experimentální výsledky již ukázaly obrovský potenciál rámce Uni3D, protože rámec Uni3D vrací přesné a efektivní výsledky napříč širokou škálou nastavení a překonává existující špičkové rámce.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.