KI-Modelle und Plattformen

Uni3D: Erforschung einheitlicher 3D-Darstellung im großen Maßstab

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Die Skalierung von Text- und BildreprÃĪsentationen war in den letzten Jahren ein wichtiger Forschungsschwerpunkt. Die Entwicklungen und Forschungsergebnisse der jÞngsten Vergangenheit haben zu zahlreichen Revolutionen im Bereich der Sprachverarbeitung und des Sehens gefÞhrt. Allerdings wurde die Skalierung von ReprÃĪsentationen fÞr 3D-Szenen und -Objekte bisher nicht ausreichend diskutiert.

Heute werden wir Uni3D besprechen, ein 3D-Grundmodell, das darauf abzielt, einheitliche 3D-ReprÃĪsentationen zu erforschen. Das Uni3D-Framework verwendet ein 2D-initialisiertes ViT-Framework, das von Anfang an trainiert wird, um Bild-Text-Funktionen mit den entsprechenden 3D-Punktwolkenfunktionen auszurichten.

Das Uni3D-Framework nutzt VorwÃĪrmen und eine einfache Architektur, um die FÞlle vorab trainierter 2D-Modelle und Bild-Text-Modelle als Initialisierungen und Ziele zu nutzen. Dieser Ansatz entfesselt das volle Potenzial von 2D-Modellen und -Strategien, um sie auf die 3D-Welt zu skalieren.

In diesem Artikel werden wir tiefer in die 3D-Computer-Vision und das Uni3D-Framework eintauchen, indem wir die wesentlichen Konzepte und die Architektur des Modells erforschen. Also, fangen wir an.

Uni3D und 3D-ReprÃĪsentationslernen: Eine EinfÞhrung

In den letzten Jahren ist die Computer-Vision zu einem der am meisten investierten Bereiche in der KI-Industrie geworden. Nach bedeutenden Fortschritten in 2D-Computer-Vision-Frameworks haben die Entwickler ihre Aufmerksamkeit auf die 3D-Computer-Vision verlagert. Dieser Bereich, insbesondere das 3D-ReprÃĪsentationslernen, kombiniert Aspekte der Computer-Grafik, des Maschinellen Lernens, der Computer-Vision und der Mathematik, um die Verarbeitung und das VerstÃĪndnis von 3D-Geometrie zu automatisieren. Die schnelle Entwicklung von 3D-Sensoren wie LiDAR und ihre weit verbreiteten Anwendungen in der AR/VR-Industrie haben dazu gefÞhrt, dass das 3D-ReprÃĪsentationslernen zunehmend an Bedeutung gewinnt. Seine potenziellen Anwendungen wachsen tÃĪglich.

Obwohl bestehende Frameworks bemerkenswerte Fortschritte in der 3D-Modellarchitektur, taskorientierter Modellierung und Lernzielen gemacht haben, erforschen die meisten die 3D-Architektur auf einer relativ kleinen Skala mit begrenzten Daten, Parametern und Aufgabenszenarien. Die Herausforderung, skalierbare 3D-ReprÃĪsentationen zu erlernen, die dann auf Echtzeit-Anwendungen in verschiedenen Umgebungen angewendet werden kÃķnnen, bleibt weitgehend unerforscht.

Weiterhin, in den letzten Jahren, hat die Skalierung von großen Sprachmodellen, die vorab trainiert wurden, dazu beigetragen, den Bereich der natÞrlichen Sprachverarbeitung zu revolutionieren, und jÞngste Arbeiten haben gezeigt, dass der Fortschritt von der Sprache zu 2D mithilfe von Daten- und Modellskalierung den Weg fÞr Entwickler ebnet, um dies zu wiederholen und ein 3D-ReprÃĪsentationslernen zu ermÃķglichen, das skaliert und auf reale Anwendungen Þbertragen werden kann.

Uni3D ist ein skalierbares und einheitliches Vortrainings-3D-Framework, das entwickelt wurde, um große 3D-ReprÃĪsentationen zu erlernen, die ihre Grenzen bei Þber einer Milliarde Parameter, Þber 10 Millionen Bildern, die mit Þber 70 Millionen Texten gepaart sind, und Þber einer Million 3D-Formen testen. Die folgende Abbildung vergleicht die Zero-Shot-Genauigkeit gegenÞber Parametern im Uni3D-Framework. Das Uni3D-Framework skaliert erfolgreich 3D-ReprÃĪsentationen von 6 Millionen auf Þber eine Milliarde.

Das Uni3D-Framework besteht aus einem 2D-ViT oder einem Vision-Transformer als 3D-Encoder, der von Anfang an trainiert wird, um die Bild-Text-Funktionen mit den 3D-Punktwolkenfunktionen auszurichten. Das Uni3D-Framework nutzt VorwÃĪrmen und eine einfache Architektur, um die FÞlle vorab trainierter 2D-Modelle und Bild-Text-Modelle als Initialisierungen und Ziele zu nutzen, und entfesselt so das volle Potenzial von 2D-Modellen und -Strategien, um sie auf die 3D-Welt zu skalieren. Die FlexibilitÃĪt und Skalierbarkeit des Uni3D-Frameworks werden in Bezug auf

  1. Skalierung des Modells von 6M auf Þber eine Milliarde Parameter.
  2. 2D-Initialisierung zu textÞberwachter visueller SelbstÞberwachung.
  3. Text-Bild-Zielmodell-Skalierung von 150 Millionen auf Þber eine Milliarde Parameter.

Unter dem flexiblen und einheitlichen Framework von Uni3D beobachten die Entwickler eine kohÃĪrente Leistungssteigerung, wenn es um die Skalierung jedes Komponenten geht. Das große 3D-ReprÃĪsentationslernen profitiert auch erheblich von den teilerbaren 2D- und Skalierungsstrategien.

Wie in der folgenden Abbildung zu sehen ist, zeigt das Uni3D-Framework eine Leistungssteigerung im Vergleich zu vorherigen Frameworks in Few-Shot- und Zero-Shot-Szenarien. Es ist erwÃĪhnenswert, dass das Uni3D-Framework eine Zero-Shot-Klassifizierungs-Genauigkeit von Þber 88% auf ModelNet erreicht, was der Leistung mehrerer State-of-the-Art-Überwachungsmethoden entspricht.

DarÞber hinaus liefert das Uni3D-Framework auch Spitzenleistungen, wenn es um andere reprÃĪsentative 3D-Aufgaben wie Teilsegmentierung und offene WeltverstÃĪndnis geht. Das Uni3D-Framework zielt darauf ab, die LÞcke zwischen 2D- und 3D-Vision zu ÞberbrÞcken, indem es 3D-Grundmodelle mit einem einheitlichen, aber einfachen Vortrainingsansatz skaliert, um robuste 3D-ReprÃĪsentationen Þber eine breite Palette von Aufgaben zu erlernen, die letztendlich dazu beitragen kÃķnnten, 2D- und 3D-Vision Þber eine breite Palette von ModalitÃĪten zu konvergieren.

Uni3D: Verwandte Arbeiten

Das Uni3D-Framework zieht Inspiration und lernt von den Entwicklungen, die in der 3D-ReprÃĪsentationslernen und den Grundmodellen, insbesondere unter verschiedenen ModalitÃĪten, gemacht wurden.

3D-ReprÃĪsentationslernen

Die 3D-ReprÃĪsentationslernen-Methode verwendet Punktwolken fÞr das 3D-VerstÃĪndnis von Objekten, und dieses Feld wurde von Entwicklern in der jÞngsten Vergangenheit stark erforscht. Es wurde beobachtet, dass diese Punktwolken unter SelbstÞberwachung mithilfe spezifischer 3D-VorwÃĪrmen, einschließlich Maskenpunktemodellierung, Selbstrekonstruktion und kontrastivem Lernen, vorab trainiert werden kÃķnnen.

Es ist erwÃĪhnenswert, dass diese Methoden mit begrenzten Daten arbeiten und oft nicht multimodale ReprÃĪsentationen von 3D zu 2D oder NLP untersuchen. Allerdings hat der jÞngste Erfolg des CLIP-Frameworks, das hohe Effizienz bei der Lernung von visuellen Konzepten aus rohem Text mithilfe des kontrastiven Lernens zeigt, und weiterhin darauf abzielt, 3D-ReprÃĪsentationen zu lernen, indem es Bild-, Text- und Punktwolkenfunktionen mithilfe des kontrastiven Lernens ausrichtet.

Grundmodelle

Entwickler haben intensiv an der Gestaltung von Grundmodellen gearbeitet, um multimodale ReprÃĪsentationen zu skalieren und zu vereinheitlichen. Zum Beispiel haben Entwickler im NLP-Bereich an Frameworks gearbeitet, die vorab trainierte Sprachmodelle skalieren kÃķnnen, und dies revolutioniert langsam die NLP-Industrie. DarÞber hinaus sind Fortschritte im 2D-Vision-Bereich zu beobachten, da Entwickler an Frameworks arbeiten, die Daten- und Modellskalierungstechniken verwenden, um den Fortschritt von der Sprache zu 2D-Modellen zu unterstÞtzen, obwohl solche Frameworks schwierig zu replizieren sind, wenn es um 3D-Modelle geht, aufgrund der begrenzten VerfÞgbarkeit von 3D-Daten und der Herausforderungen, die bei der Vereinheitlichung und Skalierung von 3D-Frameworks auftreten.

Durch das Lernen aus diesen beiden Arbeitsbereichen haben Entwickler das Uni3D-Framework, das erste 3D-Grundmodell mit Þber einer Milliarde Parametern, entwickelt, das eine einheitliche ViT- oder Vision-Transformer-Architektur verwendet, die es Entwicklern ermÃķglicht, das Uni3D-Modell mithilfe einheitlicher 3D- oder NLP-Skalierungsstrategien zu skalieren. Entwickler hoffen, dass diese Methode es dem Uni3D-Framework ermÃķglichen wird, die LÞcke zu ÞberbrÞcken, die derzeit 2D- und 3D-Vision trennt, und die multimodale Konvergenz zu erleichtern.

Uni3D: Methode und Architektur

Die obige Abbildung zeigt eine allgemeine Übersicht des Uni3D-Frameworks, ein skalierbares und einheitliches Vortrainings-3D-Framework fÞr großes 3D-ReprÃĪsentationslernen. Entwickler verwenden Þber 70 Millionen Texte und 10 Millionen Bilder, die mit Þber einer Million 3D-Formen gepaart sind, um das Uni3D-Framework auf Þber eine Milliarde Parameter zu skalieren. Das Uni3D-Framework verwendet einen 2D-ViT oder einen Vision-Transformer als 3D-Encoder, der von Anfang an trainiert wird, um die Text-Bild-Daten mit den 3D-Punktwolkenfunktionen auszurichten, was es dem Uni3D-Framework ermÃķglicht, die gewÞnschte Effizienz und Genauigkeit Þber eine breite Palette von Benchmarks zu liefern. Lassen Sie uns nun einen detaillierten Blick auf die Funktionsweise des Uni3D-Frameworks werfen.

Skalierung des Uni3D-Frameworks

Vorherige Studien zum Punktwolken-ReprÃĪsentationslernen haben traditionell stark auf die Gestaltung spezifischer Modellarchitekturen fokussiert, die bessere Leistungen Þber eine breite Palette von Anwendungen liefern, und arbeiten mit begrenzten Daten aufgrund kleiner DatensÃĪtze. Allerdings haben jÞngste Studien versucht, die MÃķglichkeit der Verwendung von skalierbarem Vortrainings im 3D zu erforschen, aber es gab keine bedeutenden Ergebnisse aufgrund der begrenzten VerfÞgbarkeit von 3D-Daten. Um das Skalierungsproblem von 3D-Frameworks zu lÃķsen, nutzt das Uni3D-Framework die Kraft einer Vanille-Transformer-Struktur, die fast einem Vision-Transformer entspricht, und kann die Skalierungsprobleme mithilfe einheitlicher 2D- oder NLP-Skalierungsstrategien lÃķsen, um die ModellgrÃķße zu skalieren.

Vorherige Studien zum Punktwolken-ReprÃĪsentationslernen haben traditionell stark auf die Gestaltung spezifischer Modellarchitekturen fokussiert, die bessere Leistungen Þber eine breite Palette von Anwendungen liefern, und arbeiten mit begrenzten Daten aufgrund kleiner DatensÃĪtze. Allerdings haben jÞngste Studien versucht, die MÃķglichkeit der Verwendung von skalierbarem Vortrainings im 3D zu erforschen, aber es gab keine bedeutenden Ergebnisse aufgrund der begrenzten VerfÞgbarkeit von 3D-Daten. Um das Skalierungsproblem von 3D-Frameworks zu lÃķsen, nutzt das Uni3D-Framework die Kraft einer Vanille-Transformer-Struktur, die fast einem Vision-Transformer entspricht, und kann die Skalierungsprobleme mithilfe einheitlicher 2D- oder NLP-Skalierungsstrategien lÃķsen, um die ModellgrÃķße zu skalieren.

Initialisierung von Uni3D

Eine weitere Herausforderung, die von vorherigen Arbeiten im Bereich der Skalierung von 3D-ReprÃĪsentationen auftrat, waren die Schwierigkeiten bei der Konvergenz und Überanpassung, die durch die große GrÃķße der Modelle verursacht wurden. Ein effektiver Ansatz, um diese HÞrde zu Þberwinden, besteht darin, individuelle 3D-RÞcken zuvor mit spezifischen 3D-VorwÃĪrmen zu trainieren und vorab trainierte Parameter zu initialisieren. Allerdings ist dieser Ansatz mit hohen Trainingskosten verbunden, und es ist auch schwierig, eine robuste Initialisierung fÞr cross-modale Lernprozesse zu etablieren, aufgrund der begrenzten VerfÞgbarkeit von 3D-Daten fÞr Trainingszwecke.

Das Uni3D-Framework nutzt eine Vanille-Transformer-Struktur, die der eines ViT entspricht. Mit diesem Ansatz kann das Uni3D-Framework natÞrlicherweise vorab trainierte große Modelle mit anderen ModalitÃĪten initialisieren.

Multimodale Ausrichtung

Das Uni3D-Framework versucht, multimodale Ausrichtungen Þber Bild, Sprache und Punktwolken zu lernen, indem es Paradigmen ÃĪhnlich wie OpenShape und ULIP verwendet. DarÞber hinaus wird das Uni3D-Framework fÞr einen fairen Vergleich mit anderen Methoden das ensemblierte 3D-Datenset von OpenShape fÞr Trainingszwecke verwenden. Dieses ensemblierte Datenset von OpenShape besteht aus 4 3D-DatensÃĪtzen:

  1. Objaverse.
  2. ShapeNet.
  3. 3D-FUTURE.
  4. ABO.

Experimente und Ergebnisse

Das Uni3D-Framework wird in verschiedenen Szenarien getestet, einschließlich seiner Leistung in Zero-Shot- und Few-Shot-Szenarien, Ergebnissen in offener WeltverstÃĪndnis und mehr. Lassen Sie uns einen detaillierten Blick auf diese Ergebnisse werfen.

Zero-Shot-Formenklassifizierung

Um die Leistung des Uni3D-Frameworks in Zero-Shot-Formenklassifizierungsaufgaben zu bewerten, fÞhren die Entwickler Experimente in drei Benchmarks durch, einschließlich ModelNet, ScanObjNN und Objaverse-LVIS-Benchmark-DatensÃĪtzen. ModelNet und ScanObjNN sind DatensÃĪtze, die hÃĪufig fÞr Klassifizierungsaufgaben verwendet werden und 15 bzw. 40 Objektkategorien enthalten, wÃĪhrend der Objaverse-LVIS-Benchmark ein gereinigtes und annotiertes Datenset mit Þber 40.000 Objekten in Þber 1.100 Kategorien ist. Der Vergleich zwischen den Frameworks ist in der folgenden Abbildung dargestellt, und wie zu sehen ist, Þbertrifft das Uni3D-Framework die vorherigen State-of-the-Art-Frameworks in verschiedenen Szenarien.

Few-Shot-Lineare-Probing

In der KI ist Lineare Probing eine gÃĪngige Methode, um die ReprÃĪsentationen zu bewerten, die ein Framework oder ein Modell lernt. Um die lineare Probing-FÃĪhigkeit von Uni3D zu bewerten, frieren die Entwickler die Parameter des Uni3D-Frameworks mithilfe der Þblichen Einstellungen von OpenShape ein. Anschließend trainieren die Entwickler einen linearen Klassifizierer fÞr Uni3D mithilfe von Few-Shot-Klassenlabels. Die folgende Abbildung zeigt die lineare Probing-FÃĪhigkeit verschiedener Frameworks auf dem Objaverse-LVIS-Datenset und zeigt die durchschnittliche Leistung des Modells Þber 10 zufÃĪllige Seeds. Wie zu sehen ist, Þbertrifft das Uni3D-Framework bestehende Methoden in verschiedenen Few-Shot-Szenarien.

Offenes WeltverstÃĪndnis

Um die FÃĪhigkeit des Uni3D-Frameworks zu bewerten, reale Formen und Objekte in Echtzeit zu verstehen, verwenden die Entwickler die ScanNet- und CLIP-DatensÃĪtze, um die Leistung von Uni3D zu erforschen. Es ist erwÃĪhnenswert, dass die Ground-Truth-Instant-Segmentierung verfÞgbar ist, und das primÃĪre Ziel ist, die Kategorie jedes Szenen-Instants in einem Zero-Shot-Szenario zu erkennen. Die Ergebnisse sind in der folgenden Abbildung dargestellt. Wie zu sehen ist, liefert das Uni3D-Framework außergewÃķhnliche Ergebnisse, wenn es um reales WeltverstÃĪndnis und -erkennung geht. Das Uni3D-Framework Þbertrifft bestehende Frameworks um ein erhebliches Maß, obwohl es nie auf realen DatensÃĪtzen trainiert wurde.

Übermodale RÞckgewinnung

Die multimodalen ReprÃĪsentationen, die das Uni3D-Framework lernt, ermÃķglichen es dem Framework, 3D-Formen auf natÞrliche Weise aus Texten oder Bildern zurÞckzugewinnen. Um die 3D-Formen zurÞckzugewinnen, berechnet das Modell die Kosinus-Ähnlichkeit zwischen den Einbettungen von 3D-Formen und den Einbettungen einer Abfrage-Textprompt oder eines Abfrage-Bildes. Das Framework verwendet dann den KNN- oder K-Next-Neighbor-Algorithmus, um 3D-Formen zu generieren, die dem Abfrage am ÃĪhnlichsten sind, und die Ergebnisse sind in der folgenden Abbildung dargestellt. Wie zu sehen ist, verwendet das Uni3D-Framework erfolgreich reale Bilder, um 3D-Formen zurÞckzugewinnen. Es ist auch erwÃĪhnenswert, dass die Trainingsbilder nur fÞr Rendering-Zwecke verwendet werden und die LÞcke zwischen realen und Trainingsbildern erheblich ist. DarÞber hinaus verwendet das Modell auch zwei Eingabe-Bilder und gewinnt Formen zurÞck, die beiden Eingabe-Bildern ÃĪhneln, indem es die Kosinus-Ähnlichkeit zwischen der Durchschnittseinbettung beider Bilder und den eingebetteten 3D-Formen verwendet. Die Ergebnisse sind interessant, da sie die FÃĪhigkeit von Uni3D zeigen, vielfÃĪltige 3D-ReprÃĪsentationen zu lernen und mehrere 2D-Signale wahrzunehmen.

In der ersten Spalte verwendet das Framework zwei Abfrage-Bilder, um 3D-Formen zurÞckzugewinnen, die den Abfrage-Bildern am ÃĪhnlichsten sind. In der zweiten Spalte verwendet das Framework zwei Eingabe-Bilder, um 3D-Formen zurÞckzugewinnen, die beiden Eingabe-Bildern ÃĪhneln. Schließlich verwendet das Modell in der letzten Spalte Abfrage-Texte und gibt 3D-Formen zurÞck, die den Abfrage-Texten am ÃĪhnlichsten sind.

EndgÞltige Gedanken

In diesem Artikel haben wir Þber Uni3D gesprochen, ein skalierbares und einheitliches Vortrainings-3D-Framework, das entwickelt wurde, um große 3D-ReprÃĪsentationen zu lernen, die ihre Grenzen bei Þber einer Milliarde Parameter, Þber 10 Millionen Bildern, die mit Þber 70 Millionen Texten gepaart sind, und Þber einer Million 3D-Formen testen. Die Entwickler des Frameworks haben eine Vanille-Transformer-Struktur mit einer Struktur, die der eines ViT entspricht, verwendet, um das Uni3D-Framework zu skalieren. DarÞber hinaus kann das Uni3D-Framework eine breite Palette von vorab trainierten 2D-Frameworks und 2D-Strategien auf die 3D-Welt Þbertragen. Die experimentellen Ergebnisse haben bereits das enorme Potenzial des Uni3D-Frameworks demonstriert, da das Uni3D-Framework genaue und effiziente Ergebnisse Þber eine breite Palette von Szenarien liefert und bestehende State-of-the-Art-Frameworks Þbertrifft.

Ein Ingenieur von Beruf, ein Schriftsteller von Herzen. Kunal ist ein technischer Schriftsteller mit einer tiefen Liebe und einem tiefen VerstÃĪndnis fÞr KI und ML, der sich der Aufgabe widmet, komplexe Konzepte in diesen Bereichen durch seine ansprechenden und informativen Dokumentationen zu vereinfachen.