KI-Modelle und Plattformen
Uni3D: Erforschung einheitlicher 3D-Darstellung im großen Maßstab
Die Skalierung von Text- und Bildrepräsentationen war in den letzten Jahren ein wichtiger Forschungsschwerpunkt. Die Entwicklungen und Forschungsergebnisse der jüngsten Vergangenheit haben zu zahlreichen Revolutionen im Bereich der Sprachverarbeitung und des Sehens geführt. Allerdings wurde die Skalierung von Repräsentationen für 3D-Szenen und -Objekte bisher nicht ausreichend diskutiert.
Heute werden wir Uni3D besprechen, ein 3D-Grundmodell, das darauf abzielt, einheitliche 3D-Repräsentationen zu erforschen. Das Uni3D-Framework verwendet ein 2D-initialisiertes ViT-Framework, das von Anfang an trainiert wird, um Bild-Text-Funktionen mit den entsprechenden 3D-Punktwolkenfunktionen auszurichten.
Das Uni3D-Framework nutzt Vorwärmen und eine einfache Architektur, um die Fülle vorab trainierter 2D-Modelle und Bild-Text-Modelle als Initialisierungen und Ziele zu nutzen. Dieser Ansatz entfesselt das volle Potenzial von 2D-Modellen und -Strategien, um sie auf die 3D-Welt zu skalieren.
In diesem Artikel werden wir tiefer in die 3D-Computer-Vision und das Uni3D-Framework eintauchen, indem wir die wesentlichen Konzepte und die Architektur des Modells erforschen. Also, fangen wir an.
Uni3D und 3D-Repräsentationslernen: Eine Einführung
In den letzten Jahren ist die Computer-Vision zu einem der am meisten investierten Bereiche in der KI-Industrie geworden. Nach bedeutenden Fortschritten in 2D-Computer-Vision-Frameworks haben die Entwickler ihre Aufmerksamkeit auf die 3D-Computer-Vision verlagert. Dieser Bereich, insbesondere das 3D-Repräsentationslernen, kombiniert Aspekte der Computer-Grafik, des Maschinellen Lernens, der Computer-Vision und der Mathematik, um die Verarbeitung und das Verständnis von 3D-Geometrie zu automatisieren. Die schnelle Entwicklung von 3D-Sensoren wie LiDAR und ihre weit verbreiteten Anwendungen in der AR/VR-Industrie haben dazu geführt, dass das 3D-Repräsentationslernen zunehmend an Bedeutung gewinnt. Seine potenziellen Anwendungen wachsen täglich.
Obwohl bestehende Frameworks bemerkenswerte Fortschritte in der 3D-Modellarchitektur, taskorientierter Modellierung und Lernzielen gemacht haben, erforschen die meisten die 3D-Architektur auf einer relativ kleinen Skala mit begrenzten Daten, Parametern und Aufgabenszenarien. Die Herausforderung, skalierbare 3D-Repräsentationen zu erlernen, die dann auf Echtzeit-Anwendungen in verschiedenen Umgebungen angewendet werden können, bleibt weitgehend unerforscht.
Weiterhin, in den letzten Jahren, hat die Skalierung von großen Sprachmodellen, die vorab trainiert wurden, dazu beigetragen, den Bereich der natürlichen Sprachverarbeitung zu revolutionieren, und jüngste Arbeiten haben gezeigt, dass der Fortschritt von der Sprache zu 2D mithilfe von Daten- und Modellskalierung den Weg für Entwickler ebnet, um dies zu wiederholen und ein 3D-Repräsentationslernen zu ermöglichen, das skaliert und auf reale Anwendungen übertragen werden kann.
Uni3D ist ein skalierbares und einheitliches Vortrainings-3D-Framework, das entwickelt wurde, um große 3D-Repräsentationen zu erlernen, die ihre Grenzen bei über einer Milliarde Parameter, über 10 Millionen Bildern, die mit über 70 Millionen Texten gepaart sind, und über einer Million 3D-Formen testen. Die folgende Abbildung vergleicht die Zero-Shot-Genauigkeit gegenüber Parametern im Uni3D-Framework. Das Uni3D-Framework skaliert erfolgreich 3D-Repräsentationen von 6 Millionen auf über eine Milliarde.

Das Uni3D-Framework besteht aus einem 2D-ViT oder einem Vision-Transformer als 3D-Encoder, der von Anfang an trainiert wird, um die Bild-Text-Funktionen mit den 3D-Punktwolkenfunktionen auszurichten. Das Uni3D-Framework nutzt Vorwärmen und eine einfache Architektur, um die Fülle vorab trainierter 2D-Modelle und Bild-Text-Modelle als Initialisierungen und Ziele zu nutzen, und entfesselt so das volle Potenzial von 2D-Modellen und -Strategien, um sie auf die 3D-Welt zu skalieren. Die Flexibilität und Skalierbarkeit des Uni3D-Frameworks werden in Bezug auf
- Skalierung des Modells von 6M auf über eine Milliarde Parameter.
- 2D-Initialisierung zu textüberwachter visueller Selbstüberwachung.
- Text-Bild-Zielmodell-Skalierung von 150 Millionen auf über eine Milliarde Parameter.
Unter dem flexiblen und einheitlichen Framework von Uni3D beobachten die Entwickler eine kohärente Leistungssteigerung, wenn es um die Skalierung jedes Komponenten geht. Das große 3D-Repräsentationslernen profitiert auch erheblich von den teilerbaren 2D- und Skalierungsstrategien.
Wie in der folgenden Abbildung zu sehen ist, zeigt das Uni3D-Framework eine Leistungssteigerung im Vergleich zu vorherigen Frameworks in Few-Shot- und Zero-Shot-Szenarien. Es ist erwähnenswert, dass das Uni3D-Framework eine Zero-Shot-Klassifizierungs-Genauigkeit von über 88% auf ModelNet erreicht, was der Leistung mehrerer State-of-the-Art-Überwachungsmethoden entspricht.

Darüber hinaus liefert das Uni3D-Framework auch Spitzenleistungen, wenn es um andere repräsentative 3D-Aufgaben wie Teilsegmentierung und offene Weltverständnis geht. Das Uni3D-Framework zielt darauf ab, die Lücke zwischen 2D- und 3D-Vision zu überbrücken, indem es 3D-Grundmodelle mit einem einheitlichen, aber einfachen Vortrainingsansatz skaliert, um robuste 3D-Repräsentationen über eine breite Palette von Aufgaben zu erlernen, die letztendlich dazu beitragen könnten, 2D- und 3D-Vision über eine breite Palette von Modalitäten zu konvergieren.
Uni3D: Verwandte Arbeiten
Das Uni3D-Framework zieht Inspiration und lernt von den Entwicklungen, die in der 3D-Repräsentationslernen und den Grundmodellen, insbesondere unter verschiedenen Modalitäten, gemacht wurden.
3D-Repräsentationslernen
Die 3D-Repräsentationslernen-Methode verwendet Punktwolken für das 3D-Verständnis von Objekten, und dieses Feld wurde von Entwicklern in der jüngsten Vergangenheit stark erforscht. Es wurde beobachtet, dass diese Punktwolken unter Selbstüberwachung mithilfe spezifischer 3D-Vorwärmen, einschließlich Maskenpunktemodellierung, Selbstrekonstruktion und kontrastivem Lernen, vorab trainiert werden können.
Es ist erwähnenswert, dass diese Methoden mit begrenzten Daten arbeiten und oft nicht multimodale Repräsentationen von 3D zu 2D oder NLP untersuchen. Allerdings hat der jüngste Erfolg des CLIP-Frameworks, das hohe Effizienz bei der Lernung von visuellen Konzepten aus rohem Text mithilfe des kontrastiven Lernens zeigt, und weiterhin darauf abzielt, 3D-Repräsentationen zu lernen, indem es Bild-, Text- und Punktwolkenfunktionen mithilfe des kontrastiven Lernens ausrichtet.
Grundmodelle
Entwickler haben intensiv an der Gestaltung von Grundmodellen gearbeitet, um multimodale Repräsentationen zu skalieren und zu vereinheitlichen. Zum Beispiel haben Entwickler im NLP-Bereich an Frameworks gearbeitet, die vorab trainierte Sprachmodelle skalieren können, und dies revolutioniert langsam die NLP-Industrie. Darüber hinaus sind Fortschritte im 2D-Vision-Bereich zu beobachten, da Entwickler an Frameworks arbeiten, die Daten- und Modellskalierungstechniken verwenden, um den Fortschritt von der Sprache zu 2D-Modellen zu unterstützen, obwohl solche Frameworks schwierig zu replizieren sind, wenn es um 3D-Modelle geht, aufgrund der begrenzten Verfügbarkeit von 3D-Daten und der Herausforderungen, die bei der Vereinheitlichung und Skalierung von 3D-Frameworks auftreten.
Durch das Lernen aus diesen beiden Arbeitsbereichen haben Entwickler das Uni3D-Framework, das erste 3D-Grundmodell mit über einer Milliarde Parametern, entwickelt, das eine einheitliche ViT- oder Vision-Transformer-Architektur verwendet, die es Entwicklern ermöglicht, das Uni3D-Modell mithilfe einheitlicher 3D- oder NLP-Skalierungsstrategien zu skalieren. Entwickler hoffen, dass diese Methode es dem Uni3D-Framework ermöglichen wird, die Lücke zu überbrücken, die derzeit 2D- und 3D-Vision trennt, und die multimodale Konvergenz zu erleichtern.
Uni3D: Methode und Architektur

Die obige Abbildung zeigt eine allgemeine Übersicht des Uni3D-Frameworks, ein skalierbares und einheitliches Vortrainings-3D-Framework für großes 3D-Repräsentationslernen. Entwickler verwenden über 70 Millionen Texte und 10 Millionen Bilder, die mit über einer Million 3D-Formen gepaart sind, um das Uni3D-Framework auf über eine Milliarde Parameter zu skalieren. Das Uni3D-Framework verwendet einen 2D-ViT oder einen Vision-Transformer als 3D-Encoder, der von Anfang an trainiert wird, um die Text-Bild-Daten mit den 3D-Punktwolkenfunktionen auszurichten, was es dem Uni3D-Framework ermöglicht, die gewünschte Effizienz und Genauigkeit über eine breite Palette von Benchmarks zu liefern. Lassen Sie uns nun einen detaillierten Blick auf die Funktionsweise des Uni3D-Frameworks werfen.
Skalierung des Uni3D-Frameworks
Vorherige Studien zum Punktwolken-Repräsentationslernen haben traditionell stark auf die Gestaltung spezifischer Modellarchitekturen fokussiert, die bessere Leistungen über eine breite Palette von Anwendungen liefern, und arbeiten mit begrenzten Daten aufgrund kleiner Datensätze. Allerdings haben jüngste Studien versucht, die Möglichkeit der Verwendung von skalierbarem Vortrainings im 3D zu erforschen, aber es gab keine bedeutenden Ergebnisse aufgrund der begrenzten Verfügbarkeit von 3D-Daten. Um das Skalierungsproblem von 3D-Frameworks zu lösen, nutzt das Uni3D-Framework die Kraft einer Vanille-Transformer-Struktur, die fast einem Vision-Transformer entspricht, und kann die Skalierungsprobleme mithilfe einheitlicher 2D- oder NLP-Skalierungsstrategien lösen, um die Modellgröße zu skalieren.

Vorherige Studien zum Punktwolken-Repräsentationslernen haben traditionell stark auf die Gestaltung spezifischer Modellarchitekturen fokussiert, die bessere Leistungen über eine breite Palette von Anwendungen liefern, und arbeiten mit begrenzten Daten aufgrund kleiner Datensätze. Allerdings haben jüngste Studien versucht, die Möglichkeit der Verwendung von skalierbarem Vortrainings im 3D zu erforschen, aber es gab keine bedeutenden Ergebnisse aufgrund der begrenzten Verfügbarkeit von 3D-Daten. Um das Skalierungsproblem von 3D-Frameworks zu lösen, nutzt das Uni3D-Framework die Kraft einer Vanille-Transformer-Struktur, die fast einem Vision-Transformer entspricht, und kann die Skalierungsprobleme mithilfe einheitlicher 2D- oder NLP-Skalierungsstrategien lösen, um die Modellgröße zu skalieren.
Initialisierung von Uni3D
Eine weitere Herausforderung, die von vorherigen Arbeiten im Bereich der Skalierung von 3D-Repräsentationen auftrat, waren die Schwierigkeiten bei der Konvergenz und Überanpassung, die durch die große Größe der Modelle verursacht wurden. Ein effektiver Ansatz, um diese Hürde zu überwinden, besteht darin, individuelle 3D-Rücken zuvor mit spezifischen 3D-Vorwärmen zu trainieren und vorab trainierte Parameter zu initialisieren. Allerdings ist dieser Ansatz mit hohen Trainingskosten verbunden, und es ist auch schwierig, eine robuste Initialisierung für cross-modale Lernprozesse zu etablieren, aufgrund der begrenzten Verfügbarkeit von 3D-Daten für Trainingszwecke.
Das Uni3D-Framework nutzt eine Vanille-Transformer-Struktur, die der eines ViT entspricht. Mit diesem Ansatz kann das Uni3D-Framework natürlicherweise vorab trainierte große Modelle mit anderen Modalitäten initialisieren.
Multimodale Ausrichtung
Das Uni3D-Framework versucht, multimodale Ausrichtungen über Bild, Sprache und Punktwolken zu lernen, indem es Paradigmen ähnlich wie OpenShape und ULIP verwendet. Darüber hinaus wird das Uni3D-Framework für einen fairen Vergleich mit anderen Methoden das ensemblierte 3D-Datenset von OpenShape für Trainingszwecke verwenden. Dieses ensemblierte Datenset von OpenShape besteht aus 4 3D-Datensätzen:
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Experimente und Ergebnisse
Das Uni3D-Framework wird in verschiedenen Szenarien getestet, einschließlich seiner Leistung in Zero-Shot- und Few-Shot-Szenarien, Ergebnissen in offener Weltverständnis und mehr. Lassen Sie uns einen detaillierten Blick auf diese Ergebnisse werfen.
Zero-Shot-Formenklassifizierung
Um die Leistung des Uni3D-Frameworks in Zero-Shot-Formenklassifizierungsaufgaben zu bewerten, führen die Entwickler Experimente in drei Benchmarks durch, einschließlich ModelNet, ScanObjNN und Objaverse-LVIS-Benchmark-Datensätzen. ModelNet und ScanObjNN sind Datensätze, die häufig für Klassifizierungsaufgaben verwendet werden und 15 bzw. 40 Objektkategorien enthalten, während der Objaverse-LVIS-Benchmark ein gereinigtes und annotiertes Datenset mit über 40.000 Objekten in über 1.100 Kategorien ist. Der Vergleich zwischen den Frameworks ist in der folgenden Abbildung dargestellt, und wie zu sehen ist, übertrifft das Uni3D-Framework die vorherigen State-of-the-Art-Frameworks in verschiedenen Szenarien.

Few-Shot-Lineare-Probing
In der KI ist Lineare Probing eine gängige Methode, um die Repräsentationen zu bewerten, die ein Framework oder ein Modell lernt. Um die lineare Probing-Fähigkeit von Uni3D zu bewerten, frieren die Entwickler die Parameter des Uni3D-Frameworks mithilfe der üblichen Einstellungen von OpenShape ein. Anschließend trainieren die Entwickler einen linearen Klassifizierer für Uni3D mithilfe von Few-Shot-Klassenlabels. Die folgende Abbildung zeigt die lineare Probing-Fähigkeit verschiedener Frameworks auf dem Objaverse-LVIS-Datenset und zeigt die durchschnittliche Leistung des Modells über 10 zufällige Seeds. Wie zu sehen ist, übertrifft das Uni3D-Framework bestehende Methoden in verschiedenen Few-Shot-Szenarien.

Offenes Weltverständnis
Um die Fähigkeit des Uni3D-Frameworks zu bewerten, reale Formen und Objekte in Echtzeit zu verstehen, verwenden die Entwickler die ScanNet- und CLIP-Datensätze, um die Leistung von Uni3D zu erforschen. Es ist erwähnenswert, dass die Ground-Truth-Instant-Segmentierung verfügbar ist, und das primäre Ziel ist, die Kategorie jedes Szenen-Instants in einem Zero-Shot-Szenario zu erkennen. Die Ergebnisse sind in der folgenden Abbildung dargestellt. Wie zu sehen ist, liefert das Uni3D-Framework außergewöhnliche Ergebnisse, wenn es um reales Weltverständnis und -erkennung geht. Das Uni3D-Framework übertrifft bestehende Frameworks um ein erhebliches Maß, obwohl es nie auf realen Datensätzen trainiert wurde.

Übermodale Rückgewinnung
Die multimodalen Repräsentationen, die das Uni3D-Framework lernt, ermöglichen es dem Framework, 3D-Formen auf natürliche Weise aus Texten oder Bildern zurückzugewinnen. Um die 3D-Formen zurückzugewinnen, berechnet das Modell die Kosinus-Ähnlichkeit zwischen den Einbettungen von 3D-Formen und den Einbettungen einer Abfrage-Textprompt oder eines Abfrage-Bildes. Das Framework verwendet dann den KNN- oder K-Next-Neighbor-Algorithmus, um 3D-Formen zu generieren, die dem Abfrage am ähnlichsten sind, und die Ergebnisse sind in der folgenden Abbildung dargestellt. Wie zu sehen ist, verwendet das Uni3D-Framework erfolgreich reale Bilder, um 3D-Formen zurückzugewinnen. Es ist auch erwähnenswert, dass die Trainingsbilder nur für Rendering-Zwecke verwendet werden und die Lücke zwischen realen und Trainingsbildern erheblich ist. Darüber hinaus verwendet das Modell auch zwei Eingabe-Bilder und gewinnt Formen zurück, die beiden Eingabe-Bildern ähneln, indem es die Kosinus-Ähnlichkeit zwischen der Durchschnittseinbettung beider Bilder und den eingebetteten 3D-Formen verwendet. Die Ergebnisse sind interessant, da sie die Fähigkeit von Uni3D zeigen, vielfältige 3D-Repräsentationen zu lernen und mehrere 2D-Signale wahrzunehmen.

In der ersten Spalte verwendet das Framework zwei Abfrage-Bilder, um 3D-Formen zurückzugewinnen, die den Abfrage-Bildern am ähnlichsten sind. In der zweiten Spalte verwendet das Framework zwei Eingabe-Bilder, um 3D-Formen zurückzugewinnen, die beiden Eingabe-Bildern ähneln. Schließlich verwendet das Modell in der letzten Spalte Abfrage-Texte und gibt 3D-Formen zurück, die den Abfrage-Texten am ähnlichsten sind.
Endgültige Gedanken
In diesem Artikel haben wir über Uni3D gesprochen, ein skalierbares und einheitliches Vortrainings-3D-Framework, das entwickelt wurde, um große 3D-Repräsentationen zu lernen, die ihre Grenzen bei über einer Milliarde Parameter, über 10 Millionen Bildern, die mit über 70 Millionen Texten gepaart sind, und über einer Million 3D-Formen testen. Die Entwickler des Frameworks haben eine Vanille-Transformer-Struktur mit einer Struktur, die der eines ViT entspricht, verwendet, um das Uni3D-Framework zu skalieren. Darüber hinaus kann das Uni3D-Framework eine breite Palette von vorab trainierten 2D-Frameworks und 2D-Strategien auf die 3D-Welt übertragen. Die experimentellen Ergebnisse haben bereits das enorme Potenzial des Uni3D-Frameworks demonstriert, da das Uni3D-Framework genaue und effiziente Ergebnisse über eine breite Palette von Szenarien liefert und bestehende State-of-the-Art-Frameworks übertrifft.












