Modèles et plateformes d’IA
Uni3D : Explorer les Représentations 3D Unifiées à Grande Échelle
L’augmentation des représentations de texte et de visuels a été un axe majeur de recherche ces dernières années. Les développements et les recherches menés récemment ont conduit à de nombreuses révolutions dans l’apprentissage du langage et la vision. Cependant, malgré la popularité de l’augmentation des représentations de texte et de visuels, l’augmentation des représentations pour les scènes et les objets 3D n’a pas été suffisamment discutée.
Aujourd’hui, nous allons discuter de Uni3D, un modèle de base 3D qui vise à explorer les représentations 3D unifiées. Le cadre Uni3D utilise un cadre ViT initialisé 2D, pré-entraîné de bout en bout, pour aligner les fonctionnalités d’image-texte avec les fonctionnalités de nuage de points 3D correspondantes.
Le cadre Uni3D utilise des tâches prétextes et une architecture simple pour exploiter l’abondance de modèles 2D pré-entraînés et de modèles alignés image-texte en tant qu’initialisations et cibles, respectivement. Cette approche libère tout le potentiel des modèles 2D et des stratégies pour les mettre à l’échelle dans le monde 3D.
Dans cet article, nous allons approfondir la vision par ordinateur 3D et le cadre Uni3D, en explorant les concepts essentiels et l’architecture du modèle. Alors, commençons.
Uni3D et Apprentissage de Représentation 3D : Une Introduction
Au cours des dernières années, la vision par ordinateur est devenue l’un des domaines les plus investis de l’industrie de l’IA. Suite aux progrès importants réalisés dans les cadres de vision par ordinateur 2D, les développeurs se sont tournés vers la vision par ordinateur 3D. Ce domaine, en particulier l’apprentissage de représentation 3D, combine des aspects de graphisme par ordinateur, d’apprentissage automatique, de vision par ordinateur et de mathématiques pour automatiser le traitement et la compréhension de la géométrie 3D. Le développement rapide des capteurs 3D comme LiDAR, ainsi que leurs applications généralisées dans l’industrie AR/VR, a entraîné une attention accrue pour l’apprentissage de représentation 3D. Ses applications potentielles continuent de croître chaque jour.
Bien que les cadres existants aient montré des progrès remarquables dans l’architecture de modèle 3D, la modélisation orientée tâche et les objectifs d’apprentissage, la plupart explorent l’architecture 3D à une échelle relativement petite avec des données limitées, des paramètres et des scénarios de tâches. Le défi de l’apprentissage de représentations 3D évolutives, qui peuvent ensuite être appliquées à des applications en temps réel dans des environnements divers, reste en grande partie inexploré.
En poursuivant, au cours des dernières années, l’augmentation des grands modèles de langage pré-entraînés a contribué à révolutionner le domaine du traitement du langage naturel, et les travaux récents ont indiqué une traduction du progrès de 2D à partir du langage en utilisant des données et une mise à l’échelle de modèle qui permet aux développeurs d’essayer et de réessayer ce succès pour apprendre une représentation 3D qui peut être mise à l’échelle et transférée à des applications dans le monde réel.
Uni3D est un cadre de pré-entraînement 3D évolutif et unifié développé dans le but d’apprendre de grandes représentations 3D qui testent ses limites à l’échelle de plus d’un milliard de paramètres, plus de 10 millions d’images appariées avec plus de 70 millions de textes et plus d’un million de formes 3D. La figure ci-dessous compare la précision de classification zéro-shot en fonction des paramètres dans le cadre Uni3D. Le cadre Uni3D met avec succès à l’échelle les représentations 3D de 6 millions à plus d’un milliard.

Le cadre Uni3D se compose d’un ViT 2D ou d’un Vision Transformer en tant que codeur 3D qui est ensuite pré-entraîné de bout en bout pour aligner les fonctionnalités d’image-texte avec les fonctionnalités de nuage de points 3D. Le cadre Uni3D utilise des tâches prétextes et une architecture simple pour exploiter l’abondance de modèles 2D pré-entraînés et de modèles alignés image-texte en tant qu’initialisations et cibles, respectivement, libérant ainsi tout le potentiel des modèles 2D et des stratégies pour les mettre à l’échelle dans le monde 3D. La flexibilité et la mise à l’échelle du cadre Uni3D sont mesurées en termes de
- Mise à l’échelle du modèle de 6M à plus d’un milliard de paramètres.
- Initialisation 2D à la supervision de texte à partir de l’apprentissage auto-supervisé visuel.
- Mise à l’échelle du modèle cible image-texte de 150 millions à plus d’un milliard de paramètres.
Sous le cadre unifié et flexible offert par Uni3D, les développeurs observent une augmentation cohérente des performances lorsqu’il s’agit de mettre à l’échelle chaque composant. L’apprentissage de représentation 3D à grande échelle bénéficie également considérablement des stratégies 2D partageables et de mise à l’échelle.
Comme on peut le voir dans la figure ci-dessous, le cadre Uni3D affiche une augmentation des performances par rapport aux travaux antérieurs dans les paramètres zéro-shot et few-shot. Il est important de noter que le cadre Uni3D retourne une précision de classification zéro-shot de plus de 88 % sur ModelNet, ce qui est à parité avec les performances de plusieurs méthodes de supervision de pointe.

De plus, le cadre Uni3D livre également des performances de pointe en termes de précision et de performance lors de l’exécution d’autres tâches 3D représentatives comme la segmentation de parties et la compréhension du monde ouvert. Le cadre Uni3D vise à combler le fossé entre la vision 2D et la vision 3D en mettant à l’échelle les modèles de base 3D avec une approche de pré-entraînement unifiée et simple pour apprendre des représentations 3D plus robustes à travers une large gamme de tâches, ce qui pourrait finalement aider à la convergence de la vision 2D et 3D à travers une large gamme de modalités.
Uni3D : Travaux Associés
Le cadre Uni3D s’inspire des développements réalisés par les travaux antérieurs sur l’apprentissage de représentation 3D et les modèles de base, en particulier sous différentes modalités.
Apprentissage de Représentation 3D
La méthode d’apprentissage de représentation 3D utilise des nuages de points pour la compréhension 3D de l’objet, et ce domaine a été exploré par les développeurs à grande échelle dans le passé récent, et il a été observé que ces nuages de points peuvent être pré-entraînés sous auto-supervision en utilisant des tâches prétextes 3D spécifiques, y compris la modélisation de points masqués, la reconstruction auto-supervisée et l’apprentissage contrastif.
Il est important de noter que ces méthodes fonctionnent avec des données limitées et qu’elles n’enquêtent généralement pas sur les représentations multimodales à partir de 2D ou de NLP. Cependant, le succès récent du cadre CLIP qui retourne une efficacité élevée dans l’apprentissage de concepts visuels à partir de texte brut en utilisant la méthode d’apprentissage contrastif, et qui cherche ensuite à apprendre des représentations 3D en alignant les fonctionnalités d’image, de texte et de nuage de points en utilisant la même méthode d’apprentissage contrastif.
Modèles de Base
Les développeurs ont travaillé sans relâche pour concevoir des modèles de base pour mettre à l’échelle et unifier les représentations multimodales. Par exemple, dans le domaine du NLP, les développeurs ont travaillé sur des cadres qui peuvent mettre à l’échelle les modèles de langage pré-entraînés, et cela révolutionne lentement l’industrie du NLP. De plus, des progrès peuvent être observés dans le domaine de la vision 2D car les développeurs travaillent sur des cadres qui utilisent des techniques de mise à l’échelle de données et de modèle pour aider à la progression du langage vers les modèles 2D, bien que de tels cadres soient difficiles à reproduire pour les modèles 3D en raison de la disponibilité limitée de données 3D et des défis rencontrés lors de l’unification et de la mise à l’échelle des cadres 3D.
En apprenant des deux domaines de travail ci-dessus, les développeurs ont créé le cadre Uni3D, le premier modèle de base 3D avec plus d’un milliard de paramètres qui utilise une architecture de transformateur de vision unifiée qui permet aux développeurs de mettre à l’échelle le cadre Uni3D en utilisant des stratégies de mise à l’échelle 3D unifiées ou NLP pour mettre à l’échelle les modèles. Les développeurs espèrent que cette méthode permettra au cadre Uni3D de combler le fossé qui sépare actuellement la vision 2D et la vision 3D, ainsi que de faciliter la convergence multimodale.
Uni3D : Méthode et Architecture

L’image ci-dessus montre une vue d’ensemble générique du cadre Uni3D, un cadre de pré-entraînement 3D évolutif et unifié pour l’apprentissage de représentation 3D à grande échelle. Les développeurs utilisent plus de 70 millions de textes et 10 millions d’images appariées avec plus d’un million de formes 3D pour mettre à l’échelle le cadre Uni3D à plus d’un milliard de paramètres. Le cadre Uni3D utilise un ViT 2D ou un Vision Transformer en tant que codeur 3D qui est ensuite pré-entraîné de bout en bout pour aligner les données d’image-texte avec les fonctionnalités de nuage de points 3D, permettant ainsi au cadre Uni3D de livrer l’efficacité et la précision souhaitées à travers une large gamme de benchmarks. Examinons maintenant en détail le fonctionnement du cadre Uni3D.
Mise à l’échelle du Cadre Uni3D
Les études antérieures sur l’apprentissage de représentation de nuage de points se sont traditionnellement concentrées sur la conception d’architectures de modèle spécifiques qui livrent de meilleures performances à travers une large gamme d’applications et fonctionnent avec une quantité limitée de données en raison de petits ensembles de données. Cependant, les études récentes ont tenté d’explorer la possibilité d’utiliser une pré-entraînement évolutif en 3D, mais il n’y a eu aucun résultat majeur en raison de la disponibilité limitée de données 3D. Pour résoudre le problème de mise à l’échelle des cadres 3D, le cadre Uni3D utilise la puissance d’une structure de transformateur vanille qui ressemble presque à un Vision Transformer et peut résoudre les problèmes de mise à l’échelle en utilisant des stratégies de mise à l’échelle 2D unifiées ou NLP pour mettre à l’échelle la taille du modèle.

Les études antérieures sur l’apprentissage de représentation de nuage de points se sont traditionnellement concentrées sur la conception d’architectures de modèle spécifiques qui livrent de meilleures performances à travers une large gamme d’applications et fonctionnent avec une quantité limitée de données en raison de petits ensembles de données. Cependant, les études récentes ont tenté d’explorer la possibilité d’utiliser une pré-entraînement évolutif en 3D, mais il n’y a eu aucun résultat majeur en raison de la disponibilité limitée de données 3D. Pour résoudre le problème de mise à l’échelle des cadres 3D, le cadre Uni3D utilise la puissance d’une structure de transformateur vanille qui ressemble presque à un Vision Transformer et peut résoudre les problèmes de mise à l’échelle en utilisant des stratégies de mise à l’échelle 2D unifiées ou NLP pour mettre à l’échelle la taille du modèle.
Initialisation de Uni3D
Un autre défi majeur rencontré par les travaux antérieurs impliqués dans la mise à l’échelle des représentations 3D, les difficultés de convergence et de sur-ajustement qui étaient le résultat de la grande taille des modèles. Une approche efficace pour surmonter cet obstacle consiste à pré-entraîner les backbones 3D individuels avec des tâches prétextes 3D spécifiées et à initialiser les paramètres pré-entraînés. Cependant, l’approche est accompagnée de coûts de formation élevés et il est également difficile d’établir une initialisation robuste pour l’apprentissage cross-modal en raison de la quantité limitée de données 3D disponibles à des fins de formation.
Le cadre Uni3D utilise un transformateur vanille dont la structure ressemble étroitement à celle du ViT. Avec cette approche, le cadre Uni3D peut naturellement adopter les modèles pré-entraînés de grande taille avec d’autres modalités pour initialiser le cadre Uni3D.
Alignement Multimodal
Le cadre Uni3D tente d’apprendre des alignements multimodaux entre les images, le langage et les nuages de points en utilisant des paradigmes similaires à ceux des cadres OpenShape et ULIP. De plus, pour assurer une comparaison équitable avec d’autres méthodes, le cadre Uni3D utilise l’ensemble de données 3D de OpenShape pour la formation. Cet ensemble de données de OpenShape se compose de 4 ensembles de données 3D :
- Objaverse.
- ShapeNet.
- 3D-FUTURE.
- ABO.
Expériences et Résultats
Le cadre Uni3D est testé dans différents paramètres et dans diverses tâches de classification, y compris sa performance dans les paramètres zéro-shot et few-shot, les résultats autour de la compréhension du monde ouvert et plus. Examinons en détail ces résultats.
Classification de Forme Zéro-Shot
Pour évaluer les performances du cadre Uni3D dans les tâches de classification de forme zéro-shot, les développeurs effectuent des expériences sur trois benchmarks, y compris les ensembles de données ModelNet, ScanObjNN et Objaverse-LVIS. ModelNet et ScanObjNN sont des ensembles de données largement utilisés pour les tâches de classification et contiennent respectivement 15 et 40 catégories d’objets, tandis que l’ensemble de données Objaverse-LVIS est un ensemble de données nettoyé et annoté contenant plus de 40 000 objets dans plus de 1 100 catégories. La comparaison entre les cadres est présentée dans l’image ci-dessous, et comme on peut le voir, le cadre Uni3D surpasse de manière significative les cadres de l’état de l’art antérieurs dans différents paramètres.

Sondage Linéaire Few-Shot
Dans l’IA, le sondage linéaire est une méthode couramment utilisée pour évaluer les représentations que le cadre ou le modèle apprend. Pour évaluer la capacité de sondage linéaire de Uni3D, les développeurs figent les paramètres du cadre Uni3D en utilisant les paramètres courants d’OpenShape. Ensuite, les développeurs forment un classificateur linéaire pour Uni3D en utilisant des étiquettes de classe few-shot. La figure ci-dessous montre la capacité de sondage linéaire de différents cadres sur l’ensemble de données Objaverse-LVIS et montre la performance moyenne du modèle sur 10 graines aléatoires. Comme on peut le voir, le cadre Uni3D surpasse de manière significative les méthodes existantes dans différents paramètres few-shot.

Compréhension du Monde Ouvert
Pour évaluer la capacité du cadre Uni3D à comprendre les formes et les objets du monde réel en temps réel, les développeurs utilisent les ensembles de données ScanNet et CLIP pour explorer les performances de Uni3D. Il est important de noter que la segmentation d’instantané de vérité est disponible et que l’objectif principal est de reconnaître la catégorie de chaque instantané individuel dans une scène dans un paramètre zéro-shot. Les résultats sont présentés dans l’image ci-dessous. Comme on peut le voir, le cadre Uni3D livre des résultats exceptionnels lors de la compréhension et de la reconnaissance du monde réel. Le cadre Uni3D surpasse les cadres existants d’une marge significative, même s’il n’a jamais été formé sur des ensembles de données du monde réel.

Récupération Cross-Modale
Les représentations multimodales apprises par le cadre Uni3D peuvent permettre au cadre de récupérer des formes 3D à partir de textes ou d’images. Pour récupérer les formes 3D, le modèle calcule la similarité cosinuse entre les embeddings des formes 3D et les embeddings d’une invite de texte ou d’une image d’invite. Le cadre utilise ensuite l’algorithme KNN ou K Plus Proches Voisins pour générer des formes 3D qui ressemblent le plus à l’invite, et les résultats sont présentés dans la figure ci-dessous. Comme on peut le voir, le cadre Uni3D utilise avec succès des images du monde réel pour récupérer des formes 3D. De plus, il est important de noter que les images de formation ne sont utilisées que pour le rendu et que le fossé entre les images du monde réel et les images de formation est important. De plus, le modèle prend également deux images d’entrée et récupère des formes similaires aux deux images d’entrée en utilisant la similarité cosinuse entre les embeddings moyens des deux images et les embeddings des formes 3D. Les résultats sont intéressants car ils montrent la capacité de Uni3D à apprendre des représentations 3D diverses et à percevoir plusieurs signaux 2D.

Dans la première colonne, le cadre utilise deux invites d’image pour retourner des formes 3D qui sont les plus similaires aux invites d’image. Dans la deuxième colonne, le cadre utilise deux images d’entrée pour récupérer des formes qui ressemblent aux deux images d’entrée. Enfin, dans la dernière colonne, le modèle utilise des invites de texte et retourne des formes 3D qui ressemblent le plus à l’invite de texte.
Pensées Finales
Dans cet article, nous avons discuté de Uni3D, un cadre de pré-entraînement 3D évolutif et unifié développé dans le but d’apprendre de grandes représentations 3D qui testent ses limites à l’échelle de plus d’un milliard de paramètres, plus de 10 millions d’images appariées avec plus de 70 millions de textes et plus d’un million de formes 3D. Les développeurs du cadre ont inclus un transformateur vanille dont la structure ressemble à celle du ViT, ce qui leur permet de mettre à l’échelle le cadre Uni3D en utilisant des stratégies de mise à l’échelle 2D unifiées ou NLP. De plus, le cadre Uni3D peut exploiter une large gamme de cadres 2D pré-entraînés et de stratégies 2D pour le monde 3D. Les résultats expérimentaux ont déjà démontré le grand potentiel du cadre Uni3D, car le cadre Uni3D retourne des résultats précis et efficaces à travers une large gamme de paramètres et surpasse les cadres de l’état de l’art existants.












