Modèles et plateformes d’IA
Splatter Image : Une tentative de reconstruction 3D ultra-rapide en une seule vue
La reconstruction d’objets 3D en une seule vue avec des réseaux de neurones convolutionnels a démontré des capacités remarquables. Les modèles de reconstruction 3D en une seule vue génèrent le modèle 3D de n’importe quel objet à partir d’une seule image de référence, ce qui en fait l’un des sujets de recherche les plus chauds en vision par ordinateur.

Par exemple, considérons la moto de l’image ci-dessus. Générer sa structure 3D nécessite un pipeline complexe qui combine d’abord les indices d’images de bas niveau avec des informations sémantiques de haut niveau et des connaissances sur l’agencement structurel des pièces.
En raison de ce processus complexe, la reconstruction 3D en une seule vue a été un défi majeur en vision par ordinateur. Dans une tentative d’améliorer l’efficacité de la reconstruction 3D en une seule vue, les développeurs ont travaillé sur Splatter Image, une méthode qui vise à réaliser une construction ultra-rapide de forme et d’apparence 3D des objets. Au cœur du cadre Splatter Image, la méthode de splatting gaussien est utilisée pour analyser les représentations 3D, en tirant parti de la vitesse et de la qualité qu’elle offre.
Récemment, la méthode de splatting gaussien a été mise en œuvre par de nombreux modèles de reconstruction multi-vue pour un rendu en temps réel, une mise à l’échelle améliorée et une formation rapide. Avec cela, Splatter Image est le premier cadre à mettre en œuvre la méthode de splatting gaussien pour les tâches de reconstruction en une seule vue.
Dans cet article, nous allons explorer comment le cadre Splatter Image utilise le splatting gaussien pour réaliser une reconstruction 3D ultra-rapide en une seule vue. Alors, commençons.
Splatter Image : Une tentative de reconstruction 3D ultra-rapide en une seule vue
Comme mentionné plus tôt, Splatter Image est une approche ultra-rapide pour la reconstruction d’objets 3D en une seule vue basée sur la méthode de splatting gaussien. Splatter Image est le premier cadre de vision par ordinateur à mettre en œuvre le splatting gaussien pour la génération d’objets 3D monoclaires, puisque traditionnellement, le splatting gaussien a alimenté les cadres de reconstruction d’objets 3D multi-vue. Cependant, ce qui distingue le cadre Splatter Image des méthodes précédentes est qu’il s’agit d’une approche basée sur l’apprentissage, et la reconstruction lors des tests ne nécessite que l’évaluation feed-forward du réseau de neurones.
Splatter Image repose fondamentalement sur les qualités de rendu du splatting gaussien et sur une vitesse de traitement élevée pour générer des reconstructions 3D. Le cadre Splatter Image présente une conception simple : le cadre utilise un réseau de neurones d’image à image 2D pour prédire un gaussien 3D par pixel d’image d’entrée, et mappe l’image d’entrée à un gaussien 3D par pixel. Les gaussiens 3D résultants ont la forme d’une image, connue sous le nom d’image Splatter, et ces gaussiens fournissent également une représentation à 360 degrés de l’image. Le processus est démontré dans l’image suivante.

Bien que le processus soit simple et direct, il existe certains défis clés auxquels le cadre Splatter Image est confronté lors de l’utilisation du splatting gaussien pour générer des gaussiens 3D pour les représentations 3D en une seule vue. Le premier obstacle majeur est de concevoir un réseau de neurones qui accepte l’image d’un objet comme entrée et génère un mélange de gaussiens représentant tous les côtés de l’image comme sortie. Pour relever ce défi, le Splatter Image tire parti du fait que même si le mélange de gaussiens généré est un ensemble ou une collection non ordonnée d’éléments, il peut toujours être stocké dans une structure de données ordonnée. Par conséquent, le cadre utilise une image 2D comme conteneur pour les gaussiens 3D, ce qui signifie que chaque pixel du conteneur contient les paramètres d’un gaussien, y compris ses propriétés telles que la forme, l’opacité et la couleur.
En stockant les ensembles de gaussiens 3D dans une image, le cadre Splatter Image est en mesure de réduire les obstacles de reconstruction rencontrés lors de l’apprentissage d’un réseau de neurones d’image à image. En utilisant cette approche, le processus de reconstruction peut être mis en œuvre uniquement en utilisant des opérateurs 2D efficaces au lieu de s’appuyer sur des opérateurs 3D. De plus, dans le cadre Splatter Image, la représentation 3D est un mélange de gaussiens 3D, ce qui lui permet d’exploiter les avantages de vitesse de rendu et d’efficacité de mémoire offerts par le splatting gaussien, ce qui améliore l’efficacité à la fois lors de la formation et de l’inférence. En poursuivant, le cadre Splatter Image ne génère pas seulement des représentations 3D en une seule vue, mais il démontre également une remarquable efficacité, car il peut être formé même sur une seule carte graphique sur des benchmarks d’objets 3D standard. De plus, le cadre Splatter Image peut être étendu pour prendre plusieurs images comme entrée. Il peut le faire en enregistrant les mélanges de gaussiens individuels dans une référence commune, puis en prenant la combinaison des mélanges de gaussiens prédits à partir de vues individuelles. Le cadre injecte également des couches d’attention croisée légères dans son architecture, ce qui permet aux différentes vues de communiquer entre elles pendant la prédiction.
D’un point de vue empirique, il est important de noter que le cadre Splatter Image peut produire une reconstruction à 360 degrés de l’objet, même s’il n’en voit qu’un seul côté. Le cadre attribue ensuite différents gaussiens dans un voisinage 2D à différentes parties de l’objet 3D pour coder les informations de reconstruction à 360 degrés dans l’image 2D. De plus, le cadre définit l’opacité de plusieurs gaussiens à zéro, ce qui les désactive, ce qui leur permet d’être éliminés lors du post-traitement.
Pour résumer, le cadre Splatter Image est
- Une approche novatrice pour générer des reconstructions d’objets 3D en une seule vue en transposant l’approche de splatting gaussien.
- Étend la méthode pour la reconstruction d’objets 3D multi-vue.
- Atteint les performances de reconstruction d’objets 3D de pointe sur des benchmarks standard avec une vitesse et une qualité exceptionnelles.
Splatter Image : Méthodologie et architecture
Splatting gaussien
Comme mentionné plus tôt, le splatting gaussien est la méthode principale mise en œuvre par le cadre Splatter Image pour générer des reconstructions d’objets 3D en une seule vue. En termes simples, le splatting gaussien est une méthode de rasterisation pour reconstruire des images 3D et rendre des images en temps réel avec plusieurs points de vue. L’espace 3D dans l’image est appelé gaussiens, et des techniques d’apprentissage automatique sont mises en œuvre pour apprendre les paramètres de chaque gaussien. Le splatting gaussien n’exige pas de formation pendant le rendu, ce qui facilite des temps de rendu plus rapides. L’image suivante résume l’architecture du splatting gaussien 3D.

Le splatting gaussien 3D utilise d’abord l’ensemble d’images d’entrée pour générer un nuage de points. Le splatting gaussien utilise ensuite les images d’entrée pour estimer les paramètres externes de la caméra, tels que l’inclinaison et la position, en faisant correspondre les pixels entre les images, et ces paramètres sont ensuite utilisés pour calculer le nuage de points. En utilisant différentes méthodes d’apprentissage automatique, le splatting gaussien optimise ensuite quatre paramètres pour chaque gaussien, à savoir : position (où se trouve-t-il), covariance (l’étendue de son étirement ou de sa mise à l’échelle dans une matrice 3×3), couleur (quelle est la palette de couleurs RVB) et alpha (mesurant la transparence). Le processus d’optimisation rend l’image pour chaque position de caméra et l’utilise pour déterminer les paramètres plus proches de l’image d’origine. En conséquence, la sortie de splatting gaussien 3D résultante est une image, appelée image Splatter, qui ressemble le plus à l’image d’origine à la position de caméra à partir de laquelle elle a été capturée.

De plus, la fonction d’opacité et la fonction de couleur dans le splatting gaussien donnent un champ de rayonnement avec la direction de vue du point 3D. Le cadre rend ensuite le champ de rayonnement sur une image en intégrant les couleurs observées le long du rayon qui passe à travers le pixel. Le splatting gaussien représente ces fonctions comme une combinaison de gaussiens colorés, où la moyenne du gaussien ou le centre, ainsi que la covariance du gaussien, aident à déterminer sa forme et sa taille. Chaque gaussien possède également une propriété d’opacité et une propriété de couleur dépendante de la vue qui, ensemble, définissent le champ de rayonnement.
Image Splatter
Le composant de rendu mappe l’ensemble de gaussiens 3D à une image. Pour effectuer une reconstruction 3D en une seule vue, le cadre cherche ensuite une fonction inverse pour les gaussiens 3D qui reconstruisent le mélange de gaussiens 3D à partir d’une image. L’inclusion clé ici est de proposer une conception efficace et simple pour la fonction inverse. Plus précisément, pour une image d’entrée, le cadre prédit un gaussien pour chaque pixel individuel en utilisant une architecture de réseau de neurones d’image à image pour produire une image, l’image Splatter, en sortie. Le réseau prédit également la forme, l’opacité et la couleur.
Maintenant, on pourrait se demander comment le cadre Splatter Image peut reconstruire la représentation 3D d’un objet même s’il n’a accès qu’à l’une de ses vues ? En temps réel, le cadre Splatter Image apprend à utiliser certains des gaussiens disponibles pour reconstruire la vue et utilise les gaussiens restants pour reconstruire automatiquement les parties non visibles de l’image. Pour maximiser son efficacité, le cadre peut désactiver automatiquement les gaussiens en prédissant si l’opacité est nulle. Si l’opacité est nulle, les gaussiens sont désactivés et le cadre ne rend pas ces points, qui sont plutôt éliminés lors du post-traitement.
Perte au niveau de l’image
Un avantage majeur de l’exploitation de la vitesse et de l’efficacité offertes par la méthode de splatting gaussien est qu’elle permet au cadre de rendre toutes les images à chaque itération, même pour des lots avec une taille de lot relativement plus grande. De plus, cela implique que non seulement le cadre peut utiliser des pertes décomposables, mais qu’il peut également utiliser des pertes au niveau de l’image qui ne se décomposent pas en pertes par pixel.
Normalisation d’échelle
Il est difficile d’estimer la taille d’un objet en regardant une seule vue, et il est difficile de résoudre cette ambiguïté lorsqu’il est formé avec une perte. Le même problème n’est pas observé dans les ensembles de données synthétiques, car tous les objets sont rendus avec des intrinsèques de caméra identiques et les objets sont à une distance fixe de la caméra, ce qui aide finalement à résoudre l’ambiguïté. Cependant, dans les ensembles de données avec des images de la vie réelle, l’ambiguïté est bastante évidente, et le cadre Splatter Image emploie plusieurs méthodes de prétraitement pour fixer approximativement la taille de tous les objets.
Couleur dépendante de la vue
Pour représenter les couleurs dépendantes de la vue, le cadre Splatter Image utilise des harmoniques sphériques pour généraliser les couleurs au-delà du modèle de couleur lambertien. Pour chaque gaussien spécifique, le modèle définit des coefficients qui sont prédits par le réseau et les harmoniques sphériques. Le changement de point de vue transforme une direction de vue dans la source de caméra en sa direction de vue correspondante dans le cadre de référence. Le modèle trouve ensuite les coefficients correspondants pour trouver la fonction de couleur transformée. Le modèle peut le faire car les harmoniques sphériques sont fermés lors de la rotation, ainsi que tous les autres ordres.
Architecture de réseau de neurones
La majorité de l’architecture du prédicteur qui mappe l’image d’entrée au mélange de gaussiens est identique au processus utilisé dans le cadre SongUNet. La dernière couche de l’architecture est remplacée par une couche de convolution 1×1 avec le modèle de couleur qui détermine la largeur des canaux de sortie. Étant donné l’image d’entrée, le réseau produit un tenseur de canal de sortie en sortie, et pour chaque canal de pixel, code les paramètres qui sont ensuite transformés en décalage, opacité, rotation, profondeur et couleur. Le cadre utilise ensuite des fonctions non linéaires pour activer les paramètres et obtenir les paramètres du gaussien.
Pour reconstruire des représentations 3D avec plusieurs vues, le cadre Splatter Image applique le même réseau à chaque vue d’entrée, puis utilise l’approche de point de vue pour combiner les reconstructions individuelles. De plus, pour faciliter une coordination et un échange d’informations efficaces entre les vues dans le réseau, le cadre Splatter Image apporte deux modifications au réseau. Premièrement, le cadre conditionne le modèle avec sa pose de caméra respective et passe des vecteurs en codant chaque entrée à l’aide d’un codage de position sinusoidal, ce qui donne lieu à plusieurs dimensions. Deuxièmement, le cadre ajoute des couches d’attention croisée pour faciliter la communication entre les fonctionnalités des différentes vues.
Splatter Image : Expériences et résultats
Le cadre Splatter Image mesure la qualité de ses reconstructions en évaluant la qualité de synthèse de vues nouvelles, car le cadre utilise la vue source et rend la forme 3D pour cibler des vues non visibles pour effectuer des reconstructions. Le cadre évalue ses performances en mesurant les scores SSIM ou de similarité structurelle, PSNR ou de rapport signal/bruit et de qualité perceptive ou LPIPS.
Performances de reconstruction 3D en une seule vue
Le tableau suivant démontre les performances du modèle Splatter Image dans la tâche de reconstruction 3D en une seule vue sur le benchmark ShapeNet.

Comme on peut l’observer, le cadre Splatter Image surpasse toutes les méthodes de reconstruction déterministes dans les scores LPIPS et SSIM. Les scores indiquent que le modèle Splatter Image génère des images avec des reconstructions plus nettes. De plus, le modèle Splatter Image surpasse également toutes les méthodes de reconstruction déterministes en termes de score PSNR, ce qui indique que les reconstructions générées sont également plus précises. De plus, outre le fait de surperformer toutes les méthodes déterministes, le cadre Splatter Image n’exige que les poses de caméra relatives pour améliorer son efficacité à la fois lors des phases de formation et de test.
L’image suivante démontre la puissance qualitative du cadre Splatter Image, et comme on peut le voir, le modèle génère des reconstructions avec des géométries fines et intéressantes, et capture les détails des vues de conditionnement.

L’image suivante montre que les reconstructions générées par le cadre Splatter Image ne sont pas seulement plus nettes mais également plus précises que les modèles précédents, en particulier dans des conditions non conventionnelles avec des structures fines et une visibilité limitée.

Reconstruction 3D multi-vue
Pour évaluer ses capacités de reconstruction 3D multi-vue, le cadre Splatter Image est formé sur l’ensemble de données SpaneNet-SRN Cars pour des prédictions à deux vues. Les méthodes existantes utilisent un conditionnement de pose de caméra absolue pour les tâches de reconstruction 3D multi-vue, ce qui signifie que le modèle apprend à s’appuyer principalement sur l’orientation canonique de l’objet dans l’objet. Bien que cela fasse l’affaire, cela limite l’applicabilité des modèles, car la pose de caméra absolue est souvent inconnue pour une nouvelle image d’un objet.

Pensées finales
Dans cet article, nous avons discuté de Splatter Image, une méthode qui vise à réaliser une construction ultra-rapide de forme et d’apparence 3D des objets. Au cœur du cadre Splatter Image, la méthode de splatting gaussien est utilisée pour analyser les représentations 3D, en tirant parti de la vitesse et de la qualité qu’elle offre. Le cadre Splatter Image traite les images en utilisant une architecture de réseau de neurones d’image à image 2D pour prédire une image pseudo qui contient un gaussien coloré par pixel. En utilisant la méthode de splatting gaussien, le cadre Splatter Image est en mesure de combiner un rendu rapide avec une inférence rapide, ce qui donne lieu à une formation rapide et à une évaluation plus rapide sur des benchmarks réels et synthétiques.












