Modèles et plateformes d’IA
Zero123++ : Un Modèle de Base de Diffusion Multi-Vue Consistante à Partir d’une Seule Image

Ces dernières années, nous avons assisté à une avancée rapide des performances, de l’efficacité et des capacités de génération des nouveaux modèles de génération de données basés sur l’intelligence artificielle qui exploitent des ensembles de données étendus et des pratiques de génération de diffusion 2D. Aujourd’hui, les modèles de génération d’IA sont extrêmement capables de générer différents types de contenu multimédia 2D et, dans une certaine mesure, 3D, y compris du texte, des images, des vidéos, des GIF et plus encore.
Dans cet article, nous allons parler du cadre Zero123++, un modèle de génération d’IA basé sur la diffusion conditionnée par image qui vise à générer des images multi-vues cohérentes 3D à partir d’une seule vue d’entrée. Pour maximiser l’avantage tiré des modèles de génération pré-entraînés, le cadre Zero123++ met en œuvre de nombreuses techniques d’entraînement et de conditionnement pour minimiser l’effort nécessaire pour affiner les modèles d’image de diffusion prêts à l’emploi. Nous allons plonger plus profondément dans l’architecture, le fonctionnement et les résultats du cadre Zero123++, et analyser ses capacités à générer des images multi-vues cohérentes de haute qualité à partir d’une seule image. Alors, commençons.
Zero123 et Zero123++ : Introduction
Le cadre Zero123++ est un modèle de génération d’IA basé sur la diffusion conditionnée par image qui vise à générer des images multi-vues cohérentes 3D à partir d’une seule vue d’entrée. Le cadre Zero123++ est une continuation du cadre Zero123 ou Zero-1-to-3 qui utilise la technique de synthèse d’image de vue nouvelle pour pionnier les conversions d’image unique à 3D open source. Bien que le cadre Zero123++ offre des performances prometteuses, les images générées par le cadre ont des incohérences géométriques visibles, et c’est la principale raison pour laquelle le fossé entre les scènes 3D et les images multi-vues persiste.
Le cadre Zero-1-to-3 sert de base à plusieurs autres cadres, notamment SyncDreamer, One-2-3-45, Consistent123, et plus, qui ajoutent des couches supplémentaires au cadre Zero123 pour obtenir des résultats plus cohérents lors de la génération d’images 3D. D’autres cadres comme ProlificDreamer, DreamFusion, DreamGaussian, et plus suivent une approche basée sur l’optimisation pour obtenir des images 3D en distillant une image 3D à partir de modèles incohérents. Bien que ces techniques soient efficaces et génèrent des images 3D satisfaisantes, les résultats pourraient être améliorés avec la mise en œuvre d’un modèle de base de diffusion capable de générer des images multi-vues de manière cohérente. Par conséquent, le cadre Zero123++ prend le cadre Zero-1-to-3 et affine un nouveau modèle de base de diffusion multi-vue à partir de la diffusion stable.
Dans le cadre Zero-1-to-3, chaque nouvelle vue est générée de manière indépendante, et cette approche conduit à des incohérences entre les vues générées car les modèles de diffusion ont une nature d’échantillonnage. Pour résoudre ce problème, le cadre Zero123++ adopte une approche de disposition en tuiles, avec l’objet entouré de six vues dans une seule image, et assure une modélisation correcte de la distribution jointe des images multi-vues d’un objet.
Un autre défi majeur auquel sont confrontés les développeurs travaillant sur le cadre Zero-1-to-3 est qu’il sous-utilise les capacités offertes par la diffusion stable qui conduit à une inefficacité et à des coûts supplémentaires. Il y a deux raisons principales pour lesquelles le cadre Zero-1-to-3 ne peut pas maximiser les capacités offertes par la diffusion stable
- Lors de l’entraînement avec des conditions d’image, le cadre Zero-1-to-3 n’intègre pas efficacement les mécanismes de conditionnement local ou global offerts par la diffusion stable.
- Lors de l’entraînement, le cadre Zero-1-to-3 utilise une résolution réduite, une approche dans laquelle la résolution de sortie est réduite en dessous de la résolution d’entraînement, ce qui peut réduire la qualité de la génération d’images pour les modèles de diffusion stable.
Pour résoudre ces problèmes, le cadre Zero123++ met en œuvre une série de techniques de conditionnement qui maximisent l’utilisation des ressources offertes par la diffusion stable et maintiennent la qualité de la génération d’images pour les modèles de diffusion stable.
Amélioration de la Condition et de la Cohérence
Dans une tentative d’améliorer la condition d’image et la cohérence des images multi-vues, le cadre Zero123++ a mis en œuvre différentes techniques, avec l’objectif principal de réutiliser les techniques antérieures issues du modèle de diffusion stable pré-entraîné.
Génération Multi-Vue
La qualité indispensable de la génération d’images multi-vues cohérentes réside dans la modélisation correcte de la distribution jointe de plusieurs images. Dans le cadre Zero-1-to-3, la corrélation entre les images multi-vues est ignorée car pour chaque image, le cadre modèle la distribution marginale conditionnelle de manière indépendante et séparée. Cependant, dans le cadre Zero123++, les développeurs ont opté pour une approche de disposition en tuiles qui assemble 6 images dans un seul cadre/image pour une génération multi-vue cohérente, et le processus est démontré dans l’image suivante.

De plus, il a été remarqué que les orientations des objets ont tendance à se désambiguïser lors de l’entraînement du modèle sur les poses de caméra, et pour prévenir cette désambiguïsation, le cadre Zero-1-to-3 s’entraîne sur les poses de caméra avec des angles d’élévation et des azimuts relatifs à l’entrée. Pour mettre en œuvre cette approche, il est nécessaire de connaître l’angle d’élévation de la vue de l’entrée qui est ensuite utilisé pour déterminer la pose relative entre les vues nouvelles d’entrée. Dans une tentative de connaître cet angle d’élévation, les cadres ajoutent souvent un module d’estimation d’élévation, et cette approche se fait souvent au prix d’erreurs supplémentaires dans le pipeline.
Calendrier de Bruit
Le calendrier linéaire échelonné, le calendrier de bruit d’origine pour la diffusion stable, se concentre principalement sur les détails locaux, mais comme on peut le voir dans l’image suivante, il comporte très peu d’étapes avec un rapport signal/bruit (SNR) plus faible.

Ces étapes de faible rapport signal/bruit se produisent tôt pendant la phase de débruitage, une phase cruciale pour déterminer la structure globale à basse fréquence. La réduction du nombre d’étapes pendant la phase de débruitage, soit pendant l’interférence ou l’entraînement, conduit souvent à une variation structurelle plus importante. Bien que cette configuration soit idéale pour la génération d’images unique, elle limite la capacité du cadre à assurer la cohérence globale entre les différentes vues. Pour surmonter cet obstacle, le cadre Zero123++ affine un modèle LoRA sur le cadre de prédiction 2 v de la diffusion stable pour effectuer une tâche de jouet, et les résultats sont démontrés ci-dessous.

Avec le calendrier de bruit linéaire échelonné, le modèle LoRA ne surapprend pas, mais blanchit légèrement l’image. Inversement, lorsqu’il travaille avec le calendrier de bruit linéaire, le cadre LoRA génère une image blanche avec succès, quelle que soit la invite de l’entrée, ce qui signifie l’impact du calendrier de bruit sur la capacité du cadre à s’adapter à de nouvelles exigences globales.
Attention de Référence Échelonnée pour les Conditions Locales
L’entrée de vue unique ou les images de conditionnement dans le cadre Zero-1-to-3 est concaténée avec les entrées bruyantes dans la dimension de fonction pour être bruyante pour le conditionnement d’image.
Cette concaténation conduit à une correspondance spatiale pixel par pixel incorrecte entre l’image cible et l’entrée. Pour fournir une entrée de conditionnement local correcte, le cadre Zero123++ utilise une attention de référence échelonnée, une approche dans laquelle l’exécution d’un modèle de débruitage UNet est référencée sur une image de référence supplémentaire, suivie de l’ajout de matrices de valeur et d’attention auto à partir de l’image de référence aux couches d’attention respectives lorsque l’entrée du modèle est débruitée, et le processus est démontré dans la figure suivante.

L’approche d’attention de référence est capable de guider le modèle de diffusion pour générer des images partageant une texture ressemblante avec l’image de référence et un contenu sémantique sans aucun affinage. Avec l’affinage, l’approche d’attention de référence offre de meilleurs résultats avec le latent échelonné.

Conditionnement Global : FlexDiffuse
Dans l’approche originale de diffusion stable, les embeddings de texte sont la seule source d’embeddings globaux, et l’approche utilise le cadre CLIP comme encodeur de texte pour effectuer des examens croisés entre les embeddings de texte et les latents du modèle. Par conséquent, les développeurs sont libres d’utiliser l’alignement entre les espaces de texte et les images CLIP résultantes pour les utiliser pour les conditionnements d’image globaux.
Le cadre Zero123++ propose d’utiliser une variante entraînable du mécanisme de guidage linéaire pour incorporer le conditionnement d’image global dans le cadre avec un affinage minimal nécessaire, et les résultats sont démontrés dans l’image suivante. Comme on peut le voir, sans la présence d’un conditionnement d’image global, la qualité du contenu généré par le cadre est satisfaisante pour les régions visibles qui correspondent à l’image d’entrée. Cependant, la qualité de l’image générée par le cadre pour les régions non visibles subit une détérioration significative, principalement due à l’incapacité du modèle à déduire les sémantiques globales de l’objet.

Architecture du Modèle
Le cadre Zero123++ est entraîné avec le modèle 2v de diffusion stable comme base en utilisant les différentes approches et techniques mentionnées dans l’article. Le cadre Zero123++ est pré-entraîné sur l’ensemble de données Objaverse qui est rendu avec un éclairage HDRI aléatoire. Le cadre adopte également l’approche d’entraînement par phases utilisée dans le cadre de variations d’images de diffusion stable dans une tentative de minimiser davantage l’effort d’affinage requis et de préserver autant que possible les connaissances acquises par la diffusion stable.
Le fonctionnement ou l’architecture du cadre Zero123++ peut être divisé en étapes ou phases séquentielles. La première phase voit le cadre affiner les matrices KV des couches d’attention croisées et les couches d’auto-attention de la diffusion stable avec AdamW comme optimiseur, 1000 étapes de réchauffement et l’horaire d’apprentissage cosinus maximisant à 7×10-5. Dans la deuxième phase, le cadre utilise un taux d’apprentissage constant très conservateur avec 2000 ensembles de réchauffement et utilise l’approche Min-SNR pour maximiser l’efficacité pendant l’entraînement.
Zero123++ : Résultats et Comparaison de Performance
Performance Qualitative
Pour évaluer les performances du cadre Zero123++ en fonction de la qualité des images générées, il est comparé à SyncDreamer et Zero-1-to-3-XL, deux des cadres les plus performants pour la génération de contenu. Les cadres sont comparés à quatre images d’entrée avec différents champs d’application. La première image est un chat jouet électrique, prise directement à partir de l’ensemble de données Objaverse, et elle présente une grande incertitude sur l’extrémité arrière de l’objet. La deuxième image est celle d’un extincteur d’incendie, et la troisième est l’image d’un chien assis sur une fusée, générée par le modèle SDXL. La dernière image est une illustration d’anime. Les étapes d’élévation requises pour les cadres sont obtenues en utilisant la méthode d’estimation d’élévation du cadre One-2-3-4-5, et la suppression de l’arrière-plan est réalisée en utilisant le cadre SAM. Comme on peut le voir, le cadre Zero123++ génère des images multi-vues de haute qualité de manière cohérente et est capable de généraliser à l’illustration 2D hors domaine et aux images générées par l’IA de la même manière.


Analyse Quantitative
Pour comparer de manière quantitative le cadre Zero123++ aux cadres Zero-1-to-3 et Zero-1-to-3-XL actuels, les développeurs évaluent le score de similarité d’image par patch perceptive apprise (LPIPS) de ces modèles sur les données de validation, un sous-ensemble de l’ensemble de données Objaverse. Pour évaluer les performances du modèle sur la génération d’images multi-vues, les développeurs assemblent les images de référence de vérité et les 6 images générées respectivement, puis calculent le score LPIPS. Les résultats sont démontrés ci-dessous et, comme on peut le voir clairement, le cadre Zero123++ obtient les meilleures performances sur l’ensemble de validation.

Évaluation de Texte à Multi-Vue
Pour évaluer la capacité du cadre Zero123++ à générer du contenu de texte à multi-vue, les développeurs utilisent d’abord le cadre SDXL avec des invites de texte pour générer une image, puis emploient le cadre Zero123++ sur l’image générée. Les résultats sont démontrés dans l’image suivante, et comme on peut le voir, par rapport au cadre Zero-1-to-3 qui ne peut pas garantir une génération multi-vue cohérente, le cadre Zero123++ renvoie des images multi-vues cohérentes, réalistes et très détaillées en mettant en œuvre l’approche ou le pipeline de texte à image à multi-vue.

Zero123++ Depth ControlNet
En plus du cadre Zero123++ de base, les développeurs ont également publié le Depth ControlNet Zero123++, une version contrôlée par la profondeur du cadre d’origine construit en utilisant l’architecture ControlNet. Les images linéaires normalisées sont rendues en respect avec les images RGB suivantes, et un cadre ControlNet est entraîné pour contrôler la géométrie du cadre Zero123++ en utilisant la perception de profondeur.

Conclusion
Dans cet article, nous avons parlé de Zero123++, un modèle de génération d’IA basé sur la diffusion conditionnée par image qui vise à générer des images multi-vues cohérentes 3D à partir d’une seule vue d’entrée. Pour maximiser l’avantage tiré des modèles de génération pré-entraînés, le cadre Zero123++ met en œuvre de nombreuses techniques d’entraînement et de conditionnement pour minimiser l’effort nécessaire pour affiner les modèles d’image de diffusion prêts à l’emploi. Nous avons également discuté des différentes approches et améliorations mises en œuvre par le cadre Zero123++ qui lui permettent d’obtenir des résultats comparables à, et même dépassant ceux obtenus par les cadres actuels les plus performants.
Cependant, malgré son efficacité et sa capacité à générer des images multi-vues cohérentes de haute qualité, le cadre Zero123++ a encore des marges d’amélioration, avec des domaines de recherche potentiels tels qu’un modèle de raffineur à deux étapes qui pourrait résoudre l’incapacité de Zero123++ à répondre aux exigences globales de cohérence. Des mises à l’échelle supplémentaires pour améliorer encore la capacité de Zero123++ à générer des images de qualité encore plus élevée.
- Modèle de Raffineur à Deux Étapes qui pourrait résoudre l’incapacité de Zero123++ à répondre aux exigences globales de cohérence.
- Mises à l’Échelle Supplémentaires pour améliorer encore la capacité de Zero123++ à générer des images de qualité encore plus élevée.












