Modèles et plateformes d’IA
LucidDreamer : Génération de texte-3D haute fidélité via Interval Score Matching

Les récents progrès réalisés dans les cadres de génération de texte-3D ont marqué un jalon important dans les modèles génératifs. Ils ouvrent la voie à de nouvelles possibilités de création d’actifs 3D dans de nombreux scénarios du monde réel. Les actifs numériques 3D occupent désormais une place indispensable dans notre présence numérique, permettant une visualisation et une interaction complètes avec des environnements et des objets complexes qui reflètent nos expériences du monde réel. Ces cadres de génération de texte-3D sont appliqués dans divers domaines, notamment l’animation, l’architecture, les jeux, la réalité augmentée et virtuelle, et bien plus encore. Ils sont également utilisés de manière extensive dans les conférences en ligne, la vente au détail, l’éducation et le marketing.
Cependant, malgré les promesses de ces progrès dans les cadres de génération de texte-3D, l’utilisation intensive des technologies 3D pose un problème majeur. La génération d’images et de contenus médiatiques 3D de haute qualité nécessite toujours beaucoup de temps, d’efforts, de ressources et d’expertise spécialisée. Même avec ces exigences remplies, la génération de texte-3D échoue souvent à produire des modèles 3D détaillés et de haute qualité. Ce problème de rendu et de génération 3D de mauvaise qualité est plus répandu dans les cadres qui utilisent la méthode de Score Distillation Sampling (SDS). Cet article discutera des déficiences notables observées dans les modèles utilisant la méthode SDS, qui introduisent des incohérences et des directions de mise à jour de mauvaise qualité, aboutissant à un effet de lissage excessif sur la sortie générée. Nous présenterons également le cadre LucidDreamer, une approche novatrice qui utilise la méthode Interval Score Matching (ISM) pour surmonter le problème de lissage excessif. Nous explorerons l’architecture du modèle et ses performances par rapport aux cadres de génération de texte-3D génératifs de pointe. Alors, commençons.
LucidDreamer3D : Introduction à la génération 3D utilisant Interval Score Matching
Une raison majeure pour laquelle les modèles de génération 3D ont été le point de discussion de l’industrie de l’intelligence artificielle générative est due à leurs applications généralisées dans divers domaines et industries, ainsi qu’à leur capacité à produire du contenu 3D en temps réel. En raison de leurs applications pratiques généralisées, les développeurs ont proposé de nombreuses approches de génération de contenu 3D, dont la génération de texte-3D se démarque pour sa capacité à utiliser uniquement des descriptions textuelles pour générer des modèles 3D imaginatifs. Les cadres de génération de texte-3D réalisent cela en utilisant un modèle de diffusion d’image pré-entraîné pour superviser l’entraînement d’un modèle de paramètres neuronaux 3D, permettant ainsi de rendre des images 3D de manière cohérente qui correspondent au texte. Cette capacité à rendre des images 3D constantes est ancrée dans l’utilisation de la Score Distillation Sampling, et permet à la SDS d’agir comme mécanisme principal pour passer des résultats 2D des modèles de diffusion à leurs équivalents 3D, permettant ainsi l’entraînement de modèles 3D sans utiliser d’images d’entraînement. Malgré leur efficacité, les cadres de génération de texte-3D qui utilisent la méthode SDS souffrent souvent de problèmes de distorsion et de lissage excessif qui entravent les mises en œuvre pratiques de la génération 3D de haute fidélité.
Pour résoudre les problèmes de lissage excessif, le cadre LucidDreamer met en œuvre une approche Interval Score Matching, une approche novatrice qui utilise deux mécanismes efficaces. Premièrement, l’approche ISM utilise la méthode d’inversion DDIM pour atténuer l’effet de moyenne causé par les incohérences de pseudo-vérités de base en produisant une trajectoire de diffusion inversible. Deuxièmement, au lieu de faire correspondre les images rendues par le modèle 3D avec les pseudo-vérités de base, la méthode ISM les fait correspondre entre deux étapes d’intervalle dans la trajectoire de diffusion, ce qui l’aide à éviter une erreur de reconstruction élevée en évitant la reconstruction en une étape. L’utilisation de l’ISM par rapport à la SDS aboutit à des performances constamment élevées avec des sorties réalistes et détaillées.
Dans l’ensemble, le cadre LucidDreamer vise à apporter les contributions suivantes dans l’intelligence artificielle générative 3D
- Fournit une analyse approfondie de la SDS, le concept fondamental dans les cadres de génération de texte-3D, et identifie ses limitations clés de pseudo-vérités de base de mauvaise qualité, et fournit une explication pour l’effet de lissage excessif rencontré par ces cadres de génération de texte-3D.
- Pour contrer les limitations posées par l’approche SDS, le cadre LucidDreamer introduit l’Interval Score Matching, une approche novatrice qui utilise des correspondances basées sur les intervalles et des trajectoires de diffusion inversibles pour surpasser la SDS en produisant des sorties réalistes et détaillées.
- Atteint des performances de pointe en intégrant la méthode ISM avec le splatting gaussien 3D pour surpasser les méthodes existantes de génération de contenu 3D avec des coûts d’entraînement faibles.
Limitations de la SDS
Comme mentionné précédemment, la SDS est l’une des approches les plus populaires pour les modèles de génération de texte-3D, et elle cherche des modes pour le postérieur conditionnel dans l’espace latent de la DDPM. L’approche SDS adopte également un modèle DDPM pré-entraîné pour modéliser le postérieur conditionnel, et vise à distiller les représentations 3D pour le postérieur conditionnel qui est réalisé en minimisant la divergence de KL. De plus, l’approche SDS réutilise l’objectif de correspondance de score de bruit pondéré pour l’entraînement de la DDP. L’objectif principal de l’approche SDS peut également être vu comme faisant correspondre la vue du modèle 3D avec la pseudo-vérité de base estimée par la DDPM en une seule étape, bien que le processus de distillation ignore souvent un aspect critique de la composante DDPM, à savoir qu’elle produit des pseudo-vérités de base de mauvaise qualité avec des caractéristiques incohérentes pendant le processus de distillation.

Cependant, les directions de mise à jour sous des circonstances indésirables sont mises à jour vers des représentations 3D qui aboutissent finalement à des résultats lissés excessivement. De plus, il est important de noter que la composante DDPM est sensible aux entrées, et les caractéristiques de la pseudo-vérité de base changent considérablement même avec le moindre changement dans l’entrée. De plus, l’aléatoire dans la pose de la caméra et la composante de bruit des entrées peut ajouter aux fluctuations qui sont inévitables pendant la distillation. L’optimisation de l’entrée pour des pseudo-vérités de base incohérentes aboutit à des résultats moyens en fonction des caractéristiques. Ce qui est plus important, c’est que l’approche SDS obtient des pseudo-vérités de base avec une prédiction en une seule étape pour tous les intervalles de temps, et ne prend pas en compte les limitations d’une composante DDPM à une seule étape qui est incapable de produire des sorties de haute qualité, ce qui indique que la distillation d’actifs 3D ou d’images avec une composante SDS peut ne pas être l’approche la plus idéale.
LucidDreamer : Méthodologie et fonctionnement
Le cadre LucidDreamer présente l’approche ISM, mais il s’appuie également sur les connaissances acquises à partir d’autres cadres, notamment les modèles de génération de texte-3D, les modèles de diffusion et les cadres de représentation 3D différentiables. Avec cela dit, examinons de plus près l’architecture et la méthodologie du cadre LucidDreamer.
Interval Score Matching ou ISM
Les problèmes de lissage excessif et de sortie de mauvaise qualité rencontrés par la majorité des cadres de génération de texte-3D peuvent être attribués à leur utilisation de l’approche SDS qui vise à faire correspondre la pseudo-vérité de base avec les représentations 3D qui est incohérente et souvent de mauvaise qualité. Pour contrer les problèmes rencontrés par la SDS, le cadre LucidDreamer présente l’ISM ou l’Interval Score Matching, une approche novatrice qui comporte deux étapes de fonctionnement. Dans la première étape, la composante ISM obtient des pseudo-vérités de base plus cohérentes pendant la distillation, indépendamment de l’aléatoire dans les poses de caméra et le bruit. Dans la deuxième étape, le cadre génère des pseudo-vérités de base de meilleure qualité.
Une autre limitation majeure de la SDS est la génération de pseudo-vérités de base avec une prédiction en une seule étape pour tous les intervalles de temps, ce qui rend difficile la garantie de pseudo-vérités de base de haute qualité, et cela forme la base pour améliorer la qualité visuelle des pseudo-vérités de base. De même, l’objectif de la SDS peut être vu comme faisant correspondre la vue du modèle 3D avec la pseudo-vérité de base estimée par la DDPM en une seule étape, bien que le processus de distillation ignore un aspect critique de la composante DDPM, à savoir qu’elle produit des pseudo-vérités de base de mauvaise qualité avec des caractéristiques incohérentes pendant le processus de distillation.
Dans l’ensemble, la composante ISM promet de livrer plusieurs avantages par rapport aux méthodes précédentes utilisées dans les modèles de génération de texte-3D. Premièrement, grâce à la capacité de l’ISM à fournir des pseudo-vérités de base de haute qualité de manière cohérente, elle est capable de produire des sorties de distillation de haute fidélité avec des structures plus fines et des détails plus riches, ce qui élimine le besoin d’une grande échelle de guidage et améliore la flexibilité pour la création de contenu 3D. Deuxièmement, la transition de l’approche SDS à l’approche ISM a une surcharge computationnelle marginale, en particulier depuis que l’approche ISM ne compromet pas l’efficacité globale, même si elle exige des coûts de calcul supplémentaires pour les inversions DDIM.

La figure ci-dessus démontre le fonctionnement de l’approche ISM et fournit une vue d’ensemble de l’architecture du cadre LucidDreamer. Le cadre initialise d’abord le splatting gaussien, c’est-à-dire les représentations 3D, à l’aide d’un générateur de texte-3D pré-entraîné à l’aide d’une invite. Il est ensuite incorporé avec une composante DDPM pré-entraînée pour perturber des vues aléatoires vers des trajectoires latentes non conditionnelles bruyantes à l’aide des inversions DDIM, puis met à jour avec le score d’intervalle. Grâce à son architecture, le noyau de l’optimisation de la composante ISM se concentre sur la mise à jour des représentations 3D vers des pseudo-vérités de base de haute qualité et cohérentes en termes de caractéristiques, tout en étant computationnellement amical. Ce principe est ce qui permet à l’ISM de s’aligner sur les objectifs fondamentaux de l’approche SDS tout en affinant la méthode existante.
Inversion DDIM
Le cadre LucidDreamer vise à produire des pseudo-vérités de base plus cohérentes en accord avec les représentations 3D. Par conséquent, au lieu de produire des représentations 3D, le cadre LucidDreamer utilise l’approche d’inversion DDIM pour prédire des représentations latentes de bruit 3D et prédire une trajectoire latente de bruit inversible de manière itérative. De plus, c’est grâce à l’inversibilité de l’inversion DDIM que le cadre LucidDreamer est capable d’augmenter la cohérence de la pseudo-vérité de base de manière significative pour tous les intervalles de temps.
Pipeline de génération avancée
Le cadre LucidDreamer présente également une pipeline avancée, en plus de l’ISM, pour explorer les facteurs qui affectent la qualité visuelle de la génération de texte-3D, et introduit le splatting gaussien 3D ou 3DGS comme modèle de génération 3D et de nuage de points 3D pour l’initialisation.
Splatting gaussien 3D
Les travaux existants ont indiqué que l’augmentation de la taille du lot et de la résolution de rendu pour l’entraînement améliore considérablement la qualité visuelle. Cependant, la plupart des représentations 3D apprenables adoptées pour la génération de texte-3D sont gourmandes en temps et en mémoire. D’un autre côté, l’approche de splatting gaussien 3D fournit des résultats efficaces en termes d’optimisation et de rendu, ce qui permet à la pipeline de génération avancée du cadre LucidDreamer d’atteindre une grande taille de lot ainsi qu’une résolution de rendu élevée, même lorsqu’elle fonctionne avec des ressources computationnelles limitées.
Initialisation
La plupart des cadres de génération de texte-3D de pointe initialisent leurs représentations 3D avec des géométries limitées comme des cercles, des boîtes ou des cylindres, ce qui aboutit souvent à des sorties indésirables pour les objets non symétriques axiaux. D’un autre côté, puisque le cadre LucidDreamer introduit le splatting gaussien 3D comme représentations 3D, le cadre peut adopter plusieurs cadres de génération de points de texte de manière naturelle pour générer une initialisation grossière avec des entrées humaines. La stratégie d’initialisation accélère finalement la vitesse de convergence de manière significative.
LucidDreamer : Expériences et résultats
Génération de texte-3D

La figure ci-dessus démontre les résultats générés par le modèle LucidDreamer avec l’approche de diffusion stable originale, tandis que la figure suivante parle des résultats générés sur différents points de finition.

Comme on peut le voir, le cadre LucidDreamer est capable de générer du contenu 3D hautement cohérent en utilisant le texte d’entrée et les indices sémantiques. De plus, avec l’utilisation de l’ISM, le cadre LucidDreamer génère des images plus réalistes et plus détaillées tout en évitant les problèmes courants tels que la sur-saturation ou le lissage excessif, et excelle dans la génération d’objets courants ainsi que dans le soutien à la création créative.
Généralisabilité de l’ISM
Pour évaluer la généralisabilité de l’ISM, une comparaison est effectuée entre l’ISM et la SDS dans les représentations explicites et implicites, et les résultats sont démontrés dans l’image suivante.

Comparaison qualitative
Pour analyser l’efficacité qualitative du cadre LucidDreamer, il est comparé aux modèles de base de pointe actuels, et pour assurer une comparaison équitable, il utilise le cadre de diffusion stable 2.1 pour la distillation, et les résultats sont démontrés dans l’image suivante. Comme on peut le voir, le cadre livre des résultats de haute fidélité et géométriquement précis tout en consommant moins de ressources et de temps.

De plus, pour fournir une évaluation plus complète, les développeurs effectuent également une étude d’utilisateurs. L’évaluation sélectionne 28 invites et utilise différentes approches de génération de texte-3D sur chaque invite pour générer des objets. Les résultats sont ensuite classés par les utilisateurs en fonction du degré d’alignement avec l’invite d’entrée et de leur fidélité.

LucidDreamer : Applications
En raison de ses performances exceptionnelles sur une large gamme de tâches de génération de texte-3D, le cadre LucidDreamer a plusieurs applications potentielles, notamment la génération d’avatars zéro-shot, la génération de texte-3D personnalisée et la modification zéro-shot 2D et 3D.

L’image en haut à gauche démontre le potentiel de LucidDreamer dans les tâches de modification zéro-shot 2D et 3D, tandis que les images en bas à gauche démontrent la capacité du cadre à générer des sorties de texte-3D personnalisées avec LoRA, tandis que l’image de droite met en évidence la capacité du cadre à générer des avatars 3D.
Pensées finales
Dans cet article, nous avons discuté de LucidDreamer, une approche novatrice qui utilise la méthode Interval Score Matching pour surmonter le problème de lissage excessif, et avons discuté de l’architecture du modèle et de ses performances par rapport aux cadres de génération de texte-3D de pointe. Nous avons également discuté de la manière dont la SDS, une approche couramment mise en œuvre dans la majorité des modèles de génération de texte-3D, aboutit souvent à un lissage excessif des images générées, et de la manière dont le cadre LucidDreamer contrerait ce problème en introduisant une nouvelle approche, l’approche Interval Score Matching, pour générer des images 3D de haute fidélité et plus réalistes. Les résultats et l’évaluation indiquent l’efficacité du cadre LucidDreamer sur une large gamme de tâches de génération 3D, et de la manière dont le cadre surpasse déjà les modèles de génération de texte-3D de pointe actuels. Les performances exceptionnelles du cadre ouvrent la voie à une large gamme d’applications pratiques, comme déjà discuté.












