Angle d’Anderson

Résoudre les limites des modèles de diffusion pour les réflexions et les miroirs

mm
Ajouter Unite.AI à vos sources préférées sur Google
ChatGPT-4o and Adobe Firefly

Depuis que l’IA générative suscite l’intérêt du public, la recherche en vision par ordinateur approfondit le développement de modèles capables de comprendre et de reproduire les lois physiques. Apprendre aux systèmes d’apprentissage automatique à simuler la gravité ou la dynamique des liquides reste toutefois un défi majeur depuis au moins cinq ans.

Depuis que les modèles de diffusion latente (LDM) dominent l’IA générative, les chercheurs s’intéressent de plus en plus à leur capacité limitée à comprendre et reproduire les phénomènes physiques. Le problème a pris davantage d’importance avec Sora d’OpenAI, puis avec les modèles vidéo ouverts Hunyuan Video et Wan 2.1.

Des reflets peu convaincants

La plupart des travaux visant à améliorer la compréhension de la physique par les LDM portent sur la simulation de la marche, la physique des particules et d’autres aspects du mouvement newtonien. Ces domaines attirent l’attention parce qu’une erreur dans un comportement physique élémentaire détruit immédiatement l’authenticité d’une vidéo générée par l’IA.

Un courant plus restreint mais croissant étudie cependant l’une des grandes faiblesses des LDM : leur incapacité relative à produire des reflets exacts.

Exemples d’échecs de réflexion et de l’approche proposée dans l’étude de janvier 2025 « Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections ». Source : https://arxiv.org/pdf/2409.14677

From the janvier 2025 paper 'Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections', examples of 'reflection failure' versus the researchers' own approach. Source: https://arxiv.org/pdf/2409.14677

Exemples d’échecs de réflexion et de la méthode proposée. Source : https://arxiv.org/pdf/2409.14677

Le problème existait déjà à l’époque de la CGI et demeure important dans les jeux vidéo, où les algorithmes de lancer de rayons simulent le trajet de la lumière lorsqu’elle interagit avec les surfaces. Ils calculent la manière dont les rayons virtuels rebondissent sur les objets ou les traversent pour créer des reflets, des réfractions et des ombres réalistes.

Chaque rebond supplémentaire augmente fortement le coût de calcul. Les applications en temps réel doivent donc arbitrer entre latence et précision en limitant le nombre de rebonds autorisés.

A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Représentation d’un rayon calculé dans un environnement 3D ou CGI traditionnel. Source : https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Une théière chromée placée devant un miroir pourrait provoquer une boucle presque infinie de rayons entre les surfaces réfléchissantes, sans bénéfice pratique équivalent pour l’image finale. Deux ou trois rebonds dépassent généralement déjà ce que le spectateur perçoit. Un seul produirait un miroir noir, car la lumière doit accomplir au moins deux trajets pour former un reflet visible.

Chaque rebond peut presque doubler le temps de rendu. Un traitement plus rapide des reflets représente donc une occasion majeure d’améliorer la qualité du lancer de rayons.

Les reflets sont également indispensables au photoréalisme dans des scènes moins évidentes : une rue ou un champ de bataille après la pluie, la rue opposée dans une vitrine ou une porte vitrée, ou l’environnement visible dans les lunettes d’un personnage.

Un double reflet simulé par composition traditionnelle dans une scène emblématique de The Matrix (1999).

A simulated twin-reflection achieved via traditional compositing for an iconic scene in 'The Matrix' (1999).

Double reflet créé par composition traditionnelle dans The Matrix (1999).

Problèmes d’image

Les méthodes populaires avant les modèles de diffusion, comme Neural Radiance Fields (NeRF), et des solutions plus récentes comme Gaussian Splatting ont elles aussi eu du mal à produire des reflets naturels.

REF²-NeRF a proposé une méthode fondée sur NeRF pour les scènes comprenant une vitrine. La réfraction et la réflexion y sont modélisées avec des éléments dépendants et indépendants du point de vue. Les chercheurs peuvent ainsi estimer les surfaces réfractantes, notamment le verre, et séparer la lumière directe de la lumière réfléchie.

Examples from the Ref2Nerf paper. Source: https://arxiv.org/pdf/2311.17116

Exemples de l’étude Ref²-NeRF. Source : https://arxiv.org/pdf/2311.17116

Parmi les autres solutions récentes figurent NeRFReN, Reflecting Reality et Planar Reflection-Aware Neural Radiance Fields de Meta. Pour Gaussian Splatting, Mirror-3DGS, Reflective Gaussian Splatting et RefGaussian ont traité le problème, tandis que Nero a proposé en 2023 une méthode particulière pour intégrer les qualités réfléchissantes aux représentations neuronales.

MirrorVerse

Faire respecter la logique des reflets par un modèle de diffusion est sans doute plus difficile qu’avec des méthodes explicitement structurelles comme Gaussian Splatting et NeRF. Une telle règle ne s’ancre de manière fiable que si les données d’entraînement contiennent de nombreux exemples variés dans une large gamme de situations. Le résultat dépend donc fortement de la distribution et de la qualité du jeu de données.

Ces comportements sont traditionnellement ajoutés avec une LoRA ou par réglage fin du modèle de base. Aucune solution n’est idéale : la LoRA tend à orienter les sorties vers ses propres données même sans instruction explicite, tandis qu’un réglage fin coûteux peut éloigner irréversiblement le modèle de sa branche principale et créer des outils incompatibles avec l’original ou d’autres variantes.

Améliorer les modèles de diffusion demanderait d’accorder davantage d’attention à la physique des reflets dans les données. Mais beaucoup d’autres faiblesses exigent le même traitement. À l’échelle de jeux de données gigantesques, la sélection sur mesure est difficile et coûteuse ; corriger chaque faiblesse ainsi n’est donc pas réaliste.

Des solutions apparaissent néanmoins. Le projet indien MirrorVerse propose un jeu de données et une méthode d’entraînement améliorés afin de faire progresser l’état de l’art des reflets dans les modèles de diffusion.

MirrorVerse améliore les méthodes récentes mais reste imparfait. Dans un exemple, les pots en céramique sont décalés par rapport à leur position correcte. Dans un autre, où la tasse ne devrait pas apparaître dans le miroir, un reflet erroné est inséré à droite malgré la géométrie naturelle.

Right-most, the results from MirrorVerse pitted against two prior approaches (central two columns). Source: https://arxiv.org/pdf/2504.15397

Résultats de MirrorVerse à droite face à deux méthodes antérieures. Source : https://arxiv.org/pdf/2504.15397

La nouvelle méthode mérite l’attention non seulement comme état de l’art possible, mais aussi parce qu’elle montre combien ce problème peut être insoluble pour la diffusion d’images comme de vidéos. Les exemples nécessaires sont souvent liés à des actions et des contextes particuliers. Les LDM pourraient donc rester inférieurs à NeRF, Gaussian Splatting et la CGI traditionnelle pour cette fonction.

L’étude s’intitule MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World. Elle est signée par trois chercheurs du Vision and AI Lab, de l’IISc Bangalore et du Samsung R&D Institute Bangalore. Elle dispose d’une page de projet, d’un jeu de données sur Hugging Face et d’un code source publié sur GitHub.

Méthode

Les auteurs montrent d’abord à quel point Stable Diffusion et Flux peinent à respecter les instructions relatives aux reflets. SD3.5 et Flux produisent souvent des reflets incohérents et géométriquement inexacts.

From the paper: Current state-of-the-art text-to-image models, SD3.5 and Flux, exhibited significant challenges in producing consistent and geometrically accurate reflections when prompted to generate reflections in the scene.

SD3.5 et Flux peinent à produire des reflets cohérents et géométriquement exacts.

Ils ont développé MirrorFusion 2.0, un modèle génératif à diffusion destiné à améliorer le photoréalisme et la précision géométrique des reflets dans les images synthétiques. Le modèle est entraîné sur le nouveau jeu MirrorGen2, conçu pour corriger les faiblesses de généralisation des approches précédentes.

MirrorGen2 étend les méthodes antérieures par le positionnement aléatoire des objets, des rotations aléatoires et un ancrage explicite au sol. L’objectif est de conserver des reflets plausibles pour davantage de poses et de positions par rapport au miroir.

Schema for the generation of synthetic data in MirrorVerse: the dataset generation pipeline applied key augmentations by randomly positioning, rotating, and grounding objects within the scene using the 3D-Positioner. Objects are also paired in semantically consistent combinations to simulate complex spatial relationships and occlusions, allowing the dataset to capture more realistic interactions in multi-object scenes.

Le pipeline synthétique de MirrorVerse place, tourne et ancre aléatoirement les objets et crée des paires cohérentes.

Pour représenter des relations spatiales complexes, le pipeline inclut aussi des scènes avec des paires d’objets cohérentes sur le plan sémantique. Par exemple, une chaise est associée à une table. Après le placement et la rotation de l’objet principal, le second est disposé sans chevauchement, dans une région distincte.

L’ancrage au sol empêche les objets de flotter de façon inappropriée, un défaut fréquent lorsque des données synthétiques sont produites à grande échelle ou par des méthodes fortement automatisées.

Données et tests

SynMirrorV2

SynMirrorV2 vise à diversifier et rendre plus réalistes les données d’entraînement des reflets. Ses objets 3D proviennent d’Objaverse et d’Amazon Berkeley Objects (ABO), puis sont affinés avec OBJECT 3DIT et le filtrage de MirrorFusion V1 afin d’écarter les ressources de mauvaise qualité. Le corpus final comprend 66 062 objets.

Examples from the Objaverse dataset, used in the creation of the curated dataset for the new system. Source: https://arxiv.org/pdf/2212.08051

Exemples d’Objaverse, utilisé pour le corpus du nouveau système. Source : https://arxiv.org/pdf/2212.08051

Les scènes placent ces objets sur des sols texturés issus de CC-Textures et des arrière-plans HDRI de PolyHaven, devant des miroirs muraux ou de grands miroirs rectangulaires. Une source lumineuse est disposée au-dessus et derrière les objets à 45 degrés.

Les objets sont redimensionnés dans un cube unité et placés à l’intersection précalculée des champs de vision du miroir et de la caméra pour garantir leur visibilité. Des rotations aléatoires sont appliquées autour de l’axe y et une technique d’ancrage évite les artefacts flottants.

Pour les scènes complexes, plusieurs objets sont disposés en paires cohérentes selon les catégories ABO. Les objets secondaires évitent les chevauchements, produisant 3 140 scènes multi-objets avec diverses occlusions et relations de profondeur.

Examples of rendered views from the authors' dataset containing multiple (more than two) objects, with illustrations of object segmentation and depth map visualizations seen below.

Scènes rendues avec plusieurs objets et cartes de segmentation et de profondeur.

Processus d’entraînement

Le réalisme synthétique ne suffisant pas à généraliser vers les données réelles, les chercheurs ont élaboré un cursus en trois étapes pour MirrorFusion 2.0.

À l’étape 1, les poids des branches de conditionnement et de génération sont initialisés avec le point de contrôle Stable Diffusion v1.5. Le modèle est affiné sur la partie à objet unique de SynMirrorV2. Contrairement à Reflecting Reality, la branche de génération n’est pas gelée. L’entraînement dure 40 000 itérations.

À l’étape 2, 10 000 itérations supplémentaires sur la partie multi-objets apprennent au système à gérer les occlusions et les dispositions spatiales complexes.

À l’étape 3, 10 000 autres itérations utilisent des données réelles de MSD et des cartes de profondeur produites par l’estimateur monoculaire Matterport3D.

Examples from the MSD dataset, with real-world scenes analyzed into depth and segmentation maps. Source: https://arxiv.org/pdf/1908.09101

Scènes réelles de MSD analysées en cartes de profondeur et de segmentation. Source : https://arxiv.org/pdf/1908.09101

Les invites textuelles sont omises pendant 20% de l’entraînement afin de favoriser l’utilisation des informations de profondeur. Les trois étapes s’exécutent sur quatre GPU NVIDIA A100, avec un taux d’apprentissage de 1e-5, un lot de quatre éléments par GPU et l’optimiseur AdamW.

La difficulté augmente progressivement, des scènes synthétiques simples aux compositions plus exigeantes, pour améliorer le transfert vers le monde réel.

Évaluation

MirrorFusion 2.0 est comparé à MirrorFusion, l’ancien état de l’art servant de référence, sur MirrorBenchV2 avec des scènes à un ou plusieurs objets. Des tests qualitatifs utilisent également MSD et Google Scanned Objects (GSO).

L’évaluation comprend 2 991 images à objet unique dans des catégories connues et inconnues, ainsi que 300 scènes ABO à deux objets. PSNR, SSIM et LPIPS mesurent la qualité du reflet dans la zone masquée du miroir, tandis que la similarité CLIP évalue l’alignement avec les invites.

Pour les tests quantitatifs, quatre graines sont utilisées par invite et l’image au meilleur score SSIM est retenue. MirrorFusion 2.0 dépasse la référence sur les objets uniques, et la version entraînée sur plusieurs objets surpasse celle qui ne l’est pas dans les scènes complexes.

Left, Quantitative results for single object reflection generation quality on the MirrorBenchV2 single object split. MirrorFusion 2.0 outperformed the baseline, with the best results shown in bold. Right, quantitative results for multiple object reflection generation quality on the MirrorBenchV2 multiple object split. MirrorFusion 2.0 trained with multiple objects outperformed the version trained without them, with the best results shown in bold.

Résultats quantitatifs sur MirrorBenchV2 ; MirrorFusion 2.0 dépasse la référence.

Les auteurs concluent que leur méthode dépasse la référence et que le réglage sur plusieurs objets améliore les scènes difficiles.

Les résultats les plus mis en avant sont qualitatifs. Sur MirrorBenchV2, la référence ne conserve pas des reflets ni des relations spatiales exacts : l’orientation d’une chaise est incorrecte et les reflets de plusieurs objets sont déformés. Selon les auteurs, MirrorFusion 2.0 restitue correctement la position, l’orientation et la structure de la chaise et des canapés.

Comparison on MirrorBenchV2: the baseline failed to maintain accurate reflections and spatial consistency, showing incorrect chair orientation and distorted reflections of multiple objects, whereas (the authors contend) MirrorFusion 2.0 correctly renders the chair and the sofas, with accurate position, orientation, and structure.

Comparaison MirrorBenchV2 : la nouvelle méthode préserve mieux position, orientation et structure.

La référence produisait souvent des rotations erronées et des objets flottants. Entraîné sur SynMirrorV2, le nouveau modèle préserve mieux orientation et position dans les scènes à un ou plusieurs objets, pour des reflets plus réalistes et cohérents.

Sur GSO, la référence déforme la structure et crée des reflets incomplets. MirrorFusion 2.0 préserve mieux l’intégrité spatiale, la géométrie, les couleurs et les détails, même pour des objets hors distribution.

Comparison on the GSO dataset. The baseline misrepresented object structure and produced incomplete, distorted reflections, while MirrorFusion 2.0, the authors contend, preserves spatial integrity and generates accurate geometry, color, and detail, even on out-of-distribution objects.

Comparaison GSO : MirrorFusion 2.0 préserve mieux géométrie, couleur et détails.

Par exemple, les poignées d’un tiroir sont correctement réfléchies par le nouveau modèle, alors que la référence produit un résultat invraisemblable. Pour une tasse blanche et jaune, MirrorFusion 2.0 restitue une géométrie convaincante avec peu d’artefacts.

Le dernier test qualitatif porte sur des scènes réelles de MSD. Les auteurs estiment que MirrorFusion 2.0 restitue mieux des détails complexes, notamment des objets entassés sur une table et plusieurs miroirs dans un environnement tridimensionnel.

Real-world scene results comparing MirrorFusion, MirrorFusion 2.0, and MirrorFusion 2.0, fine-tuned on the MSD dataset. MirrorFusion 2.0, the authors contend, captures complex scene details more accurately, including cluttered objects on a table, and the presence of multiple mirrors within a three-dimensional environment. Only partial results are shown  here, due to the dimensions of the results in the original paper, to which we refer the reader for full results and better resolution.

Résultats MSD réels de MirrorFusion, MirrorFusion 2.0 et de la version réglée sur MSD.

Le modèle fonctionnait bien sur MirrorBenchV2 et GSO, mais rencontrait initialement des difficultés avec MSD. Un réglage fin sur une partie de MSD a amélioré les environnements encombrés et les miroirs multiples, donnant des reflets plus cohérents et détaillés sur le test réservé.

Dans une étude utilisateur, 84% des participants auraient préféré les images de MirrorFusion 2.0 à celles de la référence. Les détails figurent dans l’annexe de l’article.

Results of the user study.

Résultats de l’étude utilisateur.

Études et liens vers les sources

Études, jeux de données, pages de projet et sources techniques cités ici :

Conclusion

Plusieurs résultats constituent des progrès impressionnants. Pourtant, l’état de l’art de cette tâche reste si médiocre qu’une solution globale peu convaincante peut l’emporter avec un effort modeste. L’architecture fondamentale de la diffusion se prête mal à l’apprentissage fiable d’une physique cohérente ; le problème semble donc mal posé et peu susceptible d’une solution élégante.

Ajouter des données pour combler les lacunes des LDM est déjà la méthode standard, avec tous les inconvénients cités. Si de futurs corpus à grande échelle accordent davantage d’attention à la distribution et à l’annotation des reflets, les modèles résultants devraient mieux gérer ce cas.

Mais il en va de même pour de nombreux autres défauts des LDM. Il est difficile de déterminer lequel mérite le plus le travail et l’investissement exigés par une solution comme celle-ci.

 

Première publication le lundi 28 avril 2025. Mardi 29 avril : correction grammaticale des derniers paragraphes.

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai