Angle d’Anderson

Résoudre les limites des modèles de diffusion pour les réflexions et les miroirs

mm
Ajouter Unite.AI à vos sources préférées sur Google
ChatGPT-4o and Adobe Firefly

Depuis que l’intelligence artificielle générative a commencé à susciter l’intérêt du public, le domaine de la recherche en vision par ordinateur s’est intéressé au développement de modèles d’apprentissage automatique capables de comprendre et de reproduire les lois physiques; cependant, le défi de l’enseignement de systèmes d’apprentissage automatique pour simuler des phénomènes tels que la gravité et la dynamique des fluides a été un objectif important de recherche pendant au moins les cinq dernières années.

Depuis que les modèles de diffusion latents (LDM) ont dominé la scène de l’intelligence artificielle générative en 2022, les chercheurs se sont de plus en plus concentrés sur les limites de l’architecture LDM pour comprendre et reproduire les phénomènes physiques. Maintenant, ce problème a gagné une importance supplémentaire avec le développement emblématique du modèle de vidéo générative d’OpenAI Sora, et la sortie (plus conséquente) récente des modèles de vidéo open source Hunyuan Video et Wan 2.1.

Se refléter mal

La plupart des recherches visant à améliorer la compréhension de la physique par les LDM se sont concentrées sur des domaines tels que la simulation de la marche, la physique des particules et d’autres aspects du mouvement newtonien. Ces domaines ont attiré l’attention car les inexactitudes dans les comportements physiques de base entraîneraient immédiatement une perte d’authenticité des vidéos générées par l’IA.

Cependant, une petite mais croissante branche de recherche se concentre sur l’une des plus grandes faiblesses des LDM – leur relative incapacité à produire des réflexions précises.

À partir du document de janvier 2025 'Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections', des exemples de 'défaillance de réflexion' versus l'approche des chercheurs. Source: https://arxiv.org/pdf/2409.14677

À partir du document de janvier 2025 ‘Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections’, des exemples de ‘défaillance de réflexion’ versus l’approche des chercheurs. Source: https://arxiv.org/pdf/2409.14677

Ce problème était également un défi pendant l’ère du CGI et persiste dans le domaine du jeu vidéo, où les algorithmes de l’ombrage simulent le chemin de la lumière lorsqu’elle interagit avec les surfaces. L’ombrage calcule comment les rayons lumineux virtuels rebondissent ou traversent les objets pour créer des réflexions, des réfractions et des ombres réalistes.

Cependant, parce que chaque rebond supplémentaire augmente considérablement le coût de calcul, les applications en temps réel doivent faire un compromis entre la latence et la précision en limitant le nombre de rebonds de rayons lumineux autorisés.

Une représentation d'un faisceau lumineux virtuel dans un scénario 3D (c'est-à-dire CGI) traditionnel, utilisant des technologies et des principes développés pour la première fois dans les années 1960 et qui ont atteint leur apogée entre 1982 et 1993 (la période entre Tron [1982] et Jurassic Park [1993]). Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing

Une représentation d’un faisceau lumineux virtuel dans un scénario 3D (c’est-à-dire CGI) traditionnel, utilisant des technologies et des principes développés pour la première fois dans les années 1960 et qui ont atteint leur apogée entre 1982 et 1993 (la période entre ‘Tron’ [1982] et ‘Jurassic Park’ [1993]). Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing


Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai