Fondamentaux de l’IA

Les modèles de diffusion en IA – Tout ce que vous devez savoir

mm
Ajouter Unite.AI à vos sources préférées sur Google

Dans l’écosystème de l’IA, les modèles de diffusion définissent la direction et le rythme du progrès technologique. Ils révolutionnent la façon dont nous abordons les tâches complexes de l’IA générative. Ces modèles sont basés sur les mathématiques des principes gaussiens, de la variance, des équations différentielles et des séquences génératives. (Nous expliquerons les termes techniques ci-dessous)

Les produits et solutions modernes axés sur l’IA, développés par Nvidia (NVDA ), Google (GOOGL ), Adobe (ADBE ) et OpenAI, ont mis les modèles de diffusion au centre de l’attention. DALL.E 2, Stable Diffusion et Midjourney sont des exemples éminents de modèles de diffusion qui font actuellement le tour d’Internet. Les utilisateurs fournissent une simple invite de texte en tant qu’entrée, et ces modèles peuvent les convertir en images réalistes, comme celle ci-dessous.

Une image générée avec Midjourney v5 à l'aide de l'invite d'entrée : coquelicots de Californie vibrants.

Une image générée avec Midjourney v5 à l’aide de l’invite d’entrée : coquelicots de Californie vibrants. Source : Midjourney

Explorons les principes fondamentaux de fonctionnement des modèles de diffusion et comment ils changent les directions et les normes du monde tel que nous le voyons aujourd’hui.

Qu’est-ce que les modèles de diffusion ?

Selon la publication de recherche « Denoising Diffusion Probabilistic Models », les modèles de diffusion sont définis comme suit :

« Un modèle de diffusion ou un modèle de diffusion probabiliste est une chaîne de Markov paramétrée entraînée à l’aide d’une inférence variationnelle pour produire des échantillons correspondant aux données après un temps fini »

En termes simples, les modèles de diffusion peuvent générer des données similaires à celles sur lesquelles ils sont formés. Si le modèle est formé sur des images de chats, il peut générer des images réalistes de chats.

Maintenant, essayons de décomposer la définition technique mentionnée ci-dessus. Les modèles de diffusion s’inspirent du principe de fonctionnement et de la fondation mathématique d’un modèle probabiliste qui peut analyser et prédire le comportement d’un système qui varie dans le temps, comme prédire le rendement du marché boursier ou la propagation d’une pandémie.

La définition indique qu’ils sont des chaînes de Markov paramétrées entraînées avec une inférence variationnelle. Les chaînes de Markov sont des modèles mathématiques qui définissent un système qui bascule entre différents états au fil du temps. L’état actuel du système ne peut déterminer que la probabilité de transition vers un état spécifique. En d’autres termes, l’état actuel d’un système détient les états possibles qu’un système peut suivre ou acquérir à tout moment.

L’entraînement du modèle à l’aide de l’inférence variationnelle implique des calculs complexes pour les distributions de probabilité. Il vise à trouver les paramètres exacts de la chaîne de Markov qui correspondent aux données observées (connues ou réelles) après un temps spécifique. Ce processus minimise la valeur de la fonction de perte du modèle, qui est la différence entre l’état prédit (inconnu) et l’état observé (connu).

Une fois formé, le modèle peut générer des échantillons correspondant aux données observées. Ces échantillons représentent les trajectoires possibles ou les états que le système pourrait suivre ou acquérir au fil du temps, et chaque trajectoire a une probabilité différente de se produire. Par conséquent, le modèle peut prédire le comportement futur du système en générant une gamme d’échantillons et en trouvant leurs probabilités respectives (probabilité de ces événements).

Comment interpréter les modèles de diffusion en IA ?

Les modèles de diffusion sont des modèles génératifs profonds qui fonctionnent en ajoutant du bruit (bruit gaussien) aux données de formation disponibles (également appelé processus de diffusion direct) et en inversant le processus (appelé débruitage ou processus de diffusion inverse) pour récupérer les données. Le modèle apprend progressivement à supprimer le bruit. Ce processus de débruitage appris génère de nouvelles images de haute qualité à partir de graines aléatoires (images bruyantes aléatoires), comme le montre l’illustration ci-dessous.

Processus de diffusion inverse : une image bruyante est débruitée pour récupérer l'image originale (ou en générer des variations) via un modèle de diffusion formé.

Processus de diffusion inverse : une image bruyante est débruitée pour récupérer l’image originale (ou en générer des variations) via un modèle de diffusion formé. Source : Denoising Diffusion Probabilistic Models

3 catégories de modèles de diffusion

Il existe trois cadres mathématiques fondamentaux qui sous-tendent la science derrière les modèles de diffusion. Les trois fonctionnent sur les mêmes principes d’ajout de bruit et de suppression de bruit pour générer de nouveaux échantillons. En discutons ci-dessous.

Un modèle de diffusion ajoute et supprime du bruit d'une image.

Un modèle de diffusion ajoute et supprime du bruit d’une image. Source : Diffusion Models in Vision : A Survey

1. Modèles de diffusion probabilistes de débruitage (DDPM)

Comme mentionné ci-dessus, les DDPM sont des modèles génératifs principalement utilisés pour supprimer le bruit des données visuelles ou audio. Ils ont montré des résultats impressionnants sur diverses tâches de débruitage d’images et d’audio. Par exemple, l’industrie cinématographique utilise des outils modernes de traitement d’images et de vidéos pour améliorer la qualité de production.

2. Modèles de génération basés sur les scores avec bruit conditionnel (SGM)

Les SGM peuvent générer de nouveaux échantillons à partir d’une distribution donnée. Ils fonctionnent en apprenant une fonction d’estimation de score qui peut estimer la densité logarithmique de la distribution cible. L’estimation de la densité logarithmique fait des hypothèses pour les points de données disponibles qui font partie d’un ensemble de données inconnu (ensemble de test). Cette fonction de score peut ensuite générer de nouveaux points de données à partir de la distribution.

Par exemple, les deepfakes sont notoires pour produire des vidéos et des audios faux de personnalités célèbres. Mais ils sont principalement attribués aux réseaux antagonistes génératifs (GAN). Cependant, les SGM ont montré des capacités similaires – parfois surpassant – dans la génération de visages de célébrités de haute qualité. De plus, les SGM peuvent aider à étendre les ensembles de données de soins de santé, qui ne sont pas facilement disponibles en grande quantité en raison de réglementations et de normes industrielles strictes.

3. Équations différentielles stochastiques (SDE)

Les SDE décrivent les changements dans les processus aléatoires en fonction du temps. Ils sont largement utilisés en physique et dans les marchés financiers impliquant des facteurs aléatoires qui ont un impact significatif sur les résultats du marché.

Par exemple, les prix des matières premières sont très dynamiques et impactés par une gamme de facteurs aléatoires. Les SDE calculent les dérivés financiers comme les contrats à terme (comme les contrats à terme sur le pétrole). Ils peuvent modéliser les fluctuations et calculer les prix favorables avec précision pour donner un sentiment de sécurité.

Principales applications des modèles de diffusion en IA

Examinons certaines pratiques et utilisations largement adoptées des modèles de diffusion en IA.

Génération de vidéos de haute qualité

Créer des vidéos de haute finition à l’aide de l’apprentissage profond est difficile car cela nécessite une continuité élevée des trames vidéo. C’est là que les modèles de diffusion entrent en jeu, car ils peuvent générer un sous-ensemble de trames vidéo pour combler les trames manquantes, ce qui donne des vidéos de haute qualité et lisses sans latence.

Les chercheurs ont développé les techniques de Flexible Diffusion Model et Residual Video Diffusion pour servir cet objectif. Ces modèles peuvent également produire des vidéos réalistes en ajoutant en douceur des trames générées par l’IA entre les trames réelles.

Ces modèles peuvent simplement étendre les FPS (images par seconde) d’une vidéo à bas FPS en ajoutant des trames fictives après avoir appris les modèles à partir des trames disponibles. Avec presque aucune perte de trames, ces cadres peuvent également aider les modèles basés sur l’apprentissage profond à générer des vidéos basées sur l’IA à partir de zéro qui ressemblent à des prises de vues naturelles à partir de configurations de caméras de haute finition.

Un large éventail de générateurs de vidéos IA remarquables est disponible en 2023 pour rendre la production et l’édition de contenu vidéo rapides et faciles.

Génération d’images à partir de texte

Les modèles d’images à partir de texte utilisent des invites de texte pour générer des images de haute qualité. Par exemple, en donnant l’invite “pomme rouge sur une assiette” et en produisant une image photoréaliste d’une pomme sur une assiette. La diffusion mélangée et l’unCLIP sont deux exemples éminents de tels modèles qui peuvent générer des images hautement pertinentes et précises en fonction de l’entrée utilisateur.

De plus, le GLIDE d’OpenAI est une autre solution largement connue publiée en 2021 qui produit des images photoréalistes à l’aide de l’entrée utilisateur. Plus tard, OpenAI a publié DALL.E-2, son modèle de génération d’images le plus avancé à ce jour.

De même, Google a également développé un modèle de génération d’images appelé Imagen, qui utilise un grand modèle de langage pour développer une compréhension textuelle approfondie de l’entrée de texte et générer des images photoréalistes.

Nous avons mentionné d’autres outils de génération d’images populaires comme Midjourney et Stable Diffusion (DreamStudio) ci-dessus. Regardez une image générée à l’aide de Stable Diffusion ci-dessous.

Une image créée avec Stable Diffusion 1.5 à l'aide de l'invite suivante : « collages, hyper-réalistes, nombreuses variations de portrait de très vieux thom yorke, face de profil, différentes âges, macro objectif, espace liminaire, par lee bermejo, alphonse mucha et greg rutkowski, barbe grise, visage lisse, pommettes »

Une image créée avec Stable Diffusion 1.5 à l’aide de l’invite suivante : « collages, hyper-réalistes, nombreuses variations de portrait de très vieux thom yorke, face de profil, différentes âges, macro objectif, espace liminaire, par lee bermejo, alphonse mucha et greg rutkowski, barbe grise, visage lisse, pommettes »

Modèles de diffusion en IA – Qu’est-ce que l’on peut attendre dans le futur ?

Les modèles de diffusion ont révélé un potentiel prometteur en tant qu’approche robuste pour générer des échantillons de haute qualité à partir de jeux de données d’images et de vidéos complexes. En améliorant la capacité des humains à utiliser et à manipuler les données, les modèles de diffusion peuvent potentiellement révolutionner le monde tel que nous le voyons aujourd’hui. Nous pouvons nous attendre à voir encore plus d’applications des modèles de diffusion devenir une partie intégrante de notre vie quotidienne.

Il est important de noter que les modèles de diffusion ne sont pas la seule technique de génération d’IA. Les chercheurs utilisent également les réseaux antagonistes génératifs (GAN), les auto-encodeurs variationnels et les modèles de génération profonds basés sur le flux pour générer du contenu IA. Comprendre les caractéristiques fondamentales qui distinguent les modèles de diffusion des autres modèles génératifs peut aider à produire des solutions plus efficaces dans les jours à venir.

Pour en savoir plus sur les technologies basées sur l’IA, visitez Unite.ai. Consultez nos ressources ciblées sur les outils d’IA générative ci-dessous.

Haziqa est un Data Scientist avec une expérience approfondie dans la rédaction de contenu technique pour les entreprises d'IA et de SaaS.