Modèles et plateformes d’IA

Guide d’attention auto : améliorer la qualité des échantillons de modèles de diffusion

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les modèles de diffusion de débruitage sont des cadres d’intelligence artificielle générative qui synthétisent des images à partir de bruit via un processus de débruitage itératif. Ils sont célébrés pour leurs capacités exceptionnelles de génération d’images et de diversité, en grande partie attribuables aux méthodes de guidage conditionnelles basées sur du texte ou des classes, notamment la guidance de classeur et la guidance sans classeur. Ces modèles ont été remarquablement réussis dans la création d’images diverses et de haute qualité. Des études récentes ont montré que les techniques de guidage telles que les légendes et les étiquettes de classe jouent un rôle crucial dans l’amélioration de la qualité des images générées par ces modèles.

Cependant, les modèles de diffusion et les méthodes de guidage sont confrontés à des limitations dans certaines conditions externes. La méthode de guidage sans classeur (CFG), qui utilise la suppression d’étiquettes, ajoute de la complexité au processus d’entraînement, tandis que la méthode de guidage de classeur (CG) nécessite un entraînement de classeur supplémentaire. Les deux méthodes sont quelque peu limitées par leur dépendance à l’égard de conditions externes difficiles à obtenir, ce qui limite leur potentiel et les confine à des paramètres conditionnels.

Pour remédier à ces limitations, les développeurs ont élaboré une approche plus générale de guidage de diffusion, connue sous le nom de guidage d’attention auto (SAG). Cette méthode utilise les informations provenant des échantillons intermédiaires des modèles de diffusion pour générer des images. Nous allons explorer le SAG dans cet article, en discutant son fonctionnement, sa méthodologie et ses résultats par rapport aux cadres et pipelines d’état de l’art actuels.

Guidage d’attention auto : améliorer la qualité des échantillons de modèles de diffusion

Les modèles de diffusion de débruitage (DDM) ont gagné en popularité pour leur capacité à créer des images à partir de bruit via un processus de débruitage itératif. La synthèse d’images de ces modèles est en grande partie due aux méthodes de guidage de diffusion employées. Malgré leurs forces, les modèles de diffusion et les méthodes de guidage basées sur les conditions sont confrontés à des défis tels que la complexité ajoutée et les coûts de calcul accrus.

Pour surmonter les limitations actuelles, les développeurs ont introduit la méthode de guidage d’attention auto, une formulation plus générale de guidage de diffusion qui ne repose pas sur les informations externes provenant du guidage de diffusion, facilitant ainsi une approche conditionnelle et flexible pour guider les cadres de diffusion. L’approche retenue par le guidage d’attention auto aide finalement à améliorer l’applicabilité des méthodes de guidage de diffusion traditionnelles aux cas avec ou sans exigences externes.

Le guidage d’attention auto repose sur le principe simple de formulation généralisée, et sur l’hypothèse que les informations internes contenues dans les échantillons intermédiaires peuvent également servir de guidage. Sur la base de ce principe, la méthode SAG introduit d’abord le guidage de flou, une solution simple et directe pour améliorer la qualité des échantillons. Le guidage de flou vise à exploiter les propriétés bénéfiques du flou gaussien pour supprimer les détails à petite échelle de manière naturelle en guidant les échantillons intermédiaires à l’aide des informations éliminées en conséquence du flou gaussien. Bien que la méthode de guidage de flou améliore la qualité des échantillons avec une échelle de guidage modérée, elle a du mal à reproduire les résultats sur une grande échelle de guidage, car elle introduit souvent une ambiguïté structurelle dans les régions entières. En conséquence, la méthode de guidage de flou a du mal à aligner la prédiction de l’entrée originale avec la prédiction de l’entrée dégradée. Pour améliorer la stabilité et l’efficacité de la méthode de guidage de flou sur une grande échelle de guidage, le guidage d’attention auto tente d’exploiter le mécanisme d’attention auto des modèles de diffusion, car les modèles de diffusion modernes contiennent déjà un mécanisme d’attention auto dans leur architecture.

En supposant que l’attention auto est essentielle pour capturer les informations saillantes à son cœur, la méthode de guidage d’attention auto utilise les cartes d’attention auto des modèles de diffusion pour brouiller de manière adverse les régions contenant des informations saillantes, et guide ainsi les modèles de diffusion avec les informations résiduelles requises. La méthode utilise ensuite les cartes d’attention pendant le processus inverse des modèles de diffusion, pour améliorer la qualité des images et utilise une auto-condition pour réduire les artefacts sans nécessiter d’entraînement ou d’informations externes supplémentaires.

Pour résumer, la méthode de guidage d’attention auto

  1. Est une approche novatrice qui utilise les cartes d’attention auto internes des cadres de diffusion pour améliorer la qualité des échantillons générés sans nécessiter d’entraînement ou de conditions externes supplémentaires.
  2. La méthode SAG tente de généraliser les méthodes de guidage conditionnelles en une méthode conditionnelle qui peut être intégrée à tout modèle de diffusion sans nécessiter de ressources ou de conditions externes supplémentaires, améliorant ainsi l’applicabilité des cadres de guidage basés sur les conditions.
  3. La méthode SAG tente également de démontrer ses capacités orthogonales par rapport aux méthodes et cadres conditionnels existants, permettant ainsi une amélioration des performances en facilitant une intégration flexible avec d’autres méthodes et modèles.

En poursuivant, la méthode de guidage d’attention auto apprend des résultats des cadres associés, notamment les modèles de diffusion de débruitage, les méthodes de guidage d’échantillonnage, les méthodes d’attention auto de l’intelligence artificielle générative et les représentations internes des modèles de diffusion. Cependant, à son cœur, la méthode de guidage d’attention auto met en œuvre les enseignements des modèles de diffusion probabilistes de débruitage (DDPM), de la guidance de classeur, de la guidance sans classeur et de l’attention auto dans les cadres de diffusion. Nous allons en discuter plus en détail dans la section suivante.

Guidage d’attention auto : préliminaires, méthodologie et architecture

Modèle de diffusion probabiliste de débruitage ou DDPM

Le DDPM ou modèle de diffusion probabiliste de débruitage est un modèle qui utilise un processus de débruitage itératif pour récupérer une image à partir de bruit blanc. Traditionnellement, un modèle DDPM reçoit une image d’entrée et un calendrier de variance à un moment pour obtenir l’image en utilisant un processus direct appelé processus markovien.

Guidance de classeur et guidance sans classeur avec mise en œuvre de GAN

Les réseaux antagonistes génératifs (GAN) possèdent un commerce unique de diversité pour la fidélité, et pour apporter cette capacité des cadres GAN aux modèles de diffusion, le cadre de guidage d’attention auto propose d’utiliser une méthode de guidance de classeur qui utilise un classeur supplémentaire. Inversement, une méthode de guidance sans classeur peut également être mise en œuvre sans l’utilisation d’un classeur supplémentaire pour obtenir les mêmes résultats. Bien que la méthode donne les résultats souhaités, elle n’est pas encore viable sur le plan computationnel car elle nécessite des étiquettes supplémentaires et confine le cadre aux modèles de diffusion conditionnels qui nécessitent des conditions supplémentaires comme un texte ou une classe, ainsi que des détails d’entraînement supplémentaires qui ajoutent à la complexité du modèle.

Généralisation du guidage de diffusion

Bien que les méthodes de guidance de classeur et sans classeur donnent les résultats souhaités et aident à la génération conditionnelle dans les modèles de diffusion, elles dépendent d’entrées supplémentaires. Pour tout moment donné, l’entrée d’un modèle de diffusion comprend une condition généralisée et un échantillon perturbé sans la condition généralisée. De plus, la condition généralisée englobe les informations internes dans l’échantillon perturbé ou une condition externe, ou les deux. Le guidage résultant est formulé en utilisant un régresseur imaginaire avec l’hypothèse qu’il peut prédire la condition généralisée.

Amélioration de la qualité d’image à l’aide de cartes d’attention auto

Le guidage de diffusion généralisé implique qu’il est possible de fournir un guidage au processus inverse des modèles de diffusion en extrayant les informations saillantes dans la condition généralisée contenue dans l’échantillon perturbé. En s’appuyant sur cela, la méthode de guidage d’attention auto capture les informations saillantes pour les processus inverses de manière efficace tout en limitant les risques qui découlent des problèmes hors distribution dans les modèles de diffusion pré-entraînés.

Guidage de flou

Le guidage de flou dans le guidage d’attention auto repose sur le flou gaussien, une méthode de filtrage linéaire dans laquelle le signal d’entrée est convolué avec un filtre gaussien pour générer une sortie. Avec une augmentation de l’écart-type, le flou gaussien réduit les détails à petite échelle dans les signaux d’entrée et aboutit à des signaux d’entrée localement indiscernables en les lissant vers la constante. De plus, les expériences ont indiqué un déséquilibre d’informations entre le signal d’entrée et le signal de sortie du flou gaussien, où le signal de sortie contient plus d’informations à petite échelle.

Sur la base de cette prise de connaissance, le cadre de guidage d’attention auto introduit le guidage de flou, une technique qui exclut intentionnellement les informations des reconstructions intermédiaires pendant le processus de diffusion, et utilise plutôt ces informations pour guider ses prédictions vers l’augmentation de la pertinence des images par rapport aux informations d’entrée. Le guidage de flou entraîne essentiellement la déviation de la prédiction originale de la prédiction de l’entrée floue. De plus, la propriété bénéfique du flou gaussien empêche les signaux de sortie de s’éloigner considérablement du signal d’origine avec une déviation modérée. En termes simples, le flou se produit naturellement dans les images, ce qui rend le flou gaussien une méthode plus appropriée pour les modèles de diffusion pré-entraînés.

Dans le pipeline de guidage d’attention auto, le signal d’entrée est d’abord flou en utilisant un filtre gaussien, puis diffusé avec du bruit supplémentaire pour produire le signal de sortie. En faisant cela, le pipeline SAG atténue l’effet secondaire du flou résultant qui réduit le bruit gaussien et rend le guidage basé sur le contenu plutôt que sur le bruit aléatoire. Bien que le guidage de flou donne des résultats satisfaisants sur les cadres avec une échelle de guidage modérée, il a du mal à reproduire les résultats sur les modèles existants avec une grande échelle de guidage, car il est enclin à produire des résultats bruyants, comme le montre l’image suivante.

Ces résultats pourraient être le résultat de l’ambiguïté structurelle introduite dans le cadre par le flou global, ce qui rend difficile pour le pipeline SAG d’aligner les prédictions de l’entrée originale avec la prédiction de l’entrée dégradée, aboutissant à des sorties bruyantes.

Mécanisme d’attention auto

Comme mentionné précédemment, les modèles de diffusion disposent généralement d’un composant d’attention auto intégré, et il s’agit de l’un des composants les plus essentiels dans un cadre de modèle de diffusion. Le mécanisme d’attention auto est mis en œuvre au cœur des modèles de diffusion, et il permet au modèle de prêter attention aux parties saillantes de l’entrée pendant le processus génératif, comme le montre l’image suivante avec des masques à haute fréquence dans la rangée supérieure et des masques d’attention auto dans la rangée inférieure des images finalement générées.

La méthode de guidage d’attention auto proposée s’appuie sur le même principe et exploite les capacités des cartes d’attention auto dans les modèles de diffusion. Dans l’ensemble, la méthode de guidage d’attention auto flou les patches auto-attentionnés dans le signal d’entrée ou, en termes simples, dissimule les informations des patches auxquels le modèle de diffusion prête attention. De plus, les signaux de sortie dans le guidage d’attention auto contiennent des régions intactes des signaux d’entrée, ce qui signifie qu’il n’introduit pas d’ambiguïté structurelle des entrées et résout le problème du flou global. Le pipeline obtient ensuite les cartes d’attention auto agrégées en effectuant un poolage moyen global (GAP) pour agréger les cartes d’attention auto à la dimension, et en effectuant un échantillonnage du plus proche voisin pour correspondre à la résolution du signal d’entrée.

Guidage d’attention auto : expériences et résultats

Pour évaluer ses performances, le pipeline de guidage d’attention auto est échantillonné en utilisant 8 GPU Nvidia GeForce RTX 3090, et est construit sur les cadres pré-entraînés IDDPM, ADM et Stable Diffusion.

Génération inconditionnelle avec guidage d’attention auto

Pour mesurer l’efficacité du pipeline SAG sur les modèles inconditionnels et démontrer la propriété inconditionnelle qu’il ne possède pas, la guidance de classeur et la guidance sans classeur, le pipeline SAG est exécuté sur des cadres pré-entraînés de manière inconditionnelle sur 50 000 échantillons.

Comme on peut l’observer, la mise en œuvre du pipeline SAG améliore les métriques FID, sFID et IS des entrées inconditionnelles tout en réduisant la valeur de rappel en même temps. De plus, les améliorations qualitatives résultant de la mise en œuvre du pipeline SAG sont évidentes dans les images suivantes, où les images du haut sont des résultats des cadres ADM et Stable Diffusion, tandis que les images du bas sont des résultats des cadres ADM et Stable Diffusion avec le pipeline SAG.

Génération conditionnelle avec SAG

L’intégration du pipeline SAG dans les cadres existants donne des résultats exceptionnels dans la génération inconditionnelle, et le pipeline SAG est capable d’agnosticité de condition qui permet au pipeline SAG d’être mis en œuvre pour la génération conditionnelle.

Stable Diffusion avec guidage d’attention auto

Bien que le cadre Stable Diffusion original génère des images de haute qualité, l’intégration du cadre Stable Diffusion avec le pipeline de guidage d’attention auto peut améliorer considérablement les résultats. Pour évaluer son effet, les développeurs utilisent des invites vides pour Stable Diffusion avec une graine aléatoire pour chaque paire d’images et utilisent une évaluation humaine sur 500 paires d’images avec et sans guidage d’attention auto. Les résultats sont présentés dans l’image suivante.

De plus, la mise en œuvre du SAG peut améliorer les capacités du cadre Stable Diffusion, car la fusion de la guidance sans classeur avec le guidage d’attention auto peut élargir la gamme des modèles Stable Diffusion à la synthèse d’image à partir de texte. De plus, les images générées à partir du modèle Stable Diffusion avec le guidage d’attention auto sont de meilleure qualité avec moins d’artefacts, grâce à l’effet d’auto-condition du pipeline SAG, comme le montre l’image suivante.

Limitations actuelles

Bien que la mise en œuvre du pipeline de guidage d’attention auto puisse améliorer considérablement la qualité des images générées, elle comporte certaines limitations.

L’une des principales limitations est l’orthogonalité avec la guidance de classeur et la guidance sans classeur. Comme on peut l’observer dans l’image suivante, la mise en œuvre du SAG améliore le score FID et le score de prédiction, ce qui signifie que le pipeline SAG contient un composant orthogonal qui peut être utilisé avec les méthodes de guidage traditionnelles simultanément.

Cependant, cela nécessite encore que les modèles de diffusion soient entraînés d’une manière spécifique qui ajoute à la complexité ainsi qu’aux coûts de calcul.

De plus, la mise en œuvre du guidage d’attention auto n’augmente pas la consommation de mémoire ou de temps, ce qui indique que la surcharge résultant des opérations telles que le masquage et le flou dans le SAG est négligeable. Cependant, cela ajoute encore aux coûts de calcul, car cela inclut une étape supplémentaire par rapport aux approches sans guidage.

Pensées finales

Dans cet article, nous avons discuté du guidage d’attention auto, une formulation novatrice et générale de la méthode de guidage qui utilise les informations internes disponibles dans les modèles de diffusion pour générer des images de haute qualité. Le guidage d’attention auto repose sur le principe simple de formulation généralisée, et sur l’hypothèse que les informations internes contenues dans les échantillons intermédiaires peuvent également servir de guidage. Le pipeline de guidage d’attention auto est une approche conditionnelle et flexible qui peut être mise en œuvre dans divers modèles de diffusion, et utilise l’auto-condition pour réduire les artefacts et améliorer la qualité globale.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.