Modèles et plateformes d’IA

HD-Painter : Inpainting d’images haute résolution guidé par du texte avec des modèles de diffusion

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les modèles de diffusion ont sans aucun doute révolutionné l’industrie de l’IA et du ML, avec des applications en temps réel qui font désormais partie intégrante de notre vie quotidienne. Après que les modèles de texte-à-image aient montré leurs capacités remarquables, les techniques de manipulation d’images basées sur la diffusion, telles que la génération contrôlée, la synthèse d’images spécialisée et personnalisée, l’édition d’images au niveau des objets, les variations conditionnées par des invites et l’édition, sont devenues des sujets de recherche très populaires en raison de leurs applications dans l’industrie de la vision par ordinateur.

Cependant, malgré leurs capacités impressionnantes et leurs résultats exceptionnels, les cadres de texte-à-image, en particulier les cadres de texte-à-image d’inpainting, ont encore des domaines potentiels de développement. Ces domaines incluent la capacité de comprendre les scènes globales, en particulier lors du débruitage de l’image en temps de diffusion élevés. Pour résoudre ce problème, les chercheurs ont introduit HD-Painter, un cadre complètement sans formation qui suit avec précision les instructions d’invite et s’étend à l’inpainting d’images haute résolution de manière cohérente. Le cadre HD-Painter utilise une couche d’attention introvertie consciente de l’invite (PAIntA) qui utilise les informations d’invite pour améliorer les scores d’auto-attention, ce qui aboutit à une meilleure génération d’alignement de texte.

Pour améliorer encore la cohérence de l’invite, le modèle HD-Painter introduit une approche de guidage de score d’attention de rééquilibrage (RASG). Cette approche intègre une stratégie d’échantillonnage post-hoc dans la forme générale du composant DDIM de manière transparente, empêchant ainsi les déplacements latents hors distribution. De plus, le cadre HD-Painter comporte une technique de super-résolution spécialisée pour l’inpainting, qui permet d’étendre à des échelles plus grandes et de compléter les régions manquantes de l’image avec des résolutions allant jusqu’à 2K.

HD-Painter : Inpainting d’images guidé par du texte

Les modèles de diffusion de texte-à-image ont effectivement été un sujet important dans l’industrie de l’IA et du ML ces derniers mois, avec des modèles qui démontrent des capacités impressionnantes en temps réel dans diverses applications pratiques. Les modèles de génération d’images texte-à-image pré-formés comme DALL-E, Imagen et Stable Diffusion ont montré leur adaptabilité pour l’inpainting d’images en fusionnant les régions inconnues débruitées (générées) avec les régions connues diffusées pendant le processus de diffusion inverse. Malgré la production de sorties visuellement attrayantes et bien harmonisées, les modèles existants ont du mal à comprendre la scène globale, en particulier sous le processus de débruitage de temps de diffusion élevés. En modifiant les modèles de diffusion de texte-à-image pré-formés pour incorporer des informations contextuelles supplémentaires, ils peuvent être affinés pour l’inpainting d’images guidé par du texte.

De plus, dans les modèles de diffusion, l’inpainting guidé par du texte et l’inpainting d’images guidé par du texte sont des domaines d’intérêt majeurs pour les chercheurs. Cet intérêt est motivé par le fait que les modèles d’inpainting guidé par du texte peuvent générer du contenu dans des régions spécifiques d’une image d’entrée en fonction d’invites textuelles, ce qui conduit à des applications potentielles telles que le retouche de régions d’image spécifiques, la modification d’attributs de sujet tels que les couleurs ou les vêtements, et l’ajout ou le remplacement d’objets. En résumé, les modèles de diffusion de texte-à-image ont récemment atteint un succès sans précédent en raison de leurs capacités de génération exceptionnellement réalistes et visuellement attrayantes.

Cependant, la majorité des cadres existants démontrent une négligence d’invite dans deux scénarios. Le premier est la dominance du fond lorsque le modèle complète la région inconnue en ignorant l’invite dans le fond, tandis que le deuxième scénario est la dominance de l’objet voisin lorsque le modèle propage les objets de la région connue à la région inconnue en utilisant la probabilité de contexte visuel plutôt que l’invite de saisie. Il est possible que ces deux problèmes soient le résultat de la nature uniquement spatiale et sans invite des couches d’auto-attention. Pour résoudre ces obstacles, le cadre HD-Painter introduit la couche d’attention introvertie consciente de l’invite (PAIntA) qui utilise les informations d’invite pour améliorer les scores d’auto-attention qui aboutissent finalement à une meilleure génération d’alignement de texte. La PAIntA utilise la condition textuelle donnée pour améliorer le score d’auto-attention avec pour objectif de réduire l’impact des informations non pertinentes pour l’invite provenant de la région d’image tout en augmentant la contribution des pixels connus alignés avec l’invite. Pour améliorer encore l’alignement du texte des résultats générés, le cadre HD-Painter met en œuvre une méthode de guidage post-hoc qui utilise les scores d’attention croisés. Cependant, la mise en œuvre de la méthode de guidage post-hoc classique peut causer des déplacements de distribution hors de la distribution en raison du terme de gradient supplémentaire dans l’équation de diffusion. Le déplacement de distribution hors de la distribution aboutira finalement à une dégradation de la qualité de la sortie générée. Pour résoudre cet obstacle, le cadre HD-Painter met en œuvre un mécanisme de guidage de score d’attention de rééquilibrage (RASG) qui intègre une stratégie d’échantillonnage post-hoc dans la forme générale du composant DDIM de manière transparente. Il permet ainsi au cadre de générer des résultats d’inpainting visuellement plausibles en guidant l’échantillon vers les latents alignés avec l’invite et en les maintenant dans leur domaine formé.

En déployant à la fois les composants RASH et PAIntA dans son architecture, le cadre HD-Painter présente un avantage significatif par rapport aux modèles d’inpainting et de diffusion de texte-à-image existants, y compris les modèles de pointe, car il parvient à résoudre le problème existant de négligence d’invite. De plus, les deux composants RASH et PAIntA offrent une fonctionnalité de plug and play, ce qui les rend compatibles avec les modèles d’inpainting basés sur la diffusion pour relever les défis mentionnés ci-dessus. De plus, en mettant en œuvre une technologie de mélange itérative dans le temps et en exploitant les capacités des modèles de diffusion haute résolution, le pipeline HD-Painter peut fonctionner efficacement pour l’inpainting de résolution allant jusqu’à 2K.

Pour résumer, le HD-Painter vise à apporter les contributions suivantes dans le domaine :

  1. Il vise à résoudre le problème de négligence d’invite de l’arrière-plan et de la dominance de l’objet voisin rencontré par les cadres d’inpainting d’images guidé par du texte en mettant en œuvre la couche d’attention introvertie consciente de l’invite (PAIntA) dans son architecture.
  2. Il vise à améliorer l’alignement du texte de la sortie en mettant en œuvre la couche de guidage de score d’attention de rééquilibrage (RASG) dans son architecture qui permet au cadre HD-Painter de réaliser un échantillonnage guidé post-hoc tout en empêchant les déplacements de distribution hors de la distribution.
  3. Il vise à concevoir un pipeline d’inpainting d’images guidé par du texte sans formation efficace capable de surpasser les cadres existants de pointe, et en utilisant le cadre de super-résolution spécialisé pour l’inpainting pour réaliser l’inpainting d’images guidé par du texte jusqu’à une résolution de 2K.

HD-Painter : Méthode et Architecture

Avant d’examiner l’architecture, il est essentiel de comprendre les trois concepts fondamentaux qui forment la base du cadre HD-Painter : l’inpainting d’images, le guidage post-hoc dans les cadres de diffusion, et les blocs architecturaux spécifiques à l’inpainting.

L’inpainting d’images est une approche qui vise à remplir les régions manquantes dans une image tout en assurant l’attrait visuel de l’image générée. Les cadres d’apprentissage automatique traditionnels ont mis en œuvre des méthodes qui utilisaient les régions connues pour propager les fonctionnalités profondes. Cependant, l’introduction des modèles de diffusion a conduit à l’évolution des modèles d’inpainting, en particulier les cadres d’inpainting d’images guidé par du texte. Traditionnellement, un modèle de diffusion de texte-à-image pré-formé remplace la région latente non masquée par la version bruitée de la région connue pendant le processus d’échantillonnage. Même si cette approche fonctionne dans une certaine mesure, elle dégrade considérablement la qualité de la sortie générée puisque le réseau de débruitage ne voit que la version bruitée de la région connue. Pour résoudre cet obstacle, certaines approches visaient à affiner le modèle de diffusion de texte-à-image pré-formé pour atteindre l’inpainting d’images guidé par du texte. En mettant en œuvre cette approche, le cadre est capable de générer un masque aléatoire via la concaténation puisque le modèle peut conditionner le cadre de débruitage sur la région non masquée.

Ensuite, les modèles d’apprentissage automatique traditionnels ont mis en œuvre des couches de conception spéciales pour un inpainting efficace, certaines cadres étant capables d’extraire des informations de manière efficace et de produire des images visuellement attrayantes en introduisant des couches de convolution spéciales pour traiter les régions connues de l’image. Certains cadres ont même ajouté une couche d’attention contextuelle dans leur architecture pour réduire les lourdes exigences de calcul de l’auto-attention pour un inpainting de haute qualité.

Enfin, les méthodes de guidage post-hoc sont des méthodes d’échantillonnage de diffusion inverse qui guident la prédiction du latent de l’étape suivante vers un objectif de minimisation d’une fonction particulière. Les méthodes de guidage post-hoc sont très utiles lorsqu’il s’agit de générer du contenu visuel, en particulier en présence de contraintes supplémentaires. Cependant, les méthodes de guidage post-hoc ont un inconvénient majeur : elles sont connues pour entraîner des dégradations de la qualité de l’image puisqu’elles ont tendance à déplacer le processus de génération de latents par un terme de gradient.

En venant à l’architecture du HD-Painter, le cadre formule d’abord le problème d’inpainting d’images guidé par du texte, puis introduit deux modèles de diffusion, à savoir le Stable Inpainting et le Stable Diffusion. Le modèle HD-Painter introduit ensuite les blocs PAIntA et RASG, et enfin, nous arrivons à la technique de super-résolution spécifique à l’inpainting.

Stable Diffusion et Stable Inpainting

La Stable Diffusion est un modèle de diffusion qui opère dans l’espace latent d’un auto-encodeur. Pour la synthèse de texte-à-image, le cadre Stable Diffusion met en œuvre une invite textuelle pour guider le processus. La fonction de guidage a une structure similaire à l’architecture UNet, et les couches d’attention croisées la conditionnent sur les invites textuelles. De plus, le modèle Stable Diffusion peut effectuer l’inpainting d’images avec certaines modifications et affinages. Pour ce faire, les fonctionnalités de l’image masquée générées par l’encodeur sont concaténées avec le masque binaire réduit à l’échelle des latents. Le tenseur résultant est ensuite introduit dans l’architecture UNet pour obtenir le bruit estimé. Le cadre initialise ensuite les filtres de convolution nouvellement ajoutés avec des zéros, tandis que le reste de l’UNet est initialisé à l’aide de points de contrôle pré-formés du modèle Stable Diffusion.

La figure ci-dessus montre l’aperçu du cadre HD-Painter composé de deux étapes. Dans la première étape, le cadre HD-Painter met en œuvre l’inpainting d’images guidé par du texte, tandis que dans la deuxième étape, le modèle effectue l’inpainting de la super-résolution de la sortie. Pour remplir les régions manquantes et rester cohérent avec l’invite de saisie, le modèle prend un modèle de diffusion d’inpainting pré-formé, remplace les couches d’auto-attention par des couches PAIntA, et met en œuvre le mécanisme RASG pour effectuer un processus de diffusion inverse. Le modèle décode ensuite le latent estimé final, ce qui aboutit à une image inpaintée. Le HD-Painter met ensuite en œuvre le modèle de super-résolution stable pour l’inpainting de l’image à taille d’origine et met en œuvre le processus de diffusion inverse du cadre Stable Diffusion conditionné sur l’image d’entrée à basse résolution. Le modèle mélange les prédictions débruitées avec l’encodage de l’image d’origine après chaque étape dans la région connue et dérive le latent suivant. Enfin, le modèle décode le latent et met en œuvre un mélange de Poisson pour éviter les artefacts de bord.

Attention introvertie consciente de l’invite ou PAIntA

Les modèles d’inpainting existants comme le Stable Inpainting tendent à s’appuyer davantage sur le contexte visuel autour de la zone d’inpainting et à ignorer les invites de l’utilisateur. Sur la base de l’expérience utilisateur, ce problème peut être classé en deux catégories : la dominance de l’objet voisin et la dominance du fond. Le problème de dominance du contexte visuel sur les invites de saisie peut être le résultat de la nature uniquement spatiale et sans invite des couches d’auto-attention. Pour résoudre ce problème, le cadre HD-Painter introduit l’attention introvertie consciente de l’invite (PAIntA) qui utilise les matrices d’attention croisées et un masque d’inpainting pour contrôler la sortie des couches d’auto-attention dans la région inconnue.

Le composant d’attention introvertie consciente de l’invite applique d’abord des couches de projection pour obtenir la clé, les valeurs et les requêtes, ainsi que la matrice de similarité. Le modèle ajuste ensuite le score d’attention des pixels connus pour atténuer l’influence forte de la région connue sur la région inconnue et définit une nouvelle matrice de similarité en exploitant l’invite textuelle.

Guidage de score d’attention de rééquilibrage ou RASG

Le cadre HD-Painter adopte une méthode de guidage d’échantillonnage post-hoc pour améliorer encore l’alignement de la génération avec les invites textuelles. Avec une fonction objectif, l’approche de guidage d’échantillonnage post-hoc vise à exploiter les propriétés de segmentation à vocabulaire ouvert des couches d’attention croisées. Cependant, cette approche de guidage post-hoc classique a le potentiel de déplacer le domaine de diffusion latent qui pourrait dégrader la qualité de l’image générée. Pour résoudre ce problème, le modèle HD-Painter met en œuvre le mécanisme de guidage de score d’attention de rééquilibrage (RASG) qui introduit un mécanisme de rééquilibrage de gradient, aboutissant à la préservation du domaine latent.

HD-Painter : Expériences et Résultats

Pour analyser ses performances, le cadre HD-Painter est comparé aux modèles actuels de pointe, notamment le Stable Inpainting, le GLIDE et le BLD ou Blended Latent Diffusion, sur 10000 échantillons aléatoires où l’invite est sélectionnée comme l’étiquette de l’instance masquée.

Comme on peut l’observer, le cadre HD-Painter surpasse les cadres existants sur trois métriques différentes avec une marge significative, en particulier l’amélioration de 1,5 point sur la métrique CLIP et la différence de score d’exactitude générée d’environ 10 % par rapport aux autres méthodes de pointe.

Ensuite, la figure suivante montre la comparaison qualitative du cadre HD-Painter avec d’autres cadres d’inpainting. Comme on peut l’observer, les autres modèles de base reconstruisent les régions manquantes de l’image comme une continuation des objets de la région connue en ignorant les invites ou génèrent un fond. D’un autre côté, le cadre HD-Painter est capable de générer les objets cibles avec succès grâce à la mise en œuvre des composants PAIntA et RASG dans son architecture.

Pensées finales

Dans cet article, nous avons discuté du HD-Painter, une approche d’inpainting d’images haute résolution guidé par du texte sans formation qui répond aux défis rencontrés par les cadres d’inpainting existants, notamment la négligence d’invite et la dominance de l’objet voisin et du fond. Le cadre HD-Painter met en œuvre une couche d’attention introvertie consciente de l’invite (PAIntA) qui utilise les informations d’invite pour améliorer les scores d’auto-attention qui aboutissent finalement à une meilleure génération d’alignement de texte.

Pour améliorer encore la cohérence de l’invite, le modèle HD-Painter introduit une approche de guidage de score d’attention de rééquilibrage (RASG) qui intègre une stratégie d’échantillonnage post-hoc dans la forme générale du composant DDIM de manière transparente pour empêcher les déplacements de distribution hors de la distribution. De plus, le cadre HD-Painter introduit une technique de super-résolution spécialisée pour l’inpainting qui aboutit à une extension à des échelles plus grandes et permet au cadre HD-Painter de compléter les régions manquantes de l’image avec des résolutions allant jusqu’à 2K.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.