Modèles et plateformes d’IA
Les Curseurs de Concepts : Contrôle Précis dans les Modèles de Diffusion avec des Adaptateurs LoRA
Grâce à leurs capacités, les modèles de diffusion de texte à image sont devenus immensément populaires dans la communauté artistique. Cependant, les modèles actuels, y compris les cadres d’état de l’art, ont souvent du mal à maintenir le contrôle sur les concepts et les attributs visuels dans les images générées, ce qui conduit à des sorties insatisfaisantes. La plupart des modèles s’appuient uniquement sur des invites de texte, ce qui pose des défis pour moduler des attributs continus comme l’intensité du temps, la netteté des ombres, les expressions faciales ou l’âge d’une personne de manière précise. Cela rend difficile pour les utilisateurs finaux d’ajuster les images pour répondre à leurs besoins spécifiques. De plus, même si ces cadres génératifs produisent des images de haute qualité et réalistes, ils sont sujets à des distorsions comme des visages déformés ou des doigts manquants.
Pour surmonter ces limites, les développeurs ont proposé l’utilisation de curseurs de concepts interprétables. Ces curseurs promettent un contrôle accru pour les utilisateurs finaux sur les attributs visuels, améliorant ainsi la génération et l’édition d’images dans les modèles de diffusion. Les curseurs de concepts dans les modèles de diffusion fonctionnent en identifiant une direction de paramètre correspondant à un concept individuel tout en minimisant les interférences avec d’autres attributs. Le cadre crée ces curseurs à l’aide d’images échantillons ou d’un ensemble d’invites, établissant ainsi des directions pour les concepts textuels et visuels.

En fin de compte, l’utilisation de curseurs de concepts dans les modèles de diffusion de texte à image peut aboutir à une génération d’images avec un degré minimal d’interférence, et à un contrôle accru sur la sortie finale tout en augmentant le réalisme perçu sans altérer le contenu des images, et ainsi en générant des images réalistes. Dans cet article, nous allons discuter plus en détail du concept d’utilisation de curseurs de concepts dans les cadres de texte à image, et analyser comment leur utilisation peut aboutir à une qualité supérieure d’images générées par l’IA.
Introduction aux Curseurs de Concepts
Comme mentionné précédemment, les cadres de diffusion de texte à image actuels ont souvent du mal à contrôler les concepts et les attributs visuels dans les images générées, ce qui conduit à des résultats insatisfaisants. De plus, de nombreux de ces modèles ont du mal à moduler des attributs continus, contribuant ainsi à des sorties insatisfaisantes. Les curseurs de concepts peuvent aider à atténuer ces problèmes, en dotant les créateurs de contenu et les utilisateurs finaux d’un contrôle accru sur le processus de génération d’images et en résolvant les défis auxquels sont confrontés les cadres actuels.
La plupart des modèles de diffusion de texte à image actuels s’appuient sur la modification directe de l’invite de texte pour contrôler les attributs d’image. Bien que cette approche permette la génération d’images, elle n’est pas optimale, car la modification de l’invite peut drastiquement altérer la structure de l’image. Une autre approche utilisée par ces cadres implique des techniques post-hoc, qui inversent le processus de diffusion et modifient les attentions croisées pour éditer les concepts visuels. Cependant, les techniques post-hoc ont des limites, ne supportant qu’un nombre limité de modifications simultanées et nécessitant des passes d’interférence individuelles pour chaque nouveau concept. De plus, elles peuvent introduire une entanglement conceptuelle si elles ne sont pas conçues avec soin.
En revanche, les curseurs de concepts offrent une solution plus efficace pour la génération d’images. Ces adaptateurs légers et faciles à utiliser peuvent être appliqués à des modèles pré-entraînés, améliorant ainsi le contrôle et la précision sur les concepts souhaités en une seule passe d’interférence avec une entanglement minimale. Les curseurs de concepts permettent également l’édition de concepts visuels qui ne sont pas couverts par les descriptions textuelles, une fonctionnalité qui les distingue des méthodes d’édition basées sur les invites de texte. Bien que les méthodes de personnalisation basées sur les images puissent ajouter efficacement des jetons pour les concepts d’image, elles sont difficiles à mettre en œuvre pour l’édition d’images. Les curseurs de concepts, en revanche, permettent aux utilisateurs finaux de fournir un petit nombre d’images appariées définissant un concept souhaité. Les curseurs généralisent ensuite ce concept et l’appliquent automatiquement à d’autres images, visant à améliorer le réalisme et à corriger des distorsions telles que les mains.
Les curseurs de concepts visent à apprendre et à résoudre les problèmes courants aux quatre concepts de l’IA générative et des cadres de diffusion : l’édition d’images, les méthodes basées sur les conseils, l’édition de modèles et les directions sémantiques.
Édition d’images
Les cadres d’IA actuels se concentrent soit sur l’utilisation d’une entrée conditionnelle pour guider la structure de l’image, soit sur la manipulation des attentions croisées de l’image source avec son invite cible pour permettre l’édition d’une seule image dans les cadres de diffusion de texte à image. En conséquence, ces approches ne peuvent être mises en œuvre que sur des images individuelles et nécessitent également une optimisation de la base latente pour chaque image en raison de la structure géométrique évolutive sur les étapes temporelles entre les invites.
Méthodes basées sur les conseils
L’utilisation de méthodes de conseils basées sur des classifyeurs libres a indiqué leur capacité à améliorer la qualité des images générées et à renforcer l’alignement texte-image. En incorporant des termes de conseils pendant l’interférence, la méthode améliore la compositionnalité limitée héritée des cadres de diffusion, et ils peuvent être utilisés pour guider à travers des concepts non sûrs dans les cadres de diffusion.
Édition de modèles
L’utilisation de curseurs de concepts peut également être considérée comme une technique d’édition de modèles qui utilise un adaptateur de bas rang pour produire un seul attribut sémantique qui permet un contrôle continu qui s’aligne sur l’attribut. Les méthodes de personnalisation basées sur le réglage fin sont ensuite utilisées pour personnaliser le cadre et ajouter de nouveaux concepts. De plus, la technique de diffusion personnalisée propose une façon de réglager les couches d’attention croisée pour incorporer de nouveaux concepts visuels dans les modèles de diffusion pré-entraînés. Inversement, la technique de diffusion textuelle propose d’optimiser un vecteur d’embedding pour activer les capacités du modèle et introduire des concepts textuels dans le cadre.
Direction sémantique dans les GAN
La manipulation des attributs sémantiques est l’une des caractéristiques clés des réseaux antagonistes génératifs, et les trajectoires de l’espace latent sont trouvées pour être alignées de manière auto-supervisée. Dans les cadres de diffusion, ces trajectoires de l’espace latent existent dans les couches intermédiaires de l’architecture U-Net, et la direction principale de l’espace latent dans les cadres de diffusion capture la sémantique globale. Les curseurs de concepts forment des sous-espaces de bas rang correspondant à des attributs spéciaux directement, et obtiennent des directions d’édition précises et localisées en utilisant des paires de texte ou d’images pour optimiser les directions globales.
Curseurs de Concepts : Architecture et Fonctionnement
Modèles de diffusion et adaptateurs LoRA ou de bas rang
Les modèles de diffusion sont essentiellement une sous-classe de cadres d’IA générative qui fonctionnent sur le principe de synthèse de données en inversant un processus de diffusion. Le processus de diffusion avant ajoute initialement du bruit aux données, passant ainsi d’un état organisé à un bruit gaussien complet. L’objectif principal des modèles de diffusion est d’inverser le processus de diffusion en débruitant progressivement l’image, et en échantillonnant un bruit gaussien aléatoire pour générer une image. Dans les applications du monde réel, l’objectif principal des cadres de diffusion est de prédire le bruit réel lorsque le bruit gaussien complet est alimenté en entrée avec des entrées supplémentaires comme la condition et l’étape temporelle.
La technique d’adaptateur LoRA ou de bas rang décompose les mises à jour de poids pendant le réglage fin pour permettre une adaptation efficace de grands cadres pré-entraînés à des tâches en aval. La technique LoRA décompose les mises à jour de poids pour une couche de modèle pré-entraîné par rapport aux dimensions d’entrée et de sortie, et contraint la mise à jour à un sous-espace de bas rang.
Curseurs de Concepts
L’objectif principal des curseurs de concepts est de servir d’approche pour réglager les adaptateurs LoRA sur un cadre de diffusion pour faciliter un degré de contrôle accru sur les images ciblées par des concepts, et cela est démontré dans l’image suivante.

Lorsqu’ils sont conditionnés sur des concepts cibles, les curseurs de concepts apprennent des directions de paramètres de bas rang pour augmenter ou diminuer l’expression de certains attributs. Pour un modèle et son concept cible, l’objectif principal des curseurs de concepts est d’obtenir un modèle amélioré qui modifie la probabilité d’augmenter les attributs et de diminuer la probabilité de supprimer les attributs pour une image lorsqu’elle est conditionnée sur le concept cible pour augmenter la probabilité d’augmenter les attributs, et diminuer la probabilité de supprimer les attributs. En utilisant la reparamétrisation et la formule de Tweedie, le cadre introduit un processus de bruit temporel, et exprime chaque score comme une prédiction de débruitage. De plus, l’objectif de désentanglement affine les modules dans les curseurs de concepts tout en gardant les poids pré-entraînés constants, et le facteur d’échelle introduit pendant la formulation LoRA est modifié pendant l’interférence. Le facteur d’échelle facilite également l’ajustement de la force de l’édition, et rend les éditions plus fortes sans réentraîner le cadre, comme le montre l’image suivante.

Les méthodes d’édition utilisées précédemment par les cadres facilitaient des éditions plus fortes en réentraînant le cadre avec une guidance accrue. Cependant, la mise à l’échelle du facteur d’échelle pendant l’interférence produit les mêmes résultats d’édition sans augmenter le coût de réentraînement et le temps.
Apprentissage de Concepts Visuels
Les curseurs de concepts sont conçus pour contrôler les concepts visuels que les invites de texte ne peuvent pas définir bien, et ces curseurs utilisent de petits ensembles de données qui sont soit appariés avant ou après pour former ces concepts. Le contraste entre les paires d’images permet aux curseurs d’apprendre les concepts visuels. De plus, le processus d’entraînement des curseurs de concepts optimise le composant LoRA mis en œuvre dans les deux directions avant et arrière. En conséquence, le composant LoRA s’aligne sur la direction qui cause les effets visuels dans les deux directions.
Curseurs de Concepts : Résultats de Mise en Œuvre
Pour analyser le gain de performance, les développeurs ont évalué l’utilisation de curseurs de concepts principalement sur le Stable Diffusion XL, un cadre de haute résolution de 1024 pixels avec des expériences supplémentaires menées sur le cadre Stable Diffusion v1.4, les modèles étant entraînés pendant 500 époques chacun.
Curseurs de Concepts Textuels
Pour évaluer les performances des curseurs de concepts textuels, ils sont validés sur un ensemble de 30 concepts basés sur du texte, et la méthode est comparée à deux références qui utilisent une invite de texte standard pour un nombre fixe d’étapes temporelles, puis commence la composition en ajoutant des invites pour diriger l’image. Comme on peut le voir dans la figure suivante, l’utilisation de curseurs de concepts donne des scores CLIP constamment plus élevés et une réduction constante du score LPIPS par rapport au cadre d’origine sans curseurs de concepts.


Comme on peut le voir dans l’image ci-dessus, l’utilisation de curseurs de concepts permet une édition précise des attributs souhaités pendant le processus de génération d’images tout en maintenant la structure globale de l’image.
Curseurs de Concepts Visuels
Les modèles de diffusion de texte à image qui n’utilisent que des invites de texte ont souvent du mal à maintenir un degré élevé de contrôle sur les attributs visuels tels que les poils faciaux ou les formes des yeux. Pour assurer un meilleur contrôle sur les attributs granulaires, les curseurs de concepts utilisent des invites de texte facultatives appariées avec des ensembles d’images. Comme on peut le voir dans la figure ci-dessous, les curseurs de concepts créent des curseurs individuels pour la « taille des yeux » et la « forme des sourcils » qui capturent les transformations souhaitées en utilisant les paires d’images.

Les résultats peuvent être affinés en fournissant des textes spécifiques pour que la direction se concentre sur cette région faciale, et crée des curseurs avec un contrôle étape par étape sur l’attribut ciblé.
Composition de Curseurs
L’un des principaux avantages de l’utilisation de curseurs de concepts est leur composabilité, qui permet aux utilisateurs de combiner plusieurs curseurs pour un contrôle accru plutôt que de se concentrer sur un seul concept à la fois, ce qui peut être dû aux directions de bas rang utilisées dans les curseurs de concepts. De plus, puisque les curseurs de concepts sont des adaptateurs LoRA légers, ils sont faciles à partager et peuvent également être facilement superposés sur les modèles de diffusion. Les utilisateurs peuvent également ajuster plusieurs curseurs simultanément pour diriger des générations complexes en téléchargeant des ensembles de curseurs intéressants.

L’image suivante démontre les capacités de composition des curseurs de concepts, et plusieurs curseurs sont composés progressivement dans chaque ligne de gauche à droite, permettant ainsi la traversée d’espaces de concepts à haute dimension avec un degré de contrôle accru sur les concepts.

Amélioration de la Qualité d’Image
Bien que les cadres de diffusion de texte à image d’état de l’art et les grands modèles génératifs comme le modèle Stable Diffusion XL soient capables de générer des images réalistes et de haute qualité, ils souffrent souvent de distorsions d’image comme des objets flous ou déformés, même si les paramètres de ces cadres d’état de l’art sont équipés de la capacité latente de générer des sorties de haute qualité avec moins de générations. L’utilisation de curseurs de concepts peut aboutir à la génération d’images avec moins de distorsions en débloquant les véritables capacités de ces modèles en identifiant des directions de paramètres de bas rang.
Correction des Mains
La génération d’images avec des mains réalistes a toujours été un défi pour les cadres de diffusion, et l’utilisation de curseurs de concepts a un contrôle direct sur la tendance à déformer les mains. L’image suivante démontre l’effet de l’utilisation des curseurs de concepts « correction des mains » qui permet au cadre de générer des images avec des mains plus réalistes.

Curseurs de Réparation
L’utilisation de curseurs de concepts peut non seulement aboutir à la génération d’images avec des mains plus réalistes, mais ils ont également montré leur potentiel pour améliorer le réalisme global des images générées par le cadre. Les curseurs de concepts identifient une direction de paramètre de bas rang unique qui permet le déplacement des images à partir de problèmes de distorsion courants, et les résultats sont démontrés dans l’image suivante.

Pensées Finales
Dans cet article, nous avons discuté des curseurs de concepts, un nouveau paradigme simple mais évolutif qui permet un contrôle interprétable sur la sortie générée dans les modèles de diffusion. L’utilisation de curseurs de concepts vise à résoudre les problèmes auxquels sont confrontés les cadres de diffusion de texte à image actuels qui ont du mal à maintenir le contrôle requis sur les concepts et les attributs visuels inclus dans l’image générée, ce qui conduit souvent à des sorties insatisfaisantes. De plus, la plupart des modèles de diffusion de texte à image ont du mal à moduler des attributs continus dans une image, ce qui conduit souvent à des sorties insatisfaisantes. L’utilisation de curseurs de concepts peut permettre aux cadres de diffusion de texte à image d’atténuer ces problèmes et de doter les créateurs de contenu et les utilisateurs finaux d’un degré de contrôle accru sur le processus de génération d’images, et de résoudre les problèmes auxquels sont confrontés les cadres actuels.












