Angle d’Anderson

Le modèle de diffusion eDiffi de NVIDIA permet « de peindre avec des mots » et plus encore

mm
Ajouter Unite.AI à vos sources préférées sur Google

Essayer de créer des compositions précises avec des modèles d’images génératives de diffusion latente tels que Stable Diffusion peut être comme essayer de rassembler des chats; les mêmes pouvoirs imaginatifs et interprétatifs qui permettent au système de créer des détails extraordinaires et de faire apparaître des images extraordinaires à partir de prompts de texte relativement simples sont également difficiles à désactiver lorsque vous recherchez un contrôle de niveau Photoshop sur la génération d’images.

Maintenant, une nouvelle approche de la recherche NVIDIA, intitulée ensemble de diffusion pour les images (eDiffi), utilise un mélange de méthodes d’intégration et d’interprétation multiples (plutôt que la même méthode tout au long du pipeline) pour permettre un niveau de contrôle bien plus élevé sur le contenu généré. Dans l’exemple ci-dessous, nous voyons un utilisateur « peindre » des éléments où chaque couleur représente un mot d’un prompt de texte:

'Peindre avec des mots' est l'une des deux capacités nouvelles du modèle de diffusion eDiffi de NVIDIA. Chaque couleur appliquée représente un mot du prompt (voir-les apparaître à gauche pendant la génération), et la couleur de la zone appliquée ne consistera que de cet élément. Voir la vidéo officielle intégrée à la fin de l'article pour plus d'exemples et une meilleure résolution. Source: https://www.youtube.com/watch?v=k6cOx9YjHJc

‘Peindre avec des mots’ est l’une des deux capacités nouvelles du modèle de diffusion eDiffi de NVIDIA. Chaque couleur appliquée représente un mot du prompt (voir-les apparaître à gauche pendant la génération), et la couleur de la zone appliquée ne consistera que de cet élément. Voir la vidéo officielle pour plus d’exemples et une meilleure résolution à https://www.youtube.com/watch?v=k6cOx9YjHJc

Ceci est essentiellement « peindre avec des masques », et inverse le paradigme d’inpainting de Stable Diffusion, qui est basé sur la réparation d’images cassées ou insatisfaisantes, ou l’extension d’images qui auraient pu être de la taille souhaitée dès le départ.

Ici, au lieu de cela, les marges de la couleur appliquée représentent les limites approximatives autorisées d’un seul élément unique d’un concept, permettant à l’utilisateur de définir la taille finale du canevas dès le départ, puis d’ajouter des éléments de manière discrète.

Exemples du nouveau document. Source: https://arxiv.org/pdf/2211.01324.pdf

Exemples du nouveau document. Source: https://arxiv.org/pdf/2211.01324.pdf

Les méthodes variées employées dans eDiffi signifient également que le système fait un travail bien meilleur pour inclure chaque élément dans des prompts longs et détaillés, alors que Stable Diffusion et DALL-E 2 tendent à privilégier certaines parties du prompt, en fonction soit de l’apparition précoce des mots cibles dans le prompt, soit d’autres facteurs, tels que la difficulté potentielle de désentangler les divers éléments nécessaires pour une composition complète (mais exhaustive par rapport au texte-prompt):

Du document: eDiffi est capable d'itérer plus en profondeur à travers le prompt jusqu'à ce que le nombre maximum possible d'éléments ait été rendu. Même si les résultats améliorés pour eDiffi (dernière colonne) sont sélectionnés, les images de comparaison de Stable Diffusion et DALL-E 2 le sont également.

Du document: eDiffi est capable d’itérer plus en profondeur à travers le prompt jusqu’à ce que le nombre maximum possible d’éléments ait été rendu. Même si les résultats améliorés pour eDiffi (dernière colonne) sont sélectionnés, les images de comparaison de Stable Diffusion et DALL-E 2 le sont également.

En outre, l’utilisation d’un encodeur de texte-à-texte T5 dédié signifie que eDiffi est capable de rendre du texte anglais compréhensible, soit demandé de manière abstraite à partir d’un prompt (c’est-à-dire l’image contient du texte de [x]), soit explicitement demandé (c’est-à-dire le t-shirt dit ‘Nvidia Rocks’):

Le traitement de texte-à-texte dédié dans eDiffi signifie que le texte peut être rendu verbatim dans les images, au lieu d'être exécuté uniquement à travers une couche interprétative de texte-à-image qui déforme la sortie.

Le traitement de texte-à-texte dédié dans eDiffi signifie que le texte peut être rendu verbatim dans les images, au lieu d’être exécuté uniquement à travers une couche interprétative de texte-à-image qui déforme la sortie.

Un autre avantage du nouveau cadre est qu’il est possible de fournir une image unique comme prompt de style, plutôt que de devoir former un modèle DreamBooth ou un modèle d’intégration textuelle sur plusieurs exemples d’un genre ou de style.

Le transfert de style peut être appliqué à partir d'une image de référence à un prompt de texte-à-image, ou même à un prompt d'image-à-image.

Le transfert de style peut être appliqué à partir d’une image de référence à un prompt de texte-à-image, ou même à un prompt d’image-à-image.

Le nouveau document est intitulé eDiffi: Modèles de diffusion d’images avec un ensemble d’experts de débruitage, et

L’encodeur de texte T5

L’utilisation de l’encodeur de texte-à-texte T5 de Google est l’élément clé des résultats améliorés démontrés dans eDiffi. Le pipeline de diffusion latent moyen se centre sur l’association entre les images formées et les légendes qui les accompagnaient lorsqu’elles ont été récupérées sur Internet (ou ajustées manuellement plus tard, bien que cela soit une intervention coûteuse et donc rare).

Du document de juillet 2020 pour T5 - transformations basées sur le texte, qui peuvent aider le flux de travail d'image générative dans eDiffi (et, potentiellement, d'autres modèles de diffusion latente). Source: https://arxiv.org/pdf/1910.10683.pdf

Du document de juillet 2020 pour T5 – transformations basées sur le texte, qui peuvent aider le flux de travail d’image générative dans eDiffi (et, potentiellement, d’autres modèles de diffusion latente). Source: https://arxiv.org/pdf/1910.10683.pdf

En reformulant le texte source et en exécutant le module T5, des associations et des représentations plus exactes peuvent être obtenues que celles qui ont été formées dans le modèle à l’origine, presque comme un labeling manuel post facto avec une plus grande spécificité et une applicabilité plus grande aux stipulations du prompt de texte demandé.

Les auteurs expliquent:

‘Dans la plupart des travaux existants sur les modèles de diffusion, le modèle de débruitage est partagé entre tous les niveaux de bruit, et la dynamique temporelle est représentée à l’aide d’une intégration temporelle simple qui est alimentée au modèle de débruitage via un réseau MLP. Nous soutenons que la dynamique temporelle complexe de la diffusion de débruitage peut ne pas être apprise à partir des données de manière efficace en utilisant un modèle partagé avec une capacité limitée.

‘Au lieu de cela, nous proposons d’augmenter la capacité du modèle de débruitage en introduisant un ensemble d’experts de débruitage; chaque expert de débruitage est un modèle de débruitage spécialisé pour une plage particulière de niveaux de bruit. De cette façon, nous pouvons augmenter la capacité du modèle sans ralentir l’échantillonnage puisque la complexité computationnelle de l’évaluation de [l’élément traité] à chaque niveau de bruit reste la même.’

Flux de travail conceptuel pour eDiffi.

Flux de travail conceptuel pour eDiffi.

Les modules d’encodage CLIP existants inclus dans DALL-E 2 et Stable Diffusion sont également capables de trouver des interprétations d’images alternatives pour le texte lié à la saisie utilisateur. Cependant, ils sont formés sur des informations similaires à celles du modèle d’origine et ne sont pas utilisés comme une couche interprétative distincte dans la manière dont T5 est utilisé dans eDiffi.

Les auteurs déclarent que eDiffi est la première fois que les encodeurs T5 et CLIP ont été incorporés dans un seul pipeline:

’Comme ces deux encodeurs sont formés avec des objectifs différents, leurs embeddings favorisent la formation d’images différentes avec le même texte de saisie. Alors que les embeddings de texte CLIP aident à déterminer l’apparence globale des images générées, les sorties ont tendance à manquer de détails fins dans le texte.

‘En revanche, les images générées avec les embeddings de texte T5 seuls reflètent mieux les objets individuels décrits dans le texte, mais leur apparence globale est moins précise. Les utiliser conjointement produit les meilleurs résultats de génération d’images dans notre modèle.’

Interruption et augmentation du processus de diffusion

Le document note qu’un modèle de diffusion latent typique commence le voyage depuis le bruit pur jusqu’à une image en s’appuyant uniquement sur le texte dans les premières étapes de la génération.

Lorsque le bruit se résout en une sorte de mise en page grossière représentant la description dans le prompt de texte, le facet de texte du processus disparaît essentiellement, et le reste du processus se déplace vers l’augmentation des fonctionnalités visuelles.

Ceci signifie que tout élément qui n’a pas été résolu à l’étape naissante de l’interprétation du bruit guidé par le texte est difficile à injecter dans l’image plus tard, car les deux processus (texte-à-mise en page et mise en page-à-image) ont relativement peu de chevauchement, et la mise en page de base est assez enchevêtrée le moment venu à l’étape d’augmentation de l’image.

Du document: les cartes d'attention de diverses parties du pipeline à mesure que le processus de bruit-à-image mûrit. Nous pouvons voir la chute abrupte de l'influence de CLIP sur l'image dans la rangée inférieure, tandis que T5 continue d'influencer l'image bien plus loin dans le processus de rendu.

Du document: les cartes d’attention de diverses parties du pipeline à mesure que le processus de bruit-à-image mûrit. Nous pouvons voir la chute abrupte de l’influence de CLIP sur l’image dans la rangée inférieure, tandis que T5 continue d’influencer l’image bien plus loin dans le processus de rendu.

Potentialité professionnelle

Les exemples de la page du projet et de la vidéo YouTube se concentrent sur la génération de mèmes et d’images « mignonnes » pour les relations publiques. Comme d’habitude, la recherche NVIDIA minimise le potentiel de son innovation la plus récente pour améliorer les flux de travail photoréalistes ou VFX, ainsi que son potentiel pour améliorer les images et les vidéos de deepfake.

Dans les exemples, un novice ou un utilisateur amateur dessine des contours grossiers pour le placement d’éléments spécifiques, alors que dans un flux de travail VFX plus systématique, il pourrait être possible d’utiliser eDiffi pour interpréter plusieurs cadres d’une vidéo en utilisant le texte-à-image, dans lesquels les contours sont très précis et basés, par exemple, sur des chiffres où l’arrière-plan a été supprimé via un écran vert ou des méthodes algorithmiques.

Runway ML propose déjà un rotoscoping basé sur l'IA. Dans cet exemple, l'écran vert autour du sujet représente la couche alpha, tandis que l'extraction a été réalisée via l'apprentissage automatique plutôt que la suppression algorithmique d'un écran vert réel. Source: https://twitter.com/runwayml/status/1330978385028374529

Runway ML propose déjà un rotoscoping basé sur l’IA. Dans cet exemple, l’écran vert autour du sujet représente la couche alpha, tandis que l’extraction a été réalisée via l’apprentissage automatique plutôt que la suppression algorithmique d’un écran vert réel. Source: https://twitter.com/runwayml/status/1330978385028374529

En utilisant un personnage DreamBooth formé et un pipeline d’image-à-image avec eDiffi, il est potentiellement possible de commencer à résoudre l’un des problèmes les plus importants de tout modèle de diffusion latent: la stabilité temporelle. Dans un tel cas, les marges de l’image imposée et le contenu de l’image seraient « pré-flottés » contre le canevas de l’utilisateur, avec une continuité temporelle du contenu rendu (par exemple, transformer un pratiquant de tai chi en robot) fournie par l’utilisation d’un modèle DreamBooth verrouillé qui a « mémorisé » ses données de formation – ce qui est mauvais pour l’interprétabilité, mais excellent pour la reproductibilité, la fidélité et la continuité.

Méthode, données et tests

Le document indique que le modèle eDiffi a été formé sur « une collection de jeux de données publics et propriétaires », fortement filtrés par un modèle CLIP pré-formé, afin de supprimer les images susceptibles de diminuer le score esthétique général de la sortie. L’ensemble d’images final filtré comprend « environ un milliard » de paires d’images et de texte. La taille des images formées est décrite comme ayant le côté le plus court supérieur à 64 pixels.

Plusieurs modèles ont été formés pour le processus, avec les modèles de base et de sur-résolution formés sur l’optimiseur AdamW à un taux d’apprentissage de 0,0001, avec une décroissance de poids de 0,01, et à une taille de lot formable de 2048.

Le modèle de base a été formé sur 256 GPU NVIDIA A100, et les deux modèles de sur-résolution sur 128 GPU A100 pour chaque modèle.

Le système était basé sur la bibliothèque PyTorch Imaginaire de NVIDIA. Les jeux de données COCO et Visual Genome ont été utilisés pour l’évaluation, bien qu’ils n’aient pas été inclus dans les modèles finals, avec MS-COCO comme variante spécifique utilisée pour les tests. Les systèmes concurrents testés étaient GLIDE, Make-A-Scene, DALL-E 2, Stable Diffusion, et les deux systèmes de synthèse d’images de Google, Imagen et Parti.

Conformément à des travaux précédents similaires, FID-30K à zéro tir a été utilisé comme métrique d’évaluation. Sous FID-30K, 30 000 légendes sont extraites aléatoirement de l’ensemble de validation COCO (c’est-à-dire pas les images ou le texte utilisés pour la formation), qui ont ensuite été utilisées comme prompts de texte pour la synthèse d’images.

La distance de Fréchet Inception (FID) entre les images générées et les images de vérité terrain a ensuite été calculée, ainsi que l’enregistrement du score CLIP pour les images générées.

Résultats des tests FID à zéro tir contre les approches actuelles de l'état de l'art sur l'ensemble de validation COCO 2014, avec des résultats plus bas étant meilleurs.

Résultats des tests FID à zéro tir contre les approches actuelles de l’état de l’art sur l’ensemble de validation COCO 2014, avec des résultats plus bas étant meilleurs.

Dans les résultats, eDiffi a pu obtenir le score le plus bas (le meilleur) sur FID à zéro tir, même contre des systèmes avec un nombre de paramètres beaucoup plus élevé, tels que les 20 milliards de paramètres de Parti, par rapport aux 9,1 milliards de paramètres du modèle eDiffi le plus performant formé pour les tests.

Conclusion

Le modèle de diffusion eDiffi de NVIDIA représente une alternative bienvenue à l’ajout de plus en plus de données et de complexité aux systèmes existants, en utilisant plutôt une approche plus intelligente et plus stratifiée pour certains des obstacles les plus épineux liés à l’enchevêtrement et à la non-éditabilité dans les systèmes d’images génératives de diffusion latente.

Il y a déjà des discussions sur les sous-reddits et les Discord de Stable Diffusion pour incorporer directement tout code qui pourrait être mis à disposition pour eDiffi, ou pour restager les principes derrière lui dans une mise en œuvre distincte. Le nouveau pipeline, cependant, est si radicalement différent qu’il constituerait un changement de numéro de version pour SD, en abandonnant une certaine compatibilité ascendante, bien qu’il offre la possibilité d’améliorer considérablement le niveau de contrôle sur les images synthétisées finales, sans sacrifier les pouvoirs imaginatifs captivants de la diffusion latente.

 

Publié pour la première fois le 3 novembre 2022.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai