Angle d’Anderson

Amélioration de la génération d’écran vert pour la diffusion stable

mm
Ajouter Unite.AI à vos sources préférées sur Google
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

Malgré l’enthousiasme de la communauté et des investisseurs autour de l’IA visuelle générative, la sortie de ces systèmes n’est pas toujours prête pour une utilisation dans le monde réel; un exemple est que les systèmes d’IA générative tendent à produire des images entières (ou une série d’images, dans le cas de la vidéo), plutôt que les éléments individuels et isolés qui sont généralement nécessaires pour diverses applications dans les médias et pour les praticiens des effets visuels.

Un exemple simple est le clip-art conçu pour « flotter » sur le fond cible que l’utilisateur a sélectionné:

Le fond en damier gris clair, peut-être le plus familier aux utilisateurs de Photoshop, est devenu le symbole du canal alpha, ou canal de transparence, même dans de simples produits de consommation tels que les images stock.

Le fond en damier gris clair, peut-être le plus familier aux utilisateurs de Photoshop, est devenu le symbole du canal alpha, ou canal de transparence, même dans de simples produits de consommation tels que les images stock.

La transparence de ce type est disponible depuis plus de trente ans; depuis la révolution numérique du début des années 1990, les utilisateurs ont pu extraire des éléments de vidéos et d’images à l’aide d’un ensemble de plus en plus sophistiqué d’outils et de techniques.

Par exemple, le défi de « faire disparaître » les fonds de blue-screen et de green-screen dans les séquences vidéo, qui était autrefois l’apanage de processus chimiques coûteux et d’imprimantes optiques (ainsi que de mattes réalisées à la main), est devenu l’affaire de minutes dans des systèmes tels que les applications Adobe After Effects et Photoshop (parmi de nombreux autres programmes et systèmes gratuits et propriétaires).

Une fois qu’un élément a été isolé, un canal alpha (en effet, un masque qui obscurcit tout contenu non pertinent) permet à tout élément de la vidéo d’être superposé sans effort sur de nouveaux fonds, ou composé avec d’autres éléments isolés.

Exemples de canaux alpha, avec leurs effets représentés dans la rangée inférieure. Source: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Exemples de canaux alpha, avec leurs effets représentés dans la rangée inférieure. Source: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Suppression

Dans la vision par ordinateur, la création de canaux alpha relève de la segmentation sémantique, avec des projets open source tels que Meta’s Segment Anything qui fournissent une méthode de texte pour isoler/extraire des objets cibles, grâce à la reconnaissance d’objets améliorée sémantiquement.

Le cadre de travail Segment Anything a été utilisé dans une large gamme de flux de travail d’extraction et d’isolement d’effets visuels, tels que le projet Alpha-CLIP.

Exemples d'extractions utilisant Segment Anything, dans le cadre de travail Alpha-CLIP: Source: https://arxiv.org/pdf/2312.03818

Exemples d’extractions utilisant Segment Anything, dans le cadre de travail Alpha-CLIP: Source: https://arxiv.org/pdf/2312.03818

Il existe de nombreuses méthodes alternatives de segmentation sémantique qui peuvent être adaptées à la tâche d’attribution de canaux alpha.

Cependant, la segmentation sémantique repose sur des données formées qui peuvent ne pas contenir toutes les catégories d’objets nécessaires pour être extraites. Bien que les modèles formés sur des volumes de données très élevés puissent permettre une plus large gamme d’objets à être reconnus (en effet, devenant des modèles fondamentaux, ou modèles de monde), ils sont néanmoins limités par les classes qu’ils sont formés pour reconnaître le plus efficacement.

Les systèmes de segmentation sémantique tels que Segment Anything peuvent avoir du mal à identifier certains objets, ou parties d'objets, comme le montre ici la sortie de prompts ambigus. Source: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Les systèmes de segmentation sémantique tels que Segment Anything peuvent avoir du mal à identifier certains objets, ou parties d’objets, comme le montre ici la sortie de prompts ambigus. Source: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Dans tous les cas, la segmentation sémantique est tout autant un processus post facto qu’une procédure de green screen, et doit isoler les éléments sans l’avantage d’une seule bande de couleur de fond qui peut être efficacement reconnue et supprimée.

Pour cette raison, il est arrivé à la communauté des utilisateurs que les images et les vidéos puissent être générées qui contiennent réellement des fonds de green screen qui pourraient être instantanément supprimés via des méthodes conventionnelles.

Malheureusement, les modèles de diffusion latente populaires tels que Stable Diffusion ont souvent du mal à rendre un écran vert vraiment vif. C’est parce que les données de formation des modèles ne contiennent généralement pas beaucoup d’exemples de ce scénario plutôt spécialisé. Même lorsque le système réussit, l’idée de « vert » a tendance à se propager de manière indésirable au sujet de premier plan, en raison de l’entanglement de concept:

Ci-dessus, nous voyons que Stable Diffusion a donné la priorité à l'authenticité de l'image par rapport à la nécessité de créer une seule intensité de vert, reproduisant efficacement les problèmes du monde réel qui se produisent dans les scénarios de green screen traditionnels. Ci-dessous, nous voyons que le concept de « vert » a pollué l'image de premier plan. Plus la invite se concentre sur le concept de « vert », plus ce problème est susceptible de s'aggraver. Source: https://stablediffusionweb.com/

Ci-dessus, nous voyons que Stable Diffusion a donné la priorité à l’authenticité de l’image par rapport à la nécessité de créer une seule intensité de vert, reproduisant efficacement les problèmes du monde réel qui se produisent dans les scénarios de green screen traditionnels. Ci-dessous, nous voyons que le concept de « vert » a pollué l’image de premier plan. Plus la invite se concentre sur le concept de « vert », plus ce problème est susceptible de s’aggraver. Source: https://stablediffusionweb.com/

Malgré les méthodes avancées en cours d’utilisation, la robe de la femme et la cravate de l’homme (dans les images inférieures ci-dessus) tendraient à « disparaître » avec le fond vert – un problème qui remonte aux jours de la suppression de la teinture photochimique dans les années 1970 et 1980.

Comme toujours, les limites d’un modèle peuvent être surmontées en lançant des données spécifiques sur un problème, et en consacrant des ressources de formation considérables. Des systèmes tels que l’offre 2024 de Stanford LayerDiffuse créent un modèle affiné capable de générer des images avec des canaux alpha:

Le projet LayerDiffuse de Stanford a été formé sur un million d'images appropriées capables d'imbiber le modèle de capacités de transparence. Source: https://arxiv.org/pdf/2402.17113

Le projet LayerDiffuse de Stanford a été formé sur un million d’images appropriées capables d’imbiber le modèle de capacités de transparence. Source: https://arxiv.org/pdf/2402.17113

Malheureusement, en plus des ressources de curation et de formation considérables nécessaires pour cette approche, le jeu de données utilisé pour LayerDiffuse n’est pas disponible publiquement, ce qui restreint l’utilisation des modèles formés sur celui-ci. Même si cet obstacle n’existait pas, cette approche est difficile à personnaliser ou à développer pour des cas d’utilisation spécifiques.

Un peu plus tard en 2024, la recherche d’Adobe a collaboré avec l’Université de Stonybrook pour produire MAGICK, une approche d’extraction d’IA formée sur des images de diffusion personnalisées.

À partir du document de 2024, un exemple d'extraction de canal alpha à grain fin dans MAGICK. Source: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

À partir du document de 2024, un exemple d’extraction de canal alpha à grain fin dans MAGICK. Source: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

150 000 objets générés par IA et extraits ont été utilisés pour former MAGICK, afin que le système développe une compréhension intuitive de l’extraction:

Exemples du jeu de données de formation de MAGICK.

Exemples du jeu de données de formation de MAGICK.

Ce jeu de données, comme le mentionne le document source, a été très difficile à générer pour la raison mentionnée ci-dessus – que les méthodes de diffusion ont du mal à créer des bandes solides de couleur. Par conséquent, une sélection manuelle des mattes générées a été nécessaire.

Ce goulet d’étranglement logistique conduit une fois again à un système qui ne peut pas être facilement développé ou personnalisé, mais doit être utilisé dans sa plage de capacité initialement formée.

TKG-DM – ‘Extraction de chroma native’ pour un modèle de diffusion latent

Une nouvelle collaboration entre des chercheurs allemands et japonais a proposé une alternative à ces méthodes formées, capable – selon le document – d’obtenir de meilleurs résultats que les méthodes mentionnées ci-dessus, sans avoir besoin de former sur des jeux de données spécialement curés.

TKG-DM modifie le bruit aléatoire qui initialise une image générative afin qu'il soit mieux capable de produire un fond solide et pouvant être clé – dans n'importe quelle couleur. Source: https://arxiv.org/pdf/2411.15580

TKG-DM modifie le bruit aléatoire qui initialise une image générative afin qu’il soit mieux capable de produire un fond solide et pouvant être clé – dans n’importe quelle couleur. Source: https://arxiv.org/pdf/2411.15580

La nouvelle méthode aborde le problème au niveau de la génération, en optimisant le bruit aléatoire à partir duquel une image est générée dans un modèle de diffusion latent (LDM) tel que Stable Diffusion.

L’approche s’appuie sur une enquête précédente sur le schéma de couleur d’une distribution de Stable Diffusion, et est capable de produire une couleur de fond de n’importe quel type, avec moins (ou pas) d’entanglement de la couleur de fond clé dans le contenu de premier plan, par rapport aux autres méthodes.

Le bruit initial est conditionné par un décalage de la moyenne du canal qui peut influencer les aspects du processus de débruitage, sans entangler le signal de couleur dans le contenu de premier plan.

Le bruit initial est conditionné par un décalage de la moyenne du canal qui peut influencer les aspects du processus de débruitage, sans entangler le signal de couleur dans le contenu de premier plan.

Le document indique:

‘Nos expériences approfondies démontrent que TKG-DM améliore les scores FID et mask-FID de 33,7 % et 35,9 % respectivement.

‘Ainsi, notre modèle sans formation rivalise avec les modèles affinés, offrant une solution efficace et polyvalente pour diverses tâches de création de contenu visuel qui nécessitent un contrôle précis de l’avant-plan et de l’arrière-plan. ‘

Le nouveau document est intitulé TKG-DM: Modèle de diffusion de contenu de clé de chroma sans formation, et provient de sept chercheurs de l’Université Hosei à Tokyo et de RPTU Kaiserslautern-Landau & DFKI GmbH, à Kaiserslautern.

Méthode

La nouvelle approche étend l’architecture de Stable Diffusion en conditionnant le bruit aléatoire initial à l’aide d’un décalage de la moyenne du canal (CMS), qui produit des modèles de bruit conçus pour encourager la séparation souhaitée entre l’arrière-plan et l’avant-plan dans le résultat généré.

Schéma du flux de travail du système proposé.

Schéma du flux de travail du système proposé.

CMS ajuste la moyenne de chaque canal de couleur tout en maintenant le développement général du processus de débruitage.

Les auteurs expliquent:

‘Pour générer l’objet de premier plan sur l’arrière-plan de clé de chroma, nous appliquons une stratégie de sélection de bruit initial qui combine sélectivement le bruit initial et le bruit de couleur initial à l’aide d’un masque gaussien 2D.

‘Ce masque crée une transition progressive en préservant le bruit d’origine dans la région de premier plan et en appliquant le bruit décalé de couleur à la région d’arrière-plan.’

Le canal de couleur souhaité pour la couleur de chroma d'arrière-plan est instancié avec une invite de texte nulle, tandis que le contenu de premier plan réel est créé sémantiquement à partir de l'instruction de texte de l'utilisateur.

Le canal de couleur souhaité pour la couleur de chroma d’arrière-plan est instancié avec une invite de texte nulle, tandis que le contenu de premier plan réel est créé sémantiquement à partir de l’instruction de texte de l’utilisateur.

L’auto-attention et l’attention croisée sont utilisées pour séparer les deux facettes de l’image (l’arrière-plan de chroma et le contenu de premier plan). L’auto-attention aide à la cohérence interne de l’objet de premier plan, tandis que l’attention croisée maintient la fidélité à l’invite de texte. Le document souligne que puisque les images d’arrière-plan sont généralement moins détaillées et mises en avant dans les générations, leur influence plus faible est relativement facile à surmonter et à remplacer par une bande de couleur pure.

Une visualisation de l'influence de l'auto-attention et de l'attention croisée dans le processus de génération de style de chroma.

Une visualisation de l’influence de l’auto-attention et de l’attention croisée dans le processus de génération de style de chroma.

Données et tests

TKG-DM a été testé en utilisant Stable Diffusion V1.5 et Stable Diffusion SDXL. Les images ont été générées à 512x512px et 1024x1024px, respectivement.

Les images ont été créées en utilisant le planificateur DDIM natif de Stable Diffusion, à une échelle de guidage de 7,5, avec 50 étapes de débruitage. La couleur de fond cible était le vert, maintenant la méthode de suppression dominante.

La nouvelle approche a été comparée à DeepFloyd, sous les paramètres utilisés pour MAGICK; au modèle de diffusion à faible rang affiné GreenBack LoRA; et également au modèle LayerDiffuse mentionné précédemment.

Pour les données, 3000 images du jeu de données MAGICK ont été utilisées.

Exemples du jeu de données MAGICK, à partir duquel 3000 images ont été curées pour les tests du nouveau système. Source: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Exemples du jeu de données MAGICK, à partir duquel 3000 images ont été curées pour les tests du nouveau système. Source: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Pour les métriques, les auteurs ont utilisé la distance de Fréchet (FID) pour évaluer la qualité de l’avant-plan. Ils ont également développé une métrique spécifique au projet appelée m-FID, qui utilise le système BiRefNet pour évaluer la qualité du masque résultant.

Comparaisons visuelles du système BiRefNet par rapport aux méthodes précédentes. Source: https://arxiv.org/pdf/2401.03407

Comparaisons visuelles du système BiRefNet par rapport aux méthodes précédentes. Source: https://arxiv.org/pdf/2401.03407

Pour tester l’alignement sémantique avec les invites de texte, les méthodes CLIP-Sentence (CLIP-S) et CLIP-Image (CLIP-I) ont été utilisées. CLIP-S évalue la fidélité de l’invite, et CLIP-I la similarité visuelle avec la vérité terrain.

Premier ensemble de résultats qualitatifs pour la nouvelle méthode, cette fois pour Stable Diffusion V1.5. Veuillez vous référer au PDF source pour une meilleure résolution.

Premier ensemble de résultats qualitatifs pour la nouvelle méthode, cette fois pour Stable Diffusion V1.5. Veuillez vous référer au PDF source pour une meilleure résolution.

Les auteurs affirment que les résultats (visualisés ci-dessus et ci-dessous, SD1.5 et SDXL, respectivement) démontrent que TKG-DM obtient de meilleurs résultats sans ingénierie d’invite ou nécessité de former ou d’affiner un modèle.

Résultats qualitatifs SDXL. Veuillez vous référer au PDF source pour une meilleure résolution.

Résultats qualitatifs SDXL. Veuillez vous référer au PDF source pour une meilleure résolution.

Ils observent que avec une invite pour inciter un fond vert dans les résultats générés, Stable Diffusion 1.5 a du mal à générer un fond propre, tandis que SDXL (bien que performant un peu mieux) produit des teintes de vert clair instables susceptibles d’interférer avec la séparation dans un processus de chroma.

Ils notent en outre que tandis que LayerDiffuse génère des arrière-plans bien séparés, il perd parfois des détails, tels que des nombres ou des lettres précises, et les auteurs attribuent cela aux limites du jeu de données. Ils ajoutent que la génération de masque échoue parfois, conduisant à des images « non découpées ».

Pour les tests quantitatifs, bien que LayerDiffuse semble avoir l’avantage en SDXL pour FID, les auteurs soulignent que cela est le résultat d’un jeu de données spécialisé qui constitue en fait un produit « cuit » et non flexible. Comme mentionné précédemment, tout objet ou classe non couvert par ce jeu de données, ou couvert de manière insuffisante, risque de ne pas fonctionner aussi bien, tandis que toute affinage supplémentaire pour accommoder de nouvelles classes impose à l’utilisateur une charge de curation et de formation.

Résultats quantitatifs des comparaisons. L'avantage apparent de LayerDiffuse, selon le document, est au prix de la flexibilité, et de la charge de curation et de formation des données.

Résultats quantitatifs des comparaisons. L’avantage apparent de LayerDiffuse, selon le document, est au prix de la flexibilité, et de la charge de curation et de formation des données.

Le document indique:

‘Les scores FID, m-FID et CLIP-I élevés de DeepFloyd reflètent sa similarité avec la vérité terrain en fonction des sorties de DeepFloyd. Cependant, cet alignement lui donne un avantage inhérent, ce qui le rend inapte en tant que référence juste pour la qualité de l’image. Son score CLIP-S plus faible indique une alignment texte plus faible par rapport aux autres modèles.

‘Dans l’ensemble, ces résultats mettent en évidence la capacité de notre modèle à générer des avant-plans de haute qualité et alignés sur le texte sans affinage, offrant une solution de génération de contenu de clé de chroma efficace.’

Enfin, les chercheurs ont mené une étude utilisateur pour évaluer l’adhérence aux invites à travers les différentes méthodes. Cent participants ont été invités à juger 30 paires d’images de chaque méthode, avec des sujets extraits à l’aide de BiRefNet et des révisions manuelles sur tous les exemples. L’approche sans formation des auteurs a été préférée dans cette étude.

Résultats de l'étude utilisateur.

Résultats de l’étude utilisateur.

TKG-DM est compatible avec le système tiers populaire ControlNet pour Stable Diffusion, et les auteurs soutiennent qu’il produit de meilleurs résultats que la capacité native de ControlNet à réaliser ce type de séparation.

Conclusion

Peut-être le constat le plus notable de ce nouveau document est l’étendue à laquelle les modèles de diffusion latente sont entrelacés, contrairement à la perception publique populaire selon laquelle ils peuvent séparer sans effort les facettes des images et des vidéos lors de la génération de nouveaux contenus.

L’étude souligne également l’étendue à laquelle la communauté de recherche et de loisirs s’est tournée vers l’affinage comme une solution post facto aux limites des modèles – une solution qui s’adressera toujours à des classes et des types d’objets spécifiques. Dans un tel scénario, un modèle affiné fonctionnera très bien sur un nombre limité de classes, ou fonctionnera tolérablement bien sur un volume beaucoup plus élevé de classes et d’objets possibles, selon des quantités plus élevées de données dans les ensembles de formation.

Par conséquent, il est rafraîchissant de voir au moins une solution qui ne repose pas sur de telles solutions laborieuses et discutables.

 

* Le tournage du film Superman de 1978, l’acteur Christopher Reeve a dû porter un costume Superman turquoise pour les prises de vues de processus bleu, afin d’éviter que le costume bleu iconique ne soit effacé. La couleur bleue du costume a été restaurée plus tard via la colorimétrie.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]