Modèles et plateformes d’IA

Édition d’images sémantiques de haute précision avec EditGAN

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les réseaux antagonistes génératifs ou GAN ont connu de nouvelles applications dans l’industrie de l’édition d’images. Au cours des derniers mois, EditGAN gagne en popularité dans l’industrie de l’IA et du ML car c’est une méthode novatrice pour l’édition d’images sémantiques de haute précision et de haute qualité.

Nous allons discuter du modèle EditGAN en détail et vous expliquer pourquoi il pourrait s’avérer être un jalon dans l’industrie de l’édition d’images sémantiques.

Commençons. Mais avant de découvrir ce qu’est EditGAN, il est important de comprendre l’importance d’EditGAN et pourquoi il constitue un progrès significatif.

Pourquoi EditGAN ?

Bien que les architectures GAN traditionnelles aient contribué à faire progresser l’industrie de l’édition d’images basée sur l’IA, il existe certains défis majeurs pour construire une architecture GAN à partir de zéro.

  1. Pendant la phase d’entraînement, une architecture GAN nécessite une grande quantité de données étiquetées avec des annotations de segmentation sémantique.
  2. Elles ne sont capables de fournir qu’un contrôle de niveau élevé.
  3. Et souvent, elles ne font que interpoler entre les images.

On peut observer que même si les architectures GAN traditionnelles font le travail, elles ne sont pas efficaces pour un déploiement à grande échelle. L’efficacité médiocre des architectures GAN traditionnelles est la raison pour laquelle EditGAN a été introduit par NVIDIA (NVDA ) en 2022.

EditGAN est proposé comme une méthode efficace pour l’édition d’images sémantiques de haute précision et de haute qualité, avec la capacité de permettre à ses utilisateurs d’éditer des images en modifiant leurs masques de segmentation détaillés.

Le modèle EditGAN est construit sur un cadre GAN qui modèle les images et leurs segmentations sémantiques conjointement, et nécessite seulement une poignée de données étiquetées ou annotées pour l’entraînement.

L’architecture du cadre EditGAN permet au modèle d’apprendre un nombre arbitraire de vecteurs d’édition qui peuvent ensuite être appliqués directement à d’autres images avec une grande vitesse et efficacité.

Pour résumer, EditGAN est la première plate-forme d’édition d’images basée sur GAN qui offre

  1. Une édition de très haute précision.
  2. Peut fonctionner avec une poignée de données étiquetées.
  3. Peut être déployé efficacement dans des scénarios en temps réel.
  4. Permet la compositionnalité pour plusieurs éditions simultanées.
  5. Fonctionne sur les images générées par GAN, les images réelles intégrées et même les images hors domaine.

Édition d’images sémantiques de haute précision avec EditGAN

StyleGAN2, un cadre GAN d’état de l’art pour la synthèse d’images, est le principal composant de génération d’images d’EditGAN.

StyleGAN2 est un modèle génératif profond qui a été entraîné pour synthétiser des images de la plus haute qualité possible, ainsi que pour acquérir une compréhension sémantique des images modélisées.

Formation et inférence de segmentation

Le modèle EditGAN intègre une image dans l’espace latent de GAN à l’aide de l’optimisation et d’un encodeur pour effectuer la segmentation sur une nouvelle image, et pour former la branche de segmentation.

Le modèle EditGAN continue de s’appuyer sur les travaux précédents et forme un encodeur pour intégrer les images dans l’espace latent.

Utilisation de l’édition de segmentation pour trouver des sémantiques dans l’espace latent

Le but principal d’EditGAN est de tirer parti de la distribution conjointe des segmentations sémantiques et des images pour l’édition d’images de haute précision.

Différentes façons d’éditer pendant l’inférence

Les vecteurs d’édition de l’espace latent obtenus à l’aide de l’optimisation peuvent être décrits comme étant sémantiquement significatifs et sont souvent désentrelacés avec différents attributs.

Sur la base de nos connaissances actuelles, le cadre EditGAN peut être utilisé pour éditer des images de trois manières différentes.

  • Édition en temps réel avec des vecteurs d’édition

Pour les images localisées et désentrelacées, le modèle édite les images en appliquant des vecteurs d’édition appris précédemment avec différentes échelles et manipule les images à des taux interactifs.

  • Utilisation de l’affinage auto-supervisé pour l’édition basée sur les vecteurs

Pour éditer des images localisées qui ne sont pas parfaitement désentrelacées avec d’autres parties de l’image, le modèle initialise l’édition de l’image en utilisant des vecteurs d’édition appris précédemment et supprime les artefacts d’édition en effectuant quelques étapes d’optimisation supplémentaires pendant le temps de test.

  • Édition basée sur l’optimisation

Pour effectuer des éditions à grande échelle et spécifiques à l’image, le modèle effectue l’optimisation à partir du début, car les vecteurs d’édition ne peuvent pas être utilisés pour effectuer ces types de transferts vers d’autres images.

Mise en œuvre

Le cadre EditGAN est évalué sur des images réparties sur quatre catégories : Voitures, Oiseaux, Chats et Visages.

Résultats

Résultats qualitatifs

Résultats dans le domaine

L’image ci-dessus démontre les performances du cadre EditGAN lorsqu’il applique les vecteurs d’édition appris précédemment sur des images nouvelles et affine les images en utilisant 30 étapes d’optimisation.

Résultats quantitatifs

Pour mesurer les capacités d’édition d’images d’EditGAN de manière quantitative, le modèle utilise un benchmark d’édition de sourire qui a été introduit pour la première fois par MaskGAN.

  • Correction sémantique

Le modèle utilise un classificateur d’attribut de sourire pré-entraîné pour mesurer si les visages dans les images affichent des expressions de sourire après édition.

  • Qualité d’image au niveau de la distribution

La distance de Kernel Inception ou KID et la distance de Fréchet Inception ou FID sont calculées entre le jeu de test CelebA et 400 images éditées de test.

  • Préservation de l’identité

La capacité du modèle à préserver l’identité des sujets lors de l’édition de l’image est mesurée en utilisant un réseau de extraction de fonctionnalités ArcFace pré-entraîné.

Le tableau ci-dessus compare les performances du cadre EditGAN avec d’autres modèles de référence sur le benchmark d’édition de sourire.

Limitations

Puisque EditGAN est basé sur le cadre GAN, il a la même limitation que tout autre modèle GAN : il ne peut fonctionner qu’avec des images qui peuvent être modélisées par GAN.

Conclusion

L’une des principales raisons pour lesquelles GAN n’est pas une norme industrielle dans le domaine de l’édition d’images est due à sa limite pratique.

EditGAN vise à résoudre les problèmes présentés par les cadres GAN conventionnels, et il tente de devenir une méthode efficace pour l’édition d’images sémantiques de haute qualité et de haute précision.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.