Angle d’Anderson

Édition d’objets assistée par IA avec Imagic de Google et « Erase and Replace » de Runway

mm
Ajouter Unite.AI à vos sources préférées sur Google

Cette semaine, deux nouveaux algorithmes graphiques pilotés par l’IA, mais contrastés, offrent des moyens novateurs aux utilisateurs finaux d’apporter des modifications très granulaires et efficaces aux objets présents sur les photos.

La première est Imagic, issu de Google Research, en collaboration avec l’Israel Institute of Technology et le Weizmann Institute of Science. Imagic propose une édition d’objets conditionnée par le texte, à fine granularité, via le fine‑tuning de modèles de diffusion.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Quiconque a déjà tenté de modifier un seul élément lors d’un re‑rendu Stable Diffusion sait trop bien que, pour chaque modification réussie, le système altère cinq éléments que vous aimiez tels quels. C’est une lacune qui pousse aujourd’hui de nombreux passionnés de SD à passer constamment de Stable Diffusion à Photoshop pour corriger ce type de « dommages collatéraux ». Dès ce point de vue, les performances d’Imagic semblent remarquables.

Au moment de la rédaction, Imagic ne dispose pas encore d’une vidéo promotionnelle et, compte tenu de l’attitude circonspecte de Google vis‑à‑vis de la diffusion d’outils de synthèse d’image sans restriction, il est incertain dans quelle mesure, le cas échéant, nous pourrons tester le système.

La seconde proposition est la fonction Erase and Replace de Runway ML, plus accessible, une nouvelle fonctionnalité de la section « AI Magic Tools » de sa suite exclusivement en ligne d’utilitaires d’effets visuels basés sur l’apprentissage automatique.

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Runway ML’s Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Examinons d’abord la sortie de Runway.

Erase and Replace

Tout comme Imagic, Erase and Replace ne traite que des images fixes, bien que Runway ait prévisualisé la même fonctionnalité dans une solution d’édition texte‑à‑vidéo qui n’est pas encore publiée :

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Bien que Runway ML n’ait pas publié les détails techniques d’Erase and Replace, la rapidité avec laquelle vous pouvez remplacer une plante d’intérieur par un buste raisonnablement convaincant de Ronald Reagan suggère qu’un modèle de diffusion tel que Stable Diffusion (ou, bien moins probable, un DALL‑E 2 sous licence) est le moteur qui recrée l’objet de votre choix dans Erase and Replace.

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

Replacing a house plant with a bust of The Gipper isn’t quite as fast as this, but it’s pretty fast. Source: https://app.runwayml.com/

Le système comporte certaines restrictions de type DALL‑E 2 – les images ou textes qui déclenchent les filtres Erase and Replace généreront un avertissement concernant une éventuelle suspension de compte en cas de nouvelles infractions – pratiquement un clone standard des politiques d’OpenAI pour DALL‑E 2.

De nombreux résultats manquent des bords rugueux typiques de Stable Diffusion. Runway ML est investisseur et partenaire de recherche dans SD, et il est possible qu’ils aient entraîné un modèle propriétaire supérieur aux poids checkpoint open‑source 1.4 que le reste d’entre nous manipule actuellement (tout comme de nombreux autres groupes de développement, amateurs ou professionnels, entraînent ou ajustent actuellement des modèles Stable Diffusion).

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

Substituting a domestic table for a ‘table made of ice’ in Runway ML’s Erase and Replace.

Comme pour Imagic (voir ci‑dessous), Erase and Replace est « orienté objet » – vous ne pouvez pas simplement effacer une partie « vide » de l’image et la remplir avec le résultat de votre invite texte ; dans ce cas, le système trace simplement l’objet apparent le plus proche le long de la ligne de visée du masque (comme un mur ou une télévision) et y applique la transformation.

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

As the name indicates, you can’t inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the ‘replace’ area was drawn.

Il est difficile de déterminer si Erase and Replace se montre évasif quant à l’utilisation d’images protégées par le droit d’auteur (qui restent largement bloquées, avec un succès variable, dans DALL‑E 2), ou si le modèle utilisé dans le moteur de rendu en arrière‑plan n’est tout simplement pas optimisé pour ce type de tâche.

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

The slightly NSFW ‘Mural of Nicole Kidman’ indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2’s former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous (‘xenomorph’) to the absurd (‘the iron throne’). Inset bottom right, the source picture.

Il serait intéressant de savoir quelles méthodes Erase and Replace utilise pour isoler les objets qu’il peut remplacer. On suppose que l’image est passée par une dérivation de CLIP, les éléments discrets étant identifiés par reconnaissance d’objets puis segmentation sémantique. Aucune de ces opérations ne fonctionne aussi bien dans une installation « standard » de Stable Diffusion.

Mais rien n’est parfait – parfois le système semble effacer sans remplacer, même lorsque (comme nous l’avons vu sur l’image ci‑dessus), le mécanisme de rendu sous‑jacent comprend clairement ce que signifie une invite texte. Dans ce cas, il est impossible de transformer une table basse en xénomorphe – la table disparaît simplement.

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

A scarier iteration of ‘Where’s Waldo’, as Erase and Replace fails to produce an alien.

Erase and Replace apparaît comme un système de substitution d’objets efficace, avec un inpainting excellent. Cependant, il ne peut pas modifier les objets perçus existants, mais seulement les remplacer. Modifier réellement le contenu d’une image existante sans compromettre le matériau ambiant est sans doute une tâche bien plus difficile, liée à la longue lutte du secteur de la recherche en vision par ordinateur pour le désentrelacement dans les différents espaces latents des cadres populaires.

Imagic

C’est une tâche que Imagic relève. Le nouvel article propose de nombreux exemples de retouches qui modifient avec succès des facettes individuelles d’une photo tout en laissant le reste de l’image intact.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and ‘occlusion guessing’ characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

Le système utilise un processus en trois étapes : optimisation de l’incorporation de texte ; fine‑tuning du modèle ; et, enfin, génération de l’image modifiée.

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Imagic encodes the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Inattendu, le cadre repose sur l’architecture texte‑à‑vidéo Imagen de Google, bien que les chercheurs déclarent que les principes du système sont largement applicables aux modèles de diffusion latente.

Imagen utilise une architecture à trois niveaux, plutôt que le tableau à sept niveaux employé pour la version texte‑à‑vidéo plus récente de la société text‑to‑video iteration du logiciel. Les trois modules distincts comprennent un modèle de diffusion génératif fonctionnant à une résolution de 64 × 64 px ; un modèle de super‑résolution qui agrandit cette sortie à 256 × 256 px ; et un modèle de super‑résolution supplémentaire qui porte la sortie jusqu’à une résolution de 1024 × 1024 px.

Imagic intervient dès la première étape de ce processus, en optimisant l’incorporation de texte demandée au stade 64 px avec un optimiseur Adam à un taux d’apprentissage fixe de 0,0001.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without ‘tearing apart’ the consistency of the rest of the image.

Le fine‑tuning s’effectue ensuite sur le modèle de base d’Imagen, pendant 1500 pas par image d’entrée, conditionné sur l’incorporation révisée. Simultanément, la couche secondaire 64 px > 256 px est optimisée en parallèle sur l’image conditionnée. Les chercheurs notent qu’une optimisation similaire pour la couche finale 256 px > 1024 px a « peu ou pas d’effet » sur les résultats finaux, et n’a donc pas été implémentée.

L’article indique que le processus d’optimisation dure environ huit minutes par image sur deux puces TPUV4. Le rendu final s’effectue dans le cœur d’Imagen selon le schéma d’échantillonnage DDIM.

En commun avec les processus de fine‑tuning similaires pour le DreamBooth de Google, les incorporations résultantes peuvent également être utilisées pour la stylisation, ainsi que pour des retouches photoréalistes contenant des informations tirées de la vaste base de données sous‑jacente alimentant Imagen (puisque, comme le montre la première colonne ci‑dessous, les images sources ne contiennent aucun des contenus nécessaires à ces transformations).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Les chercheurs ont comparé Imagic à des travaux antérieurs tels que SDEdit, une approche basée sur les GAN de 2021, fruit d’une collaboration entre l’Université Stanford et l’Université Carnegie Mellon ; et Text2Live, une collaboration d’avril 2022 entre le Weizmann Institute of Science et NVIDIA.

A visual comparison between Imagic, SDEdit and Text2Live.

A visual comparison between Imagic, SDEdit and Text2Live.

Il apparaît clairement que les approches précédentes peinent, mais dans la rangée du bas, qui implique une modification massive de pose, les concurrents échouent complètement à reconstituer le matériau source, contrairement à un succès notable d’Imagic.

Les exigences en ressources d’Imagic et le temps d’entraînement par image, bien que courts au regard de telles entreprises, en font une inclusion improbable dans une application locale d’édition d’images sur des ordinateurs personnels – et il n’est pas clair dans quelle mesure le processus de fine‑tuning pourrait être réduit à un niveau consommateur.

En l’état actuel, Imagic est une offre impressionnante, davantage adaptée aux API – un environnement que Google Research, réticent aux critiques concernant la facilitation du deepfake, pourrait tout de même privilégier.

 

Première publication le 18 octobre 2022.

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai