Ángulo de Anderson

Edición de objetos asistida por IA con Imagic de Google y ‘Erase and Replace’ de Runway

mm
Añade Unite.AI a tus fuentes preferidas en Google

Esta semana, dos nuevos algoritmos gráficos impulsados por IA, pero contrastantes, están ofreciendo formas novedosas para que los usuarios finales realicen cambios altamente granulares y efectivos en los objetos de las fotos.

El primero es Imagic, de Google Research, en asociación con el Instituto Tecnológico de Israel y el Instituto Weizmann de Ciencia. Imagic ofrece edición de objetos condicionada por texto y de gran detalle mediante el ajuste fino de modelos de difusión.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Cualquiera que haya intentado cambiar solo un elemento en una re‑renderización de Stable Diffusion sabrá muy bien que, por cada edición exitosa, el sistema altera cinco cosas que le gustaban tal como estaban. Es una limitación que actualmente hace que muchos de los entusiastas más talentosos de SD pasen constantemente entre Stable Diffusion y Photoshop para corregir este tipo de ‘daño colateral’. Desde este punto de vista, los logros de Imagic parecen notables.

Al momento de redactar este artículo, Imagic aún no cuenta con un video promocional y, dada la actitud cautelosa de Google respecto a la liberación de herramientas de síntesis de imágenes sin restricciones, es incierto hasta qué punto, si es que lo habrá, tendremos la oportunidad de probar el sistema.

La segunda oferta es la herramienta Erase and Replace de Runway ML, algo más accesible, una nueva función en la sección ‘AI Magic Tools’ de su suite exclusivamente en línea de utilidades de efectos visuales basados en aprendizaje automático.

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Runway ML’s Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Veamos primero la presentación de Runway.

Borrar y Reemplazar

Al igual que Imagic, Borrar y Reemplazar se ocupa exclusivamente de imágenes estáticas, aunque Runway ha mostrado la misma funcionalidad en una solución de edición de texto a video que aún no ha sido lanzada:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Aunque Runway ML no ha divulgado detalles sobre las tecnologías detrás de Borrar y Reemplazar, la velocidad con la que puedes sustituir una planta de interior por un busto razonablemente convincente de Ronald Reagan sugiere que un modelo de difusión como Stable Diffusion (o, mucho menos probable, un DALL‑E 2 licenciado) es el motor que está reinventando el objeto que elijas en Borrar y Reemplazar.

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

Replacing a house plant with a bust of The Gipper isn’t quite as fast as this, but it’s pretty fast. Source: https://app.runwayml.com/

El sistema tiene algunas restricciones tipo DALL‑E 2: las imágenes o textos que activen los filtros de Borrar y Reemplazar generarán una advertencia sobre una posible suspensión de la cuenta en caso de infracciones adicionales, prácticamente una copia estándar de las políticas continuas de OpenAI para DALL‑E 2.

Muchos de los resultados carecen de los típicos bordes ásperos de Stable Diffusion. Runway ML son inversores y socios de investigación en SD, y es posible que hayan entrenado un modelo propietario que supera a los pesos de punto de control 1.4 de código abierto con los que el resto de nosotros estamos lidiando actualmente (ya que muchos otros grupos de desarrollo, tanto aficionados como profesionales, están entrenando o ajustando finamente modelos de Stable Diffusion).

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

Substituting a domestic table for a ‘table made of ice’ in Runway ML’s Erase and Replace.

Al igual que Imagic (ver más abajo), Borrar y Reemplazar es ‘orientado a objetos’, por así decirlo: no puedes simplemente borrar una parte ‘vacía’ de la imagen e inpaintarla con el resultado de tu indicación de texto; en ese caso, el sistema simplemente trazará el objeto aparente más cercano a lo largo de la línea de visión de la máscara (como una pared o un televisor) y aplicará la transformación allí.

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

As the name indicates, you can’t inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the ‘replace’ area was drawn.

Es difícil determinar si Borrar y Reemplazar está siendo evasivo respecto al uso de imágenes con derechos de autor (que aún están mayormente bloqueadas, aunque con éxito variable, en DALL‑E 2), o si el modelo utilizado en el motor de renderizado de fondo simplemente no está optimizado para ese tipo de situaciones.

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

The slightly NSFW ‘Mural of Nicole Kidman’ indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2’s former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous (‘xenomorph’) to the absurd (‘the iron throne’). Inset bottom right, the source picture.

Sería interesante saber qué métodos utiliza Borrar y Reemplazar para aislar los objetos que puede sustituir. Presumiblemente la imagen se procesa mediante alguna derivación de CLIP, con los elementos discretos individualizados mediante reconocimiento de objetos y segmentación semántica posterior. Ninguna de estas operaciones funciona ni de cerca tan bien en una instalación corriente de Stable Diffusion.

Pero nada es perfecto: a veces el sistema parece borrar y no reemplazar, incluso cuando (como hemos visto en la imagen anterior) el mecanismo de renderizado subyacente claramente entiende lo que significa una indicación de texto. En este caso, resulta imposible convertir una mesa de café en un xenomorfo; la mesa simplemente desaparece.

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

A scarier iteration of ‘Where’s Waldo’, as Erase and Replace fails to produce an alien.

Borrar y Reemplazar parece ser un sistema eficaz de sustitución de objetos, con un inpainting excelente. Sin embargo, no puede editar objetos percibidos existentes, solo reemplazarlos. Alterar realmente el contenido de una imagen existente sin comprometer el material ambiental es, indudablemente, una tarea mucho más difícil, vinculada a la larga lucha del sector de investigación en visión por computadora por lograr el desentrelazado en los diversos espacios latentes de los marcos populares.

Imagic

Es una tarea que Imagic aborda. El nuevo artículo ofrece numerosos ejemplos de ediciones que modifican con éxito facetas individuales de una foto mientras dejan el resto de la imagen intacto.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and ‘occlusion guessing’ characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

El sistema emplea un proceso de tres etapas: optimización de la incrustación de texto; ajuste fino del modelo; y, finalmente, la generación de la imagen modificada.

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Imagic encodes the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

No es sorprendente que el marco se base en la arquitectura de texto a video Imagen de Google, aunque los investigadores afirman que los principios del sistema son aplicables en general a los modelos de difusión latente.

Imagen utiliza una arquitectura de tres niveles, en lugar de la matriz de siete niveles empleada para la iteración más reciente de la compañía de texto a video del software. Los tres módulos distintos comprenden un modelo generativo de difusión que opera a una resolución de 64 × 64 px; un modelo de super‑resolución que escala esta salida a 256 × 256 px; y un modelo adicional de super‑resolución que lleva la salida hasta una resolución de 1024 × 1024 px.

Imagic interviene en la etapa más temprana de este proceso, optimizando la incrustación de texto solicitada en la fase de 64 px con un optimizador Adam a una tasa de aprendizaje estática de 0,0001.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without ‘tearing apart’ the consistency of the rest of the image.

Luego, el ajuste fino se lleva a cabo sobre el modelo base de Imagen, durante 1500 pasos por imagen de entrada, condicionado a la incrustación revisada. Simultáneamente, la capa secundaria 64 px > 256 px se optimiza en paralelo sobre la imagen condicionada. Los investigadores observan que una optimización similar para la capa final 256 px > 1024 px tiene ‘poco o ningún efecto’ en los resultados finales, por lo que no la han implementado.

El artículo indica que el proceso de optimización lleva aproximadamente ocho minutos por imagen en chips TPUV4 gemelos. El render final se realiza en el núcleo de Imagen bajo el esquema de muestreo DDIM.

Al igual que con procesos de ajuste fino similares para DreamBooth de Google, las incrustaciones resultantes pueden usarse también para impulsar la estilización, así como ediciones fotorrealistas que contienen información extraída de la amplia base de datos subyacente que alimenta Imagen (ya que, como muestra la primera columna a continuación, las imágenes de origen no poseen el contenido necesario para efectuar estas transformaciones).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Los investigadores compararon Imagic con trabajos previos SDEdit, un enfoque basado en GAN de 2021, una colaboración entre la Universidad de Stanford y la Universidad Carnegie Mellon; y Text2Live, una colaboración de abril de 2022 entre el Instituto Weizmann de Ciencia y NVIDIA.

A visual comparison between Imagic, SDEdit and Text2Live.

A visual comparison between Imagic, SDEdit and Text2Live.

Está claro que los enfoques anteriores están teniendo dificultades, pero en la fila inferior, que implica introducir un cambio masivo de postura, los competidores fallan por completo en reconfigurar el material de origen, en contraste con el notable éxito de Imagic.

Los requisitos de recursos y el tiempo de entrenamiento por imagen de Imagic, aunque breves según los estándares de estas investigaciones, hacen que sea una inclusión poco probable en una aplicación local de edición de imágenes en ordenadores personales, y no está claro hasta qué punto el proceso de ajuste fino podría reducirse a niveles de consumo.

Tal como está, Imagic es una oferta impresionante que se adapta mejor a APIs, un entorno con el que Google Research, reacio a las críticas por facilitar la creación de deepfakes, probablemente se sienta más cómodo.

 

Primera publicación 18 de octubre de 2022.

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai