Andersons vinkel

AI-assisteret objektredigering med Googles Imagic og Runways ‘Erase and Replace’

mm
Føj Unite.AI til dine foretrukne kilder på Google

Denne uge introducerer to nye, men kontrasterende AI-drevne grafikalgoritmer, som giver brugerne nye måder at foretage ekstremt detaljerede og effektive ændringer af objekter i fotos.

Den første er Imagic, fra Google Research i samarbejde med Israels Institut for Teknologi og Weizmann Institute of Science. Imagic tilbyder tekstbetinget, fin‑granulær redigering af objekter via finjustering af diffusionsmodeller.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Alle, der nogensinde har forsøgt at ændre kun ét element i en genrendering med Stable Diffusion, ved alt for godt, at for hver vellykket redigering ændrer systemet fem andre elementer, som man var tilfreds med. Det er en svaghed, som får mange af de mest talentfulde SD‑entusiaster til konstant at skifte mellem Stable Diffusion og Photoshop for at rette denne form for “bivirkninger”. På dette grundlag alene virker Imagic’s resultater bemærkelsesværdige.

På tidspunktet for skrivningen har Imagic endnu ikke en promotionsvideo, og i lyset af Googles forsigtige holdning til frigivelse af ubegrænsede billedsynteseredskaber er det usikkert, i hvilken grad vi overhovedet får mulighed for at teste systemet.

Den anden løsning er Runway ML’s mere tilgængelige Erase and Replace-funktion, en ny funktion i “AI Magic Tools”-sektionen af deres udelukkende online suite af maskinlæringsbaserede visuelle effekter.

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Runway ML’s Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Lad os først se på Runway’s udgave.

Slet og Erstat

Ligesom Imagic beskæftiger Slet og Erstat sig udelukkende med stillbilleder, selvom Runway har vist den samme funktion i en tekst‑til‑video‑redigeringsløsning, som endnu ikke er udgivet:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Selvom Runway ML ikke har frigivet detaljer om teknologierne bag Slet og Erstat, tyder hastigheden, hvormed du kan erstatte en stueplante med en rimelig overbevisende statue af Ronald Reagan, på at en diffusionsmodel som Stable Diffusion (eller langt mindre sandsynligt, en licenseret DALL‑E 2) er motoren, der genopfinder det valgte objekt i Slet og Erstat.

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

Replacing a house plant with a bust of The Gipper isn’t quite as fast as this, but it’s pretty fast. Source: https://app.runwayml.com/

Systemet har visse DALL‑E 2‑lignende begrænsninger – billeder eller tekst, der udløser Slet og Erstat‑filtrene, vil udløse en advarsel om mulig kontosuspension ved yderligere overtrædelser – i praksis en boilerplate‑klon af OpenAI’s løbende politikker for DALL‑E 2.

Mange af resultaterne mangler de typiske ru kanter fra Stable Diffusion. Runway ML er investorer og forskningspartnere i SD, og det er muligt, at de har trænet en proprietær model, der er overlegen i forhold til de åbne 1.4‑checkpoint‑vægte, som resten af os kæmper med (ligesom mange andre udviklingsgrupper, hobbyister og professionelle, i øjeblikket træner eller finjusterer Stable Diffusion‑modeller).

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

Substituting a domestic table for a ‘table made of ice’ in Runway ML’s Erase and Replace.

Som med Imagic (se nedenfor) er Slet og Erstat “objekt‑orienteret” – du kan ikke blot slette en “tom” del af billedet og udfylde den med resultatet af din tekstprompt; i så fald vil systemet blot følge den nærmeste synlige genstand langs maskens synslinje (såsom en væg eller et fjernsyn) og anvende transformationen dér.

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

As the name indicates, you can’t inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the ‘replace’ area was drawn.

Det er svært at afgøre, om Slet og Erstat er tilbageholdende med hensyn til brug af ophavsretligt beskyttede billeder (som stadig i vid udstrækning er blokeret, omend med varierende succes, i DALL‑E 2), eller om den bagvedliggende render‑engine blot ikke er optimeret til den slags indhold.

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

The slightly NSFW ‘Mural of Nicole Kidman’ indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2’s former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous (‘xenomorph’) to the absurd (‘the iron throne’). Inset bottom right, the source picture.

Det ville være interessant at vide, hvilke metoder Slet og Erstat bruger til at isolere de objekter, den kan erstatte. Formodentlig bliver billedet kørt gennem en afledning af CLIP, hvor de enkelte elementer individuelt identificeres via objektgenkendelse og efterfølgende semantisk segmentering. Ingen af disse operationer fungerer lige så godt i en standardinstallation af Stable Diffusion.

Men intet er perfekt – nogle gange ser det ud til, at systemet sletter uden at erstatte, selv når (som vi har set i billedet ovenfor) den underliggende render‑mekanisme tydeligt forstår, hvad en tekstprompt betyder. I dette tilfælde er det umuligt at forvandle et sofabord til en xenomorph – i stedet forsvinder bordet simpelthen.

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

A scarier iteration of ‘Where’s Waldo’, as Erase and Replace fails to produce an alien.

Slet og Erstat fremstår som et effektivt objekt‑substitutionssystem med fremragende inpainting. Det kan dog ikke redigere allerede eksisterende opfattede objekter, men kun erstatte dem. At ændre eksisterende billedindhold uden at gå på kompromis med det omgivende materiale er uden tvivl en langt sværere opgave, som er tæt forbundet med computer‑visionsforskningens lange kamp for disentanglement i de forskellige latente rum i de populære rammeværk.

Imagic

Det er en opgave, som Imagic adresserer. Det nye papir viser adskillige eksempler på redigeringer, der med succes ændrer enkelte dele af et foto, mens resten af billedet forbliver uberørt.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and ‘occlusion guessing’ characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

Systemet anvender en tre‑trins proces – optimering af tekst‑embedding; finjustering af modellen; og til sidst generering af det redigerede billede.

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Imagic encodes the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Det er ikke overraskende, at rammeværket er baseret på Googles Imagen tekst‑til‑video‑arkitektur, selvom forskerne påpeger, at principperne i systemet bredt kan anvendes på latente diffusionsmodeller.

Imagen bruger en tre‑lags arkitektur, i modsætning til den syv‑lags struktur, der anvendes i virksomhedens nyere tekst‑til‑video‑iteration af softwaren. De tre separate moduler udgør en generativ diffusionsmodel med 64 × 64 px opløsning; en super‑resolution‑model, der opskalerer dette output til 256 × 256 px; samt en yderligere super‑resolution‑model, der bringer output op til 1024 × 1024 px.

Imagic griber ind på det tidligste trin i denne proces, hvor den optimerer den ønskede tekst‑embedding på 64 px‑stadiet med en Adam‑optimizer ved en statisk læringsrate på 0,0001.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without ‘tearing apart’ the consistency of the rest of the image.

Finjusteringen foregår derefter på Imagen’s grundmodel, i 1500 trin pr. input‑billede, betinget af den reviderede embedding. Samtidig optimeres det sekundære 64 px>256 px‑lag parallelt på det betingede billede. Forskerne bemærker, at en tilsvarende optimering af det endelige 256 px>1024 px‑lag har “meget lille eller ingen effekt” på de endelige resultater, og har derfor ikke implementeret dette.

Papiret angiver, at optimeringsprocessen tager cirka otte minutter pr. billede på to TPU‑V4-chips. Den endelige rendering foregår i Imagen‑kernen under DDIM‑sample‑skemaet.

I lighed med lignende finjusteringsprocesser for Googles DreamBooth, kan de resulterende embeddings også bruges til stilisering samt fotorealistiske redigeringer, der trækker på information fra den bredere underliggende database, som driver Imagen (da, som den første kolonne nedenfor viser, indeholder kildebillederne ikke noget af det nødvendige indhold til at udføre disse transformationer).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Forskerne sammenlignede Imagic med tidligere værker SDEdit, en GAN‑baseret tilgang fra 2021, et samarbejde mellem Stanford University og Carnegie Mellon University; samt Text2Live, et samarbejde fra april 2022 mellem Weizmann Institute of Science og NVIDIA.

A visual comparison between Imagic, SDEdit and Text2Live.

A visual comparison between Imagic, SDEdit and Text2Live.

Det er tydeligt, at de tidligere tilgange kæmper, men i den nederste række, som involverer en massiv pose‑ændring, fejler de etablerede metoder fuldstændigt i at rekonstruere kilde­materialet, mens Imagic opnår en markant succes.

Imagic’s ressourcekrav og træningstid pr. billede er, selvom de er korte efter standarderne for sådanne forsøg, en usandsynlig tilføjelse til en lokal billedredigeringsapplikation på personlige computere – og det er uvist, i hvilken grad finjusteringsprocessen kan skaleres ned til forbruger‑niveau.

Som det står nu, er Imagic et imponerende tilbud, der er bedre egnet til API’er – et miljø, som Google Research, som er tilbageholdende med kritik vedrørende muliggørelse af deepfakes, i hvert fald kan føle sig mest komfortabel med.

 

Først offentliggjort 18. oktober 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai