Andersons vinkel
AI-baseret objekteredigering med Google’s Imagic og Runway’s ‘Erase and Replace’

I denne uge er to nye, men modsatrettede AI-drevne grafikalgoritmer blevet præsenteret, som tilbyder nye måder for slutbrugere at foretage meget detaljerede og effektive ændringer af objekter i billeder.
Den første er Imagic, fra Google Research, i samarbejde med Israels Teknologiske Institut og Weizmann Institute of Science. Imagic tilbyder tekstbaseret, fingranuleret redigering af objekter via finjustering af diffusionsmodeller.

Ændr, hvad du vil, og lad resten være – Imagic lover fingranuleret redigering af kun de dele, du ønsker at ændre. Kilde: https://arxiv.org/pdf/2210.09276.pdf
Enhver, der nogensinde har forsøgt at ændre kun ét element i en Stable Diffusion-genreret billedrendering, ved kun alt for godt, at for hvert succesfuldt redigeret element, vil systemet ændre fem ting, du kunne lide, præcis som de var. Det er en svaghed, der i øjeblikket har mange af de mest talentfulde SD-entusiaster konstant skiftende mellem Stable Diffusion og Photoshop for at rette denne type “collateral damage”. Set fra dette synspunkt alene, synes Imagics præstationer bemærkelsesværdige.
Ved skrivningstidspunktet mangler Imagic endnu en promotionsvideo, og med tanke på Googles forsigtige holdning til at udgive ubegrænsede billedsyntheseredskaber, er det usikkert, i hvilken udstrækning, hvis overhovedet, vi får mulighed for at teste systemet.
Den anden tilbud er Runway ML’s mere tilgængelige Erase and Replace-funktion, en ny funktion i “AI Magic Tools”-sektionen af deres eksklusivt online-suite af maskinlæringsbaserede visuelle effektværktøjer.

Runway ML’s Erase and Replace-funktion, allerede set i en forhåndsvisning af et tekst-til-video-redigeringsystem. Kilde: https://www.youtube.com/watch?v=41Qb58ZPO60
Lad os se på Runways udgave først.
Erase and Replace
Ligesom Imagic, handler Erase and Replace udelukkende med stadtbilleder, selvom Runway har forhåndsvist den samme funktionalitet i et tekst-til-video-redigeringsværktøj, der endnu ikke er udgivet:

Selvom alle kan teste den nye Erase and Replace på billeder, er videoversionen endnu ikke offentligt tilgængelig. Kilde: https://twitter.com/runwayml/status/1568220303808991232
Selvom Runway ML ikke har offentliggjort detaljer om teknologierne bag Erase and Replace, antyder hastigheden, hvormed du kan erstatte en potteplante med en rimeligt overbevisende buste af Ronald Reagan, at en diffusionsmodel som Stable Diffusion (eller, langt mindre sandsynligt, en licenseret DALL-E 2) er motoren, der genopfinder objektet af din valg i Erase and Replace.

Erstatning af en potteplante med en buste af The Gipper er ikke helt så hurtig som dette, men det er ret hurtigt. Kilde: https://app.runwayml.com/
Systemet har nogle DALL-E 2-type begrænsninger – billeder eller tekst, der udløser Erase and Replace-filtrene, vil udløse en advarsel om mulig konto-suspension i tilfælde af yderligere overtrædelser – praktisk talt en kopi af OpenAI’s politik for DALL-E 2.
Mange af resultaterne mangler de typiske ru kanter af Stable Diffusion. Runway ML er investorer og forskningspartnere i SD, og det er muligt, at de har trænet en proprietær model, der er overlegen for den åbne kilde 1.4 checkpoint-vejningsfaktorer, som resten af os i øjeblikket kæmper med (som mange andre udviklingsgrupper, hobby- og professionelle, i øjeblikket træner eller finjusterer Stable Diffusion-modeller).

Erstatning af en hjemmebord med en ‘bord af is’ i Runway ML’s Erase and Replace.
Som med Imagic (se nedenfor) er Erase and Replace “objekt-orienteret”, som det var – du kan ikke bare slette en “tom” del af billedet og inpainte det med resultatet af din tekstprompt; i den situation vil systemet blot spore den nærmeste synlige objekt langs maskens sigtelinje (såsom en væg eller en tv), og anvende transformationen der.

Som navnet antyder, kan du ikke injicere objekter i tomrum i Erase and Replace. Her resulterer en forsøg på at fremkalde den mest berømte af Sith-lordene i en underlig Vader-relateret mural på tv’et, omtrent hvor “erstat”-området var tegnet.
Det er svært at sige, om Erase and Replace er forsigtig i forhold til brugen af ophavsretligt beskyttede billeder (som stadig er delvist blokeret, omend med varierende succes, i DALL-E 2), eller om modellen, der bruges i backend-renderingsmotoren, bare ikke er optimeret til den slags.

Den lidt NSFW ‘Mural of Nicole Kidman’ antyder, at den (formodentlig) diffusionsbaserede model, der er i spil, mangler DALL-E 2’s tidligere systematiske afvisning af at rendre realistiske ansigter eller racy indhold, mens resultaterne for forsøg på at fremkalde ophavsretligt beskyttede værker varierer fra det tvetydige (‘xenomorph’) til det absurd (‘the iron throne’). Indsat nederst til højre, kildebilledet.
Det ville være interessant at vide, hvilke metoder Erase and Replace bruger til at isolere de objekter, det kan erstatte. Formodentlig køres billedet gennem en eller anden afledning af CLIP, med de diskrete elementer individueret af objektgenkendelse og efterfølgende semantisk segmentering. Ingen af disse operationer fungerer nær så godt i en almindelig installation af Stable Diffusion.
Men intet er perfekt – nogle gange synes systemet at slette og ikke erstatte, selv når (som vi har set i billedet ovenfor), den underliggende renderingsmekanisme bestemt ved, hvad en tekstprompt betyder. I dette tilfælde viser det sig umuligt at omdanne et kaffebord til en xenomorph – i stedet forsvinder bare bordet.

En mere skræmmende iteration af ‘Where’s Waldo’, da Erase and Replace ikke kan producere en alien.
Erase and Replace synes at være et effektivt objekterstatningsystem med fremragende inpainting. Men det kan ikke redigere eksisterende opfattede objekter, kun erstatte dem. At ændre eksisterende billedindhold uden at kompromittere omgivende materiale er sandsynligvis en langt sværere opgave, der er forbundet med computer vision-forskningens lange kamp mod disentanglement i de populære rammeværkers forskellige latente rum.
Imagic
Det er en opgave, som Imagic løser. Den nye artikel tilbyder talrige eksempler på redigeringer, der med held ændrer enkeltdele af et billede, mens resten af billedet forbliver urørt.

I Imagic lider de ændrede billeder ikke under de karakteristiske strækninger, forvrængninger og ‘occlusion guessing’, der er typiske for deepfake-puppetry, som udnytter begrænsede priors afledt fra et enkelt billede.
Systemet anvender en tretrinsproces – tekst-embedding-optimering; model-finjustering; og endelig generering af det ændrede billede.

Imagic kodificerer den målrettede tekstprompt for at hente den oprindelige tekst-embedding, og derefter optimerer resultatet for at få inputbilledet. Derefter finjusteres den generative model til kildebilledet, med tilføjelse af en række parametre, før den underkastes den anmodede interpolation.
Ikke overraskende er rammeværket baseret på Googles Imagen-tekst-til-video-arkitektur, selvom forskerne fastslår, at systemets principper er bredt anvendelige på latente diffusionsmodeller.
Imagen anvender en tre-lags-arkitektur, snarere end den syv-lags-matrix, der anvendes til selskabets seneste tekst-til-video-iteration af softwaren. De tre distinkte moduler består af en generativ diffusionsmodel, der opererer ved 64x64px opløsning; en super-resolution-model, der opskalerer denne output til 256x256px; og en yderligere super-resolution-model til at tage output helt op til 1024×1024 opløsning.
Imagic griber ind i den tidligste fase af denne proces, hvor den optimerer den anmodede tekst-embedding ved 64px-stadiet på en Adam-optimizer med en fast læringsrate på 0,0001.

En mesterklasse i disentanglement: de slutbrugere, der har forsøgt at ændre noget så enkelt som farven på et renderet objekt i en diffusions-, GAN- eller NeRF-model, ved, hvor betydningsfuldt det er, at Imagic kan udføre sådanne transformationer uden at “rive” sammenhængen i resten af billedet.
Finjustering finder derefter sted på Imagens basismodel, for 1500 skridt per inputbillede, betinget af den reviderede embedding. Samtidig optimeres den sekundære 64px>256px-lag parallelt på det betingede billede. Forskerne bemærker, at en tilsvarende optimering for den endelige 256px>1024px-lag har “liden eller ingen” effekt på de endelige resultater, og har derfor ikke implementeret dette.
Artiklen fastslår, at optimeringsprocessen tager cirka otte minutter for hvert billede på dobbelt TPUV4-chips. Den endelige rendering finder sted i kerne-Imagen under DDIM-sampleskemaet.
På samme måde som lignende finjusteringsprocesser for Googles DreamBooth, kan de resulterende embeddings yderligere anvendes til at aktivere stilisering samt fotorealistiske redigeringer, der indeholder informationer fra den underliggende database, der driver Imagen (da, som den første kolonne nedenfor viser, kildebillederne ikke har nogen af den nødvendige indhold til at effektuere disse transformationer).

Fleksible fotorealistiske bevægelser og redigeringer kan fremkaldes via Imagic, mens de afledte og disentanglede koder, der erhverves under processen, lige så let kan anvendes til stiliseret output.
Forskerne sammenlignede Imagic med tidligere arbejder SDEdit, en GAN-baseret tilgang fra 2021, et samarbejde mellem Stanford University og Carnegie Mellon University; og Text2Live, et samarbejde fra april 2022 mellem Weizmann Institute of Science og NVIDIA.

En visuel sammenligning mellem Imagic, SDEdit og Text2Live.
Det er klart, at de tidligere tilgange kæmper, men i den nederste række, der indebærer en massiv ændring af pose, fejler de eksisterende komplet, sammenlignet med en bemærkelsesværdig succes fra Imagic.
Imagics ressourcekrav og træningstid per billede, selv om de er korte i forhold til sådanne forfølgelser, gør det til en usandsynlig inklusion i en lokal billedredigeringsapplikation på personlige computere – og det er ikke klart, i hvilken udstrækning processen med finjustering kan skaleres ned til forbruger niveauer.
Som det er nu, er Imagic et imponerende tilbud, der er bedre egnet til API’er – en miljø, hvor Google Research, der er forsigtig med kritik i forhold til at faciliterer deepfakes, måske i hvert fald er mest komfortabel med.
Offentliggjort første gang den 18. oktober 2022.












