Andersons vinkel

AI-basert objekteredigering med Google’s Imagic og Runway’s ‘Erase and Replace’

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I denne uken har to nye, men motsatte, AI-drevne grafikkalgoritmer tilbudt nye måter for sluttbrukere å gjøre svært detaljerte og effektive endringer i objekter i bilder.

Den første er Imagic, fra Google Research, i samarbeid med Israels teknologiinstitutt og Weizmann Institute of Science. Imagic tilbyr tekst-betinget, fin-granet redigering av objekter via finjustering av diffusjonsmodeller.

Endre hva du vil, og la resten være – Imagic lover granulert redigering av bare de delene du ønsker å endre. Kilde: https://arxiv.org/pdf/2210.09276.pdf

Endre hva du vil, og la resten være – Imagic lover granulert redigering av bare de delene du ønsker å endre. Kilde: https://arxiv.org/pdf/2210.09276.pdf

Alle som har prøvd å endre bare ett element i en Stable Diffusion-omrendring, vil vite altfor godt at for hvert vellykket redigering, vil systemet endre fem ting som du likte akkurat slik de var. Dette er en svakhet som for tiden har mange av de mest talentfulle SD-entusiastene konstant til å shuffle mellom Stable Diffusion og Photoshop, for å fikse denne type “collateral damage”. Fra dette synspunktet alene, ser Imagics prestasjoner ut til å være merkbare.

Ved skrivningstidspunktet, mangler Imagic ennå en promotervideo, og, gitt Googles forsiktige holdning til å slippe ut ubegrensede bilde-synteseverktøy, er det usikkert i hvilken utstrekning, hvis noen, vi kommer til å få mulighet til å teste systemet.

Det andre tilbudet er Runway MLs mer tilgjengelige Erase and Replace-funksjon, en ny funksjon i “AI Magic Tools”-delen av deres eksklusivt online-suiter av maskinlæringsbaserte visuelle effektverktøy.

Runway MLs Erase and Replace-funksjon, allerede sett i en forhåndsvisning for en tekst-til-video-redigeringsløsning. Kilde: https://www.youtube.com/watch?v=41Qb58ZPO60

Runway MLs Erase and Replace-funksjon, allerede sett i en forhåndsvisning for en tekst-til-video-redigeringsløsning. Kilde: https://www.youtube.com/watch?v=41Qb58ZPO60

La oss se på Runways utgave først.

Erase and Replace

Like Imagic, Erase and Replace omhandler eksklusivt stillbilder, selv om Runway har forhåndsviset samme funksjonalitet i en tekst-til-video-redigeringsløsning som ikke er utgitt ennå:

Selv om alle kan teste ut den nye Erase and Replace på bilder, er videoversjonen ikke ennå offentlig tilgjengelig. Kilde: https://twitter.com/runwayml/status/1568220303808991232

Selv om alle kan teste ut den nye Erase and Replace på bilder, er videoversjonen ikke ennå offentlig tilgjengelig. Kilde: https://twitter.com/runwayml/status/1568220303808991232

Runway ML har ikke utgitt detaljer om teknologiene bak Erase and Replace, men hastigheten med hvilken du kan erstatte en husplante med en rimelig overbevisende buste av Ronald Reagan, tyder på at en diffusjonsmodell som Stable Diffusion (eller, langt mindre sannsynlig, en lisensiert DALL-E 2) er motoren som gjenskaper objektet ditt i Erase and Replace.

Erstatte en husplante med en buste av The Gipper, ikke helt like raskt, men ganske raskt. Kilde: https://app.runwayml.com/

Erstatte en husplante med en buste av The Gipper, ikke helt like raskt, men ganske raskt. Kilde: https://app.runwayml.com/

Systemet har noen DALL-E 2-liknende begrensninger – bilder eller tekst som utløser Erase and Replace-filtrene, vil utløse en advarsel om mulig konto-suspensjon i tilfelle av ytterligere overtredelser – praktisk talt en kopi av OpenAIs politikk for DALL-E 2.

Mange av resultater mangler de typiske ruvende kantene til Stable Diffusion. Runway ML er investorer og forskningspartnere i SD, og det er mulig at de har trent en proprietær modell som er overlegen den åpne kildekode 1.4 checkpoint-vektene som resten av oss for tiden sliter med (som mange andre utviklingsgrupper, hobby- og profesjonelle alike, for tiden trener eller finjusterer Stable Diffusion-modeller).

Erstatte en hjemmebord med en 'bord av is' i Runway MLs Erase and Replace.

Erstatte en hjemmebord med en ‘bord av is’ i Runway MLs Erase and Replace.

Som med Imagic (se under), er Erase and Replace ‘objekt-orientert’, som det være – du kan ikke bare slette en ‘tom’ del av bildet og inpainte den med resultatet av din tekstprompt; i den scenarioen, vil systemet bare spore den nærmeste synlige objektet langs maskens linje-syn, og anvende transformasjonen der.

Som navnet indikerer, kan du ikke injisere objekter i tom rom i Erase and Replace. Her, et forsøk på å fremkalle den mest berømte av Sith-herrene, resulterer i en merkelig Vader-relatert mural på TV-en, omtrent der 'erstatte'-området var tegnet.

Som navnet indikerer, kan du ikke injisere objekter i tom rom i Erase and Replace. Her, et forsøk på å fremkalle den mest berømte av Sith-herrene, resulterer i en merkelig Vader-relatert mural på TV-en, omtrent der ‘erstatte’-området var tegnet.

Det er vanskelig å si om Erase and Replace er forsiktig i forhold til bruk av opphavsrettslige bilder (som fortsatt er i stor grad hindret, om enn med varierende suksess, i DALL-E 2), eller om modellen som brukes i bakende rendering-motoren ikke er optimalisert for den type ting.

Den litt NSFW 'Mural av Nicole Kidman' indikerer at den (antagelig) diffusjonsbaserte modellen i hånden mangler DALL-E 2s tidligere systematisk avvisning av å rendre realistiske ansikter eller racy innhold, mens resultater for forsøk på å fremkalle opphavsrettslige verk varierer fra det tvetydige ('xenomorph') til det absurde ('the iron throne'). Innsatt nederst til høyre, kildebildet.

Den litt NSFW ‘Mural av Nicole Kidman’ indikerer at den (antagelig) diffusjonsbaserte modellen i hånden mangler DALL-E 2s tidligere systematisk avvisning av å rendre realistiske ansikter eller racy innhold, mens resultater for forsøk på å fremkalle opphavsrettslige verk varierer fra det tvetydige (‘xenomorph’) til det absurde (‘the iron throne’). Innsatt nederst til høyre, kildebildet.

Det ville være interessant å vite hva metoder Erase and Replace bruker for å isolere objektene som den kan erstatte. Antagelig kjøres bildet gjennom en eller annen variasjon av CLIP, med de diskrete elementene individuert av objektgjenkjenning og påfølgende semantisk segmentering. Ingen av disse operasjonene fungerer like bra i en vanlig installasjon av Stable Diffusion.

Men ingenting er perfekt – noen ganger ser systemet ut til å slette og ikke erstatte, selv når (som vi har sett i bildet over), den underliggende rendering-mekanismen definitivt vet hva en tekstprompt betyr. I dette tilfellet, viser det seg å være umulig å omdanne et kaffebord til en xenomorph – heller, forsvinner bare bordet.

En skremmende iterasjon av 'Where's Waldo', da Erase and Replace feiler i å produsere en alien.

En skremmende iterasjon av ‘Where’s Waldo’, da Erase and Replace feiler i å produsere en alien.

Erase and Replace ser ut til å være et effektivt objekt-erstatningssystem, med utmerket inpainting. Imidlertid kan det ikke redigere eksisterende oppfattede objekter, men bare erstatte dem. Å faktisk endre eksisterende bildeinnhold uten å kompromittere omgivelsesmateriale, er antagelig en langt harder oppgave, bundet opp med datavitskapsforskningens lange kamp mot disentanglement i de ulike latente rommene til de populære rammeverkene.

Imagic

Det er en oppgave som Imagic løser. Den nye artikkelen tilbyr tallrike eksempler på redigeringer som suksessfullt endrer enkeltfacetter av et bilde mens resten av bildet forblir urørt.

I Imagic, lider de endrede bildene ikke under de karakteristiske strekkene, forvrengningene og 'occlusion guessing' som er karakteristisk for deepfake-puppetry, som utnytter begrensede priorer fra ett enkelt bilde.

I Imagic, lider de endrede bildene ikke under de karakteristiske strekkene, forvrengningene og ‘occlusion guessing’ som er karakteristisk for deepfake-puppetry, som utnytter begrensede priorer fra ett enkelt bilde.

Systemet anvender en tre-stegs prosess – tekst-embedding-optimisering; modell-finjustering; og, til slutt, generering av det endrede bildet.

Imagic koder den mål-tekstprompten for å hente den opprinnelige tekst-embeddingen, og deretter optimaliserer resultatet for å få innputtbildet. Deretter finjusteres den generative modellen til kildebildet, og legges til en rekke parametre, før den underkastes den ønskede interpolasjonen.

Imagic koder den mål-tekstprompten for å hente den opprinnelige tekst-embeddingen, og deretter optimaliserer resultatet for å få innputtbildet. Deretter finjusteres den generative modellen til kildebildet, og legges til en rekke parametre, før den underkastes den ønskede interpolasjonen.

Ikke overraskende, er rammeverket basert på Googles Imagen-tekst-til-video-arkitektur, selv om forskerne påstår at systemets prinsipper er bredt anvendelige på latente diffusjonsmodeller.

Imagen bruker en tre-nivås arkitektur, i stedet for den syv-nivås arrayen som brukes for selskapets mer nylige tekst-til-video-iterasjon av programvaren. De tre distinkte modulene består av en generativ diffusjonsmodell som opererer på 64x64px-oppløsning; en super-oppløsningsmodell som oppskalerer denne utdata til 256x256px; og en ytterligere super-oppløsningsmodell som tar utdata helt opp til 1024×1024-oppløsning.

Imagic griper inn i den tidligste fasen av denne prosessen, optimaliserer den ønskede tekst-embeddingen på 64px-stadiet på en Adam-optimizer med en statisk læringshastighet på 0,0001.

En mesterklasse i disentanglement: de sluttbrukere som har forsøkt å endre noe så enkelt som fargen på et rendret objekt i en diffusjon, GAN eller NeRF-modell, vil vite hvor betydelig det er at Imagic kan utføre slike transformasjoner uten å 'rive fra hverandre' konsistensen av resten av bildet.

En mesterklasse i disentanglement: de sluttbrukere som har forsøkt å endre noe så enkelt som fargen på et rendret objekt i en diffusjon, GAN eller NeRF-modell, vil vite hvor betydelig det er at Imagic kan utføre slike transformasjoner uten å ‘rive fra hverandre’ konsistensen av resten av bildet.

Finjustering skjer deretter på Imagens basis-modell, for 1500 steg per innputt-bilde, betinget av den reviderte embeddingen. Samtidig optimaliseres den sekundære 64px>256px-laget i parallell på det betingede bildet. Forskerne påpeker at en lignende optimalisering for det siste 256px>1024px-laget har ‘liten eller ingen’ effekt på de endelige resultater, og har derfor ikke implementert dette.

Artikkelen påstår at optimaliseringsprosessen tar omtrent åtte minutter for hvert bilde på dobbel TPUV4-chip. Den endelige renderingen skjer i core Imagen under DDIM-sampling-scheme.

I likhet med lignende finjusteringsprosesser for Googles DreamBooth, kan de resulterende embeddingene også brukes til å drive stilisering, samt fotorealistiske redigeringer som inneholder informasjon fra den underliggende database som driver Imagen (siden, som den første kolonnen nedenfor viser, har kildebildene ingen av den nødvendige innholdet for å effektuere disse transformasjonene).

Fleksible fotorealistiske bevegelser og redigeringer kan fremkalles via Imagic, mens de avledede og disentangled-kodene som er tilegnet i prosessen, kan like lett brukes til stilisert utdata.

Fleksible fotorealistiske bevegelser og redigeringer kan fremkalles via Imagic, mens de avledede og disentangled-kodene som er tilegnet i prosessen, kan like lett brukes til stilisert utdata.

Forskerne sammenlignet Imagic med tidligere arbeider SDEdit, en GAN-basert tilnærming fra 2021, et samarbeid mellom Stanford University og Carnegie Mellon University; og Text2Live, et samarbeid, fra april 2022, mellom Weizmann Institute of Science og NVIDIA.

En visuell sammenligning mellom Imagic, SDEdit og Text2Live.

En visuell sammenligning mellom Imagic, SDEdit og Text2Live.

Det er tydelig at de tidligere tilnærmingene sliter, men i den nederste raden, som innebærer å injisere en massiv endring av pose, feiler de eksisterende helt til å omfigura kildebildet, sammenlignet med en merkbart suksess fra Imagic.

Imagics ressurskrav og treningstid per bilde, mens kort i forhold til slike forfølgelser, gjør det til en usannsynlig inklusjon i en lokal bilde-redigeringsapplikasjon på personlige datamaskiner – og det er ikke klart i hvilken utstrekning prosessen med finjustering kan skaleres ned til forbrukernivå.

Det som står, er Imagic et imponerende tilbud som er mer egnet til API-er – en miljø Google Research, som er forsiktig i forhold til å facilitere deepfaking, kan i alle fall være mest komfortabel med.

 

Først publisert 18. oktober 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai