Andersonin kulma

Tekoälyavusteinen objektiivinen muokkaus Google’n Imagic- ja Runway’n ‘Erase and Replace’ -työkaluilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tällä viikolla kaksi uutta, mutta vastakkaisia tekoälyohjattuja grafiikkasuunnittelualgoritmeja tarjoavat uusia tapoja loppukäyttäjille tehdä erittäin tarkkoja ja tehokkaita muutoksia objekteihin valokuvissa.

Ensimmäinen on Imagic, joka on kehitetty Google Researchin, Israelin Teknillisen Korkeakoulun ja Weizmannin Tiedeinstituutin yhteistyönä. Imagic tarjoaa tekstipohjaisen, hienojakoiset objektien muokkauksen diffuusiomallien hienosäätöä hyödyntäen.

Muuta mitä haluat, ja jätä loput - Imagic lupaa hienojakoiset muokkaukset vain niistä osista, jotka haluat muuttaa. Lähde: https://arxiv.org/pdf/2210.09276.pdf

Muuta mitä haluat, ja jätä loput – Imagic lupaa hienojakoiset muokkaukset vain niistä osista, jotka haluat muuttaa. Lähde: https://arxiv.org/pdf/2210.09276.pdf

Kuka tahansa, joka on yrittänyt muuttaa vain yhtä elementtiä Stable Diffusion -renderöinnissä, tietää liian hyvin, että jokaisen onnistuneen muokkauksen kohdalla järjestelmä muuttaa viisi asiaa, jotka olivat jo hyviä sellaisenaan. Tämä on puute, joka aiheuttaa monille Stable Diffusion -harrastajille paljon vaivaa, kun he yrittävät korjata tällaisia “sivuvahinkoja” Photoshopin avulla. Imagicin saavutukset näyttävät merkittäviltä juuri tästä näkökulmasta.

Toinen tarjous on Runway ML:n Erase and Replace -ominaisuus, joka on uusi ominaisuus “AI Magic Tools” -osiossa heidän verkossa olevassa koneoppimiseen perustuvassa visuaalisten efektien työkalupakettinsa.

Runway ML:n Erase and Replace -ominaisuus, joka on jo nähty esikatselussa teksti-videomuokkausjärjestelmässä. Lähde: https://www.youtube.com/watch?v=41Qb58ZPO60

Runway ML:n Erase and Replace -ominaisuus, joka on jo nähty esikatselussa teksti-videomuokkausjärjestelmässä. Lähde: https://www.youtube.com/watch?v=41Qb58ZPO60

Tarkastellaan ensin Runway’n tarjontaa.

Poista ja korvaa

Kuten Imagic, Erase and Replace käsittelee ainoastaan kuvia, vaikka Runway on esittänyt saman toiminnallisuuden teksti-videomuokkausjärjestelmässä, jota ei vielä ole julkaistu:

Vaikka kuka tahansa voi kokeilla uutta Erase and Replace -toimintoa kuvissa, videoversio ei ole vielä julkaistu. Lähde: https://twitter.com/runwayml/status/1568220303808991232

Vaikka kuka tahansa voi kokeilla uutta Erase and Replace -toimintoa kuvissa, videoversio ei ole vielä julkaistu. Lähde: https://twitter.com/runwayml/status/1568220303808991232

Vaikka Runway ML ei ole julkaissut tietoja Erase and Replace -tekniikasta, nopeus, jolla voit korvata esimerkiksi huonekasvin Ronald Reaganin patsaalla, viittaa siihen, että diffuusiomalli, kuten Stable Diffusion (tai paljon epätodennäköisemmin lisensoitu DALL-E 2), on moottori, joka uudelleenluo valitsemaasi objektia Erase and Replace -toiminnossa.

Korvata huonekasvi Ronald Reaganin patsaalla ei ole yhtä nopea kuin tämä, mutta se on silti melko nopea. Lähde: https://app.runwayml.com/

Korvata huonekasvi Ronald Reaganin patsaalla ei ole yhtä nopea kuin tämä, mutta se on silti melko nopea. Lähde: https://app.runwayml.com/

Järjestelmällä on joitakin DALL-E 2 -tyyppisiä rajoituksia – kuvat tai teksti, jotka laukaisevat Erase and Replace -suodattimet, voivat aiheuttaa varoituksen mahdollisesta tilin keskeytyksestä, mikä on käytännössä samanlainen kuin OpenAI:n DALL-E 2 -käytäntö.

Korvata koti-ilmasauna 'jäisellä pöydällä' Runway ML:n Erase and Replace -toiminnossa.

Korvata koti-ilmasauna ‘jäisellä pöydällä’ Runway ML:n Erase and Replace -toiminnossa.

Kuten Imagic (ks. alla), Erase and Replace on “objektiorientoitunut” – et voi vain poistaa “tyhjää” osaa kuvasta ja täyttää sen tekstipromptin tuloksella; tässä tapauksessa järjestelmä jäljittää lähimmän näkyvän objektin maskin näkölinjaa (kuten seinää tai televisiota) ja soveltaa muodonmuutosta siinä.

Kuten nimestä voidaan päätellä, et voi injektoida objekteja tyhjään tilaan Erase and Replace -toiminnossa. Tässä yritetään kutsua kuuluisin Sith-lordi, joka johtaa outoon Vader-aiheiseen maalauskohteeseen, joka on noin siinä, missä 'korvaa'-alue oli piirretty.

Kuten nimestä voidaan päätellä, et voi injektoida objekteja tyhjään tilaan Erase and Replace -toiminnossa.

On vaikea sanoa, onko Erase and Replace välinpitämätön tekijänoikeuksilla suojattujen kuvien käytölle (joita DALL-E 2 rajoittaa edelleen, vaikka epäonnistuneesti), vai onko taustalla oleva malli vain optimoimaton tällaisiin tehtäviin.

Hieman NSFW 'Nicole Kidmanin muotokuva' osoittaa, että käytössä oleva diffuusiopohjainen malli ei sisällä DALL-E 2:n entistä järjestelmällistä torjuntamekanismia realististen kasvojen tai rohkeiden sisältöjen renderöintiin, kun taas tekijänoikeuksilla suojattujen teosten tulokset vaihtelevat epäselvistä ('xenomorph') absurdin ('Rautavaltaistuoli') välillä. Alhaalla oikeassa reunassa on lähdekuva.

Hieman NSFW ‘Nicole Kidmanin muotokuva’ osoittaa, että käytössä oleva diffuusiopohjainen malli ei sisällä DALL-E 2:n entistä järjestelmällistä torjuntamekanismia realististen kasvojen tai rohkeiden sisältöjen renderöintiin, kun taas tekijänoikeuksilla suojattujen teosten tulokset vaihtelevat epäselvistä (‘xenomorph’) absurdin (‘Rautavaltaistuoli’) välillä.

Olisi mielenkiintoista tietää, mitä menetelmiä Erase and Replace käyttää objektien erottamiseen, joita se voi korvata. Luultavasti kuva käydään läpi jotenkin CLIP:in kaltaisen järjestelmän kautta, ja erilliset kohteet erottellaan objektin tunnistamisen ja sen jälkeisen semanttisen segmentoinnin kautta. Mikään näistä toiminnallisuuksista ei toimi läheskään yhtä hyvin tavallisessa Stable Diffusion -asennuksessa.

Aivan kuin 'Missä on Waldo', Erase and Replace epäonnistuu tuottamasta avaruusolentoa.

Aivan kuin ‘Missä on Waldo’, Erase and Replace epäonnistuu tuottamasta avaruusolentoa.

Erase and Replace näyttää olevan tehokas objektien korvausjärjestelmä, jolla on erinomainen täyttäminen. Se ei kuitenkaan voi muokata olemassa olevia havaittuja objekteja, vaan ainoastaan korvata niitä. Muuttaa olemassa olevaa kuvan sisältöä ilman, että seurauksena on ympäristömateriaalin heikentymistä, on perusteltavasti paljon vaikeampi tehtävä, joka liittyy tietokoneen näön tutkimusalan pitkään taisteluun erottamiseen suosittujen kehyskokoelmien eri latenteissa tiloissa.

Imagic

Se on tehtävä, jota Imagic käsittelee. Uusi artikkeli esittää useita esimerkkejä muokkauksista, jotka muuttavat onnistuneesti yksittäisiä valokuvan osia jättäen loput kuvasta koskemattomaksi.

Imagicissä muokatut kuvat eivät kärsi venymisestä, vääristymisestä ja 'peittävän arvauksen' ominaispiirteistä, jotka ovat tyypillisiä deepfake-nukkeja, jotka hyödyntävät rajoitettuja etuoikeuksia, jotka perustuvat yksittäiseen kuvaan.

Imagicissä muokatut kuvat eivät kärsi venymisestä, vääristymisestä ja ‘peittävän arvauksen’ ominaispiirteistä, jotka ovat tyypillisiä deepfake-nukkeja, jotka hyödyntävät rajoitettuja etuoikeuksia, jotka perustuvat yksittäiseen kuvaan.

Järjestelmä käyttää kolmevaiheista prosessia – tekstin upotusoptimoiminen, mallin hienosäätö ja lopulta muokatun kuvan generointi.

Imagic koodaa kohde-tekstipromptin hakemaan alkuperäisen tekstin upotuksen ja optimoi sitten tuloksen saadakseen syötekuva. Sen jälkeen generatiivinen malli säätetään lähdekuvan mukaan lisäämällä joukko parametreja, ennen kuin se asetetaan pyydetylle interpoloinnille.

Imagic koodaa kohde-tekstipromptin hakemaan alkuperäisen tekstin upotuksen ja optimoi sitten tuloksen saadakseen syötekuva.

Odottamattomasti, kehys perustuu Google’n Imagen -teksti-videorakenteeseen, vaikka tutkijat toteavat, että järjestelmän periaatteet ovat laajasti sovellettavissa latenteille diffuusiomalleille.

Mestariluokan erottautuminen: ne loppukäyttäjät, jotka ovat yrittäneet muuttaa jotain yhtä yksinkertaista kuin renderöidyn objektin väriä diffuusiomallissa, GAN:ssa tai NeRF-mallissa, tietävät, kuinka merkittävää on, että Imagic voi suorittaa tällaisia muodonmuutoksia ilman, että 'repii irti' loppukuvan johdonmukaisuutta.

Mestariluokan erottautuminen: ne loppukäyttäjät, jotka ovat yrittäneet muuttaa jotain yhtä yksinkertaista kuin renderöidyn objektin väriä diffuusiomallissa, GAN:ssa tai NeRF-mallissa, tietävät, kuinka merkittävää on, että Imagic voi suorittaa tällaisia muodonmuutoksia ilman, että ‘repii irti’ loppukuvan johdonmukaisuutta.

Hienosäätö tapahtuu Imagen perusmallissa 1500 askelta kunkin syötekuvan kohdalla, ehdolla muokatussa upotusobjektissa. Samalla toissijainen 64px > 256px -kerros optimoidaan rinnakkain ehdolla kuvassa. Tutkijat toteavat, että vastaavan optimoinnin 256px > 1024px -kerrokselle on “vähän tai ei ollenkaan vaikutusta” lopputulokseen, eikä he ole siten toteuttaneet tätä.

Artikkeli toteaa, että optimointiprosessi kestää noin kahdeksan minuuttia kunkin kuvan kohdalla kaksois-TPUV4 -piireillä. Lopullinen renderöinti tapahtuu perus-Imagessa DDIM-ottamissuunnitelman mukaisesti.

Yhteensopivassa mukaisuudessa Google’n DreamBooth -hienosäätöprosesseja, tuloksena olevat upotukset voidaan käyttää myös tyylittelyyn sekä fotorealistisiin muokkauksiin, jotka sisältävät tietoja Imagen taustatietokannasta (koska, kuten ensimmäinen sarake alla osoittaa, lähdekuva ei sisällä mitään tarvittavaa sisältöä näiden muodonmuutosten tekemiseksi).

Joustava fotorealistinen liike ja muokkaus voidaan saada aikaan Imagicilla, ja johdetut ja eriytetyt koodit, jotka saadaan prosessissa, voidaan yhtä hyvin käyttää tyylikkääseen ulosantiin.

Joustava fotorealistinen liike ja muokkaus voidaan saada aikaan Imagicilla, ja johdetut ja eriytetyt koodit, jotka saadaan prosessissa, voidaan yhtä hyvin käyttää tyylikkääseen ulosantiin.

Tutkijat vertasivat Imagicia aiempaan SDEdit -työhön, joka on GAN-pohjainen lähestymistapa vuodelta 2021, yhteistyö Stanfordin yliopiston ja Carnegie Mellonin yliopiston välillä; ja Text2Live -yhteistyöhön, joka on yhteistyö Weizmannin tiedeinstituutin ja Nvidian välillä huhtikuulta 2022.

Visuaalinen vertailu Imagicin, SDEditin ja Text2Liven välillä.

Visuaalinen vertailu Imagicin, SDEditin ja Text2Liven välillä.

On selvää, että edelliset lähestymistavat kamppailevat, mutta alimmassa rivissä, joka liittyy massiivisen asennonmuutoksen sisättämiseen, edelliset ehdokkaat epäonnistuvat täysin uudelleenmuokkaamaan lähdeaineistoa verrattuna Imagicin merkittävään onnistumiseen.

Imagicin resurssivaatimukset ja koulutusaika kunkin kuvan kohdalla, vaikka lyhyt näiden tietojen standardien mukaan, tekee siitä epätodennäköisen sisällyttämisen paikalliseen kuvaeditoriin henkilökohtaisiin tietokoneisiin – eikä ole selvää, missä määrin hienosäätöprosessia voidaan laskea kuluttajatasolle.

Imagic on vaikuttava tarjous, joka on paremmin sovellettavissa API:hin – ympäristöön, jossa Google Research, joka on varovainen kritiikkiin deepfakingin helpottamisesta, saattaa joka tapauksessa olla eniten mukavuudessa.

 

Julkaistu ensimmäisen kerran 18. lokakuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai