AI-mallit ja alustat

InstantID: Zero-Shot Identity-Preserving Image Generation

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoälypohjaiset kuvien luontimenetelmät ovat kehittyneet merkittävästi viime vuosina, kun suuret teksti-kuvamuunnosmallit, kuten DALL-E, GLIDE, Stable Diffusion, Imagen ja monet muut, tulivat kuvaan. Vaikka kuvien luontimallit ovat yksilöllisiä arkkitehtuureja ja koulutusmenetelmiä, ne kaikki jakavat yhteisen tavoitteen: mukautetun ja henkilökohtaisten kuvien luominen, joiden tavoitteena on luoda kuvia, joilla on yhdenmukainen hahmo-ID, aihe ja tyyli viitekuvan perusteella. Niiden merkittävien luontikapasiteettien ansiosta modernit kuvien luontirunko-ohjelmat ovat löytäneet sovelluksia alueilta, kuten kuvan animaatio, virtuaalitodellisuus, sähköinen kauppa, tekoälymuotokuvat ja monet muut. Kuitenkin, vaikka heillä on merkittäviä luontikapasiteetteja, nämä kehykset kaikki jakavat yhteisen esteen, useimmat niistä eivät pysty luomaan mukautettuja kuvia, jotka säilyttävät ihmisobjektien hienostuneet tunnistetiedot.

Mukautettujen kuvien luominen, jotka säilyttävät hienostuneet yksityiskohdat, on erittäin tärkeää, erityisesti silloin, kun on kyse ihmisen kasvon tunnistamisesta, joka vaatii korkean laadun ja yksityiskohtaisuuden, sekä hienostuneita semantiikkaa verrattuna yleisiin esineiden kuvien luontitehtäviin, jotka keskittyvät lähinnä karkeisiin tekstureihin ja väreihin. Lisäksi, viimeaikaiset henkilökohtaisten kuvien luontimallit, kuten LoRA, DreamBooth, Textual Inversion ja monet muut, ovat edistyneet merkittävästi. Kuitenkin, henkilökohtaiset kuvien luontitekoälymallit eivät ole vielä täydellisiä käytettäviksi todellisissa tilanteissa, koska ne vaativat suuren tallennustilaa, useita viitekuvia ja usein pitkän hienosäätöprosessin. Toisaalta, vaikka olemassa olevat ID-upotusmenetelmät vaativat vain yhden eteenpäin viitteen, ne joko puuttuvat yhteensopivuudesta julkisesti saatavilla olevien esikoulutettujen mallien kanssa, tai vaativat liian runsaan hienosäätöprosessin useiden parametrejen yli, tai eivät pysty ylläpitämään korkeaa kasvon laatu.

Tässä artikkelissa perehdytään InstantID:hen, joka on diffuusiomallipohjainen ratkaisu kuvien luontiin. InstantID on helppo ja modulaarinen komponentti, joka käsittelee kuvien luontia ja mukauttamista taitavasti eri tyyleissä vain yhden viitekuvan avulla ja varmistaa korkean laadun. Tämän artikkelin tärkein tavoite on antaa lukijoilleen perusteellinen ymmärrys InstantID-kehyksen teknisistä perusteista ja komponenteista, ja tarkastella mallin arkkitehtuuria, koulutusprosessia ja soveltamismahdollisuuksia. Aloita siis.

InstantID: Zero-Shot Identity-Preserving Image Generation


Teksti-kuvadiffuusiomallien kehittyminen on edistänyt kuvien luontiteknologiaa merkittävästi. Nämä mallit pyrkivät mukautettuun ja henkilökohtaisten kuvien luontiin, ja luomaan kuvia, joilla on yhdenmukainen aihe, tyyli ja hahmo-ID viitekuvan perusteella. Näiden kehysten kyky luoda yhdenmukaisia kuvia on luonut sovelluksia eri aloilla, kuten kuvan animaatio, tekoälymuotokuvat, sähköinen kauppa, virtuaali- ja lisätty todellisuus ja monet muut. Kuitenkin, vaikka näillä kehyksillä on merkittäviä kykyjä, ne kohtaavat yhteisen haasteen: useimmat niistä eivät pysty luomaan mukautettuja kuvia, jotka säilyttävät ihmisobjektien hienostuneet yksityiskohdat tarkasti.

Mukautettujen kuvien luominen, jotka säilyttävät sisäisiä yksityiskohtia, on haasteellista tehtävää, koska ihmisen kasvon tunnistaminen vaatii korkeamman laadun ja yksityiskohtaisuuden sekä hienostuneempia semantiikkaa verrattuna yleisiin esineisiin tai tyyleihin, jotka keskittyvät lähinnä väreihin tai karkeisiin tekstureihin. Olemassa olevat teksti-kuvamallit riippuvat yksityiskohtaisista tekstikuvauksista, ja ne kamppailevat vahvan semanttisen merkityksen saavuttamisessa mukautetun kuvien luontiin. Lisäksi, jotkut suuret esikoulutetut teksti-kuvakehykset lisäävät spatiaalisen ohjauksen, jotta ne voivat parantaa ohjattavuutta, ja mahdollistaa hienorakeisen struktuurin ohjaamisen elementeillä, kuten kehon asennot, syvyyskartat, käyttäjän piirtämät luonnokset, semanttinen segmentointi ja monet muut. Kuitenkin, vaikka nämä lisäykset ja parannukset, nämä kehykset pystyvät saavuttamaan vain osittaisen uskollisuuden luodulle kuvalle viitekuvan suhteen.

Tässä artikkelissa perehdytään InstantID:hen, joka on yksinkertainen ja modulaarinen komponentti, joka pyrkii siltaamaan tehokkuuden ja korkean laadun välisen aukon esittämällä yksinkertaisen plug and play -moduulin, joka mahdollistaa kehyksen käsittelemään kuvien mukauttamista vain yhden kasvokuvan avulla ja varmistaa korkean laadun. Lisäksi, InstantID-kehyksen tavoitteena on säilyttää kasvon identiteetti viitekuvasta ottamalla käyttöön uuden kasvojen koodarin, joka säilyttää hienostuneet kuvan yksityiskohdat lisäämällä heikkoja spatiaalisia ja vahvoja semanttisia ehtoja, jotka ohjaavat kuvien luontiprosessia ottamalla käyttöön tekstipromptit, viitekuvat ja kasvokuvat.

On kolme erottuvaa piirrettä, jotka erottavat InstantID-kehyksen olemassa olevista teksti-kuvakehyksistä.

  • Yhteensopivuus ja modulaarisuus: Sen sijaan, että koulutettaisiin täydellinen UNet-kehyksen parametreja, InstantID-kehyksessä koulutetaan kevyt sovittaja. Tämän ansiosta InstantID-kehyksen on yhteensopiva ja modulaarinen olemassa olevien esikoulutettujen mallien kanssa.
  • Hienosäätövapaa: InstantID-kehyksen menetelmä poistaa hienosäätövaatimuksen, koska se tarvitsee vain yhden eteenpäin propagaation inferenceä varten, mikä tekee mallista hyvin käytännöllisen ja taloudellisen hienosäätöä varten.
  • Ylivoimainen suorituskyky: InstantID-kehyksessä on korkea joustavuus ja laatu, koska se pystyy toimittamaan huipputason suorituskyvyn vain yhden viitekuvan avulla, verrattavissa koulutusmenetelmiin, jotka riippuvat useista viitekuvista.

Yhteensä, InstantID-kehyksen panokset voidaan luokitella seuraavasti.

  1. InstantID-kehyksessä on innovatiivinen, ID-säilyttävä sovittamismenetelmä esikoulutetuille teksti-kuvadiffuusiomalleille, jonka tavoitteena on siltaamaan tehokkuuden ja laadun välinen aukko.
  2. InstantID-kehyksessä on yhteensopiva ja modulaarinen mukautettujen mallejen kanssa, jotka käyttävät samaa diffuusiomallia arkkitehtuurissaan, mikä mahdollistaa ID-säilyttämisen esikoulutetuissa malleissa ilman lisäkustannuksia.

InstantID: Menetelmä ja Arkkitehtuuri

Kuten mainittiin aiemmin, InstantID-kehyksessä on tehokas ja kevyt sovittaja, joka antaa esikoulutetuille teksti-kuvadiffuusiomalleille ID-säilyttämiskykyjä vaivattomasti.

Puhuttaessa arkkitehtuurista, InstantID-kehyksessä on rakennettu Stable Diffusion -mallin päälle, joka on tunnettu kyvystään suorittaa diffuusioprosessia korkealla laskennallisen tehokkuuden kanssa matalassa latenttilaissa pikselien sijaan autoenkooderilla. Syötteen kuvan koodaus kartoittaa ensin kuvan latenttiseen edustukseen alasäätötekijän ja latenttidimensioiden kanssa. Lisäksi, denoise-normaalisti jakautuneen melun ja meluisan latentin, ehdolla ja nykyisellä aikataajuudella, diffuusioprosessi omaksuu denoise-UNet-komponentin. Ehto on tekstiprompttien upotus, joka on luotu esikoulutetulla CLIP-tekstikooderin komponentilla.

Lisäksi, InstantID-kehyksessä käytetään ControlNet-komponenttia, joka pystyy lisäämään spatiaalisen ohjauksen esikoulutetulle diffuusiomallille ehtona, laajentamalla perinteisten tekstiprompttien kykyjä. ControlNet-komponentti integroi myös UNet-arkkitehtuurin Stable Diffusion -kehyksestä koulutetun UNet-komponentin replikoinnin. UNet-komponentin replikassa on nolla konvoluutio kerroksia keskiblokeissa ja koodausblokeissa. Vaikka ne ovat samankaltaisia, ControlNet-komponentti erottuu Stable Diffusion -mallista; ne eroavat jälkimmäisessä residuaalikohteessa. ControlNet-komponentti koodaa spatiaalisen ehtotiedon, kuten asennot, syvyyskartat, luonnokset ja monet muut, lisäämällä residuaaleja UNet-blokkiin, ja upottamalla ne alkuperäiseen verkkoon.

InstantID-kehyksessä on myös vaikutteita IP-Adapterista eli kuvapromptista, joka esittää uuden lähestymistavan saavuttamiseksi kuvapromptin kyky toimia rinnakkain tekstiprompttien kanssa ilman alkuperäisten teksti-kuvamallien muuttamista. IP-Adapter-komponentti käyttää myös ainutlaatuista irtautunutta ristiriitaisuutta, joka käyttää lisäksi ristiriitaisuuskerroksia kuvien piirteiden upottamiseen, jättäen muut parametri muuttumattomaksi.

Menetelmä

Lyhyesti sanottuna, InstantID-kehyksessä pyrkii luomaan mukautettuja kuvia eri tyyleillä tai asennoilla vain yhden viitekuvan avulla korkealla laadulla. Seuraava kuva antaa lyhyen yleiskatsauksen InstantID-kehyksestä.

Kuten voidaan havaita, InstantID-kehyksessä on kolme olennaisen komponenttia:

  1. ID-upotuskomponentti, joka sieppaa vahvan semanttisen tiedon kasvon piirteistä kuvassa.
  2. Kevyt sovittajamoduuli, jossa on irtautunut ristiriitaisuuskomponentti, joka mahdollistaa kuvan käytön visuaalisena prompttina.
  3. IdentityNet-komponentti, joka koodaa yksityiskohtaiset piirteet viitekuvasta lisäämällä spatiaalisen ohjauksen.

ID-Upotus

Toisin kuin olemassa olevat menetelmät, kuten FaceStudio, PhotoMaker, IP-Adapter ja monet muut, jotka riippuvat esikoulutetusta CLIP-kuvakooderista visuaalisten prompttien upottamiseen, InstantID-kehyksessä pyrkii parantamaan laadun ja vahvempia semanttisia yksityiskohtia ID-säilyttämisessä. On huomattava, että CLIP-komponentin sisäinen rajoitus johtuu pääasiassa heikosti kohdistetusta koulutusdatasta, mikä tarkoittaa, että CLIP-kooderin upotetut piirteet sieppaavat lähinnä laajat ja epämääräiset semanttiset tiedot, kuten värit, tyyli ja sommitelma. Vaikka nämä piirteet voivat toimia yleisenä täydentäjänä tekstiupotuksille, ne eivät sovellu tarkoihin ID-säilyttämiselle, jotka vaativat vahvaa semantiikkaa ja korkeaa laatu. Lisäksi, viimeaikaiset tutkimukset kasvon edustamismalleissa, erityisesti kasvon tunnistamisessa, ovat osoittaneet kasvon edustamisen tehokkuuden monimutkaisissa tehtävissä, kuten kasvon rekonstruktiossa ja tunnistamisessa. Tästä lähtien, InstantID-kehyksessä pyrkii hyödyntämään esikoulutetun kasvomallin tunnistamaan ja upottamaan kasvon ID-upotuksia viitekuvasta, jotta se ohjaisi kuvien luontiprosessia.

Kuvan Sovittaja

Esikoulutettujen teksti-kuvadiffuusiomallien kyky kuvaprompttitehtävissä parantaa tekstipromptteja merkittävästi, erityisesti tilanteissa, joissa ne eivät voida kuvailla riittävästi tekstiprompteilla. InstantID-kehyksessä otetaan käyttöön strategia, joka muistuttaa IP-Adapter-mallia kuvaprompttitehtävissä, joka esittää uuden lähestymistavan saavuttamiseksi kuvaprompttien kyky toimia rinnakkain tekstiprompttien kanssa ilman alkuperäisten teksti-kuvamallien muuttamista. Kuitenkin, toisin kuin karkeasti kohdistetut CLIP-upotukset, InstantID-kehyksessä poikkeaa siinä, että se käyttää ID-upotuksia kuvapromptteina pyrkien saavuttamaan semanttisesti rikkaamman ja monitahoisemman prompttien integroinnin.

IdentityNet

Vaikka olemassa olevat menetelmät pystyvät integroimaan kuvapromptit tekstiprompttien kanssa, InstantID-kehyksessä väittää, että nämä menetelmät parantavat lähinnä karkeita piirteitä, ja että integrointi on riittämätön ID-säilyttämiselle. Lisäksi, kuvan ja teksti-tokenien lisääminen ristiriitaisuuskerroksiin suoraan voi heikentää teksti-tokenien ohjausta, ja kuvan tokenien vahvistaminen voi heikentää teksti-tokenien muokkauskykyjä. Tästä syystä, InstantID-kehyksessä valitaan ControlNet, joka on vaihtoehtoinen piirteiden upotusmenetelmä, joka käyttää spatiaalista tietoa syötteenä ohjattavalle moduulille, jotta se voi ylläpitää yhdenmukaisuutta UNet-asetuksien kanssa diffuusiomalleissa.

InstantID-kehyksessä tehdään kaksi muutosta perinteiseen ControlNet-arkkitehtuuriin: ehdollisissa syötteissä, InstantID-kehyksessä valitaan 5 kasvon avainkohtaa sijaan tarkkaa OpenPose-kasvon avainkohtaa. Toiseksi, InstantID-kehyksessä käytetään ID-upotuksia sijaan tekstipromptteja ehtoina ristiriitaisuuskerroksissa ControlNet-arkkitehtuurissa.

Koulutus ja Inferenssi

Koulutusvaiheessa, InstantID-kehyksessä optimoidaan IdentityNetin ja Kuvan Sovittajan parametreja, kun taas esikoulutetun diffuusiomallin parametreja jäädytetään. Koko InstantID-pipeline koulutetaan kuvatekstipareilla, jotka sisältävät ihmishahmoja, ja se käyttää koulutusohjelmaa, joka on samanlainen kuin Stable Diffusion -kehyksessä, tehtäväkohtaisilla kuvaehtoilla. InstantID-koulutusmenetelmän korostus on erottelu kuvan ja teksti-ristiriitaisuuskerrosten välillä Kuvan Sovittajassa, mikä mahdollistaa kuvaehtojen painojen sopeuttamisen joustavasti ja riippumattomasti, varmistaen tarkemman ja ohjatun inference- ja koulutusprosessin.

InstantID: Kokeet ja Tulokset

InstantID-kehyksessä otetaan käyttöön Stable Diffusion ja koulutetaan se LAION-Facen avulla, joka on suuri avoimen lähdekoodin tietokanta, joka sisältää yli 50 miljoonaa kuvatekstiparia. Lisäksi, InstantID-kehyksessä kerätään yli 10 miljoonaa ihmiskuvaa, jotka on luotu automaattisesti BLIP2-mallin avulla, jotta kuvien luontilaatu parannetaan. InstantID-kehyksessä keskitytään lähinnä yksilöllisiin kuviiin, ja se käyttää esikoulutettua kasvomallia tunnistamaan ja upottamaan kasvon ID-upotuksia kuvista, ja se koulutetaan alkuperäisillä ihmiskuvilla, eikä vain kasvojen leikkaamisella. Lisäksi, koulutusvaiheessa, InstantID-kehyksessä jäädytetään esikoulutettu teksti-kuvamalli, ja vain IdentityNetin ja Kuvan Sovittajan parametreja päivitetään.

Kuvan Vain Luonti

InstantID-malli käyttää tyhjää prompttia ohjaamaan kuvien luontiprosessia vain viitekuvan avulla, ja tulokset ilman promptteja on esitetty seuraavassa kuvassa.

’Tyhjä prompt’ -luonti, kuten edellä olevassa kuvassa, osoittaa InstantID-kehyksen kyvyn ylläpitää rikkaat semanttiset kasvon piirteet, kuten identiteetti, ikä ja ilme, vahvasti. Kuitenkin, on huomattava, että tyhjien prompttien käyttäminen ei välttämättä pysty toistamaan tuloksia muilla semantiikoilla, kuten sukupuolella. Lisäksi, edellä olevassa kuvassa, sarakkeet 2-4 käyttävät kuvaa ja prompttia, ja kuten voidaan nähdä, luodussa kuvassa ei ole havaittavissa teksti-ohjauksen heikentymistä, ja se varmistaa identiteetin yhdenmukaisuuden. Lopulta, sarakkeet 5-9 käyttävät kuvaa, prompttia ja spatiaalista ohjausta, osoittaen mallin yhteensopivuuden esikoulutettujen spatiaalisten ohjausmallien kanssa, jolloin InstantID-malli pystyy joustavasti ottamaan spatiaaliset ohjaukset esikoulutetun ControlNet-komponentin avulla.

On myös huomattava, että viitekuvien määrä vaikuttaa merkittävästi luodussa kuvassa, kuten edellä olevassa kuvassa. Vaikka InstantID-kehyksessä pystyy toimittamaan hyvät tulokset vain yhden viitekuvan avulla, useat viitekuvat tuottavat paremman laadun kuvan, koska InstantID-kehyksessä otetaan keskiarvo ID-upotuksista kuvaprompttina. Jatkamalla, on tärkeää verrata InstantID-kehyksen tuloksia aiempiin menetelmiin, jotka luovat mukautettuja kuvia vain yhden viitekuvan avulla. Seuraava kuva vertaa InstantID-kehyksen tuloksia olemassa oleviin huipputason malleihin yhden viitekuvan mukautetun kuvan luontiin.

Kuten voidaan nähdä, InstantID-kehyksessä pystyy säilyttämään kasvon piirteitä, koska ID-upotus sisältää rikkaat semanttiset tiedot, kuten identiteetti, ikä ja sukupuoli. On turvallista sanoa, että InstantID-kehyksessä ylittää olemassa olevat kehykset mukautetun kuvan luontiin, koska se pystyy säilyttämään ihmisen identiteetin ylläpitäen ohjauksen ja tyylin joustavuutta.

Loppusanat

Tässä artikkelissa on käyty läpi InstantID, joka on diffuusiomallipohjainen ratkaisu kuvien luontiin. InstantID on yksinkertainen ja modulaarinen komponentti, joka käsittelee kuvien luontia ja mukauttamista taitavasti eri tyyleissä vain yhden viitekuvan avulla ja varmistaa korkean laadun. InstantID-kehyksessä pyrkii siltaamaan tehokkuuden ja korkean laadun välisen aukon esittämällä yksinkertaisen plug and play -moduulin, joka mahdollistaa kehyksen käsittelemään kuvien mukauttamista vain yhden kasvokuvan avulla ja varmistaa korkean laadun.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.