AI-mallit ja alustat
InstantID: Zero-Shot Identity-Preserving Image Generation
TekoÃĪlypohjaiset kuvien luontimenetelmÃĪt ovat kehittyneet merkittÃĪvÃĪsti viime vuosina, kun suuret teksti-kuvamuunnosmallit, kuten DALL-E, GLIDE, Stable Diffusion, Imagen ja monet muut, tulivat kuvaan. Vaikka kuvien luontimallit ovat yksilÃķllisiÃĪ arkkitehtuureja ja koulutusmenetelmiÃĪ, ne kaikki jakavat yhteisen tavoitteen: mukautetun ja henkilÃķkohtaisten kuvien luominen, joiden tavoitteena on luoda kuvia, joilla on yhdenmukainen hahmo-ID, aihe ja tyyli viitekuvan perusteella. Niiden merkittÃĪvien luontikapasiteettien ansiosta modernit kuvien luontirunko-ohjelmat ovat lÃķytÃĪneet sovelluksia alueilta, kuten kuvan animaatio, virtuaalitodellisuus, sÃĪhkÃķinen kauppa, tekoÃĪlymuotokuvat ja monet muut. Kuitenkin, vaikka heillÃĪ on merkittÃĪviÃĪ luontikapasiteetteja, nÃĪmÃĪ kehykset kaikki jakavat yhteisen esteen, useimmat niistÃĪ eivÃĪt pysty luomaan mukautettuja kuvia, jotka sÃĪilyttÃĪvÃĪt ihmisobjektien hienostuneet tunnistetiedot.
Mukautettujen kuvien luominen, jotka sÃĪilyttÃĪvÃĪt hienostuneet yksityiskohdat, on erittÃĪin tÃĪrkeÃĪÃĪ, erityisesti silloin, kun on kyse ihmisen kasvon tunnistamisesta, joka vaatii korkean laadun ja yksityiskohtaisuuden, sekÃĪ hienostuneita semantiikkaa verrattuna yleisiin esineiden kuvien luontitehtÃĪviin, jotka keskittyvÃĪt lÃĪhinnÃĪ karkeisiin tekstureihin ja vÃĪreihin. LisÃĪksi, viimeaikaiset henkilÃķkohtaisten kuvien luontimallit, kuten LoRA, DreamBooth, Textual Inversion ja monet muut, ovat edistyneet merkittÃĪvÃĪsti. Kuitenkin, henkilÃķkohtaiset kuvien luontitekoÃĪlymallit eivÃĪt ole vielÃĪ tÃĪydellisiÃĪ kÃĪytettÃĪviksi todellisissa tilanteissa, koska ne vaativat suuren tallennustilaa, useita viitekuvia ja usein pitkÃĪn hienosÃĪÃĪtÃķprosessin. Toisaalta, vaikka olemassa olevat ID-upotusmenetelmÃĪt vaativat vain yhden eteenpÃĪin viitteen, ne joko puuttuvat yhteensopivuudesta julkisesti saatavilla olevien esikoulutettujen mallien kanssa, tai vaativat liian runsaan hienosÃĪÃĪtÃķprosessin useiden parametrejen yli, tai eivÃĪt pysty yllÃĪpitÃĪmÃĪÃĪn korkeaa kasvon laatu.
TÃĪssÃĪ artikkelissa perehdytÃĪÃĪn InstantID:hen, joka on diffuusiomallipohjainen ratkaisu kuvien luontiin. InstantID on helppo ja modulaarinen komponentti, joka kÃĪsittelee kuvien luontia ja mukauttamista taitavasti eri tyyleissÃĪ vain yhden viitekuvan avulla ja varmistaa korkean laadun. TÃĪmÃĪn artikkelin tÃĪrkein tavoite on antaa lukijoilleen perusteellinen ymmÃĪrrys InstantID-kehyksen teknisistÃĪ perusteista ja komponenteista, ja tarkastella mallin arkkitehtuuria, koulutusprosessia ja soveltamismahdollisuuksia. Aloita siis.
InstantID: Zero-Shot Identity-Preserving Image Generation
Teksti-kuvadiffuusiomallien kehittyminen on edistÃĪnyt kuvien luontiteknologiaa merkittÃĪvÃĪsti. NÃĪmÃĪ mallit pyrkivÃĪt mukautettuun ja henkilÃķkohtaisten kuvien luontiin, ja luomaan kuvia, joilla on yhdenmukainen aihe, tyyli ja hahmo-ID viitekuvan perusteella. NÃĪiden kehysten kyky luoda yhdenmukaisia kuvia on luonut sovelluksia eri aloilla, kuten kuvan animaatio, tekoÃĪlymuotokuvat, sÃĪhkÃķinen kauppa, virtuaali- ja lisÃĪtty todellisuus ja monet muut. Kuitenkin, vaikka nÃĪillÃĪ kehyksillÃĪ on merkittÃĪviÃĪ kykyjÃĪ, ne kohtaavat yhteisen haasteen: useimmat niistÃĪ eivÃĪt pysty luomaan mukautettuja kuvia, jotka sÃĪilyttÃĪvÃĪt ihmisobjektien hienostuneet yksityiskohdat tarkasti.
Mukautettujen kuvien luominen, jotka sÃĪilyttÃĪvÃĪt sisÃĪisiÃĪ yksityiskohtia, on haasteellista tehtÃĪvÃĪÃĪ, koska ihmisen kasvon tunnistaminen vaatii korkeamman laadun ja yksityiskohtaisuuden sekÃĪ hienostuneempia semantiikkaa verrattuna yleisiin esineisiin tai tyyleihin, jotka keskittyvÃĪt lÃĪhinnÃĪ vÃĪreihin tai karkeisiin tekstureihin. Olemassa olevat teksti-kuvamallit riippuvat yksityiskohtaisista tekstikuvauksista, ja ne kamppailevat vahvan semanttisen merkityksen saavuttamisessa mukautetun kuvien luontiin. LisÃĪksi, jotkut suuret esikoulutetut teksti-kuvakehykset lisÃĪÃĪvÃĪt spatiaalisen ohjauksen, jotta ne voivat parantaa ohjattavuutta, ja mahdollistaa hienorakeisen struktuurin ohjaamisen elementeillÃĪ, kuten kehon asennot, syvyyskartat, kÃĪyttÃĪjÃĪn piirtÃĪmÃĪt luonnokset, semanttinen segmentointi ja monet muut. Kuitenkin, vaikka nÃĪmÃĪ lisÃĪykset ja parannukset, nÃĪmÃĪ kehykset pystyvÃĪt saavuttamaan vain osittaisen uskollisuuden luodulle kuvalle viitekuvan suhteen.
TÃĪssÃĪ artikkelissa perehdytÃĪÃĪn InstantID:hen, joka on yksinkertainen ja modulaarinen komponentti, joka pyrkii siltaamaan tehokkuuden ja korkean laadun vÃĪlisen aukon esittÃĪmÃĪllÃĪ yksinkertaisen plug and play -moduulin, joka mahdollistaa kehyksen kÃĪsittelemÃĪÃĪn kuvien mukauttamista vain yhden kasvokuvan avulla ja varmistaa korkean laadun. LisÃĪksi, InstantID-kehyksen tavoitteena on sÃĪilyttÃĪÃĪ kasvon identiteetti viitekuvasta ottamalla kÃĪyttÃķÃķn uuden kasvojen koodarin, joka sÃĪilyttÃĪÃĪ hienostuneet kuvan yksityiskohdat lisÃĪÃĪmÃĪllÃĪ heikkoja spatiaalisia ja vahvoja semanttisia ehtoja, jotka ohjaavat kuvien luontiprosessia ottamalla kÃĪyttÃķÃķn tekstipromptit, viitekuvat ja kasvokuvat.
On kolme erottuvaa piirrettÃĪ, jotka erottavat InstantID-kehyksen olemassa olevista teksti-kuvakehyksistÃĪ.
- Yhteensopivuus ja modulaarisuus: Sen sijaan, ettÃĪ koulutettaisiin tÃĪydellinen UNet-kehyksen parametreja, InstantID-kehyksessÃĪ koulutetaan kevyt sovittaja. TÃĪmÃĪn ansiosta InstantID-kehyksen on yhteensopiva ja modulaarinen olemassa olevien esikoulutettujen mallien kanssa.
- HienosÃĪÃĪtÃķvapaa: InstantID-kehyksen menetelmÃĪ poistaa hienosÃĪÃĪtÃķvaatimuksen, koska se tarvitsee vain yhden eteenpÃĪin propagaation inferenceÃĪ varten, mikÃĪ tekee mallista hyvin kÃĪytÃĪnnÃķllisen ja taloudellisen hienosÃĪÃĪtÃķÃĪ varten.
- Ylivoimainen suorituskyky: InstantID-kehyksessÃĪ on korkea joustavuus ja laatu, koska se pystyy toimittamaan huipputason suorituskyvyn vain yhden viitekuvan avulla, verrattavissa koulutusmenetelmiin, jotka riippuvat useista viitekuvista.
YhteensÃĪ, InstantID-kehyksen panokset voidaan luokitella seuraavasti.
- InstantID-kehyksessÃĪ on innovatiivinen, ID-sÃĪilyttÃĪvÃĪ sovittamismenetelmÃĪ esikoulutetuille teksti-kuvadiffuusiomalleille, jonka tavoitteena on siltaamaan tehokkuuden ja laadun vÃĪlinen aukko.
- InstantID-kehyksessÃĪ on yhteensopiva ja modulaarinen mukautettujen mallejen kanssa, jotka kÃĪyttÃĪvÃĪt samaa diffuusiomallia arkkitehtuurissaan, mikÃĪ mahdollistaa ID-sÃĪilyttÃĪmisen esikoulutetuissa malleissa ilman lisÃĪkustannuksia.
InstantID: MenetelmÃĪ ja Arkkitehtuuri
Kuten mainittiin aiemmin, InstantID-kehyksessÃĪ on tehokas ja kevyt sovittaja, joka antaa esikoulutetuille teksti-kuvadiffuusiomalleille ID-sÃĪilyttÃĪmiskykyjÃĪ vaivattomasti.
Puhuttaessa arkkitehtuurista, InstantID-kehyksessÃĪ on rakennettu Stable Diffusion -mallin pÃĪÃĪlle, joka on tunnettu kyvystÃĪÃĪn suorittaa diffuusioprosessia korkealla laskennallisen tehokkuuden kanssa matalassa latenttilaissa pikselien sijaan autoenkooderilla. SyÃķtteen kuvan koodaus kartoittaa ensin kuvan latenttiseen edustukseen alasÃĪÃĪtÃķtekijÃĪn ja latenttidimensioiden kanssa. LisÃĪksi, denoise-normaalisti jakautuneen melun ja meluisan latentin, ehdolla ja nykyisellÃĪ aikataajuudella, diffuusioprosessi omaksuu denoise-UNet-komponentin. Ehto on tekstiprompttien upotus, joka on luotu esikoulutetulla CLIP-tekstikooderin komponentilla.
LisÃĪksi, InstantID-kehyksessÃĪ kÃĪytetÃĪÃĪn ControlNet-komponenttia, joka pystyy lisÃĪÃĪmÃĪÃĪn spatiaalisen ohjauksen esikoulutetulle diffuusiomallille ehtona, laajentamalla perinteisten tekstiprompttien kykyjÃĪ. ControlNet-komponentti integroi myÃķs UNet-arkkitehtuurin Stable Diffusion -kehyksestÃĪ koulutetun UNet-komponentin replikoinnin. UNet-komponentin replikassa on nolla konvoluutio kerroksia keskiblokeissa ja koodausblokeissa. Vaikka ne ovat samankaltaisia, ControlNet-komponentti erottuu Stable Diffusion -mallista; ne eroavat jÃĪlkimmÃĪisessÃĪ residuaalikohteessa. ControlNet-komponentti koodaa spatiaalisen ehtotiedon, kuten asennot, syvyyskartat, luonnokset ja monet muut, lisÃĪÃĪmÃĪllÃĪ residuaaleja UNet-blokkiin, ja upottamalla ne alkuperÃĪiseen verkkoon.
InstantID-kehyksessÃĪ on myÃķs vaikutteita IP-Adapterista eli kuvapromptista, joka esittÃĪÃĪ uuden lÃĪhestymistavan saavuttamiseksi kuvapromptin kyky toimia rinnakkain tekstiprompttien kanssa ilman alkuperÃĪisten teksti-kuvamallien muuttamista. IP-Adapter-komponentti kÃĪyttÃĪÃĪ myÃķs ainutlaatuista irtautunutta ristiriitaisuutta, joka kÃĪyttÃĪÃĪ lisÃĪksi ristiriitaisuuskerroksia kuvien piirteiden upottamiseen, jÃĪttÃĪen muut parametri muuttumattomaksi.
MenetelmÃĪ
Lyhyesti sanottuna, InstantID-kehyksessÃĪ pyrkii luomaan mukautettuja kuvia eri tyyleillÃĪ tai asennoilla vain yhden viitekuvan avulla korkealla laadulla. Seuraava kuva antaa lyhyen yleiskatsauksen InstantID-kehyksestÃĪ.

Kuten voidaan havaita, InstantID-kehyksessÃĪ on kolme olennaisen komponenttia:
- ID-upotuskomponentti, joka sieppaa vahvan semanttisen tiedon kasvon piirteistÃĪ kuvassa.
- Kevyt sovittajamoduuli, jossa on irtautunut ristiriitaisuuskomponentti, joka mahdollistaa kuvan kÃĪytÃķn visuaalisena prompttina.
- IdentityNet-komponentti, joka koodaa yksityiskohtaiset piirteet viitekuvasta lisÃĪÃĪmÃĪllÃĪ spatiaalisen ohjauksen.
ID-Upotus
Toisin kuin olemassa olevat menetelmÃĪt, kuten FaceStudio, PhotoMaker, IP-Adapter ja monet muut, jotka riippuvat esikoulutetusta CLIP-kuvakooderista visuaalisten prompttien upottamiseen, InstantID-kehyksessÃĪ pyrkii parantamaan laadun ja vahvempia semanttisia yksityiskohtia ID-sÃĪilyttÃĪmisessÃĪ. On huomattava, ettÃĪ CLIP-komponentin sisÃĪinen rajoitus johtuu pÃĪÃĪasiassa heikosti kohdistetusta koulutusdatasta, mikÃĪ tarkoittaa, ettÃĪ CLIP-kooderin upotetut piirteet sieppaavat lÃĪhinnÃĪ laajat ja epÃĪmÃĪÃĪrÃĪiset semanttiset tiedot, kuten vÃĪrit, tyyli ja sommitelma. Vaikka nÃĪmÃĪ piirteet voivat toimia yleisenÃĪ tÃĪydentÃĪjÃĪnÃĪ tekstiupotuksille, ne eivÃĪt sovellu tarkoihin ID-sÃĪilyttÃĪmiselle, jotka vaativat vahvaa semantiikkaa ja korkeaa laatu. LisÃĪksi, viimeaikaiset tutkimukset kasvon edustamismalleissa, erityisesti kasvon tunnistamisessa, ovat osoittaneet kasvon edustamisen tehokkuuden monimutkaisissa tehtÃĪvissÃĪ, kuten kasvon rekonstruktiossa ja tunnistamisessa. TÃĪstÃĪ lÃĪhtien, InstantID-kehyksessÃĪ pyrkii hyÃķdyntÃĪmÃĪÃĪn esikoulutetun kasvomallin tunnistamaan ja upottamaan kasvon ID-upotuksia viitekuvasta, jotta se ohjaisi kuvien luontiprosessia.
Kuvan Sovittaja
Esikoulutettujen teksti-kuvadiffuusiomallien kyky kuvaprompttitehtÃĪvissÃĪ parantaa tekstipromptteja merkittÃĪvÃĪsti, erityisesti tilanteissa, joissa ne eivÃĪt voida kuvailla riittÃĪvÃĪsti tekstiprompteilla. InstantID-kehyksessÃĪ otetaan kÃĪyttÃķÃķn strategia, joka muistuttaa IP-Adapter-mallia kuvaprompttitehtÃĪvissÃĪ, joka esittÃĪÃĪ uuden lÃĪhestymistavan saavuttamiseksi kuvaprompttien kyky toimia rinnakkain tekstiprompttien kanssa ilman alkuperÃĪisten teksti-kuvamallien muuttamista. Kuitenkin, toisin kuin karkeasti kohdistetut CLIP-upotukset, InstantID-kehyksessÃĪ poikkeaa siinÃĪ, ettÃĪ se kÃĪyttÃĪÃĪ ID-upotuksia kuvapromptteina pyrkien saavuttamaan semanttisesti rikkaamman ja monitahoisemman prompttien integroinnin.
IdentityNet
Vaikka olemassa olevat menetelmÃĪt pystyvÃĪt integroimaan kuvapromptit tekstiprompttien kanssa, InstantID-kehyksessÃĪ vÃĪittÃĪÃĪ, ettÃĪ nÃĪmÃĪ menetelmÃĪt parantavat lÃĪhinnÃĪ karkeita piirteitÃĪ, ja ettÃĪ integrointi on riittÃĪmÃĪtÃķn ID-sÃĪilyttÃĪmiselle. LisÃĪksi, kuvan ja teksti-tokenien lisÃĪÃĪminen ristiriitaisuuskerroksiin suoraan voi heikentÃĪÃĪ teksti-tokenien ohjausta, ja kuvan tokenien vahvistaminen voi heikentÃĪÃĪ teksti-tokenien muokkauskykyjÃĪ. TÃĪstÃĪ syystÃĪ, InstantID-kehyksessÃĪ valitaan ControlNet, joka on vaihtoehtoinen piirteiden upotusmenetelmÃĪ, joka kÃĪyttÃĪÃĪ spatiaalista tietoa syÃķtteenÃĪ ohjattavalle moduulille, jotta se voi yllÃĪpitÃĪÃĪ yhdenmukaisuutta UNet-asetuksien kanssa diffuusiomalleissa.
InstantID-kehyksessÃĪ tehdÃĪÃĪn kaksi muutosta perinteiseen ControlNet-arkkitehtuuriin: ehdollisissa syÃķtteissÃĪ, InstantID-kehyksessÃĪ valitaan 5 kasvon avainkohtaa sijaan tarkkaa OpenPose-kasvon avainkohtaa. Toiseksi, InstantID-kehyksessÃĪ kÃĪytetÃĪÃĪn ID-upotuksia sijaan tekstipromptteja ehtoina ristiriitaisuuskerroksissa ControlNet-arkkitehtuurissa.
Koulutus ja Inferenssi
Koulutusvaiheessa, InstantID-kehyksessÃĪ optimoidaan IdentityNetin ja Kuvan Sovittajan parametreja, kun taas esikoulutetun diffuusiomallin parametreja jÃĪÃĪdytetÃĪÃĪn. Koko InstantID-pipeline koulutetaan kuvatekstipareilla, jotka sisÃĪltÃĪvÃĪt ihmishahmoja, ja se kÃĪyttÃĪÃĪ koulutusohjelmaa, joka on samanlainen kuin Stable Diffusion -kehyksessÃĪ, tehtÃĪvÃĪkohtaisilla kuvaehtoilla. InstantID-koulutusmenetelmÃĪn korostus on erottelu kuvan ja teksti-ristiriitaisuuskerrosten vÃĪlillÃĪ Kuvan Sovittajassa, mikÃĪ mahdollistaa kuvaehtojen painojen sopeuttamisen joustavasti ja riippumattomasti, varmistaen tarkemman ja ohjatun inference- ja koulutusprosessin.
InstantID: Kokeet ja Tulokset
InstantID-kehyksessÃĪ otetaan kÃĪyttÃķÃķn Stable Diffusion ja koulutetaan se LAION-Facen avulla, joka on suuri avoimen lÃĪhdekoodin tietokanta, joka sisÃĪltÃĪÃĪ yli 50 miljoonaa kuvatekstiparia. LisÃĪksi, InstantID-kehyksessÃĪ kerÃĪtÃĪÃĪn yli 10 miljoonaa ihmiskuvaa, jotka on luotu automaattisesti BLIP2-mallin avulla, jotta kuvien luontilaatu parannetaan. InstantID-kehyksessÃĪ keskitytÃĪÃĪn lÃĪhinnÃĪ yksilÃķllisiin kuviiin, ja se kÃĪyttÃĪÃĪ esikoulutettua kasvomallia tunnistamaan ja upottamaan kasvon ID-upotuksia kuvista, ja se koulutetaan alkuperÃĪisillÃĪ ihmiskuvilla, eikÃĪ vain kasvojen leikkaamisella. LisÃĪksi, koulutusvaiheessa, InstantID-kehyksessÃĪ jÃĪÃĪdytetÃĪÃĪn esikoulutettu teksti-kuvamalli, ja vain IdentityNetin ja Kuvan Sovittajan parametreja pÃĪivitetÃĪÃĪn.
Kuvan Vain Luonti
InstantID-malli kÃĪyttÃĪÃĪ tyhjÃĪÃĪ prompttia ohjaamaan kuvien luontiprosessia vain viitekuvan avulla, ja tulokset ilman promptteja on esitetty seuraavassa kuvassa.

âTyhjÃĪ promptâ -luonti, kuten edellÃĪ olevassa kuvassa, osoittaa InstantID-kehyksen kyvyn yllÃĪpitÃĪÃĪ rikkaat semanttiset kasvon piirteet, kuten identiteetti, ikÃĪ ja ilme, vahvasti. Kuitenkin, on huomattava, ettÃĪ tyhjien prompttien kÃĪyttÃĪminen ei vÃĪlttÃĪmÃĪttÃĪ pysty toistamaan tuloksia muilla semantiikoilla, kuten sukupuolella. LisÃĪksi, edellÃĪ olevassa kuvassa, sarakkeet 2-4 kÃĪyttÃĪvÃĪt kuvaa ja prompttia, ja kuten voidaan nÃĪhdÃĪ, luodussa kuvassa ei ole havaittavissa teksti-ohjauksen heikentymistÃĪ, ja se varmistaa identiteetin yhdenmukaisuuden. Lopulta, sarakkeet 5-9 kÃĪyttÃĪvÃĪt kuvaa, prompttia ja spatiaalista ohjausta, osoittaen mallin yhteensopivuuden esikoulutettujen spatiaalisten ohjausmallien kanssa, jolloin InstantID-malli pystyy joustavasti ottamaan spatiaaliset ohjaukset esikoulutetun ControlNet-komponentin avulla.

On myÃķs huomattava, ettÃĪ viitekuvien mÃĪÃĪrÃĪ vaikuttaa merkittÃĪvÃĪsti luodussa kuvassa, kuten edellÃĪ olevassa kuvassa. Vaikka InstantID-kehyksessÃĪ pystyy toimittamaan hyvÃĪt tulokset vain yhden viitekuvan avulla, useat viitekuvat tuottavat paremman laadun kuvan, koska InstantID-kehyksessÃĪ otetaan keskiarvo ID-upotuksista kuvaprompttina. Jatkamalla, on tÃĪrkeÃĪÃĪ verrata InstantID-kehyksen tuloksia aiempiin menetelmiin, jotka luovat mukautettuja kuvia vain yhden viitekuvan avulla. Seuraava kuva vertaa InstantID-kehyksen tuloksia olemassa oleviin huipputason malleihin yhden viitekuvan mukautetun kuvan luontiin.

Kuten voidaan nÃĪhdÃĪ, InstantID-kehyksessÃĪ pystyy sÃĪilyttÃĪmÃĪÃĪn kasvon piirteitÃĪ, koska ID-upotus sisÃĪltÃĪÃĪ rikkaat semanttiset tiedot, kuten identiteetti, ikÃĪ ja sukupuoli. On turvallista sanoa, ettÃĪ InstantID-kehyksessÃĪ ylittÃĪÃĪ olemassa olevat kehykset mukautetun kuvan luontiin, koska se pystyy sÃĪilyttÃĪmÃĪÃĪn ihmisen identiteetin yllÃĪpitÃĪen ohjauksen ja tyylin joustavuutta.

Loppusanat
TÃĪssÃĪ artikkelissa on kÃĪyty lÃĪpi InstantID, joka on diffuusiomallipohjainen ratkaisu kuvien luontiin. InstantID on yksinkertainen ja modulaarinen komponentti, joka kÃĪsittelee kuvien luontia ja mukauttamista taitavasti eri tyyleissÃĪ vain yhden viitekuvan avulla ja varmistaa korkean laadun. InstantID-kehyksessÃĪ pyrkii siltaamaan tehokkuuden ja korkean laadun vÃĪlisen aukon esittÃĪmÃĪllÃĪ yksinkertaisen plug and play -moduulin, joka mahdollistaa kehyksen kÃĪsittelemÃĪÃĪn kuvien mukauttamista vain yhden kasvokuvan avulla ja varmistaa korkean laadun.












