AI-mallit ja alustat
InstantStyle: Tekstistä kuvaan generoinnin tyylipreservation
Viime vuosien aikana säätöperusteiset diffuusiomallit ovat osoittaneet merkittävää edistystä laajassa valikoimassa kuvan henkilökohtaisia tehtäviä ja mukauttamistehtäviä. Kuitenkin, vaikka heillä on potentiaalia, nykyiset säätöperusteiset diffuusiomallit jatkavat kohtaamista monimutkaisia haasteita tuottaa ja generoida tyylivakaita kuvia, ja siinä voi olla kolme syytä. Ensinnäkin, tyylillä on edelleen laaja ja määrittelemätön käsite, joka käsittää yhdistelmän elementtejä, mukaan lukien ilmapiiri, rakenne, suunnittelu, materiaali, väri ja paljon muuta. Toiseksi, käänteisyyden perusteella olevat menetelmät ovat alttiita tyylirikkoja, mikä johtaa usein hienojen yksityiskohtien menetykseen. Lopuksi, sovittimen perusteella olevat lähestymistavat vaativat usein painojen säätämistä kullekin viitekuvalle tasapainon saavuttamiseksi tekstien ohjattavuuden ja tyylivahvuuden välillä.
Lisäksi, useimpien tyylisiirtojen tai tyylillisten kuvien generoinnin tavoitteena on käyttää viitekuvaa ja soveltaa sen tiettyä tyyliä annetusta alijoukosta tai viitekuvasta kohdekuvan sisältöön. Kuitenkin, tyylillä on laaja määrä ominaisuuksia, mikä tekee työstä vaikeaksi tutkijoille kerätä tyylillisiä tietoja, edustaa tyyliä oikein ja arvioida siirron onnistumista. Aikaisemmin, mallit ja kehykset, jotka käsittelevät hienosäätöön perustuvaa diffuusioprosessia, ovat hienosäätäneet kuvien tietoja, jotka jakavat yhteisen tyylinsä, prosessi, joka on sekä aikaa vievä että rajoitettu yleistettävyydellä todellisissa tehtävissä, koska on vaikea kerätä joukko kuvia, jotka jakavat saman tai lähes saman tyylinsä.
Tässä artikkelissa, puhumme InstantStylesta, kehyksestä, joka on suunniteltu ratkaisemaan nykyisten säätöperusteisten diffuusiomallien haasteita kuvan generoinnissa ja mukauttamisessa. Puhumme InstantStyle-kehyksen kahdesta avainstrategiasta:
- Yksinkertainen mutta tehokas lähestymistapa erottaa tyylillä ja sisällöstä viitekuvista ominaisuustilassa, joka perustuu oletukseen, että ominaisuudet samassa ominaisuustilassa voidaan joko lisätä tai vähentää toisistaan.
- Estää tyylivuotoja injektoimalla viitekuvan ominaisuudet yksinomaan tyylispesifisiin lohkoihin ja välttämällä tarvetta käyttää kömpelöitä painoja hienosäätöön, mikä usein luonnehtii enemmän parametreja raskaampia suunnitteluja.
Tämä artikkeli pyrkii kattamaan InstantStyle-kehyksen syvällisemmin, ja tutkimme kehyksen mekanismin, metodologian, arkkitehtuurin ja vertaamme sitä valtavirtaisten kehysten kanssa. Puhumme myös siitä, miten InstantStyle-kehyksellä on näyttävä visuaalinen tyylittely ja löytää optimaalisen tasapainon tekstielementtien ohjattavuuden ja tyylivahvuuden välillä. Joten aloitetaan.
InstantStyle: Tyylipreservation Tekstistä Kuvaan Generoinnissa
Diffuusiopohjaiset tekstistä kuvaan generoivat AI-kehykset ovat saavuttaneet merkittävää menestystä laajassa valikoimassa mukauttamis- ja henkilökohtaisia tehtäviä, erityisesti johdonmukaisissa kuvien generoinnissa, mukaan lukien esineen mukauttaminen, kuvan säilyttäminen ja tyylisiirto. Kuitenkin, vaikka viimeaikaisessa suorituskyvyn parantamisessa, tyylisiirto edelleen muodostaa haasteen tutkijoille tyylillä on epämääräinen ja määrittelemätön luonne, usein käsittäen monia elementtejä, mukaan lukien ilmapiiri, rakenne, suunnittelu, materiaali, väri ja paljon muuta. Viitekuvan tietyn tyylillä soveltaminen kohdekuvan sisältöön on tyylillisten kuvien generoinnin tai tyylisiirron ensisijainen tavoite. Kuitenkin, tyylillä on laaja määrä ominaisuuksia, mikä tekee työstä vaikeaksi tutkijoille kerätä tyylillisiä tietoja, edustaa tyyliä oikein ja arvioida siirron onnistumista.
Nykyisten lähestymistapojen haasteiden vuoksi, tutkijat ovat kiinnostuneita kehittämään hienosäätölähestymistä tyylisiirtoon tai tyylillisten kuvien generointiin, ja nämä kehykset voidaan jakaa kahteen eri ryhmään:
- Sovittimen Vapaa Lähestymistapa: Sovittimen vapaa lähestymistapa ja kehykset hyödyntävät itsehuomion voimaa diffuusioprosessissa, ja toteuttamalla jaettu huomio-toiminto, nämä mallit pystyvät extrahoimaan olennaiset ominaisuudet, mukaan lukien avaimet ja arvot annetuista viitekuvista suoraan.
- Sovittimen Perustuva Lähestymistapa: Sovittimen perustuva lähestymistapa ja kehykset sisältävät kevyen mallin, joka on suunniteltu extrahoimaan yksityiskohtaiset kuvarepresentaatiot viitekuvista. Kehys integroi nämä representaatiot diffuusioprosessiin taitavasti käyttäen ristihuomio-mekanismeja. Integraatioprosessin ensisijainen tavoite on ohjata generointiprosessia ja varmistaa, että tulokseksi saadaan kuva, joka on linjassa toivottujen tyylillisten nuanssien kanssa.
Kuitenkin, vaikka lupauksista, säätövapaiden menetelmät kohtaavat usein joitakin haasteita. Ensinnäkin, sovittimen vapaan lähestymistapan vaatii avaimen ja arvon vaihtoa itsehuomion kerroksissa, ja ennakoi avain- ja arvomatriiseja, jotka ovat johdettu viitekuvista. Kun toteutetaan luonnollisilla kuvilla, sovittimen vapaan lähestymistapan vaatii kuvan kääntämistä takaisin latenteihin ääniin käyttäen tekniikoita, kuten DDIM tai Denoising Diffusion Implicit Models inversion. Kuitenkin, käyttäen DDIM tai muita inversion menetelmiä, voi johtaa hienojen yksityiskohtien, kuten värin ja tekstuurin, menetykseen, mikä heikentää tyylitietoa generoiduissa kuvissa. Lisäksi, tämä lisätty askel, jota nämä lähestymistavat esittävät, on aikaa vievä prosessi, ja voi aiheuttaa merkittäviä haittoja käytännön sovelluksissa. Toisaalta, sovittimen perustuvien menetelmien ensisijainen haaste on löytää oikea tasapaino kontekstin vuotojen ja tyylivahvuuden välillä. Sisällön vuoto tapahtuu, kun tyylivahvuuden lisääminen johtaa ei-tyylistä elementtien ilmestymiseen generoiduissa kuvissa, ja ensisijainen haaste on erottaa tyylit sisällöstä viitekuvissa tehokkaasti. Ratkaisemaan tämän ongelman, jotkut kehykset rakentavat pareittaisia tietoja, jotka edustavat samaa esinettä eri tyyleissä, helpottaen sisällön edustavan ja eriytetyn tyylit. Kuitenkin, kiitos tyylillä on sisäänrakennettu epämääräinen edustus, suuren mittakaavan pareittaisen tietojen luominen on rajoitettu tyylillä, jonka se voi kaapata, ja se on resursseja vaativa prosessi.

Tätä rajoitusta vastaan, InstantStyle-kehyksen esittely, joka on uusi säätövapaa mekanismi, joka perustuu olemassaoleviin sovittimen perustuihin menetelmiin, ja pystyy sulautumaan muihin huomioon perustuviin injektio-menetelmiin, ja saavuttaa sisällön ja tyylillä erottamisen tehokkaasti. Lisäksi, InstantStyle-kehyksellä on kaksi tehokasta tapaa suorittaa tyylillä ja sisällön erottaminen, ja saavuttaa paremman tyylisiirron ilman lisättyjä menetelmiä erottamiseen tai pareittaisen tietojen rakentamiseen.
Lisäksi, aikaisemmat sovittimen perustuvat kehykset ovat laajasti käytettyjä CLIP-pohjaisissa menetelmissä kuvan ominaisuuden extraktorina, jotkut kehykset ovat tutkineet mahdollisuutta toteuttaa ominaisuuden erottamista ominaisuustilassa, ja verrattuna tyylillä epämääräisiin attribuutteihin, on helpompaa kuvailla sisältöä tekstillä. Koska kuvat ja tekstit jakavat samaa ominaisuustilaa CLIP-pohjaisissa menetelmissä, yksinkertainen vähennysoperaatio kontekstin tekstin ominaisuuksista ja kuvan ominaisuuksista voi vähentää sisällön vuotoa merkittävästi. Lisäksi, useimmissa diffuusiomalleissa on tietty kerros sen arkkitehtuurissa, joka injektoi tyylitiedon, ja suorittaa sisällön ja tyylillä erottamisen injektoimalla kuvan ominaisuudet yksinomaan tiettyihin tyylilohkoihin. Toteuttamalla nämä kaksi yksinkertaista strategiaa, InstantStyle-kehyksellä on kyky ratkaista sisällön vuoto-ongelmat, joita useimmat olemassaolevat kehykset kohtaavat, samalla säilyttäen tyylillä vahvuuden.
Yhteenvetona, InstantStyle-kehyksellä on kaksi yksinkertaista, suoraa ja tehokasta mekanismia saavuttaa tehokas erottaminen sisällöstä ja tyylillä viitekuvista. InstantStyle-kehyksellä on malliriippumaton ja säätövapaa lähestymistapa, joka osoittaa merkittävää suorituskykyä tyylisiirto-tehtävissä, ja sillä on suuri potentiaali alaspäin suuntautuvissa tehtävissä.
Instant-Style: Metodologia ja Arkkitehtuuri
Aikaisempien lähestymistapojen mukaan, on tasapaino tyylillä ehdotusten injektiossa säätövapaissa diffuusiomalleissa. Jos kuvan ehto on liian voimakas, se voi johtaa sisällön vuotoon, kun taas jos kuvan ehto on liian heikko, tyylillä ei voi olla tarpeeksi selkeää. Yksi syy tähän havaintoon on, että kuvassa tyylillä ja sisällöllä on kytkös, ja tyylillä on sisäänrakennettu epämääräinen attribuutti, mikä tekee työstä vaikeaksi erottaa tyylillä ja tarkoituksen. Seuraavana, hienosäätöä usein tehdään kullekin viitekuvalle tasapainon saavuttamiseksi tekstien ohjattavuuden ja tyylivahvuuden välillä. Lisäksi, annetun viitekuvan ja sen vastaavan tekstin kuvaus inversion-perusteisissa menetelmissä, inversion-lähestymistapa, kuten DDIM, otetaan kuvan yli saadakseen käännetyksi diffuusioreitin, prosessi, joka approksimoi inversion yhtälön muuttaa kuvan latenteiksi ääneksi. Rakentamalla tästä, ja aloittaen käännetyksi diffuusioreitistä ja uudesta joukosta prompteja, nämä menetelmät generoivat uuden sisällön, jonka tyylillä on linjassa syötteen kanssa. Kuitenkin, kuten seuraavassa kuvassa näkyy, DDIM-inversion lähestymistapa todellisille kuville on usein epävakaa, koska se perustuu paikalliseen lineaaristamiseen, mikä johtaa virheiden etenemiseen ja sisällön menetykseen ja virheelliseen kuvan rekonstruktioon.

Tulevaan metodologiaan, InstantStyle-kehyksellä ei käytetä monimutkaisia strategioita erottamaan sisällöstä ja tyylillä kuvista. Sen sijaan, InstantStyle-kehyksellä on yksinkertainen lähestymistapa saavuttaa samanlainen suorituskyky. Vertaamalla tyylillä epämääräisiä attribuutteja, sisällön voidaan edustaa luonnollisella tekstillä, mikä mahdollistaa InstantStyle-kehyksellä käyttää tekstin koodausta CLIP:stä extrahoidaakseen sisällön ominaisuuksia kontekstin edustajina. Samanaikaisesti, InstantStyle-kehyksellä toteutetaan CLIP-kuvan koodaus extrahoidaakseen viitekuvan ominaisuudet. Hyödyntämällä CLIP:n globaaleja ominaisuuksia, ja vähentämällä sisällön tekstin ominaisuuksia kuvan ominaisuuksista, InstantStyle-kehyksellä voidaan erottaa tyylillä ja sisällöllä eksplisiittisesti. Vaikka se on yksinkertainen strategia, se auttaa InstantStyle-kehyksellä pitämään sisällön vuodon minimissä.

Lisäksi, jokainen kerros syvällisessä verkossa on vastuussa eri semanttisen tiedon kaappaamisesta, ja aikaisempien mallien avainhavainto on, että on kaksi huomio-kerrosta, jotka ovat vastuussa käsittelemästä tyylillä. Nämä kerrokset ovat blocks.0.attentions.1 ja down blocks.2.attentions.1, jotka ovat vastuussa kaappaamasta tyylillä, kuten väri, materiaali, ilmapiiri, ja spatiaalisen layout-kerros kaappaa rakenteen ja komposition. InstantStyle-kehyksellä käyttää näitä kerroksia implisiittisesti extrahoidakseen tyylitiedon, ja estää sisällön vuodon ilman tyylivahvuuden menetystä. Strategia on yksinkertainen, mutta tehokas, koska malli on löytänyt tyylillä lohkot, jotka voivat injektoida kuvan ominaisuudet näihin lohkoihin saavuttaakseen vaivattoman tyylisiirron. Lisäksi, koska malli vähentää sovittimen parametreja, tekstin ohjattavuus kehyksellä on parantunut, ja mekanismi on sovellettavissa muihin huomioon perustuviin ominaisuuden injektio-malleihin muokkaamiseen ja muihin tehtäviin.

Instant-Style: Kokeet ja Tulokset
InstantStyle-kehyksellä on toteutettu Stable Diffusion XL -kehyksellä, ja se käyttää yleisesti hyväksyttyä IR-sovittimen esimerkkiä validoidakseen metodologiansa, ja hiljentää kaikki lohkot paitsi tyylilohkot kuvan ominaisuuksille. InstantStyle-malli myös kouluttaa IR-sovittimen 4 miljoonan suuren mittakaavan teksti-kuvaparista tietojoukosta alusta alkaen, ja sen sijaan, että kouluttaa kaikki lohkot, se päivittää vain tyylilohkot.
Toteuttaakseen generalisaatiokykynsä ja robustisuutensa, InstantStyle-kehyksellä suorittaa useita tyylisiirto-kokeita eri tyyleillä eri sisällöillä, ja tulokset voidaan nähdä seuraavissa kuvissa. Annettaessa yksittäinen viitekuva ja vaihtelevia prompteja, InstantStyle-kehyksellä tuottaa laadukkaita, johdonmukaisia tyylillä kuvia.

Lisäksi, koska malli injektoi kuvatiedon vain tyylilohkoihin, se pystyy vähentämään sisällön vuodon ongelmaa merkittävästi, ja siksi, se ei tarvitse painojen säätämistä.

Edelleen, InstantStyle-kehyksellä otetaan käyttöön ControlNet-arkkitehtuuri saavuttaakseen kuvan perustuvaa tyylittelyä spatiaalisen ohjauksen kanssa, ja tulokset on esitetty seuraavassa kuvassa.

Vertaamalla aikaisempiin valtavirtaisiin menetelmiin, kuten StyleAlign, B-LoRA, Swapping Self Attention ja IP-Adapter, InstantStyle-kehyksellä osoittaa parhaat visuaaliset vaikutukset.

Loppusanat
Tässä artikkelissa, puhumme InstantStylesta, yleisestä kehyksestä, joka käyttää kahta yksinkertaista, mutta tehokasta strategiaa saavuttaa tehokas erottaminen sisällöstä ja tyylillä viitekuvista. InstantStyle-kehyksellä on suunniteltu ratkaisemaan nykyisten säätöperusteisten diffuusiomallien haasteita kuvan generoinnissa ja mukauttamisessa. InstantStyle-kehyksellä toteuttaa kaksi tärkeää strategiaa: yksinkertainen, mutta tehokas lähestymistapa erottaa tyylillä ja sisällöstä viitekuvista ominaisuustilassa, joka perustuu oletukseen, että ominaisuudet samassa ominaisuustilassa voidaan joko lisätä tai vähentää toisistaan. Toiseksi, estää tyylivuotoja injektoimalla viitekuvan ominaisuudet yksinomaan tyylispesifisiin lohkoihin, ja välttämällä tarvetta käyttää kömpelöitä painoja hienosäätöön, mikä usein luonnehtii enemmän parametreja raskaampia suunnitteluja.












