AI-mallit ja alustat
Konseptisliderit: Tarkka Kontrolli Diffuusiomalleissa LoRA-mukauttimesta
Kiitos heidän kykyjensä, teksti-kuva diffuusiomalleista on tullut erittäin suosituksi taiteilijayhteisössä. Kuitenkin nykyiset mallit, mukaan lukien viimeisimmät kehitysversiot, usein kamppailevat visualisten konseptien ja attribuuttien hallitsemisessa generoituissa kuvissa, johtaen tyytyväisemättömiin tuloksiin. Useimmat mallit riippuvat pelkästään tekstiprompteista, mikä aiheuttaa haasteita jatkuvien attribuuttien, kuten sään voimakkuuden, varjojen terävyyden, kasvojen ilmeiden tai henkilön iän, tarkkaan säätelyssä. Tämä tekee siitä vaikeaa loppukäyttäjille sovittaa kuvia heidän tiettyihin tarpeisiinsa. Lisäksi, vaikka nämä generatiiviset kehykset tuottavat korkealaatuisia ja realistisia kuvia, ne ovat alttiita vääristymille, kuten vääristyneille kasvoille tai puuttuville sormille.
Ylittääkseen nämä rajoitukset, kehittäjät ovat ehdottaneet tulkitettavien Konseptislidereiden käyttöä. Nämä sliderit lupaavat suurempaa valvontaa loppukäyttäjille visualisoiduista attribuuteista, parantaen kuvan generointia ja editointia diffuusiomalleissa. Konseptisliderit diffuusiomalleissa toimivat tunnistamalla yksittäisen konseptin vastaavan parametrin suunnan ja minimoiden häiriöt muiden attribuuttien kanssa. Kehys luoo nämä sliderit näytteiden kuvista tai joukosta prompteja, luoden suunnat sekä tekstuaalisille että visuaalisille konsepteille.

Lopulta, Konseptislidereiden käyttö teksti-kuvadiffuusiomalleissa voi johtaa kuvan generointiin, jossa on vähäinen määrä häiriötä, ja parantaa valvontaa lopputuloksesta, samalla kun se lisää havaittua realismitasoa ilman sisällön muuttamista, ja siten generoi realistisia kuvia. Tässä artikkelissa tarkastelemme Konseptislidereiden käytön konseptia teksti-kuvakehyksissä tarkemmin, ja analysoimme, miten sen käytön voi johtaa korkealaatuisiin AI-generoituviin kuviiin.
Konseptislidereiden Johdanto
Kuten aiemmin mainittiin, nykyiset teksti-kuvadiffuusiomallit usein kamppailevat visualisten konseptien ja attribuuttien hallitsemisessa generoituissa kuvissa, johtaen tyytyväisemättömiin tuloksiin. Lisäksi, useat näistä malleista löytävät haasteelliseksi jatkuvien attribuuttien säätely, mikä edelleen johtaa tyytyväisemättömiin tuloksiin. Konseptisliderit voivat auttaa lievittämään näitä ongelmia, antaen sisällöntuottajille ja loppukäyttäjille parannetun valvonnan kuvan generoinnissa ja ratkaisemalla haasteita, joita nykyiset kehykset kohtaavat.
Useimmat nykyiset teksti-kuvadiffuusiomallit riippuvat suoraan tekstipromptin muokkauksesta kuvan attribuuttien hallitsemiseksi. Vaikka tämä lähestymistapa sallii kuvan generoinnin, se ei ole optimaalinen, koska promptin muuttaminen voi dramaattisesti muuttaa kuvan rakennetta. Toisaalta, nämä kehykset käyttävät jälkikäteen tekniikoita, jotka käänteiseen diffuusioprosessiin ja muokkaavat ristiriitoja visualisten konseptien editoimiseksi. Kuitenkin, jälkikäteen tekniikat ovat rajoitettuja, ja ne tukevat vain rajoitettua määrää samanaikaista editointia, ja edellyttävät yksittäisiä häiriöitä kullekin uudelle konseptille. Lisäksi, ne voivat aiheuttaa konseptuaalisen sotkeutumisen, jos ne eivät ole suunniteltu huolellisesti.
Toisin sanoen, Konseptisliderit tarjoavat tehokkaamman ratkaisun kuvan generoinnissa. Nämä kevyet, helppokäyttöiset sovittimet voidaan soveltaa esikoulutetuille malleille, parantaen tarkkuutta ja valvontaa halutuissa konsepteissa yhdessä häiriöpassissa, ja vähäisellä sotkeutumisella. Konseptisliderit myös mahdollistavat visualisten konseptien editoinnin, joita tekstipromptit eivät voi määritellä, ja toisin kuin kuvapohjaiset mukauttamismenetelmät, Konseptisliderit sallivat loppukäyttäjille antaa pieni määrä pareittain kuvia, jotka määrittelevät halutun konseptin. Sliderit generalisoivat tämän konseptin ja soveltavat sen automaattisesti muihin kuviin, pyrkien parantamaan realismitasoa ja korjaamaan vääristymiä, kuten käsien vääristymisiä.
Konseptisliderit pyrkivät oppimaan ja ratkaisemaan yleisiä ongelmia neljässä generatiivisessa AI- ja diffuusiopohjaisessa kehyksessä: Kuvan editointi, Ohjausmenetelmät, Mallin editointi ja Semanttiset suunnat.
Kuvan Editointi
Nykyiset AI-kehykset keskittyvät joko ehdolliseen syötteeseen kuvan rakenteen ohjaamiseksi tai manipuloivat lähdetekstin ja kohdepromptin ristiriitoja yksittäisen kuvan editointiin teksti-kuvadiffuusiomalleissa. Tämän seurauksena nämä lähestymistavat voidaan soveltaa vain yksittäisiin kuviin, ja ne edellyttävät latentin perusoptimointia jokaiselle kuvalle, joka johtuu geometrisen rakenteen kehittymisestä ajan kuluessa prompteissa.
Ohjausmenetelmät
Luokitteluun perustuvien ohjausmenetelmien käyttö on osoittanut kykynsä parantaa generoituja kuvien laatua ja teksti-kuvan suhdetta. Sisällyttämällä ohjaustermit häiriöprosessiin, menetelmä parantaa rajoitettua koostettavuutta, joka on peräisin diffuusiopohjaisista kehyksistä, ja ne voidaan käyttää ohjaamaan epäturvallisia konsepteja diffuusiopohjaisissa kehyksissä.
Mallin Editointi
Konseptislidereiden käytön voidaan myös nähdä mallin editointitekniikkana, joka käyttää matalan arvon sovittimen tulostamaan yksittäisen semanttisen attribuutin, joka antaa tilaa jatkuvalle valvonnalle, joka on linjassa attribuutin kanssa. Hienosäätöperusteiset mukauttamismenetelmät käytetään sitten henkilökohtaistamaan kehyksen uusien konseptien lisäämiseksi. Lisäksi, Custom Diffusion -tekniikka ehdottaa tapaa hienosäätää ristiriitaloja uusien visualisten konseptien sisällyttämiseksi esikoulutettuihin diffuusiomalleihin. Toisaalta, Textual Diffusion -tekniikka ehdottaa, että ymmärrysvektoria voidaan optimoida aktivoimaan mallin kykyjä ja sisällyttämään tekstuaalisia konsepteja kehykseen.
Semanttinen Suunta GANeissa
Semanttisten attribuuttien manipulointi on yksi generatiivisten adversaali verkkojen (GAN) avainominaisuuksista, ja latenttilaajan polut on havaittu olevan linjassa itseohjautuvalla tavalla. Diffuusiopohjaisissa kehyksissä nämä latenttilaajan polut sijaitsevat U-Net -arkkitehtuurin keskimmäisissä kerroksissa, ja latenttilaajan pääsuunta diffuusiopohjaisissa kehyksissä havaitsee globaaleja semanttisia suuntia. Konseptisliderit kouluttavat matalan arvon alavuoroja vastaavia erityisiä attribuutteja suoraan, ja saavuttavat tarkan ja paikallisen editointisuunnan käyttämällä tekstiä tai kuvapareja optimoidakseen globaaleja suuntia.
Konseptisliderit: Arkkitehtuuri ja Toiminta
Diffuusiomallit ja LoRA tai Matalan Arvon Sovittimet
Diffuusiomallit ovat periaatteessa generatiivisten AI-kehysten alaluokka, jotka toimivat periaatteella, jossa data syntetisoidaan kääntämällä diffuusioprosessi. Etenevä diffuusioprosessi lisää aluksi melua dataan, siirtyen järjestäytyneestä tilasta täydelliseen Gaussian-meluun. Diffuusiomallien päämäärä on kääntää diffuusioprosessia vähitellen puhdistamalla kuvaa ja näyttelemällä satunnaista Gaussian-melua kuvan generoimiseksi. Todellisissa sovelluksissa diffuusiopohjaisten kehysten päämäärä on ennustaa todellinen melu, kun täydellinen Gaussian-melu syötetään lisäksi ehdollistamiseen ja aikaväliin.
LoRA- tai matalan arvon sovittimen tekniikka hajottaa painopisteen päivitykset hienosäätössä mahdollistaaksesi suurten esikoulutettujen kehysten tehokkaan sovittamisen alaspäin tarkoituksiin. LoRA-tekniikka hajottaa painopisteen päivitykset esikoulutetun mallin kerrokselle suhteen sekä syötteeseen että tulokseen, ja rajoittaa päivityksen matalan ulottuvuuden alavuoroon.
Konseptisliderit
Konseptislidereiden päämäärä on toimia lähestymistapana hienosäätää LoRA-sovittimia diffuusiopohjaisessa kehyksessä, jotta voidaan saavuttaa suurempi valvonta konseptipohjaisissa kuvissa, ja tämä on havaittavissa seuraavassa kuvassa.

Kun ehdollistetaan kohdekonsepteihin, Konseptisliderit oppivat matalan arvon parametrin suunnat joko lisäämään tai vähentämään tietyn attribuutin ilmaisua. Mallin ja kohdekonseptin osalta Konseptislidereiden päämäärä on saavuttaa parannettu malli, joka muuttaa attribuuttien lisäämisen ja vähentämisen todennäköisyyttä kuvan ehdollistettaessa kohdekonseptiin, lisäämällä attribuuttien lisäämisen todennäköisyyttä ja vähentämällä attribuuttien vähentämisen todennäköisyyttä. Reparameteroinnin ja Tweedie’n kaavan avulla kehys esittää aikariippuvan meluprosessin, ja ilmaisee jokaisen tuloksen puhdistusennusteen avulla. Lisäksi, eriytymisobjektiivi hienosäätää Konseptislidereiden moduuleja pitäen esikoulutetut painopisteet vakiona, ja skaalauksetekijä, joka esitellään LoRA-muodossa, muutetaan häiriössä. Skaalauksetekijä myös mahdollistaa editointivoimakkuuden säätämisen, ja tekee editoinnin vahvemmaksi ilman kehyksen uudelleenkoulutusta, kuten havaittavissa seuraavassa kuvassa.

Aiemmin käytetyt editointimenetelmät kehyksissä mahdollistivat vahvemman editoinnin kouluttamalla kehystä lisääntyneellä ohjauksella. Kuitenkin, skaalauksetekijän säätäminen häiriössä tuottaa saman editointituloksen ilman koulutuksen kustannuksen ja ajan lisäämistä.
Visuaalisten Konseptien Oppiminen
Konseptisliderit on suunniteltu hallitsemaan visuaalisia konsepteja, joita tekstipromptit eivät voi määritellä hyvin, ja nämä sliderit hyödyntävät pieniä tietoja, jotka on pareittain ennen tai jälkeen, kouluttaakseen nämä konseptit. Kuvausten välinen kontrasti mahdollistaa sliderien oppimisen visuaalisista konsepteista. Lisäksi, Konseptislidereiden koulutusprosessi optimoi LoRA-komponentin, joka on toteutettu sekä eteen- että taaksepäin. Tämän seurauksena LoRA-komponentti on linjassa suunnassa, joka aiheuttaa visuaaliset vaikutukset molemmissa suunnissa.
Konseptisliderit: Toteutus Tulokset
Arvioidakseen suorituskyvyn parantamisen, kehittäjät ovat arvioineet Konseptislidereiden käyttöä pääasiassa Stable Diffusion XL: ssä, korkearesoluutioisessa 1024-pikselin kehyksessä, ja suorittivat lisäksi kokeita Stable Diffusion v1.4 -kehyksessä, jolloin mallit koulutettiin 500 epochin ajan.
Tekstuaaliset Konseptisliderit
Arvioidakseen tekstuaalisten Konseptislidereiden suorituskyvyn, se on validoitava joukossa 30 tekstipohjaisesta konseptista, ja menetelmä on verrattavissa kahteen vertailukohtaan, jotka käyttävät standardia tekstipromptia kiinteään määrään aikaväleistä, ja aloittavat komposition lisäämällä prompteja ohjaamaan kuvaa. Kuten voidaan nähdä seuraavassa kuvassa, Konseptislidereiden käyttö johtaa jatkuvasti korkeampiin CLIP-pisteisiin ja vähäisempään LPIPS-pisteisiin verrattuna alkuperäiseen kehykseen ilman Konseptislidereitä.


Kuten voidaan nähdä yllä olevassa kuvassa, Konseptislidereiden käyttö mahdollistaa tarkan editoinnin halutuista attribuuteista kuvan generoinnissa, samalla kun se säilyttää kuvan yleisen rakenteen.
Visuaaliset Konseptisliderit
Teksti-kuvadiffuusiomallit, jotka käyttävät vain tekstiprompteja, usein kärsivät vaikeuksista visualisten attribuuttien, kuten partakkeiden tai silmien muodon, hallitsemisessa. Varmistamaan paremman valvonnan hienojakoisissa attribuuteissa, Konseptisliderit käyttävät valinnaisia teksti-ohjauksia yhdessä kuvatietojen kanssa. Kuten voidaan nähdä seuraavassa kuvassa, Konseptisliderit luovat yksittäisiä slidereitä “silmien koolle” ja “kulmien muodolle”, jotka havaitsevat halutut muutokset kuvapareiden avulla.

Tulokset voidaan jalostaa antamalla tarkkoja tekstejä, jotta suunta voi keskittyä kasvojen alueeseen, ja luoda slidereita, joilla on askeltainen valvonta kohdistetussa attribuutissa.
Konseptislidereiden Yhdistäminen
Yksi Konseptislidereiden tärkeimmistä eduista on niiden yhdistettävyys, joka mahdollistaa useiden slidereiden yhdistämisen suuremman valvonnan saavuttamiseksi, eikä vain yhden konseptin kerrallaan. Lisäksi, koska Konseptisliderit ovat kevyitä LoRA-sovittimia, ne ovat helppoja jakaa, ja ne voidaan helposti yhdistää diffuusiomalleihin. Käyttäjät voivat myös säätää useita nuppija samanaikaisesti ohjaamaan monimutkaisia generoita lataamalla mielenkiintoisia slider-joukkoja.

Seuraava kuva osoittaa Konseptislidereiden yhdistettävyyden, ja useita slidereita yhdistetään etenemällä jokaisessa rivissä vasemmalta oikealle, mahdollistaen korkean ulottuvuuden konseptitilojen käsittelyn parannetulla valvonnalla konsepteja.

Kuvan Laadun Parantaminen
Vaikka viimeisimmät teksti-kuvadiffuusiopohjaiset kehykset ja suuret generatiiviset mallit, kuten Stable Diffusion XL -malli, pystyvät generoimaan realistisia ja korkealaatuisia kuvia, ne usein kärsivät kuvan vääristymistä, kuten sumea tai vääristynyt objekti, vaikka näiden kehysten parametrejä on varustettu latentilla kyvyllä generoida korkealaatuisia tuloksia vähemmällä generoinnilla. Konseptislidereiden käyttö voi johtaa kuvien generoimiseen, joissa on vähemmän vääristymiä, lukittamalla näiden mallien todelliset kyvyt ja tunnistamalla matalan arvon parametrin suunnat.
Käsien Korjaaminen
Kuvien generoiminen realistisilla käsillä on aina ollut haaste diffuusiopohjaisille kehyksille, ja Konseptislidereiden käyttö on osoittanut suoraa valvontaa käsien vääristymisen korjaamiseksi. Seuraava kuva osoittaa “korjaa kädet” -Konseptislidereiden vaikutuksen, joka mahdollistaa kehyksen generoimisen kuvilla, joissa on realistisemmat kädet.

Korjaussliderit
Konseptislidereiden käyttö ei ainoastaan johtanut realistisempien käsien generoimiseen, vaan ne ovat myös osoittaneet potentiaalia kuvien yleisen realismin parantamisessa. Konseptisliderit tunnistavat yksittäisen matalan arvon parametrin suunnan, joka mahdollistaa kuvien siirtymisen yleisistä vääristymisongelmista, ja tulokset on esitetty seuraavassa kuvassa.

Loppusanat
Tässä artikkelissa olemme keskustelleet Konseptislidereistä, yksinkertaisesta mutta skaalautuvasta uudesta lähestymistavasta, joka mahdollistaa tulkitettavan valvonnan generoituissa tuloksissa diffuusiomalleissa. Konseptislidereiden käyttö pyrkii ratkaisemaan nykyisten teksti-kuvadiffuusiopohjaisten kehysten ongelmat, jotka kamppailevat visualisten konseptien ja attribuuttien hallitsemisessa generoituissa kuvissa, johtaen usein tyytyväisemättömiin tuloksiin. Lisäksi, useimmat teksti-kuvadiffuusiopohjaiset mallit kärsivät jatkuvien attribuuttien säätelystä, mikä johtaa usein tyytyväisemättömiin tuloksiin. Konseptislidereiden käyttö voi mahdollistaa teksti-kuvadiffuusiopohjaisten kehysten lievittämisen näitä ongelmia ja antaa sisällöntuottajille ja loppukäyttäjille parannetun valvonnan kuvan generoinnissa, ja ratkaisemalla haasteita, joita nykyiset kehykset kohtaavat.












