AI-mallit ja alustat
Itsehuomio-ohjaus: Parantamalla diffuusiomallien näytenlaatua
Puhdistusdiffuusiomallit ovat generatiiviset tekoälykehykset, jotka syntetisoivat kuvia melusta iteratiivisen puhdistusprosessin kautta. Ne ovat saaneet tunnustusta poikkeuksellisista kuvien luomiskyvystään ja monimuotoisuudesta, jota voidaan pitkälti verrata teksti- tai luokka-ehtoiseen ohjausmenetelmiin, mukaan lukien luokittelijan ohjaus ja luokittelijan vapaa ohjaus. Nämä mallit ovat olleet erittäin onnistuneita luodessaan monimuotoisia, korkealaatuisia kuvia. Viimeaikaiset tutkimukset ovat osoittaneet, että ohjausmenetelmät, kuten luokkaotsikot ja -merkit, ovat tärkeitä kuvien laadun parantamisessa, joita nämä mallit tuottavat.
Diffuusiomallit ja ohjausmenetelmät kuitenkin kohtaavat rajoituksia tietyissä ulkoisissa olosuhteissa. Luokittelijan vapaa ohjausmenetelmä (CFG), joka käyttää merkintien poistoa, lisää monimutkaisuutta koulutusprosessiin, kun taas luokittelijan ohjausmenetelmä (CG) edellyttää lisäksi luokittelijan koulutusta. Molemmat menetelmät ovat jossain määrin rajoitettuja riippuvuudestaan kovista ulkoisista olosuhteista, mikä rajoittaa niiden potentiaalia ja rajoittaa niitä ehdollisiin asetelmiin.
Näiden rajoitusten poistamiseksi kehittäjät ovat muotoilleet yleisemmän lähestymistavan diffuusioiden ohjaukseen, jota kutsutaan itsehuomio-ohjaukseksi (SAG). Tämä menetelmä hyödyntää tietoa diffuusiomallien välimuodosta kuvien luomiseen. Tässä artikkelissa tarkastelemme SAG:ia, sen toimintaa, menetelmiä ja tuloksia verrattaen nykyisiin valtavirtaisten kehysten ja putkien tuloksiin.
Itsehuomio-ohjaus: Parantamalla diffuusiomallien näytenlaatua
Puhdistusdiffuusiomallit (DDM) ovat saaneet suosiota kyvystään luoda kuvia melusta iteratiivisen puhdistusprosessin kautta. Nämä mallien kuvien synteesin taito on suurelta osin diffusion ohjausmenetelmien ansiota. Vaikka heillä on vahvuuksia, diffuusiomallit ja ohjausmenetelmät kohtaavat haasteita, kuten lisättyä monimutkaisuutta ja lisääntyneitä laskentakustannuksia.
Rajoitusten ylittämiseksi kehittäjät ovat esittäneet itsehuomio-ohjausmenetelmän, joka on yleisempi diffuusioiden ohjausmenetelmä, joka ei riipu ulkoisesta tiedosta diffuusioiden ohjauksesta, mikä mahdollistaa ehtojen ja koulutuksen vapauden lähestymistavan diffuusioiden ohjaamiseen. Itsehuomio-ohjaus perustuu yksinkertaiseen yleistettyyn muotoiluun periaatteeseen, ja oletukseen, että sisäinen tieto, joka sisältyy välimuotoon, voidaan käyttää ohjaamiseen.
Itsehuomio-ohjaus perustuu itsehuomion karttojen hyödyntämiseen diffuusiomalleissa. Kokonaisuutena itsehuomio-ohjausmenetelmä himmentää itsehuomion alueita syöte-signaaleissa tai yksinkertaisesti sanottuna, piilottaa tietoa alueista, joihin diffuusiomallit kiinnittävät huomiota. Tulostus-signaaleissa itsehuomio-ohjaus sisältää koskemattomia alueita syöte-signaaleista, mikä tarkoittaa, että se ei johda rakenteelliseen epäselvyyteen syötteissä, ja ratkaisee globaalin himmentymisen ongelman.
Itsehuomio-ohjaus: Kokeet ja tulokset
Itsehuomio-ohjausputki on otettu käyttöön 8 Nvidia GeForce RTX 3090 -näytönohjaimella, ja se perustuu esikoulutettuihin IDDPM-, ADM- ja Stable Diffusion-kehyksiin.
Ehdoton generointi itsehuomio-ohjauksella
Itsehuomio-ohjausputken tehokkuuden arvioimiseksi ehdottomissa malleissa ja osoittamaan ehtojen riippumattomuuden ominaisuutta, jota luokittelijan ohjaus ja luokittelijan vapaa ohjaus -menetelmät eivät omaa, itsehuomio-ohjausputki suoritetaan ehdottomasti esikoulutetuilla kehyksillä 50 000 näytteellä.

Kuten voidaan havaita, itsehuomio-ohjausputken toteutus parantaa FID-, sFID- ja IS-metrien arvoja ehdottomissa syötteissä, samalla kun se laskee takaisinkutsun arvoa. Lisäksi laadulliset parannukset itsehuomio-ohjausputken toteuttamisesta ovat havaittavissa seuraavissa kuvissa, joissa yläreunassa olevat kuvat ovat ADM- ja Stable Diffusion -kehyksistä, kun taas alareunassa olevat kuvat ovat ADM- ja Stable Diffusion -kehyksistä itsehuomio-ohjausputken kanssa.


Ehdollinen generointi SAG:lla
Itsehuomio-ohjausputken integrointi olemassa oleviin kehyksiin tuottaa poikkeuksellisia tuloksia ehdottomassa generoinnissa, ja itsehuomio-ohjausputki on kykeneväinen ehtojen tuntemattomuuteen, mikä mahdollistaa itsehuomio-ohjausputken toteuttamisen myös ehdollisessa generoinnissa.
Vakaa diffuusio itsehuomio-ohjauksella
Vaikka alkuperäinen Stable Diffusion -kehys tuottaa korkealaatuisia kuvia, Stable Diffusion -kehyksen integrointi itsehuomio-ohjausputkeen voi parantaa tuloksia dramaattisesti. Arvioidakseen vaikutustaan, kehittäjät käyttävät tyhjiä ohjearpoja Stable Diffusioniin satunnaisella siemenellä jokaiselle kuvaparille ja käyttävät ihmisen arviointia 500 kuvaparista ilman ja itsehuomio-ohjauksella.

Lisäksi itsehuomio-ohjausputken toteutus voi parantaa Stable Diffusion -kehyksen kykyjä, ja luokittelijan vapaan ohjauksen yhdistäminen itsehuomio-ohjaukseen voi laajentaa Stable Diffusion -mallien soveltamisalaa teksti-kuvan synteesiin. Lisäksi kuvat, jotka on generoitu Stable Diffusion -mallilla itsehuomio-ohjauksella, ovat korkealaatuisempia ja vähemmän virheellisiä itsehuomio-ohjausputken itse-ehtoisen vaikutuksen ansiosta.

Nykyiset rajoitukset
Vaikka itsehuomio-ohjausputken toteutus voi parantaa merkittävästi generoituja kuvien laatua, sillä on joitakin rajoituksia.
Yksi merkittävimmistä rajoituksista on ortogonaalisuus luokittelijan ohjauksen ja luokittelijan vapaan ohjauksen kanssa. Kuten voidaan havaita seuraavasta kuvasta, itsehuomio-ohjausputken toteutus parantaa FID-lukua ja ennustusarvoa, mikä tarkoittaa, että itsehuomio-ohjausputkessa on ortogonaalinen komponentti, jota voidaan käyttää perinteisten ohjausmenetelmien kanssa samanaikaisesti.

Kuitenkin se edellyttää, että diffuusiomallit on koulutettu tiettyyn tapaan, mikä lisää monimutkaisuutta ja laskentakustannuksia.
Lisäksi itsehuomio-ohjausputken toteutus ei lisää muistia tai aikaa, mikä osoittaa, että itsehuomio-ohjausputken operaatioiden ylijäämä on vähäistä. Kuitenkin se lisää laskentakustannuksia, koska se sisältää lisäaskelen verrattuna ohjaamattomiin menetelmiin.

Lopputajat
Tässä artikkelissa olemme keskustelleet itsehuomio-ohjauksesta, joka on uudenlainen ja yleinen ohjausmenetelmä, joka käyttää diffuusiomalleissa olevaa sisäistä tietoa korkealaatuisen kuvien luomiseen. Itsehuomio-ohjaus perustuu yksinkertaiseen yleistettyyn muotoiluun periaatteeseen, ja oletukseen, että sisäinen tieto, joka sisältyy välimuotoon, voidaan käyttää ohjaamiseen. Itsehuomio-ohjausputki on ehtojen ja koulutuksen vapaa lähestymistapa, jota voidaan soveltaa eri diffuusiomalleihin, ja joka käyttää itse-ehtoista vaikutusta vähentämään virheitä generoituissa kuvissa ja parantamaan kokonaislaatua.












