AI-mallit ja alustat
Visuaalinen Autoregressiivinen Mallinnus: Mittakaavan Säännöllinen Kuvien Generointi Seuraavan Asteen Ennustamisen Kautta
GPT-mallien ja muiden autoregressiivisten tai suurten kielen mallien kehittyminen on avaanut uuden aikakauden koneoppimisen ja tekoälynnässä. GPT- ja autoregressiiviset mallit usein osoittavat yleistä älykkyyttä ja monipuolisuutta, jotka ovat merkittävä askel kohti yleistä tekoälyä eli AGI:ä, vaikka niissä on joitakin ongelmia, kuten hallucinaatioita. Kuitenkin näiden suurten mallien hämmästyttävä ongelma on itseopiskeltu oppimisstrategia, joka sallii mallin ennustaa seuraavan tokenin jonossa, yksinkertainen mutta tehokas strategia. Viimeaikaiset tutkimukset ovat osoittaneet näiden suurten autoregressiivisten mallien menestyksen, korostamalla niiden yleispätevyyttä ja skaalautuvuutta.
Rakentamalla tämän päälle, tässä artikkelissa puhumme Visuaalisesta Autoregressiivisesta eli VAR-kehyksestä, joka on uusi sukupolvi, joka määrittelee autoregressiivisen oppimisen kuvissa karkeasta hienoon “seuraavan resoluution ennustamisena” tai “seuraavan asteen ennustamisena”. Vaikka yksinkertainen, lähestymistapa on tehokas ja sallii autoregressiivisille transformatoreille oppia visuaalisten jakautumien paremmin, ja parantaa yleispätevyyttä. Lisäksi Visuaaliset Autoregressiiviset mallit mahdollistavat GPT-tyylisille autoregressiivisille malleille ylittää diffuusiomallit kuvien generoinnissa ensimmäistä kertaa. Kokeet osoittavat myös, että VAR-kehys parantaa autoregressiivisia peruslinjoja merkittävästi, ja ylittää Diffuusiotransformatorin eli DiT-kehyksen useilla mittareilla, mukaan lukien datan tehokkuus, kuvan laatu, skaalautuvuus ja inference-nopeus.
Tämä artikkeli pyrkii kattamaan Visuaalisen Autoregressiivisen kehyksen syvällisemmin, ja tutkimme mekanismin, metodologian, arkkitehtuurin ja vertaamme sitä valmiiden kehyksiin. Puhumme myös siitä, miten Visuaalinen Autoregressiivinen kehys osoittaa kaksi tärkeää ominaisuutta LLM:istä: skaalautuvuuslain ja nollashotin generalisointi. Joten aloitetaan.
Visuaalinen Autoregressiivinen Mallinnus: Kuvien Generointi
Yleinen kaava viimeaikaisissa suurissa kielen malleissa on itseopiskeltu oppimisstrategian toteutus, yksinkertainen mutta tehokas lähestymistapa, joka ennustaa seuraavan tokenin jonossa. Kiitos tälle lähestymistavalle, autoregressiiviset ja suuret kielen mallit ovat osoittaneet merkittävää skaalautuvuutta ja yleispätevyyttä, ominaisuuksia, jotka paljastavat autoregressiivisten mallien potentiaalin oppia suuresta määrästä merkintätöntä dataa.

Tutkijat ovat kuitenkin vielä tutkimassa näiden mallien skaalautuvuuslakeja, ja mitä frustrativampaa on se, että näiden mallien suorituskyky usein jää diffuusiomalleja huonommaksi, kuten edellisessä kuvassa on näytetty. Suorituskyvyn ero osoittaa, että verrattuna suuriin kielen malleihin, autoregressiivisten mallien kyky kuvien käsittelyssä on vähemmän tutkittu.

Toisaalta perinteiset autoregressiiviset mallit vaativat määritellyn järjestyksen datasta, kun taas toisaalta Visuaalinen Autoregressiivinen eli VAR-malli uudelleenarvioi, miten kuvaa järjestetään, ja tämä erottaa VAR:n olemassa olevista AR-menetelmistä. Yleensä ihmiset luovat tai havaitsevat kuvan hierarkkisesti, kaappaen globaalin rakenteen seuraten paikallisia yksityiskohtia, moniasteinen, karkeasta hienoon lähestymistapa, joka ehdottaa luonnollista järjestystä kuvalle. Lisäksi moniasteisten suunnitelmien inspiroimana, VAR-kehys määrittelee autoregressiivisen oppimisen kuvissa seuraavan asteen ennustamisena vastakohtana perinteisille lähestymistavoille, jotka määrittelevät oppimisen seuraavan tokenin ennustamisena.
VAR-kehys pyrkii hyödyntämään GPT-2:n transformatoreiden arkkitehtuuria visuaaliselle autoregressiiviselle oppimiselle, ja tulokset ovat nähtävissä ImageNet-benchmarkissa, jossa VAR-malli parantaa AR-peruslinjaa merkittävästi, saavuttaen FID-arvon 1,80 ja inception-arvon 356, sekä 20-kertaisen parantamisen inference-nopeudessa. Mitä mielenkiintoisempaa on, että VAR-kehys pystyy ylittämään DiT- eli Diffuusiotransformatorin suorituskyvyn FID- ja IS-pisteissä, skaalautuvuudessa, inference-nopeudessa ja datan tehokkuudessa.
Yhteenvetona, VAR-kehys pyrkii tekemään seuraavat panokset.
- Se ehdottaa uutta visuaalista generatiivista kehystä, joka käyttää moniasteista autoregressiivista lähestymistapaa seuraavan asteen ennustamisena, vastakohtana perinteiselle seuraavan tokenin ennustamiselle, tuloksena on suunniteltu autoregressiivinen algoritmi tietokoneen näön tehtäviin.
- Se pyrkii vahvistamaan skaalautuvuuslakeja autoregressiivisille malleille sekä nollashotin generalisointipotentiaalia, joka jäljittelee LLMien mielenkiintoisia ominaisuuksia.
- Se tarjoaa läpimurron visuaalisten autoregressiivisten mallien suorituskyvyssä, mahdollistaen GPT-tyylisille autoregressiivisille kehyksille ylittää olemassa olevat diffuusiomallit kuvien synteesitehtävissä ensimmäistä kertaa.
Lisäksi on tärkeää keskustella olemassa olevista voimakkaista skaalautuvuuslaeista, jotka kuvaavat matemaattisesti suhteen datan kokojen, mallin parametrejen, suorituskyvyn parantamisen ja laskennallisen resurssien välillä koneoppimismalleissa. Ensinnäkin, nämä voimakkaat skaalautuvuuslaeistä mahdollistavat suuremman mallin suorituskyvyn soveltamisen skaalauttamalla mallin kokoa, laskennallista kustannusta ja dataa, säästäen tarpeettomia kustannuksia ja jakamalla koulutusbudjettia antamalla periaatteita. Toiseksi, skaalautuvuuslaeistä on osoittanut johdonmukaisen ja tyytymättömän suorituskyvyn paranemisen.
Kielelliset mallit riippuvat WordPiece-algoritmeista tai Byte Pair Encoding -lähestymistavasta tekstin tokenisointiin. Visuaaliset generatiiviset mallit, jotka perustuvat kielimalleihin, riippuvat myös voimakkaasti 2D-kuvien koodaamisesta 1D-tokenijonoiksi. Varhaiset työt, kuten VQVAE, osoittivat kuvien edustamisen diskreetteinä tokenina kohtuullisella rekonstruktio-laadulla. VQVAE:n seuraaja, VQGAN-kehys sisälsi havainnolliset ja vastakkaiset häviöt kuvan uskottavuuden parantamiseksi, ja käytti myös dekooderi-vain transformatoria kuvatokenien generointiin standardissa raster-skannauksessa.
Visuaalinen Autoregressiivinen : Metodologia ja Arkkitehtuuri

VAR-kehyksen ydin on kaksi erillistä koulutusvaihetta. Ensimmäisessä vaiheessa moniasteinen kvantisoitu autoenkooderi eli VQVAE koodaa kuvan tokenikarttoihin, ja yhdistetty rekonstruktiohäviö toteutetaan koulutustarkoituksiin. Yllä olevassa kuvassa upotus on termi, joka määrittelee diskreettisten tokenien muuttamisen jatkuviin upotusvektoreihin. Toisessa vaiheessa VAR-mallin transformatori koulutetaan joko minimoidaan cross-entropiahäviö tai maksimoidaan todennäköisyys käyttäen seuraavan asteen ennustamisen lähestymistapaa.
Autoregressiivinen Mallinnus Seuraavan Tokenin Ennustamisen Kautta
Annetaan diskreettisten tokenien jono, jossa jokainen token on kokonaisluku sanastosta, joka on kooltaan V, seuraavan tokenin autoregressiivinen malli olettaa, että nykyisen tokenin todennäköisyys riippuu vain sen etukävijästä. Olettaen yksisuuntaista token-riippuvuutta, VAR-kehys voi jakaa jonon todennäköisyyksiin. Autoregressiivisen mallin koulutus sisältää mallin optimoinnin datan yli, ja tämä optimointiprosessi on tunnettu seuraavan tokenin ennustamisena, ja sallii koulutetun mallin generoida uusia jonoja.
Kuvat ovat 2D-jatkuva signaaleja, ja soveltaa autoregressiivista lähestymistapaa kuvien käsittelyyn seuraavan tokenin ennustamisen kautta, edellyttää joitakin edellytyksiä. Ensinnäkin, kuva on koodattava useaksi diskreettiseksi tokeniksi. Yleensä kvantisoitu autoenkooderi toteutetaan kuvan piirteiden muuttamiseksi diskreettisiksi tokeneiksi. Toiseksi, 1D-järjestys on määriteltävä tokenien järjestykseksi unidirektionaaliselle autoregressiiviselle oppimiselle.
Visuaalinen Autoregressiivinen Mallinnus Seuraavan Asteen Ennustamisen Kautta
VAR-kehys uudelleenarvioi autoregressiivisen mallinnuksen kuvissa siirtymällä seuraavan tokenin ennustamisesta seuraavan asteen ennustamisen lähestymistapaan, prosessi, jossa autoregressiivinen yksikkö on koko tokenikartta. Malli ensin kvantisoituu piirteiden kartan moniasteisiin tokenikarttoihin, joista jokainen on edellistä tarkempi, ja päättyy vastaamaan alkuperäisen piirteiden kartan resoluutiota.

Visuaalinen Autoregressiivinen : Tulokset ja Kokeet
VAR-kehys käyttää perus-VQVAE-arkkitehtuuria moniasteisella kvantisaatiolla, jossa on K lisäkonvoluutioita, ja käyttää jaettua koodikirjaa kaikille asteille ja latentin ulottuvuuden 32. Pääpaino on VAR-algoritmilla, minkä vuoksi mallin arkkitehtuuri on suunniteltu yksinkertaiseksi mutta tehokkaaksi. Kehys omaksuu standardin dekooderi-vain transformatoreiden arkkitehtuurin, joka on samanlainen kuin GPT-2-malleissa, ainoana muutoksena on perinteisen kerrosten normalisoinnin korvaaminen adaptiivisella normalisoinnilla eli AdaLN:llä.
Valmiiden Kuvien Generointitulokset
Kun verrataan olemassa oleviin generatiivisiin kehyksiin, mukaan lukien GANit eli Generatiiviset Vastakkaiset Verkot, BERT-tyyliset maskitut ennustemallit, diffuusiomallit ja GPT-tyyliset autoregressiiviset mallit, Visuaalinen Autoregressiivinen kehys osoittaa lupaavia tuloksia, jotka on tiivistetty seuraavaan taulukkoon.

Kuten voidaan havaita, Visuaalinen Autoregressiivinen kehys pystyy parantamaan sekä FID- että IS-pisteitä, ja se myös osoittaa merkittävää kuvien generointinopeutta, joka on vertailukelpoinen valmiiden mallien kanssa. Lisäksi VAR-kehys myös ylläpitää tyytyväisiä tarkkuus- ja palautusarvoja, mikä vahvistaa sen semanttista johdonmukaisuutta. Mutta oikea yllätys on VAR-kehyksen merkittävä suorituskyky perinteisillä AR-ominaisuuksilla, mikä tekee siitä ensimmäisen autoregressiivisen mallin, joka ylittää Diffuusiotransformatorin suorituskyvyn.

Nollashotin Tehtävän Generalisointitulos
Sisään- ja ulospaintaustehtävissä VAR-kehys pakottaa ground truth -tokenit maskin ulkopuolelle, ja antaa mallin generoida vain tokenit maskin sisällä, ilman luokkatunnisteiden injektointia malliin. Tulokset on esitetty seuraavassa kuvassa, ja kuten voidaan nähdä, VAR-malli saavuttaa hyväksyttävät tulokset alimpien tehtävien generalisoinnissa ilman parametrin säätämistä tai verkkorakenteen muuttamista, osoittaen VAR-kehyksen generalisointikyvyn.

Loppusanat
Tässä artikkelissa olemme puhuneet Visuaalisesta Autoregressiivisesta mallinnuksesta, joka 1) teoreettisesti ratkaisee joitakin ongelmia, jotka ovat luonnollisia standardille kuvien autoregressiivisille malleille, ja 2) tekee kielimallipohjaisista autoregressiivisista malleista ensimmäistä kertaa ylittää vahvat diffuusiomallit kuvien laadussa, monipuolisuudessa, datan tehokkuudessa ja inference-nopeudessa. Toisaalta perinteiset autoregressiiviset mallit vaativat määritellyn järjestyksen datasta, kun taas Visuaalinen Autoregressiivinen eli VAR-malli uudelleenarvioi, miten kuvaa järjestetään, ja tämä erottaa VAR:n olemassa olevista AR-menettelyistä.












