AI-mallit ja alustat

MambaOut: Onko Mamballe todella tarvetta visioon?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Nykyisissä koneoppimisen ja tekoälykehysten sovelluksissa ja ominaisuuksissa transformerit ovat yksi laajimmin käytetyistä komponenteista eri aloilla, kuten GPT-sarjassa ja BERT: ssä luonnollisen kielen prosessoinnissa sekä Vision Transformers -tehtävissä tietokoneen näön tehtävissä. Vaikka transformerien sisällyttäminen mallin arkkitehtuuriin antaa merkittävän lisäyksen mallin suorituskykyyn, transformerien huomioimismoduuli skaalautuu sekvenssin pituuden neliöllisesti, mikä johtaa suuriin laskennallisiin haasteisiin. Vuosien varrella eri mallit ovat tutkineet eri strategioita laskennallisten haasteiden ratkaisemiseksi, mukaan lukien menetelmiä kuten kernelisointi, historia muistin pakkaus, token sekoitus alueen rajoitus ja matalan sijan lähestymistavat. Viime aikoina Recurrent Neural Networks -menetelmät, kuten Mamba ja RWKV, ovat keränneet merkittävää huomiota lupaavien tuloksien ansiosta suurissa kielimalleissa.

Mamba, mallien perhe, jolla on arkkitehtuuri, jossa on toistuva neuroverkko token-sekoittimen valtion avaruusmalli, otettiin vastaan vastatakseen transformerien huomioimismekanismin kvadranttiseen monimutkaisuuteen ja sovellettiin myöhemmin visiotöihin. Tutkijat ovat jo tutkineet keinoja sisällyttää Mamba ja SSM eli valtion avaruusmalli visuaaliseen tunnistustehtäviin, ja Vision Mamba, joka sisällyttää Mamban kehittääksesi isotrooppisia visiomalleja, jotka ovat samanlaisia kuin Vision Transformer, on erinomainen esimerkki siitä. Toisaalta LocalMamba sisällyttää paikalliset induktiiviset vinoumat parantamaan visuaalista Mamba-mallia, ja VMamba-kehys käyttää perus-Mamba-mallia rakentamaan hierarkkisia malleja, jotka ovat samanlaisia kuin ResNet ja AlexNet. On kuitenkin kysymys siitä, onko Mamba-kehys todella välttämätön visuaalisen tunnistuksen kontekstitehtävissä? Kysymys nousee, koska Mamba-mallien perheen suorituskyky visiotöissä on ollut heikko tähän asti verrattuna perinteisiin huomioimisperusteisiin ja valtavirtaisten konvoluutio-mallien kanssa.

MambaOut pyrkii vastaamaan siihen, onko Mamba sopiva tehtäville, joilla on autoregressiiviset ja pitkän sekvenssin ominaisuudet. MambaOut-kehys olettaa, että Mamba ei ole välttämätön visiotöille, koska kuvan luokittelu ei vastaa kummankaan pitkän sekvenssin eikä autoregressiivisten ominaisuuksien kanssa. Vaikka segmentointi- ja havaintotehtävät eivät myöskään ole autoregressiivisia, ne näyttävät pitkän sekvenssin ominaisuuksia, mikä johtaa MambaOut-kehystä olettaamaan Mamban potentiaalia näille tehtäville. MambaOut-kehys on rakennettu pinottamalla Mamba-lohkareita toistensa päälle poistamalla valtion avaruusmalli, sen ydin token-sekoittimen. Kokeelliset tulokset tukevat MambaOut-kehystä esittämää hypoteesia, koska se pystyy ylittämään kaikki visuaaliset Mamba-mallit ImageNet-kuvan luokittelu kehyksessä, osoittaen, että Mamba ei ole välttämätön visiotöille. Toisaalta havainto- ja segmentointitehtävissä MambaOut-kehys ei pysty toistamaan suorituskykyä, jota tarjoaa valtavirtainen Mamba-malli, osoittaen Mamba-mallien perheen potentiaalia pitkän sekvenssin visuaalisissa tehtävissä.

Tämä artikkeli pyrkii kattamaan MambaOut-kehystä syvällisemmin, ja tutkimme mekanismin, metodologian, kehysarkkitehtuuri ja sen vertailun valtavirtaisten kehysten kanssa. Joten aloitetaan.

MambaOut: Onko Mamballe todella tarvetta visioon?

Koneoppimisen sovellusten ja ominaisuuksien edetessä transformerit ovat nousseet valtavirtaiseksi rungoksi useissa tehtävissä, voimakkaasti malleja kuten Vision Transformers, GPT-mallit, BERT ja muutamia muita. Kuitenkin transformerien token-sekoittimen osuus aiheuttaa kvadranttisen monimutkaisuuden suhteessa sekvenssin pituuteen, mikä aiheuttaa merkittäviä haasteita pidemmille sekvensseille. Ratkaistakseen tämän ongelman on esitetty useita token-sekoittimia, joilla on lineaarinen monimutkaisuus tokenin pituudelle, kuten Linformer, Longformer, Performer, Dynaaminen konvoluutio ja Big Bird. Kuitenkin viime aikoina Recurrent Neural Networks -mallit, kuten Mamba ja RWKV, ovat keränneet merkittävää huomiota lupaavien tuloksien ansiosta suurissa kielimalleissa. Ohjattuna RNN-mallien merkittävien tuloksien, tutkijat yrittävät esitellä ja käyttää Mamba-mallien perhettä visuaalisiin tunnistustehtäviin, koska Mamba-mallien token-sekoittimen on valtion avaruusmalli, joka on Recurrent Neural Networks -hengessä.

MambaOut on yritys tutkia Mamba-mallien perhettä ja tiivistää, että Mamba on sopiva tehtäville, jotka ovat joko autoregressiivisia tai pitkän sekvenssin. Kuitenkin useimmat visiotöistä eivät ole autoregressiivisia eivätkä pitkiä sekvenssejä, ja joissakin kokeissa MambaOut esittää seuraavat kaksi hypoteesia. Ensinnäkään valtion avaruusmalli ei ole välttämätön kuvan luokitteluun, koska kuvan luokittelu ei vastaa kummankaan autoregressiivista eikä pitkän sekvenssin ominaisuuksia. Toiseksi valtion avaruusmallit voivat olla hypoteettisesti hyödyllisiä instanssien segmentoinnissa ja semanttisessa segmentoinnissa sekä objektin havainnossa, koska ne seuraavat pitkän sekvenssin ominaisuuksia, vaikka ne eivät ole autoregressiivisia. Kokeelliset tulokset, jotka suoritettiin tutkimalla valtion avaruusmallin toistuvaa neuroverkko-mekanismia, osoittavat, että Mamba-kehys on sopiva tehtäville, jotka ovat joko pitkiä sekvenssejä tai vaativat kausaalia token-sekoitus -tilaa.

Mitä tehtäviä Mamba on sopiva?

Mamba-kehys token-sekoittimen on valittu valtion avaruusmalli, joka määrittää neljä syötteen riippuvaa parametriä. Toistuvan ominaisuuden kehys erottaa RNN-tyyppisen valtion avaruusmallin kausaalisesta huomioimisesta. Piilotila voidaan nähdä kiinteän kokoisen muistina, joka tallentaa historiallista tietoa. Kiinteä koko tarkoittaa, että muisti on häviävää, mutta se myös varmistaa, että muistin integroinnin nykyisen syötteen kanssa jäävän kompleksisuuden. Toisaalta kausaalinen huomioimis kerää kaikki avaimet ja arvot edellisistä symboleista ja laajentaa lisäämällä avain ja arvo nykyisestä symbolista jokaisen uuden syötteen kanssa, ja tämä muisti on häviämätön teoreettisesti. Kuitenkin muistin koko kasvaa, kun enemmän symboleita syötetään, ja kompleksisuus muistin integroimisesta nykyisen syötteen kanssa kasvaa.

Koska valtion avaruusmallin muisti on luonnostaan häviävää, se jää kausaalisesta huomioimisesta häviämättömän muistin alueelle, ja seurauksena Mamba-mallit eivät voi osoittaa voimakkuuttaan lyhyiden sekvenssien käsittelyssä, alueella, jossa kausaalinen huomioimis toimii helposti. Kuitenkin tilanteissa, joissa on mukana pitkiä sekvenssejä, kausaalinen lähestymistapa epäonnistuu kvadranttisen monimutkaisuuden vuoksi. Tässä tilanteessa Mamba-kehys osoittaa tehokkuutensa muistin yhdistämisessä nykyiseen syötteeseen ja pystyy käsittelemään pitkiä sekvenssejä sujuvasti, osoittaen Mamba-mallien perheen sopimisen pitkien sekvenssien käsittelyyn.

On myös huomionarvoista, että toistuvan luonteen valtion avaruusmalli mahdollistaa Mamba-mallien tehokkaan käsittelyn pitkiä sekvenssejä, mutta se myös esittää tietyn rajoituksen, koska se voi käyttää tietoa vain nykyisestä ja edellisistä aikatauluista, ja tällaista token-sekoitusta kutsutaan kausaalisksi tilaksi. Tämän kausaalisuuden vuoksi tämä menetelmä on sopiva autoregressiivisille generointitehtäville.

Täysin näkyvä tila on sopiva ymmärtämistehtäville, joissa malli voi käyttää kaikkia syötteitä kerran. Lisäksi huomioimis on täysin näkyvässä tilassa oletusarvoisesti, ja se voidaan muuttaa kausaalisesti helposti soveltamalla kausaalisia maskeja huomioimiskarttoihin, ja RNN-tyyppiset mallit toimivat luonnostaan kausaalisessa tilassa toistuvien ominaisuuksiensa vuoksi. Yhteenvetona Mamba-kehys on sopiva tehtäville, jotka ovat joko pitkiä sekvenssejä tai vaativat kausaalia token-sekoitus -tilaa.

Visuaalinen tunnistus, kausaalinen token-sekoitus ja erittäin pitkät sekvenssit

Kuten aiemmin mainittiin, täysin näkyvä token-sekoitus -tila sallii rajoittamattoman sekoituksen, kun taas kausaalinen tila rajoittaa nykyistä symbolia käyttämään vain edellisten symbolien tietoa. Visuaalinen tunnistus on luokiteltu ymmärtämistehtäväksi, jossa malli voi nähdä koko kuvan kerran, ja tämä poistaa tarpeen rajoittaa token-sekoitusta, ja asettaminen lisärajoituksia token-sekoitukseen voi heikentää mallin suorituskykyä potentiaalisesti. Yleisesti täysin näkyvä tila on sopiva ymmärtämistehtäville, kun taas kausaalinen tila sopii autoregressiivisille tehtäville paremmin. Tämä väite tukeutuu lisäksi siihen, että BeRT- ja ViT-mallit ovat käytetympiä ymmärtämistehtävissä kuin GPT-mallit.

Kokeellinen vahvistus ja tulokset

Seuraava askel on vahvistaa kokeellisesti MambaOut-kehys hypoteeseja. Kuten seuraavassa kuvassa näkyy, Mamba-lohko perustuu Gated Convolutional Neural Network -lohkoon, ja Mamba- ja Gated CNN -lohkojen meta-arkkitehtuuri voidaan käsitellä yksinkertaisena integraationa MetaFormer-kehys token-sekoittimista ja MLP: stä.

Mamba-lohko laajentaa Gated Convolutional Neural Network -lohkoa lisäämällä valtion avaruusmallin, ja valtion avaruusmallin läsnäolo on se, mikä erottaa Gated CNN -lohkon ja Mamba-lohkon. Lisäksi käytännön nopeuden parantamiseksi MambaOut-kehys suorittaa ainoastaan osittaisen konvoluution osittaisilla kanavilla, ja kuten seuraavassa algoritmissa näkyy, Gated CNN -lohkon toteutus on yksinkertainen, mutta tehokas ja elegantti.

Kuvan luokittelu tehtävä

ImageNet toimii kuvan luokittelu tehtävien benchmarkkina, koska se koostuu yli tuhannesta yleisestä luokasta, yli 1,3 miljoonasta koulutuskuvasarjasta ja yli 50 000 validointikuvasarjasta. Kokeessa käytetty data-augmentaatio koostuu satunnaisesta koon muuttamisesta, Mixup, värihäiriöstä, Random Erasing, CutMix ja Rand Augment. Seuraava taulukko tiivistää Mamba-mallien perheen, MambaOut-mallin ja muiden huomioimisperusteisten ja konvoluutio-mallien suorituskyvyn ImageNet-aineistossa. Kuten näkyy, MambaOut-kehys ilman valtion avaruusmallia ylittää johdonmukaisesti visuaaliset Mamba-mallit SSM: llä kaikissa mallikokoissa.

Esimerkiksi MambaOut-Small-malli palauttaa yhden ylimmän tarkkuuden arvon yli 84 %, 0,4 % korkeamman kuin sen lähin Mamba-vastustaja. Tämä tulos tukee vahvasti ensimmäistä hypoteesia, joka väittää, että valtion avaruusmallin esittäminen kuvan luokittelu tehtävissä ei ole tarpeen.

Objektin havainto ja instanssin segmentointi tehtävät

COCO toimii objektin havainto ja instanssin segmentoinnin tehtävien benchmarkkina. Vaikka MambaOut-kehys pystyy ylittämään joitakin visuaalisia Mamba-malleja, se ei voi toistaa valtavirtaisten visuaalisten Mamba-mallien, kuten LocalVMamba ja VMamba, suorituskykyä. Ero MambaOut-suorituskyvyssä valtavirtaisten visuaalisten mallien suorituskykyyn korostaa Mamba-mallien perheen hyödyllisyyttä pitkän sekvenssin visuaalisissa tehtävissä. On kuitenkin huomionarvoista, että merkittävä suorituskykyero on edelleen olemassa valtavirtaisten konvoluutio-huomioimis-hybridimallien ja visuaalisten Mamba-mallien välillä.

Lopputulemat

Mamba-mallien perhe näyttää olevan sopiva tehtäville, jotka ovat autoregressiivisia ja pitkiä sekvenssejä. MambaOut-kehys olettaa, että Mamba ei ole välttämätön visiotöille, koska kuvan luokittelu ei vastaa kummankaan pitkän sekvenssin eikä autoregressiivisten ominaisuuksien kanssa. Vaikka segmentointi- ja havaintotehtävät eivät myöskään ole autoregressiivisia, ne näyttävät pitkän sekvenssin ominaisuuksia, mikä johtaa MambaOut-kehystä olettaamaan Mamban potentiaalia näille tehtäville. MambaOut-kehys on rakennettu pinottamalla Mamba-lohkareita toistensa päälle poistamalla valtion avaruusmalli, sen ydin token-sekoittimen. Kokeelliset tulokset tukevat MambaOut-kehystä esittämää hypoteesia, koska se pystyy ylittämään kaikki visuaaliset Mamba-mallit ImageNet-kuvan luokittelu kehyksessä, osoittaen, että Mamba ei ole välttämätön visiotöille. Toisaalta havainto- ja segmentointitehtävissä MambaOut-kehys ei pysty toistamaan suorituskykyä, jota tarjoaa valtavirtainen Mamba-malli, osoittaen Mamba-mallien perheen potentiaalia pitkän sekvenssin visuaalisissa tehtävissä.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.