AI-mallit ja alustat

MoE-LLaVA: Sekoitusasiantuntijat suurten visuaalisen kielen mallien skaalattavuuden edullisesti

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Viimeaikaiset edistysaskelet suurissa visuaalisissa kielen malleissa (LVLM) ovat osoittaneet, että näiden kehysten skaalautuminen parantaa merkittävästi suorituskykyä monilla alaisilla tehtävillä. LVLM:t, kuten MiniGPT, LLaMA ja muut, ovat saavuttaneet merkittäviä kykyjä sisällyttämällä visuaalisia projektiolaystereitä ja kuvan kooderin arkkitehtuuriinsa. Nämä komponentit parantavat visuaalisen havainnon kykyjä suurissa kielimalleissa (LLM). Suorituskykyä voidaan parantaa edelleen kasvattamalla mallin kokoa ja parametreja sekä laajentamalla tietojoukon mittaa.

Mallit kuten InternVL ovat laajentaneet kuvankooderiaan yli 6 miljardiin parametriin, kun taas toiset ovat laajentaneet LVLM:n backendiä 13 miljardiin parametriin ja saavuttaneet erinomaisen suorituskyvyn monilla tehtävillä. IDEFICS on kouluttanut LVLM:n yli 80 miljardin parametrin. Nämä skaalautumismenetelmät ovat vastaavat tai ylittäneet LLM:n esikoulutuksen yli 34, 70 tai jopa 100 miljardin parametrin. Skaalautumisen on kuitenkin huono puoli: se lisää merkittävästi koulutus- ja päätöskustannuksia. Tämä johtuu siitä, että se vaatii kaikkien parametreja olemaan aktiivisia jokaiselle tokenille laskelmassa, mikä johtaa korkeisiin laskentavaatimuksiin ja siten korkeampiin kustannuksiin.

Tässä artikkelissa käsitellään MoE-LLaVA:ta, joka on Mixture of Experts (MoE) -pohjainen harva LVLM-arkkitehtuuri, joka käyttää tehokasta koulutusstrategiaa, MoE-Tuningia, LVLM:lle. MoE-Tuning ratkaisee innovatiivisesti suorituskyvyn heikkenemisen monimodaalisessa harvassa oppimisessa, johtaen malliin, jossa on suuri määrä parametreja, mutta jossa koulutus- ja päätöskustannukset ovat vakaita. MoE-LLaVA-arkkitehtuuri on suunniteltu siten, että se aktivoi vain top-k-asiantuntijat käyttöönoton aikana, pitäen loput asiantuntijoita aktiivisina.

Tutkimme MoE-LLaVA-kehyksen mekanismia, menetelmiä, arkkitehtuuria ja sitä, miten se vertautuu johtaviin kuvan ja videon generointikehyksiin.

MoE-LLaVA: Skaalauttaminen suuria visuaalisen kielen malleja edullisesti

Lisäksi visuaalisten projektiolaystereiden ja kuvankooderien hyödyntämisestä, suuret visuaaliset kielen mallit myös skaalauttavat mallin kokoa lisäämällä parametreja, jotta parantaa mallin suorituskykyä. Jotkut merkittävät esimerkit suurista visuaalisista kielen malleista, jotka ovat seuranneet tätä lähestymistapaa parantamaan suorituskykyään, ovat MiniGPT-4, InternGPT, InternVL ja muut. Todellisissa sovelluksissa suuren kielimallin tai suuren visuaalisen kielen mallin skaalauttaminen laadukkaalla koulutusdatalla usein muodostuu välttämättömyydeksi parantamaan mallin suorituskykyä. Vaikka mallin skaalauttaminen parantaa suorituskykyä, se myös lisää laskennalliset kustannukset mallin koulutuksesta ja käyttöönotosta, ja lisää vaikeutta ja tehokkuutta käyttöönotossa rinnakkaisilla laitteilla samanaikaisesti. Yksi merkittävä syy lisääntyneille koulutus- ja päätöskustannuksille sekä laskennallisiin vaatimuksiin on, että jokainen token kehyksessä vaatii laskelmia jokaisen parametrin kanssa mallissa, jota kutsutaan tiheäksi malliksi.

Toisaalta, harvat MoE- tai Mixture of Expert -mallit ovat osoittaneet tehokkaan skaalauttamisen kehyksissä, prosessoiden dataa avustajien avulla, lähestymistapa, jota on laajalti omaksuttu luonnollisen kielen prosessoinnin alalla. Kuitenkin suoraan Mixture of Expertin käyttäminen harvojen suurten visuaalisten kielen mallien kouluttamiseen on haasteellista, koska LLM:ien muuntaminen LVLM:ksi ja samanaikainen harvennus johtaa merkittäviin suorituskyvyn heikkenemisiin. MoE-LLaVA-kehyksen toteuttamiseksi on tarpeen kouluttaa LVLM ensin harvennukseen. Tähän tarkoitukseen MoE-LLaVA-kehyksessä esitellään MoE-Tuning, yksinkertainen mutta tehokas kolmivaiheinen koulutusstrategia.

Kuvan mukaan MoE-Tuning-prosessi kouluttaa ensin monikerroksisen perkolation, joka sovittaa visuaaliset tokenit suureen kielimalliin ensimmäisessä vaiheessa. Keheyksessä koulutetaan sitten koko LLM:n parametreja, jotta valmistellaan suuri visuaalinen kielen malli yleisellä monimodaalisella ymmärtämiskyvyllä. Lopulta kolmannessa vaiheessa kehyksessä toistetaan syöttöeteenpäin -verkko feedforward -verkkona, ja koulutetaan vain Mixture of Expert -kerrokset. Koulutusprosessi auttaa hitaassa siirtymisessä harvasta mallista LVLM-alkuun harvaan Mixture of Expert -malliin.

MoE-LLaVA on perusviite suurille visuaalisille kielen malleille, jotka sisältävät Mixture of Expert -mallit, jotka sisältävät oppimiskykyiset reitittimet ja MoE-mallit. Sen ytimessä MoE-LLaVA-malli koostuu useista harvoista poluista, ja kehyksessä käytetään näitä polkuja lähettämään jokainen token eri asiantuntijoihin oppimiskykyisen reitittimen kautta. Tokenit prosessoidaan sitten yhteisesti aktiivisten asiantuntijoiden toimesta, pitäen epäaktiiviset polut hiljaisina. Keheyksessä pinotaan sitten Mixture of Expert -kooderin kerrokset iteratiivisesti tarjoamaan harvan polun suuremmalle ja voimakkaammalle LVLM:lle.

Kiitos MoE-LLaVA-kehyksen toteutuksesta, se pystyy ylittämään malleja, joilla on samanlainen määrä aktiivisia parametreja, ja ylittää ne suurella erolla POPE-objektihallusinaatiokriteerillä, vaikka sillä on vain 2,2 miljardia parametreja. Lisäksi MoE-LLaVA-kehyksellä, jolla on 2,2 miljardia parametreja, voidaan saavuttaa suorituskyky, joka on vertailukelpoinen InternVL-Chat-19B-kehyksen kanssa, jolla on lähes 8 kertaa enemmän aktiivisia parametreja.

Voimakkaat suuret kielimallit, joilla on vahva yleistys- ja ohjeiden seuraamiskyky, on toteutettu suurten visuaalisten mallien (LVLM) avulla. Varhaiset LLM:t, kuten BLIP, koodasivat visuaaliset signaalit tokenien sarjaan, jotta ne voivat sovittaa visuaalisuutta kielimalliin useiden projektiokerrosten avulla. Samalla viimeaikaiset työt keskittyvät parantamaan mallin suorituskykyä toteuttamalla menetelmiä, kuten laajentamalla ohjeistuksen koulutusdataa, lisäämällä kuvan resoluutiota, optimoimalla koulutusstrategioita, kohdistamalla syötettä, parantamalla kuvankoodereita ja paljon muuta. Nämä lähestymistavat ovat auttaneet voimaannuttamaan LVLM:itä voimakkailla visuaalisilla ymmärtämiskyvyillä laajentamalla visuaalista ohjeistuksen hienosäätödataa ja mallin mittaa. Lisäksi jotkut LVLM:t omistavat myös hienojakoisen kuvan ymmärtämiskyvyn, kuten alueen ja monialueen ymmärtämiskyvyn sekä pikselikohtaisen perustamiskyvyn. Kuitenkin laskennalliset kustannukset, jotka liittyvät tiheän visuaalisen datan ja mallien skaalauttamiseen, ovat usein erittäin korkeat, mikä tekee niistä haasteellisia. Toisaalta MoE-LLaVA-kehyksen tavoitteena on tehdä LVLM-tutkimuksesta edullisempaa hyödyntämällä MoE-mallien kykyjä.

MoE-LLaVA: Menetelmä ja arkkitehtuuri

MoE-LLaVA-kehyksen ytimessä on visuaalinen projektiokerros (monikerroksinen perkolaatio), näkökooderi, MoE-kerrokset, useat pinotut LLM-kerrokset ja sanan upottamiskerros.

Arkkitehtuuri

Seuraava taulukko tiivistää MoE-LLaVA-kehyksen yksityiskohtaiset konfiguraatiot.

Annetaan RGB-kuva, näkökooderi prosessoi kuvat saadakseen visuaalisten tokenien sarjan, ja visuaalinen projektiokerros kartoittaa visuaalisen tokenin sarjan syötekuviin. Tekstisyötteet prosessoidaan sanan upottamiskerroksen avulla, joka projisoi ne saadakseen tokenien sarjan. Samalla MoE-LLaVA-kehyksessä linkitetään teksti- ja visuaaliset tokenit yhteen ja syötetään ne LLM:ään. Kuitenkin kehyksessä koulutetaan vain visuaalinen projektiokerros suuren kielimallin kanssa, joka koostuu feedforward -neuraaliverkoista ja monipäisen itsehuomion kerroksista. Lopulta kehyksessä sovelletaan jäännösyhteyksiä ja kerrosnormalisointia jokaiseen kerrokseen.

Jatkamalla MoE-LLaVA-kehyksessä toistetaan feedforward -neuraaliverkko useita kertoja asiantuntijoiden aloitusprosessina. Reititin, joka on lineaarinen kerros, ennustaa jokaisen tokenin määrän kullekin asiantuntijalle. Jokainen tokeni prosessoidaan top-k-asiantuntijoiden toimesta, ja lasketaan painotettu summa softmax-tuloksen perusteella. Kun top-k-asiantuntijat on aktivoitu, malli sulkee loput asiantuntijat, lähestymistapa, joka varustaa MoE-LLaVA-kehyksen äärettömällä määrällä harvia polkuja, varustaa mallin laajalla valikoimalla kyvyistä.

MoE-Tuning

MoE-Tuning on yksinkertainen mutta tehokas kolmivaiheinen koulutusstrategia, joka kouluttaa ensin monikerroksisen perkolation, joka sovittaa visuaaliset tokenit suureen kielimalliin ensimmäisessä vaiheessa. Keheyksessä koulutetaan sitten koko LLM:n parametreja, jotta valmistellaan suuri visuaalinen kielen malli yleisellä monimodaalisella ymmärtämiskyvyllä. Lopulta kolmannessa vaiheessa kehyksessä toistetaan feedforward -verkko asiantuntijoiden aloituspainoina, ja koulutetaan vain Mixture of Expert -kerrokset.

Vaihe 1

Ensimmäisessä vaiheessa päämääränä on sovittaa kuvatokenit suureen kielimalliin, jotta LLM voi ymmärtää kuvan esiintymät. MoE-LLaVA-kehyksessä käytetään monikerroksista perkolaatiota kuvatokenien projisointiin kielimallin syötealueelle, ja kuvapalasia käsitellään kuin pseudo-tekstokeneitä. Tässä vaiheessa MoE-LLaVA-kehyksessä koulutetaan LLM kuvaamaan kuvia, eikä MoE-kerroksia sovelleta LLM:ään tässä vaiheessa.

Vaihe 2

Toisessa vaiheessa MoE-LLaVA yrittää parantaa kehyksen kykyjä ja ohjattavuutta säätämällä mallia monimodaalisen ohjeistuksen datalla. MoE-LLaVA-kehyksessä saavutetaan tämä sovittamalla LLM:ää LVLM:ksi monimodaalisella ymmärtämiskyvyllä. Keheyksessä käytetään monimutkaisempia ohjeita, kuten tekstintunnistusta ja loogista kuvan päättelytehtävää, jotka vaativat mallilta vahvempia monimodaalisia kykyjä. Perinteisesti tiheiden mallien koulutusprosessi katsotaan tässä vaiheessa valmiiksi. Kuitenkin MoE-LLaVA-kehyksessä havaittiin haasteita LLM:n muuntamisessa LVLM:ksi samanaikaisesti harvennusprosessin kanssa. Tähän haasteeseen kehyksessä käytetään edellisen vaiheen painoja seuraavan vaiheen aloitusprosessina, jotta helpotetaan harvan mallin oppimisen vaikeutta.

Vaihe 3

Kolmannessa vaiheessa malli toistaa feedforward -neuraaliverkon useita kertoja asiantuntijoiden aloitusprosessina. Keheyksessä syötetään sitten teksti- ja kuvatokenit Mixture of Expert -kerroksiin, ja reititin laskee vastaavuuden painot asiantuntijoille ja kullekin tokenille. Jokainen tokeni prosessoidaan top-k-asiantuntijoiden toimesta, ja lasketaan painotettu summa reitittimen painojen perusteella. Kun top-k-asiantuntijat on aktivoitu, malli sulkee loput asiantuntijat, lähestymistapa, joka varustaa MoE-LLaVA-kehyksen äärettömällä määrällä harvia polkuja, varustaa mallin laajalla valikoimalla kyvyistä.

MoE-LLaVA: Tulokset ja kokeet

MoE-LLaVA-kehyksessä käytetään CLIP-Large-näkökooderia, ja monikerroksisessa perkolaatiossa on kaksi kerrosta GELU-aktivaatiokerroksen erottamana. Oletuksena kehyksessä käytetään vuorotellen feedforward -neuraaliverkon ja Mixture of Expert -kerrosten vaihtoa, mikä tarkoittaa, että Mixture of Expert -kerrokset muodostavat 50% kokonaisten kerrosten määrästä. Seuraavassa taulukossa on eri tietojoukkoja ja niiden näytemäärät, joita käytetään MoE-LLaVA-kehyksen kouluttamiseen ja arviointiin.

Zero-Shot-kuvakysymysvastaus

Seuraava kuva osoittaa, että MoE-LLaVA on harva malli pehmeällä reitittimellä LVLM:llä. Keheyksessä arvioidaan viidellä kuvakysymysvastauskriteerillä, ja kuva osoittaa, että MoE-LLaVA-kehyksessä on merkittäviä kuvan ymmärtämiskykyjä, ja se toimii vertailukelpoisesti LLaVA 1.5 -kehyksen kanssa viidellä eri kriteerillä.

Objektihallusinaatiotestaus

Objektihallusinaatiotestaukseen MoE-LLaVA-kehyksessä käytetään POPE-arviointiputkea, äänestyspohjaisen kysymyksen menetelmää, ja tulokset on esitetty seuraavassa taulukossa. Kuva osoittaa, että kaikista kehyksistä MoE-LLaVA-kehyksessä on vahvimmat tulokset, osoittaen kehyksen kyvyn generoida kuvia, jotka ovat yhdenmukaisia syötekuvan kanssa. Lisäksi on huomattava, että MoE-LLaVA-kehyksessä tasapainotetaan hyvin kyllä/ei-kuuluvuus, osoittaen harvan mallin kyvyn antaa tarkkaa palautetta annetuille kysymyksille.

Seuraavassa kuvassa on asiantuntijoiden kuormituksen jakautuminen, jossa katkeavat viivat edustavat hyvin tasapainotun jakautumista tokenien välillä modaalien tai asiantuntijoiden välillä. Ensimmäinen kuva osoittaa työnjaon asiantuntijoiden välillä, kun taas loput kuvat osoittavat asiantuntijoiden suorituskykyä eri modaalien suhteen.

Lisäksi seuraavassa kuvassa on modaalien jakautuminen eri asiantuntijoiden välillä.

Lopputulet

Tässä artikkelissa käsiteltiin MoE-LLaVA:ta, joka on perusviite suurille visuaalisen kielen malleille, jotka sisältävät Mixture of Expert -mallit, jotka sisältävät oppimiskykyiset reitittimet ja MoE-mallit. MoE-LLaVA-mallin ytimessä on useita harvia polkuja, ja kehyksessä käytetään näitä polkuja lähettämään jokainen token eri asiantuntijoihin oppimiskykyisen reitittimen kautta. Tokenit prosessoidaan sitten yhteisesti aktiivisten asiantuntijoiden toimesta, pitäen epäaktiiviset polut hiljaisina. Keheyksessä pinotaan sitten Mixture of Expert -kooderin kerrokset iteratiivisesti tarjoamaan harvan polun suuremmalle ja voimakkaammalle LVLM:lle. MoE-Tuning-strategia ratkaisee innovatiivisesti suorituskyvyn heikkenemisen monimodaalisessa harvassa oppimisessa, johtaen malliin, jossa on suuri määrä parametreja, mutta jossa koulutus- ja päätöskustannukset ovat vakaita. MoE-LLaVA-kehyksen arkkitehtuuri on suunniteltu siten, että se aktivoi vain top-k-asiantuntijat käyttöönoton aikana, pitäen loput asiantuntijoita aktiivisina.

Kunal Kejriwal on backend‑insinööri, joka on erikoistunut Pythoniin, PostgreSQL:ään, Redis:iin ja pilvi‑infrastruktuuriin GCP:ssä ja AWS:ssä. Kolmen vuoden kokemuksella tuotantojärjestelmien rakentamisesta ja skaalaamisesta hän kirjoittaa AI‑infrastruktuurista, hajautetuista järjestelmistä ja koneoppimistyönkuormien käyttöönoton arkkitehtuurista.