AI-modeller og plattformer

MoE-LLaVA: En blanding av eksperter for store visuelt-språklige modeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

De siste fremstegene i store visuelt-språklige modeller (LVLM) har vist at skaling av disse rammeverkene betydelig forbedrer ytelsen over en rekke nedstrømsoppgaver. LVLM, inkludert MiniGPT, LLaMA og andre, har oppnådd bemerkelsesverdige evner ved å inkorporere visuelle projeksjonslag og en bildekode i deres arkitektur. Ved å implementere disse komponentene, forbedrer LVLM den visuelle persepsjonsevnen til store språkmodeller (LLM). Ytelsen kan ytterligere forbedres ved å øke modellens størrelse og antall parametre, samt utvide datamengdens størrelse.

Modeller som InternVL har utvidet deres bildekode til over 6 milliarder parametre, mens andre har utvidet backenden til LVLM til 13 milliarder parametre, og oppnådd overlegen ytelse på en rekke oppgaver. IDEFICS har trent en LVLM med over 80 milliarder parametre. Disse skalingmetodene har matchet eller overgått ytelsen til LLM som er forhåndstrengt på over 34, 70 eller sogar 100 milliarder parametre. Imidlertid har skaling en ulempe: det øker betydelig trenings- og inferenskostnader. Dette skyldes at det krever at alle parametre er aktive for hver token i beregning, noe som fører til høye beregningsbehov og dermed høyere kostnader.

Dette artikkel diskuterer MoE-LLaVA, en MoE-basert sparse LVLM-arkitektur som benytter en effektiv treningsstrategi, MoE-Tuning, for LVLM. MoE-Tuning adresserer innovativt ytelsesnedgang i multi-modal sparsitetlæring, noe som resulterer i en modell med et stort antall parametre, men konsistente trenings- og inferenskostnader. MoE-LLaVA-arkitekturen er designet til å aktivere bare de øverste k-ekspertene under deployering, mens de resterende ekspertene holdes inaktive.

Vi vil utforske MoE-LLaVA-rammeverket, og undersøke dens mekanisme, metode, arkitektur og hvordan det sammenlignes med ledende bilde- og videogenereringsrammeverk.

MoE-LLaVA: Skaling av store visuelt-språklige modeller på en rimelig måte

I tillegg til å benytte visuelle projeksjonslag og bildekoder, skalerer store visuelt-språklige modeller også opp modellstørrelsen ved å øke antall parametre for å forbedre modellens ytelse. Noen bemerkelsesverdige eksempler på store visuelt-språklige modeller som har fulgt denne tilnærmingen for å forbedre deres ytelse, er MiniGPT-4, InternGPT, InternVL og andre. I virkelige anvendelser blir det ofte nødvendig å skale opp en stor språkmodell eller en stor visuelt-språklig modell med høykvalitets treningsdata for å forbedre modellens ytelse. Selv om å skale opp en modellstørrelse forbedrer ytelsen, øker det også de beregningsmessige kostnadene og komplikasjonene ved å deployere modellen på parallell enheter samtidig. En stor årsak til den økte trenings- og inferenskostnadene, samt beregningskravene, er at hver token i rammeverket krever beregning med hver enkelt parameter i modellen, kjent som den tette modellen.

På den andre siden har sparse MoE eller Mixture of Expert-modeller demonstrert effektiv skaling av rammeverk ved å behandle data med hjelp av faste aktive parametre, en tilnærming som har blitt vidt akseptert i feltet naturlig språkbehandling. Imidlertid er det utfordrende å bruke Mixture of Expert til å trene sparse store visuelt-språklige modeller direkte, ettersom konvertering av LLM til LVLM og sparsifisering av modellen samtidig resulterer i betydelig ytelsesnedgang. For å implementere Mixture of Models til å skale LLM og LVLM, er det essensielt å først initialisere LVLM for sparsifisering. For å oppnå dette, innfører MoE-LLaVA-rammeverket MoE-Tuning, en enkel, men effektiv tre-fase treningsstrategi.

Som vist i figuren ovenfor, starter MoE-Tuning-prosessen med å trene en MLP eller en multilayer-perceptron som tilpasser visuelle token til en stor språkmodell i den første fasen. Rammeverket trener deretter alle parametrene i LLM for å forhåndstrenge den store visuelt-språklige modellen med en generell multi-modal forståelsesevne. Til slutt, i den tredje fasen, replikerer rammeverket FFN eller Feed Forward Network som initialiseringsvektorer for ekspertene, og trener bare Mixture of Expert-lagene. Denne treningsprosessen hjelper med en gradvis overgang av den sparse modellen fra en LVLM-initialisering til en sparse Mixture of Expert-modell.

Med treningsprosessen dekket, la oss kaste lys over MoE-LLaVA, en baseline for store visuelt-språklige modeller med Mixture of Expert-modeller som inkorporerer lærbare ruter og MoE-modeller. I kjernen består MoE-LLaVA-modellen av flere sparse stier, og rammeverket bruker disse stiene til å sende hver token til forskjellige eksperter gjennom den lærbare ruter. Tokenene behandles deretter kollektivt av de aktive ekspertene, mens de inaktive stier holdes stille. Rammeverket stablet deretter Mixture of Expert-kodningslagene iterativt for å gi en sparse sti mot en større og mer kraftig LVLM.

Takk til tilnærmingen implementert av MoE-LLaVA-rammeverket, er det i stand til å overgå modeller med et lignende antall aktive parametre, og overgå dem med en stor margin på POPE-objekt-hallusinasjonsbenchmark, til tross for å ha bare 2,2 milliarder parametre. Videre er MoE-LLaVA-rammeverket med 2,2 milliarder parametre i stand til å oppnå en ytelse som er sammenlignbar med InternVL-Chat-19B-rammeverket med nesten 8 ganger så mange aktive parametre.

Kraftige store språkmodeller med sterke generaliserings- og instruksjonsfølgingsevner har blitt implementert i store visuelt-språklige modeller. Tidlige LLM som BLIP kodet visuelle signaler inn i en sekvens av visuelle token, noe som tillot dem å tilpasse visjon til LLM med flere projeksjonslag. Samtidig fokuserer nyere arbeid på å forbedre modellens ytelse ved å implementere metoder som å utvide instruksjons-treningsdataset, øke bildeoppløsningen, optimere treningsstrategier, justere innmaten, forbedre bildekodere og mye mer. Disse tilnærmingene har hjulpet med å gi store visuelt-språklige modeller kraftige visuelle forståelsesevner ved å utvide det visuelle instruksjons-finetuningsdataset og modellskalene. Videre har noen store visuelt-språklige modeller også fine-grainede bildeforståelsesevner, som region- og multi-regionforståelse, samt pikselvis grundleggjende evner. Imidlertid er de beregningsmessige kostnadene forbundet med å skale opp tette visuelle data og modeller ofte svært høye, noe som gjør det utfordrende å bruke. På den andre siden, har MoE-LLaVA-rammeverket som mål å gjøre store visuelt-språklige modellforskning mer rimelig ved å utnytte evnene til MoE-modeller.

MoE-LLaVA: Metode og arkitektur

I kjernen består MoE-LLaVA-rammeverket av en visuell projeksjonslag (Multilayer Perceptron), en visjonkode, MoE-blokker, flere stablede LLM-blokker og et ord-embeddingslag.

Arkitektur

Følgende tabell summerer de detaljerte konfigurasjonene til MoE-LLaVA-rammeverket.

For et gitt RGB-bilde, behandler visjonkoden bildene for å få en sekvens av visuelle token med en visuell projeksjonslag som kartlegger den visuelle tokensekvensen til innbilde. Tekstinnmaten behandles av ord-embeddingslaget som deretter projiserer det for å få tokensekvensen. Samtidig kobler MoE-LLaVA-rammeverket tekst- og visuelle token sammen og matet dem inn i LLM. Imidlertid trener rammeverket bare den visuelle projeksjonslaget med den store språkmodellen, som består av FFN eller Feedforward Neural Networks og Multi-Head Self Attention Layers. Til slutt, anvender rammeverket residualforbindelser og lag-normalisering til hvert blokk.

Videre repliserer MoE-LLaVA-rammeverket FFN eller Feedforward Neural Networks fra den andre fasen for å danne en ensemble av eksperter som initialiseringssteg. Ruterne, som er lineære lag, forutsier sannsynligheten for hver token til å bli tildelt hver ekspert. Hver token behandles av de øverste k-ekspertene med maksimal sannsynlighet og beregner den vektsum-baserte utgangen basert på softmax-resultatet av sannsynlighetene. Når de øverste k-ekspertene er aktive, lukker modellen de resterende ekspertene, en tilnærming som utstyrer MoE-LLaVA-rammeverket med uendelig mulige sparse stier, og dermed utstyrer modellen med en rekke evner.

MoE-Tuning

MoE-Tuning er en enkel, men effektiv tre-fase treningsstrategi som først trener en MLP eller en multilayer-perceptron som tilpasser visuelle token til en stor språkmodell i den første fasen. Rammeverket trener deretter alle parametrene i LLM for å forhåndstrenge den store visuelt-språklige modellen med en generell multi-modal forståelsesevne. Til slutt, i den tredje fasen, repliserer rammeverket FFN eller Feed Forward Network som initialiseringsvektorer for ekspertene, og trener bare Mixture of Expert-lagene.

Fase 1

I den første fasen er det primære målet å tilpasse bildetokene til den store språkmodellen, noe som tillater LLM å forstå instansene i bildet. MoE-LLaVA-rammeverket benytter en multilayer-perceptron for å projicere bildetokene inn i innmatingsdomenet til den store språkmodellen og behandler bildetokene som pseudo-teksttoken. I denne fasen trener MoE-LLaVA-rammeverket LLM for å beskrive bildene og anvender ikke MoE-lagene til LLM under denne fasen.

Fase 2

I den andre fasen forsøker MoE-LLaVA-rammeverket å forbedre evnene og kontrollen til rammeverket ved å justere modellen med multi-modal instruksjonsdata. MoE-LLaVA-rammeverket oppnår dette ved å justere LLM for å bli en LVLM med multi-modal forståelsesevner. Rammeverket benytter mer komplekse instruksjoner, inkludert tekstgjenkjenning og logisk bilde-ressonering, som krever at modellen har sterke multi-modal evner. Tradisjonelt anses treningsprosessen for tette modeller å være fullført ved dette steg. Imidlertid møtte MoE-LLaVA-rammeverket utfordringer i å omgjøre LLM til en LVLM samtidig med å sparsifisere LVLM. For å motvirke denne utfordringen, benytter rammeverket vektene fra den andre fasen som initialisering for den neste fasen i et forsøk på å lette læringssvårighetene til den sparse modellen.

Fase 3

I den tredje fasen repliserer modellen Feed Forward Neural Networks flere ganger for å initialisere ekspertene som en initialiseringsprosess. Rammeverket matet deretter tekst- og bildetokene inn i Mixture of Expert-lagene, og ruterne beregner matchingsvektorene mellom eksperter og hver token. Hver token behandles av de øverste k-ekspertene med den aggregerte utgangen beregnet ved vektsum basert på vektene til ruterne. Når de øverste k-ekspertene er aktive, lukker modellen de resterende ekspertene, en tilnærming som utstyrer MoE-LLaVA-rammeverket med uendelig mulige sparse stier, og dermed utstyrer modellen med en rekke evner.

MoE-LLaVA: Resultater og eksperimenter

MoE-LLaVA-rammeverket benytter CLIP-Large som visjonkoden med Multilayer Perceptron bestående av to lag med en GELU-aktiveringslag som skiller de to. Som standard benytter rammeverket en alternativ erstattning av Feedforward Neural Networks med Mixture of Expert-lag, noe som betyr at Mixture of Expert-lagene utgjør 50% av det totale antallet lag. Følgende tabell inneholder de forskjellige datasettene sammen med deres stikkprøvestørrelse som ble brukt til å trene og evaluere MoE-LLaVA-rammeverket.

<b Nullskudd billedspørsmål

Følgende figur demonstrerer at MoE-LLaVA er en sparse modell med en myk ruter basert på LVLM. Rammeverket er evaluert på 5 billedspørsmål-benchmark, og som det kan observeres, demonstrerer MoE-LLaVA-rammeverket bemerkelsesverdige bildeforståelsesevner og leverer en ytelse som er sammenlignbar med LLaVA 1.5-rammeverket på fem forskjellige benchmark.

Objekt-hallusinasjons-evaluering

For å evaluere objekt-hallusinasjon, benytter MoE-LLaVA-rammeverket POPE-evalueringen, en avstemningsbasert spørsmålsmetode, og resultater er demonstrert i følgende tabell. Som det kan observeres, er MoE-LLaVA-rammeverket det sterkeste av alle rammeverkene, noe som indikerer evnen til å generere objekter som er konsistente med innbilde. Videre er det verdt å merke seg at MoE-LLaVA-rammeverket balanserer ja-forholdet godt, noe som indikerer evnen til å gi nøyaktig tilbakemelding for det gitte spørsmålet.

Følgende bilde inneholder distribusjonen av ekspertlast, hvor de uavbrutte linjene representerer en godt balansert distribusjon av token blant modalitetene eller eksperter. Den første figuren illustrerer arbeidsbelastningen innenfor eksperter, mens de resterende bildene demonstrerer ytelsen til eksperter mot forskjellige modaliteter.

Videre demonstrerer følgende bilde distribusjonen av modaliteter over forskjellige eksperter.

Slutt tanker

I denne artikkelen har vi diskutert MoE-LLaVA, en baseline for store visuelt-språklige modeller med Mixture of Expert-modeller som inkorporerer lærbare ruter og MoE-modeller. I kjernen består MoE-LLaVA-modellen av flere sparse stier, og rammeverket benytter disse stiene til å sende hver token til forskjellige eksperter gjennom den lærbare ruter. Tokenene behandles deretter kollektivt av de aktive ekspertene, mens de inaktive stier holdes stille. Rammeverket stablet deretter Mixture of Expert-kodningslagene iterativt for å gi en sparse sti mot en større og mer kraftig LVLM. MoE-Tuning-strategien adresserer det vanlige problemet med ytelsesnedgang i multi-modal sparsitetlæring innovativt, og konstruerer en modell med et betydelig stort antall parametre, men konsistente trenings- og inferenskostnader. Arkitekturen til MoE-LLaVA-rammeverket er designet for å aktivere bare de øverste k-ekspertene under deployering, mens de resterende ekspertene holdes inaktive.

Kunal Kejriwal er en backend‑ingeniør som spesialiserer seg på Python, PostgreSQL, Redis og skyinfrastruktur på GCP og AWS. Med tre års erfaring med å bygge og skalere produksjonssystemer skriver han om AI‑infrastruktur, distribuerte systemer og arkitekturen bak utrulling av maskinlæringsarbeidsbelastninger.