AI-modeller og plattformer
Uni-MoE: Skalerer Unified Multimodal LLMs med Mixture of Experts
De nylige fremstegene i arkitekturen og ytelsen til multimodale store språkmodeller eller MLLM har understreket viktigheten av skalerbar data og modeller for å forbedre ytelsen. Selv om denne tilnærmingen forbedrer ytelsen, medfører den betydelige beregningskostnader som begrenser praktisiteten og brukbarheten av slike tilnærminger. Over årene har Mixture of Expert eller MoE-modeller dukket opp som en suksessfull alternativ tilnærming for å skalerer bilde-tekst og store språkmodeller effektivt, da Mixture of Expert-modeller har betydelig lavere beregningskostnader og sterk ytelse. Imidlertid, til tross for deres fordeler, er Mixture of Models ikke den ideelle tilnærmingen for å skalerer store språkmodeller, da de ofte involverer færre eksperter og begrensede modaliteter, noe som begrenser anvendelsesområdene.
For å motvirke hindringene som møtes av nåværende tilnærminger, og for å skalerer store språkmodeller effektivt, vil vi i denne artikkelen diskutere Uni-MoE, en unified multimodal stor språkmodell med en MoE eller Mixture of Expert-arkitektur som kan håndtere en bred rekke modaliteter og eksperter. Uni-MoE-rammeverket implementerer også en sparse Mixture of Expert-arkitektur innenfor store språkmodeller i et forsøk på å gjøre trenings- og inferensprosessen mer effektiv ved å anvende ekspertnivå-modell-parallellisme og data-parallellisme. Videre, for å forbedre generalisering og multi-ekspert-samarbeid, presenterer Uni-MoE-rammeverket en progressiv treningsstrategi som er en kombinasjon av tre forskjellige prosesser. Først oppnår Uni-MoE-rammeverket cross-modality-alignment ved å bruke forskjellige koblinger med forskjellige cross-modality-data. Andre, aktiverer Uni-MoE-rammeverket preferansen for ekspert-komponentene ved å trene modality-spesifikke eksperter med cross-modality-instruktionsdata. Til slutt implementerer Uni-MoE-modellen LoRA eller Low-Rank Adaptation-læringsteknikken på blandet multimodal instruktionsdata for å finjustere modellen. Når instruktions-justerte Uni-MoE-rammeverket ble evaluert på en omfattende sett av multimodale datasett, viste de omfattende eksperimentelle resultater den primære fordelen til Uni-MoE-rammeverket i å redusere ytelsesforvrengning ved å håndtere blandet multimodal data betydelig. Resultatene indikerte også en betydelig forbedring av multi-ekspert-samarbeid og generalisering.
Denne artikkelen har som mål å dekke Uni-MoE-rammeverket i dybden, og vi utforsker mekanismen, metoden, arkitekturen til rammeverket sammen med dens sammenligning med state-of-the-art-rammeverk. La oss begynne.
Uni-MoE: Skalerer Unified Multimodal LLMs
Introduksjonen av åpne multimodale store språkmodeller, inkludert LLama og InstantBlip, har vist den merkede suksessen og fremgangen i oppgaver som involverer bilde-tekst-forståelse over de siste årene. Videre arbeider AI-samfunnet aktivt mot å bygge en unified multimodal stor språkmodell som kan håndtere en bred rekke modaliteter, inkludert bilde, tekst, lyd, video og mer, og gå utenfor den tradisjonelle bilde-tekst-paradigmet. En vanlig tilnærming som følges av det åpne samfunnet for å forbedre evnene til multimodale store språkmodeller er å øke størrelsen på visjon-grunnmodellene og integrere dem med store språkmodeller med milliarder av parametre, og bruke diverse multimodale datasett for å forbedre instruksjonstuning. Disse utviklingene har vist den økende evnen til multimodale store språkmodeller til å resonnere og prosessere multiple modaliteter, og understreket viktigheten av å utvide multimodal instruksjonsdata og modell-skalerbarhet.
Selv om å skalerer en modell er en prøvet og testet tilnærming som leverer betydelige resultater, er å skalerer en modell en beregningskostbar prosess for både trenings- og inferensprosessen.
For å motvirke problemet med høye beregningskostnader, er det åpne samfunnet i ferd med å integrere MoE eller Mixture of Expert-modellarkitekturen i store språkmodeller for å forbedre både trenings- og inferenseffektiviteten. I motsetning til multimodale store språkmodeller og store språkmodeller som bruker alle tilgjengelige parametre for å prosessere hver innputt, krever Mixture of Expert-arkitekturen bare at brukerne aktiverer en undergruppe av ekspert-parametre for hver innputt. Som resultat oppstår Mixture of Expert-tilnærmingen som en livskraftig vei for å forbedre effektiviteten til store modeller uten omfattende parameter-aktivering og høye beregningskostnader. Selv om eksisterende arbeider har vist den suksessfulle implementeringen og integreringen av Mixture of Expert-modeller i konstruksjonen av tekst-bare og tekst-bilde store modeller, er forskerne ennå ikke fullt ut utforsket potensialet for å utvikle Mixture of Expert-arkitekturen for å konstruere kraftfulle unified multimodale store språkmodeller.
Uni-MoE er en multimodal stor språkmodell som utnytter sparse Mixture of Expert-modeller for å tolke og håndtere multiple modaliteter i et forsøk på å utforske å skalerer unified multimodale store språkmodeller med MoE-arkitekturen. Som vist i følgende bilde, oppnår Uni-MoE-rammeverket først kodningen av forskjellige modaliteter ved å bruke modality-spesifikke kodere, og kartlegger deretter disse kodningene inn i språk-representasjonsrommet til store språkmodeller ved å bruke forskjellige designet koblinger. Disse koblingene inneholder en treningbar transformer-modell med påfølgende lineære prosjeksjoner for å destillere og prosjektere utgangs-representasjonene til den frosne koderen. Uni-MoE-rammeverket introduserer deretter en sparse Mixture of Expert-lag innenfor den interne blokkene til den tette store språkmodellen. Som resultat har hver Mixture of Expert-basert blokk en delt selv-oppmerksomhetslag som er anvendbar på tvers av alle modaliteter, en sparse router for å tildele ekspertise på token-nivå og diverse eksperter basert på feedforward-nettverket. Takket være denne tilnærmingen er Uni-MoE-rammeverket i stand til å forstå multiple modaliteter, inkludert tale, lyd, tekst, video, bilde og bare krever aktivering av delvis parametre under inferens.

Videre, for å forbedre multi-ekspert-samarbeid og generalisering, implementerer Uni-MoE-rammeverket en tre-stegs treningsstrategi. I den første fasen, bruker rammeverket omfattende bilde/lyd/tale-til-språk-par til å trene den korresponderende koblingen på grunn av den unified modality-representasjonen i språk-rommet til den store språkmodellen. Andre, trener Uni-MoE-modellen modality-spesifikke eksperter ved å bruke cross-modality-datasett separat i et forsøk på å finjustere ferdighetene til hver ekspert innenfor dens respektive domene. I den tredje fasen, integrerer Uni-MoE-rammeverket disse trente eksperter inn i Mixture of Expert-laget til den store språkmodellen og trener hele Uni-MoE-rammeverket med blandet multimodal instruksjonsdata. For å redusere treningskostnadene ytterligere, bruker Uni-MoE-rammeverket LoRA-læringstilnærmingen for å finjustere disse selv-oppmerksomhetslagene og de forhåndstrente eksperter.
Uni-MoE : Metodologi og Arkitektur
Den grunnleggende motivasjonen bak Uni-MoE-rammeverket er de høye trenings- og inferenskostnadene til å skalerer multimodale store språkmodeller, samt effektiviteten til Mixture of Expert-modeller, og utforske muligheten for å skape en effektiv, kraftfull og unified multimodal stor språkmodell som utnytter MoE-arkitekturen. Følgende figur presenterer en representasjon av arkitekturen implementert i Uni-MoE-rammeverket, som viser designet som inkluderer individuelle kodere for forskjellige modaliteter, samt deres respektive modality-koblinger.

Uni-MoE-rammeverket integrerer deretter Mixture of Expert-arkitekturen med den indre store språkmodell-blokken, en prosess som er avgjørende for å forbedre den totale effektiviteten til både trenings- og inferensprosessen. Uni-MoE-rammeverket oppnår dette ved å implementere en sparse routing-mekanisme. Den totale treningsprosessen til Uni-MoE-rammeverket kan deles inn i tre faser: cross-modality-alignment, trenings-modality-spesifikke eksperter og finjustering av Uni-MoE ved å bruke en divers sett av multimodale instruksjonsdatasett. For å effektivt omforme forskjellige modale innputt til en lingvistisk format, er Uni-MoE-rammeverket bygget på toppen av LLaVA, en forhåndstrent visuell språk-ramme. LLaVA-basemodellen integrerer CLIP som dens visuelle kodere, samt en lineær prosjeksjonslag som konverterer bilde-egenskaper til deres korresponderende myke bilde-token. Videre, for å prosessere video-innhold, velger Uni-MoE-rammeverket åtte representative rammeverk fra hver video og transformerer dem til video-token ved å bruke gjennomsnittlig pooling for å aggregere deres bilde- eller rammeverks-baserte representasjon. For lyd-oppgaver, deployerer Uni-MoE-rammeverket to kodere, BEATs og Whisper-koderen for å forbedre egenskaps-uttrekk. Modellen destillerer deretter lyd-egenskapsvektoren og fikser lengden på tale, og kartlegger dem til tale-token og myke lyd-token via en lineær prosjeksjonslag.
Treningsstrategi
Uni-MoE-rammeverket introduserer en progressiv treningsstrategi for den inkrementelle utviklingen av modellen. Den progressive treningsstrategien introdusert forsøker å utnytte de distinkte evnene til forskjellige eksperter, forbedre multi-ekspert-samarbeidseffektiviteten og forbedre den totale generaliseringen av rammeverket. Treningsprosessen deles inn i tre faser med forsøket på å aktualisere MLLM-strukturen bygget på toppen av integrerte Mixture of Experts.
Fase 1 : Cross-Modality-Alignment
I den første fasen, forsøker Uni-MoE-rammeverket å etablere koblinger mellom forskjellige lingvistiske og modaliteter. Uni-MoE-rammeverket oppnår dette ved å oversette modale data til myke token ved å konstruere koblinger. Det primære målet med den første treningsfasen er å minimere den generative entropi-tapet.Innenfor Uni-MoE-rammeverket, er LLM-optimert for å generere beskrivelser for innputt på tvers av forskjellige modaliteter, og modellen underkaster bare koblingene for treningsprosessen, en strategi som gjør det mulig for Uni-MoE-rammeverket å integrere forskjellige modaliteter innenfor en unified språk-ramme.

Fase 2: Trenings-Modality-Spesifikke Eksperter
I den andre fasen, fokuserer Uni-MoE-rammeverket på å utvikle enkelt-modality-eksperter ved å trene modellen dedikert på spesifikke cross-modality-data. Det primære målet er å finjustere ferdighetene til hver ekspert innenfor dens respektive domene, og dermed forbedre den totale ytelsen til Mixture of Expert-systemet på en bred rekke av multimodale data. Videre, tilpasser Uni-MoE-rammeverket feedforward-nettverkene for å alignere mer nært med karakteristikkene til modalityen, samtidig som generativ entropi-tap er et fokalt mål for treningsprosessen.

Fase 3: Finjustering av Uni-MoE
I den tredje og siste fasen, integrerer Uni-MoE-rammeverket vektene som er justert av eksperter under Fase 2 inn i Mixture of Expert-lagene. Uni-MoE-rammeverket finjusterer deretter MLLM-ene ved å bruke blandet multimodal instruksjonsdata sammen. Tap-kurveene i følgende bilde reflekterer fremgangen i treningsprosessen.

En sammenligningsanalyse mellom konfigurasjonene av Mixture of Expert avdekket at ekspertene som modellen finjusterte under den andre treningsfasen viste forbedret stabilitet og oppnådde raskere konvergens på blandet-modal-datasett. Videre, på oppgaver som involverte komplekse multi-modale data, inkludert tekst, bilder, lyd, video, viste Uni-MoE-rammeverket mer konsistent treningsytelse og redusert tap-variabilitet når det ble brukt fire eksperter sammenlignet med når det ble brukt to eksperter.

Uni-MoE : Eksperimenter og Resultater
Følgende tabell summerer de arkitektoniske spesifikasjonene til Uni-MoE-rammeverket. Det primære målet med Uni-MoE-rammeverket, bygget på LLaMA-7B-arkitekturen, er å skalerer modell-størrelsen.

Følgende tabell summerer designet og optimaliseringen av Uni-MoE-rammeverket, som er styrt av spesialiserte treningsoppgaver. Disse oppgavene er avgjørende for å finjustere evnene til MLP-lagene, og dermed utnytte deres spesialiserte kunnskap for å forbedre modell-ytelsen. Uni-MoE-rammeverket tar i bruk åtte enkelt-modality-ekspert-oppgaver for å belyse de differensierte impaktene av forskjellige treningsmetoder.

Modellen evaluerer ytelsen til forskjellige modell-variantene på en divers sett av benchmark-sett som omfatter to video-forståelses-, tre lyd-forståelses- og fem tale-relaterte oppgaver. Først testes modellen på dens evne til å forstå tale-bilde- og tale-tekst-oppgaver, og resultater er inkludert i følgende tabell.

Som det kan observeres, leverer de tidligere baseline-modellene dårligere resultater på tale-forståelses-oppgaver, noe som videre påvirker ytelsen på bilde-tale-forståelses-oppgaver. Resultatene indikerer at introduksjonen av Mixture of Expert-arkitekturen kan forbedre generaliseringen av MLLM-er på ubrukte audi-bilde-forståelses-oppgaver. Følgende tabell presenterer de eksperimentelle resultater på bilde-tekst-forståelses-oppgaver. Som det kan observeres, overgår de beste resultater fra Uni-MoE-modellene baseline-modellene og overgår finjusteringsoppgaven med en gjennomsnittlig margin på 4 poeng.

Slutt tanker
I denne artikkelen har vi diskutert Uni-MoE, en unified multimodal stor språkmodell med en MoE eller Mixture of Expert-arkitektur som kan håndtere en bred rekke modaliteter og eksperter. Uni-MoE-rammeverket implementerer også en sparse Mixture of Expert-arkitektur innenfor store språkmodeller i et forsøk på å gjøre trenings- og inferensprosessen mer effektiv ved å anvende ekspertnivå-modell-parallellisme og data-parallellisme. Videre, for å forbedre generalisering og multi-ekspert-samarbeid, presenterer Uni-MoE-rammeverket en progressiv treningsstrategi som er en kombinasjon av tre forskjellige prosesser. Først oppnår Uni-MoE-rammeverket cross-modality-alignment ved å bruke forskjellige koblinger med forskjellige cross-modality-data. Andre, aktiverer Uni-MoE-rammeverket preferansen for ekspert-komponentene ved å trene modality-spesifikke eksperter med cross-modality-instruktionsdata. Til slutt implementerer Uni-MoE-modellen LoRA eller Low-Rank Adaptation-læringsteknikken på blandet multimodal instruksjonsdata for å finjustere modellen.












