AI-modeller og platforme

Uni-MoE: Skalering af Unified Multimodal LLMs med Mixture of Experts

mm
Føj Unite.AI til dine foretrukne kilder på Google

De seneste fremskridt i arkitektur og præstation af Multimodal Large Language Models eller MLLMs har understreget betydningen af skalerbar data og modeller for at forbedre præstationen. Selvom denne tilgang forbedrer præstationen, medfører den betydelige beregningsomkostninger, der begrænser praktikabiliteten og brugbarheden af sådanne tilgange. Gennem årene er Mixture of Expert eller MoE-modeller opstået som en succesfuld alternativ tilgang til at skale billede-tekst og store sprogmodeller effektivt, da Mixture of Expert-modeller har betydeligt lavere beregningsomkostninger og stærk præstation. Men trods deres fordele er Mixture of Models ikke den ideelle tilgang til at skale store sprogmodeller, da de ofte involverer færre eksperter og begrænsede modaliteter, hvilket begrænser anvendelserne.

For at modgå de hindringer, som nuværende tilgange møder, og for at skale store sprogmodeller effektivt, vil vi i denne artikel tale om Uni-MoE, en unified multimodal stor sprogmodel med en MoE eller Mixture of Expert-arkitektur, der kan håndtere en bred vifte af modaliteter og eksperter. Uni-MoE-rammeværket implementerer også en sparsom Mixture of Expert-arkitektur inden for de store sprogmodeller i et forsøg på at gøre trænings- og inferensprocessen mere effektiv ved at anvende ekspertniveau-model-parallellisme og data-parallellisme. Endvidere for at forbedre generalisering og multi-ekspert-samarbejde præsenterer Uni-MoE-rammeværket en progressiv træningsstrategi, der er en kombination af tre forskellige processer. Først opnår Uni-MoE-rammeværket cross-modality-alignment ved hjælp af forskellige connectors med forskellige cross-modality-data. Anden, Uni-MoE-rammeværket aktiverer præferencen for ekspertkomponenterne ved at træne modality-specifikke eksperter med cross-modality-instruktionsdata. Endelig implementerer Uni-MoE-modellen LoRA eller Low-Rank Adaptation-læringsteknikken på blandet multimodal instruktionsdata for at justere modellen. Da den instruktions-justerede Uni-MoE-ramme blev evaluueret på en omfattende samling af multimodale datasæt, fremhævede de omfattende eksperimentelle resultater den primære fordel af Uni-MoE-rammeværket i at reducere præstationsbias i håndtering af blandet multimodal datasæt betydeligt. Resultaterne indikerede også en betydelig forbedring af multi-ekspert-samarbejde og generalisering.

Denne artikel har til formål at dække Uni-MoE-rammeværket i dybden, og vi udforsker mekanismen, metodologien, arkitekturen i rammeværket samt sammenligningen med state-of-the-art-rammeværker. Så lad os komme i gang.

Uni-MoE: Skalering af Unified Multimodal LLMs

Introduktionen af open-source multimodale store sprogmodeller, herunder LLama og InstantBlip, har understreget den betydelige succes og fremgang i opgaver, der involverer billede-tekst-forståelse i de seneste år. Endvidere arbejder AI-samfundet aktivt på at bygge en unified multimodal stor sprogmodel, der kan rumme en bred vifte af modaliteter, herunder billede, tekst, lyd, video og mere, og gå ud over den traditionelle billede-tekst-paradigme. En almindelig tilgang, der følges af open-source-samfundet for at forbedre evnerne af multimodale store sprogmodeller, er at øge størrelsen af vision-fundamentsmodeller og integrere dem med store sprogmodeller med milliarder af parametre og anvende diverse multimodale datasæt til at forbedre instruktions-justering. Disse udviklinger har understreget den øgede evne af multimodale store sprogmodeller til at resonere og behandle multiple modaliteter, hvilket understreger betydningen af at udvide multimodal instruktionsdata og model-skalerbarhed.

Selvom at skale en model op er en prøvet og testet tilgang, der leverer betydelige resultater, er at skale en model en beregningsmæssigt dyrt proces for både trænings- og inferensprocesser.

For at modgå problemet med høje beregningsomkostninger er open-source-samfundet på vej mod at integrere MoE eller Mixture of Expert-modellens arkitektur i store sprogmodeller for at forbedre både trænings- og inferens-effektiviteten. I modsætning til multimodale store sprogmodeller og store sprogmodeller, der anvender alle tilgængelige parametre til at behandle hver indgang, kræver Mixture of Expert-arkitekturen kun, at brugerne aktiverer en undermængde af ekspertparametre for hver indgang. Som resultat opstår Mixture of Expert-tilgangen som en livskraftig vej til at forbedre effektiviteten af store modeller uden omfattende parameter-aktivering og høje beregningsomkostninger. Selvom eksisterende arbejder har understreget den succesfulde implementering og integration af Mixture of Expert-modeller i konstruktionen af tekst- og tekst-billede-store modeller, er forskere endnu ikke fuldt ud at udforske potentialet for at udvikle Mixture of Expert-arkitekturen til at konstruere kraftfulde unified multimodale store sprogmodeller.

Uni-MoE er en multimodal stor sprogmodel, der udnytter sparsom Mixture of Expert-modeller til at fortolke og håndtere multiple modaliteter i et forsøg på at udforske skalering af unified multimodale store sprogmodeller med MoE-arkitekturen. Som vist i følgende billede, opnår Uni-MoE-rammeværket først kodningen af forskellige modaliteter ved hjælp af modality-specifikke encodere og mapper derefter disse kodninger til sprog-repræsentationsrummet af store sprogmodeller ved hjælp af forskellige designede connectors. Disse connectors indeholder en trænet transformer-model med efterfølgende lineære projectioner til at destillere og projicere output-repræsentationerne af den frosne encoder. Uni-MoE-rammeværket introducerer derefter en sparsom Mixture of Expert-lag inden for den interne blok af den tætte store sprogmodel. Som resultat har hver Mixture of Expert-baseret blok en delt selv-attention-lag, der er anvendelig på tværs af alle modaliteter, en sparsom router til at allokerer ekspertise på token-niveau og forskellige eksperter baseret på feedforward-netværket. Takket være denne tilgang er Uni-MoE-rammeværket i stand til at forstå multiple modaliteter, herunder tale, lyd, tekst, video, billede og kræver kun aktivering af partielle parametre under inferens.

Endvidere for at forbedre multi-ekspert-samarbejde og generalisering implementerer Uni-MoE-rammeværket en tre-stages træningsstrategi. I den første stage, anvender rammeværket omfattende billede/lyd/tale-til-sprog-par til at træne den tilsvarende connector på grund af den unified modality-repræsentation i sprog-rummet af den store sprogmodel. Anden, træner Uni-MoE-modellen modality-specifikke eksperter ved at anvende cross-modality-datasæt separat i et forsøg på at raffinere dygtigheden af hver ekspert inden for dens respektive domæne. I den tredje stage, integrerer Uni-MoE-rammeværket disse trænede eksperter i Mixture of Expert-laget af den store sprogmodel og træner hele Uni-MoE-rammeværket med blandet multimodal instruktionsdata. For at reducere træningsomkostningerne yderligere, anvender Uni-MoE-rammeværket LoRA-læringsapproachen til at finjustere disse selv-attention-lag og de fortrænede eksperter.

Uni-MoE: Metodologi og Arkitektur

Den grundlæggende motivation bag Uni-MoE-rammeværket er de høje trænings- og inferensomkostninger af at skale multimodale store sprogmodeller samt effektiviteten af Mixture of Expert-modeller og udforske muligheden for at skabe en effektiv, kraftfuld og unified multimodal stor sprogmodel ved hjælp af MoE-arkitekturen. Følgende figur præsenterer en repræsentation af arkitekturen, der er implementeret i Uni-MoE-rammeværket, der viser designet, der inkluderer individuelle encodere for forskellige modaliteter, herunder lyd, tale og visuelle samt deres respektive modality-connectors.

Uni-MoE-rammeværket integrerer derefter Mixture of Expert-arkitekturen med den store sprogmodels kerneblokke, en proces, der er afgørende for at forbedre den overordnede effektivitet af både trænings- og inferensprocessen. Uni-MoE-rammeværket opnår dette ved at implementere en sparsom router-mekanisme. Den overordnede træningsproces af Uni-MoE-rammeværket kan deles ind i tre faser: cross-modality-alignment, træning af modality-specifikke eksperter og justering af Uni-MoE ved hjælp af en divers samling af multimodale instruktionsdatasæt. For at effektivt omforme forskellige modal-indgang til en lingvistisk format er Uni-MoE-rammeværket bygget oven på LLaVA, en fortrænet visuel sprog-ramme. LLaVA-basismodellen integrerer CLIP som dens visuelle encoder samt en lineær projection-lag, der konverterer billede-funktioner til deres respektive bløde billede-token. Endvidere for at behandle video-indhold vælger Uni-MoE-rammeværket otte repræsentative rammer fra hver video og transformerer dem til video-token ved hjælp af gennemsnits-pooling til at aggregere deres billede- eller ramme-baserede repræsentation. For lyd-opgaver anvender Uni-MoE-rammeværket to encodere, BEATs og Whisper-encoder til at forbedre funktionsextraktion. Modellen destillerer derefter lyd-funktioner-vektor og fast-længde-tale og mapper dem til tale-token og bløde lyd henholdsvis via en lineær projection-lag.

Træningsstrategi

Uni-MoE-rammeværket introducerer en progressiv træningsstrategi for den inkrementelle udvikling af modellen. Den progressive træningsstrategi, der er introduceret, forsøger at udnytte de forskellige eksperters distinkte evner, forbedre multi-ekspert-samarbejde-effektiviteten og forbedre den overordnede generalisering af rammeværket. Træningsprocessen er inddelt i tre faser i et forsøg på at realisere MLLM-strukturen bygget oven på integreret Mixture of Experts.

Stage 1: Cross-Modality Alignment

I den første stage, forsøger Uni-MoE-rammeværket at etablere forbindelse mellem forskellige lingvistiske og modaliteter. Uni-MoE-rammeværket opnår dette ved at oversætte modal-data til bløde token ved at konstruere connectors. Det primære formål med den første træningsstage er at minimere den generative entropi-tab. Inden for Uni-MoE-rammeværket er LLM optimeret til at generere beskrivelser for indgang på tværs af forskellige modaliteter, og modellen underkaster kun connectors til træning, en strategi, der ermöglicer Uni-MoE-rammeværket at integrere forskellige modaliteter inden for en unified sprog-ramme.

Stage 2: Træning af Modality-Specifikke Eksperter

I den anden stage, fokuserer Uni-MoE-rammeværket på at udvikle enkelt-modality-eksperter ved at træne modellen dedikeret på specifikke cross-modality-data. Det primære formål er at raffinere dygtigheden af hver ekspert inden for dens respektive domæne, hvilket forbedrer den overordnede præstation af Mixture of Expert-systemet på en bred vifte af multimodale data. Endvidere tilpasser Uni-MoE-rammeværket feedforward-netværket til at aligne mere tæt med karakteristikkerne af modaliteten, mens den opretholder generative entropi-tab som fokal metrik-træning.

Stage 3: Justering af Uni-MoE

I den tredje og sidste stage, integrerer Uni-MoE-rammeværket de vægte, der er justeret af eksperter under Stage 2, i Mixture of Expert-lagene. Uni-MoE-rammeværket justerer derefter MLLM ved hjælp af blandet multimodal instruktionsdata sammen. Tab-curve i følgende billede reflekterer fremgangen i træningsprocessen.

En sammenlignende analyse af Mixture of Expert-konfigurationer afslørede, at de eksperter, modellen raffinerede under den 2. træningsstage, viste forbedret stabilitet og opnåede hurtigere konvergens på blandet-modal datasæt. Endvidere på opgaver, der involverede komplekse multi-modale data, herunder tekst, billeder, lyd, video, demonstrerede Uni-MoE-rammeværket mere konsistent træningspræstation og reduceret tab-variation, når det anvendte fire eksperter i stedet for to eksperter.

Uni-MoE: Eksperimenter og Resultater

Følgende tabel summerer de arkitektoniske specifikationer af Uni-MoE-rammeværket. Det primære formål med Uni-MoE-rammeværket, bygget på LLaMA-7B-arkitekturen, er at skale modelstørrelsen.

Følgende tabel summerer designet og optimeringen af Uni-MoE-rammeværket, som er guidet af specialiserede træningsopgaver. Disse opgaver er afgørende for at raffinere evnerne af MLP-lagene og udnytte deres specialiserede viden til forbedret modelpræstation. Uni-MoE-rammeværket påtager sig otte enkelt-modality-ekspert-opgaver for at belyse de differentialle impakter af forskellige træningsmetoder.

Modellen evaluerer præstationen af forskellige model-variationer på tværs af en divers samling af benchmarks, der omfatter to video-forståelses-, tre lyd-forståelses- og fem tale-relaterede opgaver. Først testes modellen på dens evne til at forstå tale-billede og tale-tekst-opgaver, og resultaterne er indeholdt i følgende tabel.

Som det kan ses, leverer de tidligere baseline-modeller ringe resultater på tale-forståelsesopgaver, hvilket yderligere påvirker præstationen på billede-tale-forståelsesopgaver. Resultaterne indikerer, at introduktionen af Mixture of Expert-arkitektur kan forbedre generaliseringen af MLLM på usete audi-billede-forståelsesopgaver. Følgende tabel præsenterer de eksperimentelle resultater på billede-tekst-forståelsesopgaver. Som det kan ses, overgår de bedste resultater fra Uni-MoE-modellerne baseline-modellerne og overgår fine-tuning-opgaven med en gennemsnitlig margin på 4 point.

Endelige Tanker

I denne artikel har vi talt om Uni-MoE, en unified multimodal stor sprogmodel med en MoE eller Mixture of Expert-arkitektur, der kan håndtere en bred vifte af modaliteter og eksperter. Uni-MoE-rammeværket implementerer også en sparsom Mixture of Expert-arkitektur inden for de store sprogmodeller i et forsøg på at gøre trænings- og inferensprocessen mere effektiv ved at anvende ekspertniveau-model-parallellisme og data-parallellisme. Endvidere for at forbedre generalisering og multi-ekspert-samarbejde præsenterer Uni-MoE-rammeværket en progressiv træningsstrategi, der er en kombination af tre forskellige processer. Først opnår Uni-MoE-rammeværket cross-modality-alignment ved hjælp af forskellige connectors med forskellige cross-modality-data. Anden, Uni-MoE-rammeværket aktiverer præferencen for ekspertkomponenterne ved at træne modality-specifikke eksperter med cross-modality-instruktionsdata. Endelig implementerer Uni-MoE-modellen LoRA eller Low-Rank Adaptation-læringsteknikken på blandet multimodal instruktionsdata for at justere modellen.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.