AI-modeller och plattformar
Uni-MoE: Skalning av enhetliga multimodala stora språkmodeller med Mixture of Experts
De senaste framstegen inom arkitektur och prestanda för multimodala stora språkmodeller, eller MLLM, har betonat vikten av skalbar data och modeller för att förbättra prestandan. Även om denna metod förbättrar prestandan, medför den betydande beräkningskostnader som begränsar praktiskheten och användbarheten av sådana metoder. Under de senaste åren har Mixture of Expert-modeller, eller MoE, framkommit som en framgångsrik alternativ metod för att skala bild-text och stora språkmodeller effektivt, eftersom Mixture of Expert-modeller har betydligt lägre beräkningskostnader och stark prestanda. Men trots sina fördelar är Mixture of Models inte den idealiska metoden för att skala stora språkmodeller, eftersom de ofta involverar färre experter och begränsade modaliteter, vilket begränsar tillämpningarna.
För att motverka de hinder som möter nuvarande metoder och för att skala stora språkmodeller effektivt, kommer vi i den här artikeln att prata om Uni-MoE, en enhetlig multimodal stor språkmodell med en MoE- eller Mixture of Expert-arkitektur som kan hantera en mängd olika modaliteter och experter. Uni-MoE-ramverket implementerar också en sparse Mixture of Expert-arkitektur inom de stora språkmodellerna i ett försök att göra tränings- och inferensprocessen mer effektiv genom att använda expertnivåmodellparallellism och dataparallellism. Dessutom, för att förbättra generalisering och multi-expert-samarbete, presenterar Uni-MoE-ramverket en progressiv träningsstrategi som är en kombination av tre olika processer. I den första processen uppnår Uni-MoE-ramverket cross-modality-alignment med hjälp av olika connectors med olika cross-modality-data. Andra, Uni-MoE-ramverket aktiverar preferensen för expertkomponenterna genom att träna modality-specifika experter med cross-modality-instruktionsdata. Slutligen implementerar Uni-MoE-modellen LoRA- eller Low-Rank Adaptation-lärandetekniken på blandad multimodal instruktionsdata för att justera modellen. När den instruktionsjusterade Uni-MoE-ramverket utvärderades på en omfattande uppsättning multimodala dataset, betonade de omfattande experimentella resultaten den primära fördelen med Uni-MoE-ramverket i att minska prestandabiasen vid hantering av blandade multimodala dataset betydligt. Resultaten indikerade också en betydande förbättring av multi-expert-samarbete och generalisering.
Denna artikel syftar till att täcka Uni-MoE-ramverket i detalj, och vi utforskar mekanismen, metodiken, arkitekturen i ramverket samt dess jämförelse med state-of-the-art-ramverk. Så låt oss komma igång.
Uni-MoE: Skalning av enhetliga multimodala stora språkmodeller
Tillkomsten av öppen källkod multimodala stora språkmodeller, inklusive LLama och InstantBlip, har markerat den betydande framgången och utvecklingen inom uppgifter som involverar bild-textförståelse under de senaste åren. Dessutom arbetar AI-samhället aktivt mot att bygga en enhetlig multimodal stor språkmodell som kan hantera en mängd olika modaliteter, inklusive bild, text, ljud, video och mer, och gå utöver den traditionella bild-text-paradigmen. En vanlig metod som följs av den öppna källkodsgemenskapen för att förbättra förmågan hos multimodala stora språkmodeller är att öka storleken på vision grundmodeller och integrera dem med stora språkmodeller med miljarder parametrar, och använda olika multimodala dataset för att förbättra instruktionsjustering. Dessa utvecklingar har betonat den ökande förmågan hos multimodala stora språkmodeller att resonera och bearbeta flera modaliteter, och visar på vikten av att expandera multimodal instruktionsdata och modellskalbarhet.
Även om att skala upp en modell är en beprövad och testad metod som ger betydande resultat, är att skala en modell en beräkningsmässigt dyr process för både tränings- och inferensprocesserna.
För att motverka problemet med höga beräkningskostnader, rör sig den öppna källkodsgemenskapen mot att integrera MoE- eller Mixture of Expert-modellarkitekturen i stora språkmodeller för att förbättra både tränings- och inferenseffektiviteten. Till skillnad från multimodala stora språkmodeller och stora språkmodeller som använder alla tillgängliga parametrar för att bearbeta varje indata, vilket resulterar i en tät beräkningsmetod, kräver Mixture of Expert-arkitekturen endast att användarna aktiverar en delmängd av expertparametrar för varje indata. Som ett resultat framstår Mixture of Expert-metoden som en livskraftig väg för att förbättra effektiviteten hos stora modeller utan omfattande parameteraktivering och höga beräkningskostnader. Även om befintliga arbeten har betonat den framgångsrika implementeringen och integrationen av Mixture of Expert-modeller i konstruktionen av textbaserade och text-bild-stora modeller, har forskare ännu inte fullständigt utforskat potentialen i att utveckla Mixture of Expert-arkitekturen för att konstruera kraftfulla enhetliga multimodala stora språkmodeller.
Uni-MoE är en multimodal stor språkmodell som använder sparse Mixture of Expert-modeller för att tolka och hantera flera modaliteter i ett försök att utforska skalning av enhetliga multimodala stora språkmodeller med MoE-arkitekturen. Som visas i följande bild, erhåller Uni-MoE-ramverket först kodningen av olika modaliteter med hjälp av modality-specifika kodare, och kartlägger sedan dessa kodningar till språkrepresentationen av de stora språkmodellerna med hjälp av olika designade connectors. Dessa connectors innehåller en tränbar transformermodell med efterföljande linjära projectioner för att destillera och projicera utdatarepresentationerna av den frusna kodaren. Uni-MoE-ramverket introducerar sedan en sparse Mixture of Expert-lager inom den interna blocken av den täta stora språkmodellen. Som ett resultat innehåller varje Mixture of Expert-baserat block ett delat självuppmärksamhetslager som är tillämpligt för alla modaliteter, en sparse router för att allokera expertis på token-nivå och olika experter baserade på feedforward-nätverket. På grund av denna metod kan Uni-MoE-ramverket förstå flera modaliteter, inklusive tal, ljud, text, video, bild och endast kräver aktivering av partiella parametrar under inferens.

Dessutom, för att förbättra multi-expert-samarbete och generalisering, implementerar Uni-MoE-ramverket en tre-stegs träningsstrategi. I den första fasen, använder ramverket omfattande bild/ljud/tal till språkpar för att träna den motsvarande connectorn på grund av den enhetliga modality-representationen i språkutrymmet för den stora språkmodellen. Andra, tränar Uni-MoE-modellen modality-specifika experter med hjälp av cross-modality-dataset separat i ett försök att finslipa expertisen hos varje expert inom dess respektive domän. I den tredje fasen, integrerar Uni-MoE-ramverket dessa tränade experter i Mixture of Expert-lagret av den stora språkmodellen och tränar hela Uni-MoE-ramverket med blandad multimodal instruktionsdata. För att minska träningskostnaden ytterligare, använder Uni-MoE-ramverket LoRA-lärandetekniken för att finslipa självuppmärksamhetslagren och de förtränade experterna.
Uni-MoE: Metodik och Arkitektur
Den grundläggande motivationen bakom Uni-MoE-ramverket är de höga tränings- och inferenskostnaderna för att skala multimodala stora språkmodeller, samt effektiviteten hos Mixture of Expert-modeller, och utforska möjligheten att skapa en effektiv, kraftfull och enhetlig multimodal stor språkmodell med hjälp av MoE-arkitekturen. Följande figur presenterar en representation av arkitekturen som implementeras i Uni-MoE-ramverket, som visar designen som innehåller individuella kodare för olika modaliteter, t.ex. ljud, tal och visuella, samt deras respektive modality-connector.

Uni-MoE-ramverket integrerar sedan Mixture of Expert-arkitekturen med de centrala stora språkmodellblocken, en process som är avgörande för att förbättra den övergripande effektiviteten hos både tränings- och inferensprocessen. Uni-MoE-ramverket uppnår detta genom att implementera en sparse router-mekanism. Den övergripande träningsprocessen för Uni-MoE-ramverket kan delas in i tre faser: cross-modality-alignment, träningsmodality-specifika experter och justering av Uni-MoE med hjälp av en divers uppsättning multimodala instruktionsdataset. För att effektivt omvandla olika modalinmatningar till en lingvistisk form, byggs Uni-MoE-ramverket på toppen av LLaVA, en förtränad visuell språkram. LLaVA-basmodellen integrerar CLIP som sin visuella kodare, tillsammans med en linjär projicering som omvandlar bildfunktioner till deras motsvarande mjuka bildtoken. Dessutom, för att bearbeta videoinnehåll, väljer Uni-MoE-ramverket åtta representativa ramar från varje video och omvandlar dem till videotoken genom genomsnittlig poolning för att samla deras bild- eller ram-baserade representation. För ljuduppgifter, distribuerar Uni-MoE-ramverket två kodare, BEATs och Whisper-kodaren, för att förbättra funktionsextrahering. Modellen destillerar sedan ljudfunktioner och fasta ljudlängder, och kartlägger dem till tal-token och mjuka ljud, respektive, via en linjär projicering.
Träningsstrategi
Uni-MoE-ramverket introducerar en progressiv träningsstrategi för den inkrementella utvecklingen av modellen. Den progressiva träningsstrategin som introduceras försöker utnyttja de distinkta förmågorna hos olika experter, förbättra multi-expert-samarbete och öka den övergripande generaliserbarheten hos ramverket. Träningsprocessen delas in i tre faser i ett försök att förverkliga MLLM-strukturen byggd på toppen av integrerade Mixture of Experts.
Fas 1: Cross-Modality Alignment
I den första fasen, försöker Uni-MoE-ramverket etablera en koppling mellan olika lingvistik och modaliteter. Uni-MoE-ramverket uppnår detta genom att översätta modaldatabas till mjuka token genom att konstruera connectors. Det primära målet med den första träningsfasen är att minimera den generativa entropiförlusten.Inom Uni-MoE-ramverket optimeras LLM för att generera beskrivningar för indata över olika modaliteter, och modellen utsätter endast connectorn för träningsprocessen, en strategi som möjliggör för Uni-MoE-ramverket att integrera olika modaliteter inom ett enhetligt språkramverk.

Fas 2: Träning av Modality-Specifika Experter
I den andra fasen, fokuserar Uni-MoE-ramverket på att utveckla enkelmodality-experter genom att träna modellen dedikerat på specifik cross-modality-data. Det primära målet är att finslipa expertisen hos varje expert inom dess respektive domän, och därmed förbättra den övergripande prestandan hos Mixture of Expert-systemet på en mängd olika multimodala dataset. Dessutom, anpassar Uni-MoE-ramverket feedforward-nätverken för att stämma bättre överens med egenskaperna hos modaliteten, samtidigt som den upprätthåller generativ entropiförlust som fokalmetrisk träningsprocess.

Fas 3: Justering av Uni-MoE
I den tredje och sista fasen, integrerar Uni-MoE-ramverket de viktade experterna från fas 2 i Mixture of Expert-lagren. Uni-MoE-ramverket justerar sedan MLLM med hjälp av blandad multimodal instruktionsdata gemensamt. Förlustkurvorna i följande bild reflekterar träningsprocessens framsteg.

En jämförande analys mellan konfigurationerna av Mixture of Expert avslöjade att experterna som modellen finslipade under den andra träningsfasen visade förbättrad stabilitet och uppnådde snabbare konvergens på blandade multimodala dataset. Dessutom, på uppgifter som involverade komplexa multimodala data, inklusive text, bilder, ljud och videor, visade Uni-MoE-ramverket mer konsekvent träningsprestanda och reducerad förlustvariabilitet när det använde fyra experter jämfört med när det använde två experter.

Uni-MoE: Experiment och Resultat
Följande tabell sammanfattar de arkitektoniska specifikationerna för Uni-MoE-ramverket. Det primära målet med Uni-MoE-ramverket, byggt på LLaMA-7B-arkitekturen, är att skala modellstorleken.

Följande tabell sammanfattar designen och optimeringen av Uni-MoE-ramverket, som styrs av specialiserade träningsuppgifter. Dessa uppgifter är avgörande för att finslipa förmågorna hos MLP-lagren, och därmed utnyttja deras specialiserade kunskap för förbättrad modellprestanda. Uni-MoE-ramverket genomför åtta enkelmodality-expertuppgifter för att belysa de differentiala effekterna av olika träningsmetoder.

Modellen utvärderar prestandan hos olika modellvarianter över en divers uppsättning benchmark, som omfattar två video-förståelse, tre ljud-förståelse och fem tal-relaterade uppgifter. Först testas modellen på dess förmåga att förstå tal-bild och tal-textuppgifter, och resultaten presenteras i följande tabell.

Som det kan observeras, levererar de tidigare baslinje-modellerna undermåliga resultat över tal-förståelseuppgifter, vilket påverkar prestandan på bild-tal-resonemangs-uppgifter. Resultaten indikerar att introduktionen av Mixture of Expert-arkitektur kan förbättra generaliserbarheten hos MLLM på osedda audi-bild-resonemangs-uppgifter. Följande tabell presenterar de experimentella resultaten på bild-text-förståelseuppgifter. Som det kan observeras, överträffar de bästa resultaten från Uni-MoE-modellerna baslinjerna och överträffar finjusteringsuppgiften med en genomsnittlig marginal på 4 poäng.

Slutliga Tankar
I den här artikeln har vi talat om Uni-MoE, en enhetlig multimodal stor språkmodell med en MoE- eller Mixture of Expert-arkitektur som kan hantera en mängd olika modaliteter och experter. Uni-MoE-ramverket implementerar också en sparse Mixture of Expert-arkitektur inom de stora språkmodellerna i ett försök att göra tränings- och inferensprocessen mer effektiv genom att använda expertnivåmodellparallellism och dataparallellism. Dessutom, för att förbättra generalisering och multi-expert-samarbete, presenterar Uni-MoE-ramverket en progressiv träningsstrategi som är en kombination av tre olika processer. I den första processen, uppnår Uni-MoE-ramverket cross-modality-alignment med hjälp av olika connectors med olika cross-modality-data. Andra, Uni-MoE-ramverket aktiverar preferensen för expertkomponenterna genom att träna modality-specifika experter med cross-modality-instruktionsdata. Slutligen implementerar Uni-MoE-modellen LoRA- eller Low-Rank Adaptation-lärandetekniken på blandad multimodal instruktionsdata för att justera modellen.












