AI-modeller och plattformar
MoE-LLaVA: En blandning av experter för stora visionsspråkmodeller
De senaste framstegen inom stora visionsspråkmodeller (LVLM) har visat att skalning av dessa ramverk signifikant förbättrar prestandan över en mängd olika nedströmsuppgifter. LVLM, inklusive MiniGPT, LLaMA och andra, har uppnått remarkabla förmågor genom att införa visuella projiceringsskikt och en bildkodare i deras arkitektur. Genom att implementera dessa komponenter förbättrar LVLM de visuella perceptionsförmågorna hos stora språkmodeller (LLM). Prestandan kan förbättras ytterligare genom att öka modellens storlek och antal parametrar, samt expandera datamängdens skala.
Modeller som InternVL har expanderat sin bildkodare till över 6 miljarder parametrar, medan andra har utökat backenden för LVLM till 13 miljarder parametrar, och uppnått överlägsen prestanda på en mängd olika uppgifter. IDEFICS har tränat en LVLM med över 80 miljarder parametrar. Dessa skalningsmetoder har matchat eller överträffat prestandan hos LLM som förtränats på över 34, 70 eller till och med 100 miljarder parametrar. Men skalning har en negativ sida: det ökar signifikant tränings- och inferenskostnader. Detta beror på att det kräver att alla parametrar är aktiva för varje token i beräkningen, vilket leder till höga beräkningsbehov och, i följd, högre kostnader.
Denna artikel diskuterar MoE-LLaVA, en MoE-baserad (Mixture of Experts) sparse LVLM-arkitektur som använder en effektiv träningsstrategi, MoE-Tuning, för LVLM. MoE-Tuning adresserar innovativt prestandaförsämringen i multi-modal sparsitetsträning, vilket resulterar i en modell med ett stort antal parametrar men konsekventa tränings- och inferenskostnader. MoE-LLaVA-arkitekturen är utformad för att endast aktivera de översta k-experterna under distribution, medan de återstående experterna förblir inaktiva.
Vi kommer att undersöka MoE-LLaVA-ramverket, med fokus på dess mekanism, metodik, arkitektur och hur det jämför med ledande bild- och videogenereringsramverk.
MoE-LLaVA: Skalning av stora visionsspråkmodeller på ett ekonomiskt sätt
Förutom att utnyttja visuella projiceringsskikt och bildkodare, skalar stora visionsspråkmodeller också upp modellstorleken genom att öka antalet parametrar för att förbättra modellens prestanda. Några exempel på stora visionsspråkmodeller som har följt denna strategi för att förbättra sin prestanda är MiniGPT-4, InternGPT, InternVL och andra. I realvärlden blir det ofta nödvändigt att skala upp en stor språkmodell eller en stor visionsspråkmodell med högkvalitativ träningsdata för att förbättra modellens prestanda. Även om att skala upp en modellstorlek förbättrar prestandan, ökar det också de beräkningskostnaderna för tränings- och distribution av modellen, och ökar dessutom svårigheterna och effektiviteten vid distribution av modellen på parallella enheter samtidigt. En viktig anledning till de ökade tränings- och inferenskostnaderna, liksom de beräkningskraven, är att varje token i ramverket kräver beräkning med varje enskild parameter inom modellen, som kallas en tät modell.
Å andra sidan har sparse MoE eller Mixture of Expert-modeller visat sig vara effektiva för att skala ramverk genom att bearbeta data med hjälp av fasta aktiverade parametrar, en strategi som har använts flitigt inom området för naturligt språkbehandling. Men att använda Mixture of Expert för att direkt träna sparse stora visionsspråkmodeller är utmanande, eftersom omvandling av LLM till LVLM och sparsifiering av modellen samtidigt resulterar i signifikant prestandaförsämring. För att implementera Mixture of Expert för att skala LLM och LVLM är det viktigt att först initiera LVLM för sparsifiering. För att uppnå detta introducerar MoE-LLaVA-ramverket MoE-Tuning, en enkel men effektiv tre-fas träningsstrategi.

Som visas i figuren ovan, tränar MoE-Tuning-processen först en MLP eller en Multilayer Perceptron som anpassar de visuella token till en stor språkmodell i den första fasen. Ramverket tränar sedan alla parametrar i LLM för att förbereda den stora visionsspråkmodellen med allmän multi-modal förståelseförmåga. Slutligen, i den tredje fasen, replikerar ramverket FFN eller Feed Forward Network som initieringsvikter för experterna och tränar endast Mixture of Expert-lagren. Den totala träningsprocessen hjälper till att gradvis övergå från en sparse modell till en MoE-modell.
Med träningsprocessen täckt, låt oss belysa MoE-LLaVA, en baseline för stora visionsspråkmodeller med Mixture of Expert-modeller som inkorporerar lärbare routrar och MoE-modeller. I kärnan består MoE-LLaVA-modellen av flera sparse vägar, och ramverket använder dessa vägar för att dirigera varje token till olika experter via den lärbare routern. Token bearbetas sedan kollektivt av de aktiverade experterna medan de inaktiva vägarna hålls tysta. Ramverket staplar sedan Mixture of Expert-kodarlager iterativt för att tillhandahålla en sparse väg mot en större och mer kraftfull LVLM.

Tack vare tillvägagångssättet som implementeras av MoE-LLaVA-ramverket, kan det prestera bättre än modeller med ett liknande antal aktiverade parametrar och överträffa dem med en stor skillnad på POPE-objekt hallucinationsbenchmark, trots att det endast har 2,2 miljarder parametrar. Dessutom kan MoE-LLaVA-ramverket med 2,2 miljarder parametrar uppnå en prestanda som är jämförbar med InternVL-Chat-19B-ramverket med nästan 8 gånger fler aktiverade parametrar.
Kraftfulla stora språkmodeller med stark generaliserings- och instruktionsföljande förmåga har implementerats för stora visionsspråkmodeller. Tidiga LLM som BLIP kodade visuella signaler till en sekvens av visuella token, vilket möjliggjorde anpassning av vision till LLM med hjälp av flera projiceringsskikt. Samtidigt fokuserar senare arbeten på att förbättra modellprestandan genom att implementera metoder som utvidgning av instruktionsanpassningsdataset, ökning av bildupplösning, optimering av träningsstrategier, justering av indata, förbättring av bildkodare och mycket mer. Dessa tillvägagångssätt har hjälpt till att ge LVLM kraftfulla visuella förståelseförmågor genom att utöka det visuella instruktionsanpassningsdataset och modellskalor. Dessutom besitter vissa LVLM fina, detaljerade bildförståelseförmågor, såsom regions- och multi-regionsförståelse, samt pixelvis grundningsförmåga. Men de beräkningskostnader som följer med att skala upp täta visuella data och modeller är ofta mycket höga, vilket gör det utmanande att hantera. Å andra sidan syftar MoE-LLaVA-ramverket till att göra LVLM-forskning mer ekonomiskt genom att utnyttja MoE-modellernas förmågor.
MoE-LLaVA: Metod och arkitektur
I kärnan består MoE-LLaVA-ramverket av ett visuellt projiceringsskikt (Multilayer Perceptron), en visionkodare, MoE-block, flera staplade LLM-block och ett ordinbäddningslager.

Arkitektur
Följande tabell sammanfattar de detaljerade konfigurationerna för MoE-LLaVA-ramverket.

För en given RGB-bild bearbetar visionkodaren bilden för att erhålla en sekvens av visuella token med ett visuellt projiceringsskikt som kartar den visuella tokensekvensen till inmatningsbilder. Textinmatningarna bearbetas av ordinbäddningslagret som projicerar dem för att erhålla tokensekvensen. Samtidigt länkar MoE-LLaVA-ramverket text- och visuella token ihop och matar dem till LLM. Men ramverket tränar endast det visuella projiceringsskiktet med den stora språkmodellen, som består av FFN eller Feedforward Neural Networks och Multi-Head Self Attention Layers. Slutligen tillämpar ramverket residualanslutningar och lagernormalisering till varje block.
Vidare replikerar MoE-LLaVA-ramverket FFN eller Feedforward Neural Networks från den andra fasen för att bilda en ensemble av experter som initieringssteg. Routern, som är en linjär skikt, förutsäger sannolikheten för varje token att tilldelas varje expert. Varje token bearbetas av de översta k-experterna med den maximala sannolikheten och beräknar den viktade summan baserat på softmax-resultatet av sannolikheterna. När de översta k-experterna aktiveras stänger modellen de återstående experterna, ett tillvägagångssätt som utrustar MoE-LLaVA-ramverket med oändligt många sparse vägar, vilket ger modellen en mängd olika förmågor.
MoE-Tuning
MoE-Tuning är en enkel men effektiv tre-fas träningsstrategi som först tränar en MLP eller en Multilayer Perceptron som anpassar de visuella token till en stor språkmodell i den första fasen. Ramverket tränar sedan alla parametrar i LLM för att förbereda den stora visionsspråkmodellen med allmän multi-modal förståelseförmåga. Slutligen, i den tredje fasen, replikerar ramverket FFN eller Feed Forward Network som initieringsvikter för experterna och tränar endast Mixture of Expert-lagren.
Fas 1
I den första fasen är det primära målet att anpassa bildtoken till den stora språkmodellen, vilket möjliggör för LLM att förstå instanser i bilden. MoE-LLaVA-ramverket använder en Multilayer Perceptron för att projicera bildtoken till inmatningsdomänen för den stora språkmodellen och behandlar bildpatchar som pseudo-texttoken. I denna fas tränar MoE-LLaVA-ramverket LLM för att beskriva bilderna och tillämpar inte MoE-lagren på LLM under denna fas.
Fas 2
I den andra fasen försöker MoE-LLaVA-ramverket att förbättra ramverkets förmågor och kontroll genom att justera modellen med multi-modal instruktionsdata. MoE-LLaVA-ramverket uppnår detta genom att anpassa LLM för att bli en LVLM med multi-modal förståelseförmåga. Ramverket använder mer komplexa instruktioner, inklusive textigenkänning och logisk bildresonemangsuppgifter, som kräver att modellen besitter starkare multi-modala förmågor. Traditionellt anses träningsprocessen för täta modeller vara komplett vid detta steg. Men MoE-LLaVA-ramverket mötte utmaningar vid omvandling av LLM till LVLM samtidigt som sparsifiering av LVLM. För att motverka denna utmaning använder ramverket vikterna från fasen som initiering för nästa fas i ett försök att lindra den lärda svårigheten för den sparse modellen.
Fas 3
I den tredje fasen replikerar modellen Feed Forward Network flera gånger för att initiera experterna som ett initieringsförfarande. Ramverket matar sedan text- och bildtoken in i Mixture of Expert-lagren, varefter routern beräknar matchningsvikterna mellan experter och varje token. Varje token bearbetas av de översta k-experterna med den aggregerade utmatningen beräknad genom viktad summation baserad på routerns vikter. När de översta k-experterna aktiveras stänger modellen de återstående experterna, ett tillvägagångssätt som utrustar MoE-LLaVA-ramverket med oändligt många sparse vägar, vilket ger modellen en mängd olika förmågor.
MoE-LLaVA: Resultat och experiment
MoE-LLaVA-ramverket antar CLIP-Large som visionkodaren med Multilayer Perceptron bestående av två lager med en GELU-aktiveringslager som skiljer dem åt. Som standard använder ramverket en alternativ ersättning av Feed Forward Network med Mixture of Expert-lagren, vilket innebär att Mixture of Expert-lagren utgör 50% av det totala antalet lager. Följande tabell innehåller olika dataset tillsammans med deras exempelstorlek som används för att träna och utvärdera MoE-LLaVA-ramverket.

Nollskottsbildfrågesvar
Följande figur visar att MoE-LLaVA är en sparse modell med en mjuk router baserad på LVLM. Ramverket utvärderas på 5 bildfrågesvarsbenchmark och som det kan observeras, visar MoE-LLaVA-ramverket remarkabla bildförståelseförmågor och levererar jämförbar prestanda med den senaste LLaVA 1.5-ramverket på fem olika benchmark.

Objekthallucinationsevaluation
För att utvärdera objekthallucination antar MoE-LLaVA-ramverket POPE-utvärderingspipelinen, en omröstningsbaserad frågemetod, och resultaten visas i följande tabell. Som det kan observeras, av alla ramverk, levererar MoE-LLaVA de starkaste resultaten, vilket indikerar ramverkets förmåga att generera objekt som är konsekventa med inmatningsbilden. Dessutom är det värt att notera att MoE-LLaVA-ramverket balanserar ja-förhållandet väl, vilket indikerar den sparse modellens förmåga att ge korrekt återkoppling för den givna frågan.

Följande bild innehåller distributionen av expertlastningar, där de oavbrutna linjerna representerar en välbalanserad distribution av token bland modaliteterna eller experterna. Den första figuren visar arbetsbelastningen inom experterna, medan de återstående bilderna visar prestandan hos experterna för olika modaliteter.

Dessutom visar följande figur distributionen av modaliteter över olika experter.

Slutliga tankar
I denna artikel har vi diskuterat MoE-LLaVA, en baseline för stora visionsspråkmodeller med Mixture of Expert-modeller som inkorporerar lärbare routrar och MoE-modeller. I kärnan består MoE-LLaVA-modellen av flera sparse vägar, och ramverket använder dessa vägar för att dirigera varje token till olika experter via den lärbare routern. Token bearbetas sedan kollektivt av de aktiverade experterna medan de inaktiva vägarna hålls tysta. Ramverket staplar sedan Mixture of Expert-kodarlager iterativt för att tillhandahålla en sparse väg mot en större och mer kraftfull LVLM. MoE-Tuning-strategin adresserar det vanliga problemet med prestandaförsämring i multi-modal sparsitetsträning innovativt, vilket konsekvent konstruerar en modell med ett signifikant stort antal parametrar men konsekventa tränings- och inferenskostnader. MoE-LLaVA-ramverkets arkitektur har utformats för att endast aktivera de översta k-experterna under distribution, medan de återstående experterna förblir inaktiva.












