AI-modeller og platforme
MoE-LLaVA: En blanding af eksperter til store vision-sprogmodeller
De seneste fremskridt inden for store vision-sprogmodeller (LVLM’er) har vist, at en betydelig skalering af disse rammer betydeligt forbedrer performances på en række nedstrømsopgaver. LVLM’er, herunder MiniGPT, LLaMA og andre, har opnået bemærkelsesværdige evner ved at inkorporere visuelle projektionslag og et billedencoder i deres arkitektur. Ved at implementere disse komponenter forbedrer LVLM’er de visuelle perceptionsevner for store sprogmodeller (LLM’er). Performancen kan yderligere forbedres ved at øge modellens størrelse og antal parametre samt udvide datasætskalaen.
Modeller som InternVL har udvidet deres billedencoder til over 6 milliarder parametre, mens andre har udvidet backend’en af LVLM’er til 13 milliarder parametre og opnået overlegen performance på en lang række opgaver. IDEFICS har trænet en LVLM med over 80 milliarder parametre. Disse skaleringsmetoder har matchet eller overgået performancen af LLM’er, der er fortrænet på over 34, 70 eller selv 100 milliarder parametre. Imidlertid har skaleringsmetoderne en ulempe: de øger betydeligt trænings- og inferensomkostninger. Dette skyldes, at det kræver, at alle parametre er aktive for hvert token i beregningen, hvilket fører til høje beregningsbehov og dermed højere omkostninger.
Dette artikel diskuterer MoE-LLaVA, en MoE-baseret sparse LVLM-arkitektur, der anvender en effektiv træningsstrategi, MoE-Tuning, til LVLM’er. MoE-Tuning adresserer innovativt performancesvigt i multi-modal sparsitetlæring, hvilket resulterer i en model med et stort antal parametre, men konsekvente trænings- og inferensomkostninger. MoE-LLaVA-arkitekturen er designet til kun at aktivere de top-k eksperter under deployment, mens de resterende eksperter forbliver inaktive.
Vi vil undersøge MoE-LLaVA-rammen, hvor vi ser på dens mekanisme, metode, arkitektur og hvordan den sammenlignes med førende billed- og videogenereringsrammer.
MoE-LLaVA: Skalering af store vision-sprogmodeller på en billig måde
Ud over at udnytte visuelle projektionslag og billedencodere, skalrer store vision-sprogmodeller også op modellens størrelse ved at øge antallet af parametre for at forbedre modellens performance. Nogle bemærkelsesværdige eksempler på store vision-sprogmodeller, der har fulgt denne tilgang for at forbedre deres performance, er MiniGPT-4, InternGPT, InternVL og andre. I virkelige anvendelser bliver det ofte nødvendigt at skalere en stor sprogmodel eller en stor vision-sprogmodel med højkvalitets træningsdata for at forbedre modellens performance. Selvom en modellens størrelse forbedrer performancen, øger det også beregningsomkostningerne ved træning og deployment af modellen og øger kompleksiteten og effektiviteten ved at deployere modellen på parallelle enheder samtidigt. En af hovedårsagerne til de øgede trænings- og inferensomkostninger samt beregningskrav er, at hver token i rammen kræver beregning med hver enkelt parameter i modellen, kendt som den tætte model.
På den anden side har sparse MoE eller Mixture of Expert-modeller demonstreret en effektiv skalering af rammer ved at behandle data med hjælp af faste aktiverede parametre, en tilgang, der er blevet bredt accepteret i det naturlige sprogbehandlingsfelt. Imidlertid er det udfordrende at bruge Mixture of Expert til at træne sparse store vision-sprogmodeller direkte, da konvertering af LLM’er til LVLM’er og sparsificering af modellen samtidigt resulterer i betydelig performancesvigt. For at implementere Mixture of Models til at skalere LLM’er og LVLM’er er det essentiel at først initialisere LVLM’en til sparsificering. For at opnå dette introducerer MoE-LLaVA-rammen MoE-Tuning, en simpel, men effektiv, tre-faset træningsstrategi.

Som vist i figuren ovenfor, træner MoE-Tuning-processen først en MLP eller en Multilayer Perceptron, der tilpasser de visuelle tokens til en stor sprogmodel i den første fase. Rammen træner derefter alle parametrene af LLM’en for at give den store vision-sprogmodel en generel multi-modal forståelsesevne. Til sidst, i den tredje fase, replicerer rammen FFN eller Feed Forward Network som initialiseringsvægte for eksperterne og træner kun Mixture of Expert-lagene. I alt hjælper træningsprocessen med at gradvist overføre den sparse model fra en LVLM-initialisering til en sparse Mixture of Expert-model.
Med træningsprocessen dækket, lad os kaste lidt lys over MoE-LLaVA, en baseline for store vision-sprogmodeller med Mixture of Expert-modeller, der inkorporerer lærbare routere og MoE-modeller. I dens kerne består MoE-LLaVA-modellen af multiple sparse stier, og rammen bruger disse stier til at sende hver token til forskellige eksperter gennem den lærbare router. Tokenene behandles derefter kollektivt af de aktiverede eksperter, mens de inaktive stier forbliver stille. Rammen stablet derefter Mixture of Expert-encoder-lagene iterativt for at give en sparse sti mod en større og mere kraftfuld LVLM.

Takket være tilgangen, der er implementeret af MoE-LLaVA-rammen, er den i stand til at overgå modeller med et lignende antal aktiverede parametre og overgå dem med en stor forskel på POPE-objekt-hallucinations-benchmarken, på trods af kun at have 2,2 milliarder parametre. Desuden er MoE-LLaVA-rammen med 2,2 milliarder parametre i stand til at opnå en performance, der er sammenlignelig med InternVL-Chat-19B-rammen med næsten 8 gange så mange aktiverede parametre.
Kraftfulde store sprogmodeller med stærke generaliserings- og instruktionsfølgeevner er blevet implementeret til store vision-sprogmodeller. Tidlige LLM’er som BLIP encodede visuelle signaler i en sekvens af visuelle tokens, der tillod dem at tilpasse vision til LLM’er med succes ved hjælp af multiple projektionslag. Samtidig fokuserer nyere arbejder på at forbedre modellens performance ved at implementere metoder som udvidelse af instruktions-tunings-datasættet, øgning af billedets opløsning, optimering af træningsstrategier, justering af input, forbedring af billedencodere og meget mere. Disse tilgange har hjulpet med at give LVLM’er kraftfulde visuelle forståelsesevner ved at udvide det visuelle instruktions-finetunings-datasæt og modellens skala. Desuden besidder nogle LVLM’er også fine-grænede billedforståelsesevner, såsom regions- og multi-regions-forståelse samt pixel-vis grundlæggelse. Imidlertid er de beregningsomkostninger, der følger med at skalere op tætte visuelle data og modeller, ofte meget høje, hvilket gør det udfordrende at bære. På den anden side sigter MoE-LLaVA-rammen mod at gøre LVLM-forskning mere billig ved at udnytte MoE-modellernes evner.
MoE-LLaVA: Metode og arkitektur
I dens kerne består MoE-LLaVA-rammen af et visuelt projektionslag (Multilayer Perceptron), en vision-encoder, MoE-blokke, multiple stablede LLM-blokke og et ord-embedding-lag.

Arkitektur
Følgende tabel summerer de detaljerede konfigurationer af MoE-LLaVA-rammen.

For et givent RGB-billede behandler vision-encoderen billedet for at få en sekvens af visuelle tokens med et visuelt projektionslag, der mapper den visuelle token-sekvens til input-billeder. Tekst-input behandles af ord-embedding-laget, der projicerer det til at få token-sekvensen. Samtidig kobler MoE-LLaVA-rammen tekst- og visuelle tokens sammen og føder dem til LLM’en. Imidlertid træner rammen kun det visuelle projektionslag med den store sprogmodel, der består af FFN eller Feedforward Neural Networks og Multi-Head Self Attention Layers. Til sidst anvender rammen residual-forbindelser og lag-normalisering til hvert blok.
Herefter replicerer MoE-LLaVA-rammen FFN eller Feedforward Neural Networks fra den anden fase for at danne en ensemble af eksperter som initialiserings-trin. Ruterne, der er lineære lag, forudsiger sandsynligheden for, at hver token bliver tildelt hver ekspert. Hver token behandles af de top-k eksperter med den maksimale sandsynlighed og beregner den vægtede sum baseret på softmax-resultatet af sandsynlighederne.
MoE-Tuning
MoE-Tuning er en simpel, men effektiv, tre-faset træningsstrategi, der først træner en MLP eller en Multilayer Perceptron, der tilpasser de visuelle tokens til en stor sprogmodel i den første fase. Rammen træner derefter alle parametrene af LLM’en for at give den store vision-sprogmodel en generel multi-modal forståelsesevne. Til sidst, i den tredje fase, replicerer rammen FFN eller Feed Forward Network som initialiseringsvægte for eksperterne og træner kun Mixture of Expert-lagene.
Fase 1
I den første fase er det primære mål at tilpasse billed-tokenene til den store sprogmodel, hvilket giver LLM’en mulighed for at forstå instanser i billedet. MoE-LLaVA-rammen anvender en Multilayer Perceptron til at projicere billed-tokenene ind i input-domænet for den store sprogmodel og behandler billed-patches som pseudo-tekst-token.
Fase 2
I den anden fase forsøger MoE-LLaVA at forbedre rammens evner og kontrollabilitet ved at justere modellen med multi-modal instruktionsdata. MoE-LLaVA-rammen opnår dette ved at tilpasse LLM’en til at blive en LVLM med multi-modal forståelsesevner. Rammen anvender mere komplekse instruktioner, herunder tekst-genkendelse og logisk billed-forståelse, der kræver, at modellen har stærkere multi-modal evner.
Fase 3
I den tredje fase replicerer modellen Feed Forward Network flere gange for at initialisere eksperterne som et initialiserings-trin. Rammen føder derefter tekst- og billed-tokenene ind i Mixture of Expert-lagene, og ruterne beregner matchende vægte mellem eksperter og hver token. Hver token behandles af de top-k eksperter med den aggregerte output beregnet ved vægtsum baseret på ruterens vægte.
MoE-LLaVA: Resultater og eksperimenter
MoE-LLaVA-rammen anvender CLIP-Large som vision-encoder med en Multilayer Perceptron bestående af to lag med en GELU-aktiveringslag, der adskiller de to. Som standard anvender rammen en alternativ erstatning af Feed Forward Network med Mixture of Expert-lagene, hvilket betyder, at Mixture of Expert-lagene udgør 50% af det totale antal lag.

Zero-Shot billed-spørgsmål besvarelse
Følgende figur demonstrerer, at MoE-LLaVA er en sparse model med en blød router baseret på LVLM. Rammen er evaluueret på 5 billed-spørgsmål-benchmark, og som det kan ses, demonstrerer MoE-LLaVA-rammen bemærkelsesværdige billed-forståelsesevner og leverer en performance, der er sammenlignelig med LLaVA 1.5-rammen på fem forskellige benchmark.

Objekt-hallucinations-evaluering
For at evaluere objekt-hallucination anvender MoE-LLaVA-rammen POPE-evalueringen, en afstemnings-baseret spørgsmåls-metode, og resultaterne vises i følgende tabel. Som det kan ses, leverer MoE-LLaVA-rammen de stærkeste resultater af alle rammerne, hvilket indikerer rammens evne til at generere objekter, der er konsistente med input-billedet.

Følgende billed viser fordelingen af ekspert-last, hvor de uafbrudte linjer repræsenterer en vel-balanceret fordeling af tokens mellem modaliteterne eller eksperterne.

Desuden viser følgende figur fordelingen af modaliteter på tværs af forskellige eksperter.

Afsluttende tanker
I denne artikel har vi talt om MoE-LLaVA, en baseline for store vision-sprogmodeller med Mixture of Expert-modeller, der inkorporerer lærbare routere og MoE-modeller. I dens kerne består MoE-LLaVA-modellen af multiple sparse stier, og rammen bruger disse stier til at sende hver token til forskellige eksperter gennem den lærbare router. Tokenene behandles derefter kollektivt af de aktiverede eksperter, mens de inaktive stier forbliver stille. Rammen stablet derefter Mixture of Expert-encoder-lagene iterativt for at give en sparse sti mod en større og mere kraftfuld LVLM. MoE-Tuning-strategien adresserer innovativt performancesvigt i multi-modal sparsitetlæring, hvilket konsekvent konstruerer en model med et betydeligt stort antal parametre, men konsekvente trænings- og inferensomkostninger. MoE-LLaVA-rammens arkitektur er designet til kun at aktivere de top-k eksperter under deployment, mens de resterende eksperter forbliver inaktive.












