AI-modellen en platforms
MoE-LLaVA: Een Mixture of Experts voor Grote Visuele Taalmodellen
Recente vooruitgang in Grote Visuele Taalmodellen (LVLM’s) heeft aangetoond dat het schalen van deze kaders aanzienlijk de prestaties verbetert over een breed scala aan downstream-taken. LVLM’s, waaronder MiniGPT, LLaMA en anderen, hebben opmerkelijke capaciteiten bereikt door visuele projectielaag en een beeldencoder in hun architectuur op te nemen. Door deze componenten te implementeren, verbeteren LVLM’s de visuele perceptiecapaciteiten van Grote Taalmodellen (LLM’s). De prestaties kunnen verder worden verbeterd door de grootte van het model en het aantal parameters te vergroten, evenals door de schaal van de dataset uit te breiden.
Modellen zoals InternVL hebben hun beeldencoder uitgebreid tot meer dan 6 miljard parameters, terwijl anderen de backend van LVLM’s hebben uitgebreid tot 13 miljard parameters, waardoor ze superieure prestaties behalen op een breed scala aan taken. IDEFICS heeft een LVLM getraind met meer dan 80 miljard parameters. Deze schaalmethoden hebben de prestaties van LLM’s gematched of overschreden die zijn getraind op meer dan 34, 70 of zelfs 100 miljard parameters. Echter, schalen heeft een nadeel: het verhoogt de trainings- en inferentiekosten aanzienlijk. Dit komt doordat het alle parameters activeert voor elke token in berekening, waardoor hoge computationele behoeften en, gevolglijk, hogere kosten ontstaan.
Dit artikel bespreekt MoE-LLaVA, een Mixture of Experts (MoE)-gebaseerde sparse LVLM-architectuur die een effectieve trainingsstrategie, MoE-Tuning, voor LVLM’s gebruikt. MoE-Tuning adresseert innovatief de prestatieverslechtering in multi-modale sparsity learning, waardoor een model met een groot aantal parameters maar consistente trainings- en inferentiekosten ontstaat. De MoE-LLaVA-architectuur is ontworpen om alleen de top-k-experts te activeren tijdens de implementatie, terwijl de resterende experts inactief blijven.
We zullen de MoE-LLaVA-kader onderzoeken, waarbij we zijn mechanisme, methodologie, architectuur en hoe het zich verhoudt tot leidende beeld- en videogeneratiekaders bekijken.
MoE-LLaVA: Het schalen van Grote Visuele Taalmodellen tegen een betaalbare prijs
Naast het gebruik van visuele projectielaag en beeldencoders, schalen Grote Visuele Taalmodellen ook de modelgrootte door het aantal parameters te verhogen om de prestaties van het model te verbeteren. Enkele opvallende voorbeelden van Grote Visuele Taalmodellen die deze aanpak hebben gevolgd om hun prestaties te verbeteren, zijn MiniGPT-4, InternGPT, InternVL en anderen. In real-world-toepassingen wordt het schalen van een Groot Taalmodel of een Groot Visueel Taalmodel met hoge kwaliteit trainingsdata vaak een noodzaak om de prestaties van het model te verbeteren. Hoewel het schalen van de modelgrootte de prestaties verbetert, verhoogt het ook de computationele kosten van trainen en implementeren van het model, en verhoogt het verder de complicaties en efficiëntie van het implementeren van het model op parallelle apparaten tegelijkertijd. Een belangrijke reden achter de verhoogde trainings- en inferentiekosten, evenals de computationele vereisten, is dat elke token in het kader berekening vereist met elk enkel parameter binnen het model, bekend als het dichte model.
Aan de andere kant hebben sparse MoE- of Mixture of Expert-modellen effectief het schalen van kaders aangetoond door gegevens te verwerken met behulp van vaste geactiveerde parameters, een aanpak die breed is geadopteerd in het veld van Natuurlijke Taalverwerking. Echter, het direct trainen van een sparse Groot Visueel Taalmodel met Mixture of Experts is uitdagend, aangezien het omzetten van LLM’s naar LVLM’s en het sparsifiëren van het model tegelijkertijd resulteert in aanzienlijke prestatieverslechtering. Om Mixture of Models te implementeren om LLM’s en LVLM’s te schalen, is het essentieel om eerst het LVLM te initialiseren voor sparsificatie. Om dit te bereiken, introduceert de MoE-LLaVA-kader MoE-Tuning, een eenvoudige maar effectieve driefasentrainingsstrategie.

Zoals getoond in de bovenstaande figuur, begint het MoE-Tuning-proces met het trainen van een Multilayer Perceptron die de visuele tokens aanpast aan een Groot Taalmodel in de eerste fase. De kader traint vervolgens alle parameters van de LLM om het Groot Visueel Taalmodel te voorzien van algemene multi-modale begripsvermogens. Ten slotte, in de derde fase, repliceren de kader de Feed Forward Network als de initialisatiegewichten voor de experts en traint alleen de Mixture of Expert-lagen. Over het algemeen helpt het trainingsproces bij de geleidelijke overgang van het sparse model van een LVLM-initialisatie naar een sparse Mixture of Expert-model.
Met het trainingsproces behandeld, laten we enkele licht werpen op MoE-LLaVA, een baseline voor Grote Visuele Taalmodellen met Mixture of Expert-modellen die learnable routers en MoE-modellen incorporeren. In zijn kern bestaat het MoE-LLaVA-model uit meerdere sparse paden, en de kader gebruikt deze paden om elke token naar verschillende experts te dispatchen via de learnable router. De tokens worden vervolgens collectief verwerkt door de geactiveerde experts, terwijl de inactieve paden stil worden gehouden. De kader stapelt de Mixture of Expert-encoderlagen iteratief om een sparse pad naar een groter en krachtiger LVLM te bieden.

Dankzij de aanpak geïmplementeerd door de MoE-LLaVA-kader, kan het modellen met een vergelijkbaar aantal geactiveerde parameters overtreffen en hen met een grote marge overtreffen op de POPE-objecthallucatiebenchmark, ondanks dat het slechts 2,2 miljard parameters heeft. Bovendien kan de MoE-LLaVA-kader met 2,2 miljard parameters prestaties bereiken die vergelijkbaar zijn met de InternVL-Chat-19B-kader met bijna 8 keer het aantal geactiveerde parameters.
Krachtige Grote Taalmodellen met sterke generalisatie- en instructievolgcapaciteiten zijn geïmplementeerd in Grote Visuele Taalmodellen. Vroege LLM’s zoals BLIP codeerden visuele signalen in een reeks van visuele tokens, waardoor ze visie aan LLM’s konden aanpassen met behulp van meerdere projectielaag. Tegelijkertijd richten recente werken zich op het verbeteren van de modelprestaties door methoden te implementeren zoals het uitbreiden van de instructie-tuningsdataset, het verhogen van de resolutie van het beeld, het optimaliseren van trainingsstrategieën, het aligneren van de invoer, het verbeteren van de beeldencoders en veel meer. Deze aanpakken hebben geholpen om Grote Visuele Taalmodellen te empoweren met krachtige visuele begripsvermogens door de visuele instructiefine-tuningsdataset en modelgroottes uit te breiden. Bovendien beschikken sommige LVLM’s ook over fijne beeldbegripscapaciteiten, zoals regio- en multi-regiobegrip, evenals pixel-wise groundingcapaciteiten. Echter, de computationele kosten die gepaard gaan met het schalen van dichte visuele gegevens en modellen zijn vaak aanzienlijk hoog, waardoor het een uitdaging is om ze te dragen. Aan de andere kant streeft de MoE-LLaVA-kader ernaar om Grote Visuele Taalmodelonderzoek betaalbaarder te maken door de capaciteiten van MoE-modellen te benutten.
MoE-LLaVA: Methode en Architectuur
In zijn kern bestaat de MoE-LLaVA-kader uit een visuele projectielaag (Multilayer Perceptron), een visie-encoder, MoE-blokken, meerdere gestapelde LLM-blokken en een woord-embeddingslaag.

Architectuur
De volgende tabel vat de gedetailleerde configuraties van de MoE-LLaVA-kader samen.

Voor een gegeven RGB-beeld, verwerkt de visie-encoder de beelden om een reeks van visuele tokens te verkrijgen, met een visuele projectielaag die de visuele tokenreeks naar invoerbeelden kaart. De tekstinput wordt verwerkt door de woord-embeddingslaag, die vervolgens projecteert om de tokenreeks te verkrijgen. Tegelijkertijd koppelt de MoE-LLaVA-kader de tekst- en visuele tokens samen en voedt ze de LLM. Echter, de kader traint alleen de visuele projectielaag met het grote taalmodel, bestaande uit FFN of Feedforward Neural Networks en Multi-Head Self Attention Layers. Ten slotte past de kader residu-verbindingen en laag-normalisatie toe op elk blok.
Verder repliceren de MoE-LLaVA-kader de FFN of Feedforward Neural Networks uit de tweede fase om een ensemble van experts te vormen als initialisatiestap. De router, die een lineaire laag is, voorspelt de waarschijnlijkheid van elke token die aan elke expert wordt toegewezen. Elke token wordt verwerkt door de top-k-experts met de maximale waarschijnlijkheid en berekent de gewogen som op basis van de softmax-resultaat van de waarschijnlijkheden.
MoE-Tuning
MoE-Tuning is een eenvoudige maar effectieve driefasentrainingsstrategie die eerst een Multilayer Perceptron traint die de visuele tokens aanpast aan een Groot Taalmodel in de eerste fase. De kader traint vervolgens alle parameters van de LLM om het Groot Visueel Taalmodel te voorzien van algemene multi-modale begripsvermogens. Ten slotte, in de derde fase, repliceren de kader de FFN of Feed Forward Network als de initialisatiegewichten voor de experts en traint alleen de Mixture of Expert-lagen.
Fase 1
In de eerste fase is het primaire doel om de beeldtokens aan te passen aan het grote taalmodel, waardoor de LLM de instanties in het beeld kan begrijpen. De MoE-LLaVA-kader gebruikt een Multilayer Perceptron om de beeldtokens te projecteren naar het invoerdomein van het grote taalmodel en behandelt beeldpatches als pseudo-teksttokens. In deze fase traint de MoE-LLaVA-kader de LLM om de beelden te beschrijven en past de MoE-lagen niet toe op de LLM tijdens deze fase.
Fase 2
In de tweede fase probeert de MoE-LLaVA-kader de capaciteiten en controle van de kader te verbeteren door het model af te stemmen op multi-modale instructiedata. De MoE-LLaVA-kader bereikt dit door de LLM aan te passen om een LVLM met multi-modale begripsvermogens te worden. De kader gebruikt meer complexe instructies, waaronder tekstherkenning en logische beeldredenataken die vereisen dat het model sterke multi-modale capaciteiten heeft. Traditioneel wordt de trainingsprocedure voor dichte modellen als voltooid beschouwd na deze stap. Echter, de MoE-LLaVA-kader ondervond uitdagingen bij het omzetten van de LLM naar een LVLM en het sparsifiëren van de LVLM tegelijkertijd. Om deze uitdaging te counteren, gebruikt de kader de gewichten uit de fase als initialisatie voor de volgende fase in een poging om de leeruitdaging van het sparse model te verlichten.
Fase 3
In de derde fase repliceren de kader de Feed Forward Network meerdere keren om de experts te initialiseren als initialisatiestap. De kader voedt vervolgens de tekst- en beeldtokens in de Mixture of Expert-lagen, waarna de router de overeenkomende gewichten tussen experts en elk token berekent. Elke token wordt vervolgens verwerkt door de top-k-experts met de geaggregeerde output berekend door gewogen sommatie op basis van de gewichten van de router. Zodra de top-k-experts zijn geactiveerd, sluit de kader de resterende experts, een aanpak die de MoE-LLaVA-kader uitrust met oneindig veel mogelijke sparse paden, waardoor het model een breed scala aan capaciteiten heeft.
MoE-LLaVA: Resultaten en Experimenten
De MoE-LLaVA-kader gebruikt CLIP-Large als de visie-encoder met de Multilayer Perceptron bestaande uit twee lagen met een GELU-activatielaag ertussen. Standaard gebruikt de kader een afwisselende vervanging van de Feed Forward Networks met de Mixture of Expert-lagen, wat betekent dat de Mixture of Expert-lagen 50% van het totale aantal lagen vormen. De volgende tabel bevat de verschillende datasets met hun steekproefgrootte die worden gebruikt om de MoE-LLaVA-kader te trainen en te evalueren.

Zero-Shot Beeldvragen
De volgende figuur toont aan dat MoE-LLaVA een sparse model is met een zachte router op basis van LVLM. De kader wordt geëvalueerd op 5 beeldvragenbenchmarks en, zoals te zien is, toont de MoE-LLaVA-kader opmerkelijke beeldbegripscapaciteiten en levert vergelijkbare prestaties als de state-of-the-art LLaVA 1.5-kader op vijf verschillende benchmarks.

Objecthallucatie-evaluatie
Om objecthallucatie te evalueren, gebruikt de MoE-LLaVA-kader de POPE-evaluatiepijplijn, een polling-gebaseerde querymethode, en de resultaten worden getoond in de volgende tabel. Zoals te zien is, levert de MoE-LLaVA-kader de sterkste resultaten van alle kaders, wat aangeeft dat de kader in staat is om objecten te genereren die consistent zijn met het invoerbeeld. Bovendien is het de moeite waard om op te merken dat de MoE-LLaVA-kader de yes-ratio goed in evenwicht houdt, wat aangeeft dat het sparse model in staat is om accurate feedback te geven voor de gegeven vraag.

De volgende afbeelding bevat de distributie van expertbelastingen, waarbij de onderbroken lijnen een goed gebalanceerde distributie van tokens onder de modaliteiten of experts vertegenwoordigen. De eerste figuur toont de workload binnen de experts, terwijl de resterende afbeeldingen de prestaties van experts naar verschillende modaliteiten demonstreren.

Verder toont de volgende figuur de distributie van modaliteiten over verschillende experts.

Slotgedachten
In dit artikel hebben we het over MoE-LLaVA gehad, een baseline voor Grote Visuele Taalmodellen met Mixture of Expert-modellen die learnable routers en MoE-modellen incorporeren. In zijn kern bestaat het MoE-LLaVA-model uit meerdere sparse paden, en de kader gebruikt deze paden om elke token naar verschillende experts te dispatchen via de learnable router. De tokens worden vervolgens collectief verwerkt door de geactiveerde experts, terwijl de inactieve paden stil worden gehouden. De kader stapelt de Mixture of Expert-encoderlagen iteratief om een sparse pad naar een groter en krachtiger LVLM te bieden. De MoE-Tuning-strategie adresseert het gemeenschappelijke probleem van prestatieverslechtering in multi-modale sparsity learning innovatief, waardoor een model met een aanzienlijk groot aantal parameters maar consistente trainings- en inferentiekosten ontstaat. De architectuur van de MoE-LLaVA-kader is ontworpen om alleen de top-k-experts te activeren tijdens de implementatie, terwijl de resterende experts inactief blijven.












