Modely a platformy AI
MoE-LLaVA: Směs odborníků pro velké modely vizuálního jazyka
Poslední pokroky ve velkých modelech vizuálního jazyka (LVLM) ukázaly, že škálování těchto rámců významně zvyšuje výkon napříč různými úkoly. LVLM, včetně MiniGPT, LLaMA a dalších, dosáhly pozoruhodných schopností díky začlenění vizuálních projekčních vrstev a obrazového kódéru do své architektury. Implementací těchto komponent zvyšují LVLM vizuální vnímací schopnosti velkých jazykových modelů (LLM). Výkon lze dále zlepšit zvýšením velikosti modelu a počtu parametrů, stejně jako rozšířením rozsahu dat.
Modely jako InternVL rozšířily svůj obrazový kódér na více než 6 miliard parametrů, zatímco jiné rozšířily backend LVLM na 13 miliard parametrů, dosahující lepšího výkonu v širokém spektru úkolů. IDEFICS trénoval LVLM s více než 80 miliardami parametrů. Tyto metody škálování odpovídají nebo překračují výkon LLM, které byly předtrénovány na více než 34, 70 nebo dokonce 100 miliardách parametrů. Nicméně, škálování má nevýhodu: významně zvyšuje náklady na trénování a inference. To je způsobeno tím, že vyžaduje aktivaci všech parametrů pro každý token v výpočtu, což vede k vysokým výpočetním potřebám a následně k vyšším nákladům.
Tento článek diskutuje o MoE-LLaVA, architektuře založené na směsi odborníků (MoE) pro LVLM, která využívá efektivní trénovací strategii, MoE-Tuning, pro LVLM. MoE-Tuning inovativně řeší degradaci výkonu při multi-modální sparse učení, vedoucí k modelu s velkým počtem parametrů, ale konzistentními náklady na trénování a inference. Architektura MoE-LLaVA je navržena tak, aby během nasazení aktivovala pouze top-k odborníky, zatímco ostatní odborníci zůstávají neaktivní.
Budeme prozkoumávat rámec MoE-LLaVA, jeho mechanismus, metodologii, architekturu a to, jak se srovnává s vedoucími rámci generování obrazů a videa.
MoE-LLaVA: Škálování velkých modelů vizuálního jazyka dostupně
Kromě využití vizuálních projekčních vrstev a obrazových kódérů také LVLM škáluje velikost modelu zvyšováním počtu parametrů, aby vylepšila výkon modelu. Některé pozoruhodné příklady LVLM, které následovaly tento přístup, jsou MiniGPT-4, InternGPT, InternVL a další. Ve skutečných aplikacích se často stává nezbytným škálovat velký jazykový model nebo LVLM s vysokokvalitními trénovacími daty, aby se zlepšil výkon modelu. Ačkoli škálování modelu velikosti zlepšuje výkon, také zvyšuje výpočetní náklady na trénování a nasazení modelu a dále zvyšuje komplikace a efektivitu nasazení modelu na paralelních zařízeních současně. Hlavním důvodem zvýšených nákladů na trénování a inference, spolu s výpočetními požadavky, je to, že každý token v rámci vyžaduje výpočet se všemi parametry v modelu, známým jako hustý model.
Na druhé straně mají sparse MoE nebo modely založené na směsi odborníků prokázaly efektivní škálování rámců zpracováním dat s pomocí aktivovaných parametrů, přístup, který byl široce přijat v oblasti zpracování přirozeného jazyka. Nicméně, použití MoE pro přímé trénování sparse LVLM je náročné, protože konverze LLM na LVLM a sparseifikace modelu současně vede k významnému poklesu výkonu. Pro implementaci MoE pro škálování LLM a LVLM je nezbytné nejprve inicializovat LVLM pro sparseifikaci. K tomu MoE-LLaVA rámec zavedl MoE-Tuning, jednoduchou, ale efektivní tří-fázovou trénovací strategii.

Jak je znázorněno na výše uvedeném obrázku, proces MoE-Tuning nejprve trénuje MLP nebo multilayerový perceptron, který přizpůsobuje vizuální tokeny velkému jazykovému modelu v první fázi. Rámec poté trénuje všechny parametry LLM, aby vybavil velký vizuální jazykový model obecnými multi-modálními pochopeními. Nakonec, ve třetí fázi, rámec replikuje FFN nebo feedforwardovou neuronovou síť jako inicializační váhy pro odborníky a trénuje pouze vrstvy založené na směsi odborníků. Celý trénovací proces pomáhá při postupném přechodu sparse modelu z inicializace LVLM na sparse směs odborníků.
S trénovacím procesem pokrytým, pojďme osvětlit MoE-LLaVA, základní rámec pro LVLM se směsí odborníků, který zahrnuje učitelné routery a modely MoE. V jádru modelu MoE-LLaVA se skládá z více sparse cest a rámec používá tyto cesty k přeposlání každého tokenu na různé odborníky prostřednictvím učitelného routera. Tokeny jsou poté zpracovány společně aktivovanými odborníky, zatímco neaktivní cesty zůstávají tiché. Rámec poté skládá vrstvy kódéru založené na směsi odborníků iterativně, aby poskytl sparse cestu k většímu a silnějšímu LVLM.

Díky přístupu implementovanému rámcem MoE-LLaVA je schopen překonat modely se stejným počtem aktivovaných parametrů a překonat je o velkou část na POPE objektové halucinaci, a to navzdory tomu, že má pouze 2,2 miliardy parametrů. Kromě toho je rámec MoE-LLaVA se 2,2 miliardami parametrů schopen dosáhnout výkonu srovnatelného s rámcem InternVL-Chat-19B, který má téměř 8krát více aktivovaných parametrů.
Velké jazykové modely s silnými obecnými a instrukčními schopnostmi byly implementovány do LVLM. Rané LLM, jako je BLIP, zakódovávaly vizuální signály do sekvence vizuálních tokenů, aby umožnily adaptaci vizuálu na LLM pomocí více projekčních vrstev. Současně se recentní práce zaměřují na zlepšení modelového výkonu implementací metod, jako je rozšíření instrukční trénovací datové sady, zvýšení rozlišení obrazu, optimalizace trénovacích strategií, zarovnání vstupu, vylepšení obrazových kódérů a mnoho dalšího. Tyto přístupy pomohly vybavit LVLM silnými vizuálními pochopeními schopnostmi rozšiřováním vizuální instrukční jemné trénovací datové sady a modelových škál. Kromě toho některé LVLM také disponují jemnými obrazovými pochopeními schopnostmi, jako je regionální a multi-regionální pochopení, spolu s pixelovými zakotveními schopnostmi. Nicméně, výpočetní náklady spojené se škálováním hustých vizuálních dat a modelů jsou často značně vysoké, což z nich činí náročné na použití. Na druhé straně se rámec MoE-LLaVA snaží učinit LVLM výzkum dostupnějším využíváním schopností modelů MoE.
MoE-LLaVA: Metoda a architektura
V jádru se rámec MoE-LLaVA skládá z vizuální projekční vrstvy (multilayerový perceptron), obrazového kódéru, bloků MoE, více vrstev LLM a vrstvy word embedding.

Architektura
Následující tabulka shrnuje podrobné konfigurace rámce MoE-LLaVA.

Pro daný RGB obraz, obrazový kódér zpracovává obrazy, aby získal sekvenci vizuálních tokenů, a vizuální projekční vrstva mapuje vizuální tokeny na vstupní obrazy. Textové vstupy jsou zpracovány vrstvou word embedding, která poté projekty na vstupní tokeny. Současně rámec MoE-LLaVA spojuje textové a vizuální tokeny, a poté je zpracovává velkým jazykovým modelem (LLM). Nicméně, rámec trénuje pouze vizuální projekční vrstvu s velkým jazykovým modelem, skládajícím se z FFN nebo feedforwardových neuronových sítí a multi-head self-attention vrstev. Nakonec rámec aplikuje reziduální spoje a normalizaci vrstev na každém bloku.
Rámec MoE-LLaVA replikuje FFN nebo feedforwardové neuronové sítě z druhé fáze, aby vytvořil soubor odborníků jako inicializační krok. Router, jako lineární vrstva, předpovídá pravděpodobnost každého tokenu přiřazeného každému odborníkovi. Každý token je zpracován top-k odborníky s nejvyšší pravděpodobností, a vypočítává vážený součet na základě softmax výsledku pravděpodobností. Jakmile jsou top-k odborníci aktivováni, model deaktivuje zbývající odborníky, přístup, který vybavuje rámec MoE-LLaVA nekonečným množstvím sparse cest, a tím vybavuje model širokým spektrem schopností.
MoE-Tuning
MoE-Tuning je jednoduchá, ale efektivní tří-fázová trénovací strategie, která nejprve trénuje MLP nebo multilayerový perceptron, který přizpůsobuje vizuální tokeny velkému jazykovému modelu v první fázi. Rámec poté trénuje všechny parametry LLM, aby vybavil velký vizuální jazykový model obecnými multi-modálními pochopeními. Nakonec, ve třetí fázi, rámec replikuje FFN nebo feedforwardovou neuronovou síť jako inicializační váhy pro odborníky, a trénuje pouze vrstvy založené na směsi odborníků.
Stage 1
V první fázi je primárním cílem přizpůsobit obrazové tokeny velkému jazykovému modelu, aby umožnil LLM pochopit instance v obraze. Rámec MoE-LLaVA využívá multilayerový perceptron k projekci obrazových tokenů do vstupní domény velkého jazykového modelu a zachází s obrazovými fragmenty jako s pseudo-textovými tokeny. V této fázi rámec MoE-LLaVA trénuje LLM, aby popsal obrazy, a neaplikuje vrstvy MoE na LLM během této fáze.
Stage 2
V druhé fázi se rámec MoE-LLaVA snaží vylepšit schopnosti a ovladatelnost rámce laděním modelu s multi-modální instrukčními daty. Rámec MoE-LLaVA dosahuje tohoto cíle laděním LLM, aby se stal LVLM s multi-modálními pochopeními. Rámec využívá složitější instrukce, včetně textového rozpoznání a logického obrazového rozumu, které vyžadují, aby model disponoval silnějšími multi-modálními schopnostmi. Tradičně se považuje, že proces trénování pro husté modely je dokončen touto fází. Nicméně, rámec MoE-LLaVA narazil na výzvy při transformaci LLM na LVLM současně se sparseifikací LVLM. Pro řešení této výzvy rámec využívá váhy ze druhé fáze jako inicializaci pro následující fázi, aby zmírnil obtížnost učení sparse modelu.
Stage 3
V třetí fázi model replikuje feedforwardovou neuronovou síť několikrát, aby inicializoval odborníky jako inicializační proceduru. Rámec poté zpracovává textové a obrazové tokeny ve vrstvách založených na směsi odborníků, a router vypočítává odpovídající váhy mezi odborníky a každým tokenem. Každý token je poté zpracován top-k odborníky s váženým součtem na základě softmax výsledku pravděpodobností. Jakmile jsou top-k odborníci aktivováni, model deaktivuje zbývající odborníky, přístup, který vybavuje rámec MoE-LLaVA nekonečným množstvím sparse cest, a tím vybavuje model širokým spektrem schopností.
MoE-LLaVA: Výsledky a experimenty
Rámec MoE-LLaVA采用 CLIP-Large jako obrazový kódér s multilayerovým perceptronem, skládajícím se ze dvou vrstev s GELU aktivací mezi nimi. Ve výchozím nastavení rámec využívá střídavou náhradu feedforwardových neuronových sítí s vrstvami založených na směsi odborníků, což znamená, že vrstvy založené na směsi odborníků tvoří 50 % celkového počtu vrstev. Následující tabulka obsahuje různé datové sady spolu s jejich vzorkovou velikostí, které se používají pro trénování a hodnocení rámce MoE-LLaVA.

Nultá obrazová otázka a odpověď
Následující obrázek demonstruje, že MoE-LLaVA je sparse model s měkkým routerem založeným na LVLM. Rámec je hodnocen na 5 obrazových otázka-odpověď benchmarků, a jak je vidět, rámec MoE-LLaVA demonstruje pozoruhodné obrazové pochopení schopnosti, a dodává srovnatelný výkon se státem umělého LLaVA 1.5 rámce na pěti různých benchmarků.

Objektová halucinace hodnocení
Pro hodnocení objektové halucinace rámec MoE-LLaVA采用 POPE hodnocení pipeline, polling-based dotazovací metodu, a výsledky jsou demonstrovány v následující tabulce. Jak je vidět, z všech rámců, MoE-LLaVA dodává nejsilnější výsledky, indikující schopnost rámce generovat objekty konzistentní s vstupním obrazem. Kromě toho je také důležité poznamenat, že rámec MoE-LLaVA vyvažuje ano poměr dobře, indikující schopnost sparse modelu poskytovat přesnou zpětnou vazbu pro danou otázku.

Následující obrázek obsahuje distribuci expertních zátěží, kde přerušované linie reprezentují dobře vyváženou distribuci tokenů mezi modality nebo odborníky. První obrázek ilustruje zátěž uvnitř odborníků, zatímco zbývající obrázky demonstrují výkon odborníků vůči různým modalitám.

Dále, následující obrázek demonstruje distribuci modalit přes různé odborníky.

Závěrečné myšlenky
V tomto článku jsme diskutovali o MoE-LLaVA, základním rámci pro LVLM se směsí odborníků, který zahrnuje učitelné routery a modely MoE. V jádru modelu MoE-LLaVA se skládá z více sparse cest, a rámec používá tyto cesty k přeposlání každého tokenu na různé odborníky prostřednictvím učitelného routera. Tokeny jsou poté zpracovány společně aktivovanými odborníky, zatímco neaktivní cesty zůstávají tiché. Rámec poté skládá vrstvy kódéru založené na směsi odborníků iterativně, aby poskytl sparse cestu k většímu a silnějšímu LVLM. Strategie MoE-Tuning řeší běžný problém degradace výkonu při multi-modální sparse učení inovativně, a tím vybavuje model významným počtem parametrů, ale konzistentními náklady na trénování a inference. Architektura rámce MoE-LLaVA je navržena tak, aby během nasazení aktivovala pouze top-k odborníky, zatímco ostatní odborníci zůstávají neaktivní.












