Modele și platforme AI
MoE-LLaVA: Amestecul de Experți pentru Modele Mari de Viziune și Limbaj
Avansurile recente în domeniul Modelelor Mari de Viziune și Limbaj (LVLM) au demonstrat că scalarea acestor cadre îmbunătățește semnificativ performanța într-o varietate de sarcini downstream. LVLM, inclusiv MiniGPT, LLaMA și altele, au realizat capacități remarcabile prin integrarea unor straturi de proiecție vizuală și a unui encoder de imagine în arhitectura lor. Prin implementarea acestor componente, LVLM îmbunătățește capacitățile de percepție vizuală ale Modelelor Mari de Limbaj (LLM). Performanța poate fi îmbunătățită și mai mult prin creșterea dimensiunii modelului și a numărului de parametri, precum și prin extinderea dimensiunii setului de date.
Modele precum InternVL au extins encoderul de imagine la peste 6 miliarde de parametri, în timp ce altele au extins partea din spate a LVLM la 13 miliarde de parametri, realizând o performanță superioară într-o gamă largă de sarcini. IDEFICS a antrenat un LVLM cu peste 80 de miliarde de parametri. Aceste metode de scalare au egalat sau depășit performanța LLM preantrenate pe peste 34, 70 sau chiar 100 de miliarde de parametri. Cu toate acestea, scalarea are un dezavantaj: crește semnificativ costurile de antrenare și inferență. Acest lucru se datorează faptului că necesită ca toți parametrii să fie activați pentru fiecare token în calcul, ceea ce duce la nevoi computaționale ridicate și, în consecință, la costuri mai mari.
Acest articol discută despre MoE-LLaVA, o arhitectură LVLM bazată pe Amestecul de Experți (MoE) care utilizează o strategie de antrenare eficientă, MoE-Tuning, pentru LVLM. MoE-Tuning abordează în mod inovativ degradarea performanței în învățarea multi-modală și rezultă într-un model cu un număr mare de parametri, dar cu costuri de antrenare și inferență constante. Arhitectura MoE-LLaVA este proiectată pentru a activa doar experții de top-k în timpul implementării, ținând experții rămași inactivi.
Vom explora cadrul MoE-LLaVA, examinând mecanismul, metodologia, arhitectura și modul în care se compară cu cadrele de generare de imagini și videoclipuri lider.
MoE-LLaVA: Scalarea Modelelor Mari de Viziune și Limbaj în Mod Afectiv
În plus față de utilizarea straturilor de proiecție vizuală și a encoderelor de imagine, Modelele Mari de Viziune și Limbaj măresc și dimensiunea modelului prin creșterea numărului de parametri pentru a îmbunătăți performanța modelului. Unele exemple notabile de Modele Mari de Viziune și Limbaj care au urmat această abordare pentru a-și îmbunătăți performanța sunt MiniGPT-4, InternGPT, InternVL și altele. În aplicațiile din lumea reală, scalarea unui Model Mare de Limbaj sau a unui Model Mare de Viziune și Limbaj cu date de antrenare de înaltă calitate devine adesea o necesitate pentru a îmbunătăți performanța modelului. Deși mărirea dimensiunii modelului îmbunătățește performanța, aceasta crește și costurile computaționale de antrenare și implementare a modelului și mărește complicațiile și eficiența implementării modelului pe dispozitive paralele simultan. Un motiv principal pentru creșterea costurilor de antrenare și inferență, precum și a cerințelor computaționale, este acela că fiecare token din cadrul necesită calcul cu fiecare parametru din model, cunoscut sub numele de model dens.
Pe de altă parte, modelele MoE sau Amestecul de Experți au demonstrat o scalare eficientă a cadrului prin procesarea datelor cu ajutorul parametrilor activați fix, o abordare care a fost adoptată pe scară largă în domeniul Procesării Limbajului Natural. Cu toate acestea, utilizarea Amestecului de Experți pentru a antrena direct Modele Mari de Viziune și Limbaj sparse este dificilă, deoarece conversia LLM în LVLM și sparsificarea modelului simultan rezultă într-o degradare semnificativă a performanței. Pentru a implementa Amestecul de Experți pentru a scala LLM și LVLM, este esențial să se initializeze mai întâi LVLM pentru sparsificare. Pentru a realiza acest lucru, cadrul MoE-LLaVA introduce MoE-Tuning, o strategie de antrenare simplă, dar eficientă, în trei etape.

Așa cum se arată în figura de mai sus, procesul MoE-Tuning antrenează mai întâi un MLP sau un Multilayer Perceptron care adaptează tokenurile vizuale la un Model Mare de Limbaj în prima etapă. Cadrul apoi antrenează toți parametrii LLM pentru a pregăti Modelul Mare de Viziune și Limbaj cu capacități de înțelegere multi-modală generală. În final, în a treia etapă, cadrul replică FFN sau Rețeaua Neurală Feed Forward ca greutăți de inițializare pentru experți și antrenează doar straturile Amestecului de Experți. Procesul de antrenare ajută la trecerea graduală a modelului sparse de la o inițializare LVLM la un Amestec de Experți sparse.
Cu procesul de antrenare acoperit, să aruncăm o privire asupra MoE-LLaVA, o bază pentru Modele Mari de Viziune și Limbaj cu Amestec de Experți care incorporează routere învățabile și Amestec de Experți. La nivelul său fundamental, modelul MoE-LLaVA constă în multiple căi sparse, iar cadrul utilizează aceste căi pentru a trimite fiecare token la experți diferiți prin routerul învățabil. Tokenurile sunt apoi procesate colectiv de către experții activați, în timp ce păstrează căile inactive tăcute. Cadrul apoi stivuie straturile Amestecului de Experți encoder iterativ pentru a oferi o cale sparse către un Model Mare de Viziune și Limbaj mai mare și mai puternic.

Mulțumită abordării implementate de cadrul MoE-LLaVA, acesta reușește să depășească modele cu un număr similar de parametri activați și să le întreacă cu o diferență mare pe benchmark-ul POPE de halucinație a obiectelor, în ciuda faptului că are doar 2,2 miliarde de parametri. Mai mult, cadrul MoE-LLaVA cu 2,2 miliarde de parametri reușește să atingă o performanță comparabilă cu cadrul InternVL-Chat-19B, care are aproape de 8 ori mai mulți parametri activați.
Modele puternice de Limbaj Mare cu capacități puternice de generalizare și urmărire a instrucțiunilor au fost implementate pentru a împuternici Modelele Mari de Viziune și Limbaj. Modelele LLM timpurii, cum ar fi BLIP, au codat semnalele vizuale într-o secvență de tokenuri vizuale, permițându-le să adapteze viziunea la LLM cu succes, utilizând multiple straturi de proiecție. În același timp, lucrările recente se concentrează pe îmbunătățirea performanței modelului prin implementarea unor metode, cum ar fi extinderea setului de date de instruire, creșterea rezoluției imaginii, optimizarea strategiilor de antrenare, alinierea intrărilor, îmbunătățirea encoderelor de imagine și multe altele. Aceste abordări au ajutat la împuternicirea Modelelor Mari de Viziune și Limbaj cu capacități puternice de înțelegere vizuală, prin extinderea setului de date de instruire vizuală și a dimensiunii modelului. Mai mult, unele Modele Mari de Viziune și Limbaj posedă capacități fine de înțelegere a imaginilor, cum ar fi înțelegerea regiunilor și a multi-regiunilor, împreună cu capacități de ancorare pixel cu pixel. Cu toate acestea, costul computațional însoțitor al scalării datelor vizuale dense și a modelului este adesea foarte ridicat, ceea ce face dificilă implementarea. Pe de altă parte, cadrul MoE-LLaVA își propune să facă cercetarea Modelelor Mari de Viziune și Limbaj mai accesibilă, prin utilizarea capacităților modelelor Amestec de Experți.
MoE-LLaVA: Metodă și Arhitectură
La nivelul său fundamental, cadrul MoE-LLaVA constă într-un strat de proiecție vizuală (Multilayer Perceptron), un encoder de viziune, blocuri MoE, multiple blocuri LLM stivuite și un strat de încorporare a cuvintelor.

Arhitectură
Tabelul următor rezumă configurațiile detaliate ale cadrului MoE-LLaVA.

Pentru o imagine RGB dată, encoderul de viziune procesează imaginile pentru a obține o secvență de tokenuri vizuale, iar stratul de proiecție vizuală mappează secvența de tokenuri vizuale la imaginile de intrare. Intrările textuale sunt procesate de stratul de încorporare a cuvintelor, care apoi proiectează pentru a obține secvența de tokenuri. În același timp, cadrul MoE-LLaVA leagă tokenurile textuale și vizuale împreună și le alimentează LLM. Cu toate acestea, cadrul antrenează doar stratul de proiecție vizuală cu modelul de limbaj mare, care constă în FFN sau Rețele Neurale Feed Forward și Straturi de Atenție Multi-Head. În final, cadrul aplică conexiuni reziduale și normalizare de strat la fiecare bloc.
Continuând, cadrul MoE-LLaVA replică FFN sau Rețeaua Neurală Feed Forward din etapa a doua pentru a forma un ansamblu de experți ca procedură de inițializare. Routerul, care este un strat liniar, prezice probabilitatea fiecărui token de a fi atribuit fiecărui expert. Fiecare token este procesat de către experții de top-k cu probabilitatea maximă și calculează suma ponderată pe baza rezultatului softmax al probabilităților. Odată ce experții de top-k sunt activați, modelul închide experții rămași, o abordare care dotează cadrul MoE-LLaVA cu căi sparse infinite, dotând modelul cu o gamă largă de capacități.
MoE-Tuning
MoE-Tuning este o strategie de antrenare simplă, dar eficientă, în trei etape, care antrenează mai întâi un MLP sau un Multilayer Perceptron care adaptează tokenurile vizuale la un Model Mare de Limbaj în prima etapă. Cadrul apoi antrenează toți parametrii LLM pentru a pregăti Modelul Mare de Viziune și Limbaj cu capacități de înțelegere multi-modală generală. În final, în a treia etapă, cadrul replică FFN sau Rețeaua Neurală Feed Forward ca greutăți de inițializare pentru experți și antrenează doar straturile Amestecului de Experți.
Etapa 1
În prima etapă, obiectivul principal este de a adapta tokenurile de imagine la modelul de limbaj mare, permițând LLM să înțeleagă instanțele din imagine. Cadrul MoE-LLaVA utilizează un Multilayer Perceptron pentru a proiecta tokenurile de imagine în domeniul de intrare al modelului de limbaj mare și tratează patch-urile de imagine ca tokenuri pseudo-text. În această etapă, cadrul MoE-LLaVA antrenează LLM pentru a descrie imaginile și nu aplică straturile MoE la LLM în timpul acestei etape.
Etapa 2
În a doua etapă, cadrul MoE-LLaVA încearcă să îmbunătățească capacitățile și controlabilitatea cadrului prin ajustarea modelului cu date de instruire multi-modală. Cadrul MoE-LLaVA realizează acest lucru prin ajustarea LLM pentru a deveni un LVLM cu capacități de înțelegere multi-modală. Cadrul utilizează instrucțiuni mai complexe, inclusiv recunoașterea textului și sarcinile de raționament logic al imaginilor, care necesită ca modelul să posedă capacități multi-modale mai puternice. În mod tradițional, procesul de antrenare pentru modele dense se consideră a fi completat prin acest pas. Cu toate acestea, cadrul MoE-LLaVA a întâmpinat dificultăți în transformarea LLM într-un LVLM simultan cu sparsificarea LVLM. Pentru a contracara această provocare, cadrul utilizează greutățile din etapa anterioară ca inițializare pentru etapa următoare, în încercarea de a atenua dificultatea de învățare a modelului sparse.
Etapa 3
În a treia etapă, modelul replică Rețeaua Neurală Feed Forward de mai multe ori pentru a inițializa experții ca procedură de inițializare. Cadrul apoi alimentează tokenurile textuale și vizuale în straturile Amestecului de Experți, urmat de routerul care calculează greutățile de potrivire între experți și fiecare token. Fiecare token este apoi procesat de către experții de top-k, cu ieșirea agregată calculată prin sumă ponderată pe baza greutăților routerului. Odată ce experții de top-k sunt activați, modelul închide experții rămași, o abordare care dotează cadrul MoE-LLaVA cu căi sparse infinite, dotând modelul cu o gamă largă de capacități.
MoE-LLaVA: Rezultate și Experimente
Cadrul MoE-LLaVA adoptă CLIP-Large ca encoder de viziune, cu Multilayer Perceptron constând din două straturi cu un strat de activare GELU care separă cele două. În mod implicit, cadrul utilizează o înlocuire alternativă a Rețelelor Neurale Feed Forward cu straturile Amestecului de Experți, ceea ce înseamnă că straturile Amestecului de Experți reprezintă 50% din numărul total de straturi. Tabelul următor conține diferitele seturi de date, împreună cu dimensiunea lor de eșantion, utilizate pentru a antrena și evalua cadrul MoE-LLaVA.

Întrebări și Răspunsuri de Imagine Zero-Shot
Figura următoare demonstrează că MoE-LLaVA este un model sparse cu un router moale bazat pe LVLM. Cadrul este evaluat pe 5 benchmark-uri de întrebări și răspunsuri de imagine, și, așa cum se poate observa, cadrul MoE-LLaVA demonstrează capacități remarcabile de înțelegere a imaginilor și oferă o performanță comparabilă cu cadrul LLaVA 1.5 pe cinci benchmark-uri diferite.

Evaluarea Halucinației Obiectului
Pentru a evalua halucinația obiectului, cadrul MoE-LLaVA adoptă pipeline-ul de evaluare POPE, o metodă de anchetă bazată pe vot, și rezultatele sunt demonstrate în tabelul următor. Așa cum se poate observa, dintre toate cadrele, MoE-LLaVA oferă cele mai puternice rezultate, indicând capacitatea cadrului de a genera obiecte consistente cu imaginea de intrare. În plus, este important de remarcat că cadrul MoE-LLaVA echilibrează bine raportul da/nu, indicând capacitatea modelului sparse de a oferi feedback precis pentru întrebarea dată.

Imaginea următoare conține distribuția încărcăturii experților, unde liniile discontinue reprezintă o distribuție bine echilibrată a tokenurilor între modalități sau experți. Prima figură ilustrează încărcătura de lucru în cadrul experților, în timp ce imaginile rămase demonstrează performanța experților în ceea ce privește diferitele modalități.

Mai mult, figura următoare demonstrează distribuția modalităților între diferiți experți.

Gânduri Finale
În acest articol am discutat despre MoE-LLaVA, o bază pentru Modele Mari de Viziune și Limbaj cu Amestec de Experți care incorporează routere învățabile și Amestec de Experți. La nivelul său fundamental, modelul MoE-LLaVA constă în multiple căi sparse, iar cadrul utilizează aceste căi pentru a trimite fiecare token la experți diferiți prin routerul învățabil. Tokenurile sunt apoi procesate colectiv de către experții activați, în timp ce păstrează căile inactive tăcute. Cadrul apoi stivuie straturile Amestecului de Experți encoder iterativ pentru a oferi o cale sparse către un Model Mare de Viziune și Limbaj mai mare și mai puternic. Strategia MoE-Tuning abordează în mod inovativ degradarea performanței în învățarea multi-modală și rezultă într-un model cu un număr mare de parametri, dar cu costuri de antrenare și inferență constante. Arhitectura cadrului MoE-LLaVA a fost proiectată pentru a activa doar experții de top-k în timpul implementării, ținând experții rămași inactivi.












