Modelli e piattaforme di IA

MoE-LLaVA: Miscela di Esperti per Modelli di Visione-Linguaggio di Grande Scala

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Le recenti scoperte nei Modelli di Visione-Linguaggio di Grande Scala (LVLM) hanno dimostrato che la scalabilità di questi framework aumenta notevolmente le prestazioni in una varietà di compiti downstream. Gli LVLM, tra cui MiniGPT, LLaMA e altri, hanno raggiunto capacità notevoli incorporando layer di proiezione visiva e un encoder di immagini nella loro architettura. Implementando questi componenti, gli LVLM migliorano le capacità di percezione visiva dei Modelli di Linguaggio di Grande Scala (LLM). Le prestazioni possono essere ulteriormente migliorate aumentando la dimensione del modello e il numero di parametri, nonché espandendo la scala del set di dati.

I modelli come InternVL hanno esteso il loro encoder di immagini a oltre 6 miliardi di parametri, mentre altri hanno esteso il backend degli LVLM a 13 miliardi di parametri, raggiungendo prestazioni superiori in una vasta gamma di compiti. IDEFICS ha addestrato un LVLM con oltre 80 miliardi di parametri. Questi metodi di scalabilità hanno eguagliato o superato le prestazioni degli LLM pre-addestrati su oltre 34, 70 o addirittura 100 miliardi di parametri. Tuttavia, la scalabilità ha un lato negativo: aumenta notevolmente i costi di addestramento e inferenza. Ciò è dovuto al fatto che richiede che tutti i parametri siano attivi per ogni token nel calcolo, portando a elevate esigenze computazionali e, di conseguenza, a costi più alti.

Questo articolo discute MoE-LLaVA, un’architettura di modello di visione-linguaggio di grande scala (LVLM) basata su una miscela di esperti (MoE) che impiega una strategia di addestramento efficace, MoE-Tuning, per gli LVLM. MoE-Tuning affronta in modo innovativo il degrado delle prestazioni nell’apprendimento della sparsità multi-modale, risultando in un modello con un gran numero di parametri ma con costi di addestramento e inferenza coerenti. L’architettura di MoE-LLaVA è progettata per attivare solo gli esperti top-k durante la distribuzione, mantenendo gli esperti rimanenti inattivi.

Esploreremo il framework MoE-LLaVA, esaminandone il meccanismo, la metodologia, l’architettura e come si confronta con i principali framework di generazione di immagini e video.

MoE-LLaVA: Scalare Modelli di Visione-Linguaggio di Grande Scala in Modo Accessibile

Oltre a sfruttare i layer di proiezione visiva e gli encoder di immagini, i Modelli di Visione-Linguaggio di Grande Scala aumentano anche la dimensione del modello aumentando il numero di parametri per migliorare le prestazioni del modello. Alcuni esempi notevoli di Modelli di Visione-Linguaggio di Grande Scala che hanno seguito questo approccio per migliorare le loro prestazioni sono MiniGPT-4, InternGPT, InternVL e altri. Nelle applicazioni del mondo reale, scalare un Modello di Linguaggio di Grande Scala o un Modello di Visione-Linguaggio di Grande Scala con dati di addestramento di alta qualità spesso diventa una necessità per migliorare le prestazioni del modello. Sebbene l’aumento della dimensione del modello migliori le prestazioni, aumenta anche i costi computazionali di addestramento e distribuzione del modello, e aumenta ulteriormente le complicazioni e l’efficienza della distribuzione del modello su dispositivi paralleli contemporaneamente. Un motivo principale dietro l’aumento dei costi di addestramento e inferenza, insieme alle esigenze computazionali, è che ogni token nel framework richiede un calcolo con ogni singolo parametro all’interno del modello, noto come modello denso.

D’altra parte, i modelli MoE o Mixture of Expert sparsi hanno dimostrato una scalabilità efficace dei framework elaborando i dati con l’aiuto di parametri attivati fissi, un approccio che è stato ampiamente adottato nel campo dell’Elaborazione del Linguaggio Naturale. Tuttavia, utilizzare la Miscela di Esperti per addestrare direttamente i Modelli di Visione-Linguaggio di Grande Scala sparsi è impegnativo, poiché convertire gli LLM in LVLM e sparsificare il modello contemporaneamente comporta un degrado significativo delle prestazioni. Per implementare la Miscela di Modelli per scalare gli LLM e gli LVLM, è essenziale inizializzare prima l’LVLM per la sparsificazione. Per raggiungere ciò, il framework MoE-LLaVA introduce MoE-Tuning, una strategia di addestramento a tre fasi semplice ma efficace.

Come mostrato nella figura sopra, il processo MoE-Tuning addestra prima un MLP o un Multilayer Perceptron che adatta i token visivi a un Modello di Linguaggio di Grande Scala nel primo stadio. Il framework addestra poi tutti i parametri dell’LLM per pre-potenziare il Modello di Visione-Linguaggio di Grande Scala con capacità di comprensione multi-modale generali. Infine, nel terzo stadio, il framework replica il FFN o la Rete Neurale Feed Forward come pesi di inizializzazione per gli esperti e addestra solo i layer della Miscela di Esperti. Nel complesso, il processo di addestramento aiuta nella transizione graduale del modello sparsa da un’inizializzazione LVLM a una miscela di modelli di esperti sparsi.

Con il processo di addestramento coperto, esaminiamo MoE-LLaVA, una baseline per i Modelli di Visione-Linguaggio di Grande Scala con modelli di esperti che incorporano router apprendibili e modelli MoE. Al suo nucleo, il modello MoE-LLaVA consiste in più percorsi sparsi, e il framework utilizza questi percorsi per inviare ogni token a diversi esperti attraverso il router apprendibile. I token vengono quindi elaborati collettivamente dagli esperti attivati mentre si mantengono i percorsi inattivi silenziosi. Il framework impila poi i layer dell’encoder della Miscela di Esperti in modo iterativo per fornire un percorso sparsa verso un LVLM più grande e potente.

Grazie all’approccio implementato dal framework MoE-LLaVA, è in grado di superare modelli con un numero simile di parametri attivati e superarli di una grande differenza nel benchmark di allucinazione di oggetti POPE, nonostante abbia solo 2,2 miliardi di parametri. Inoltre, il framework MoE-LLaVA con 2,2 miliardi di parametri è in grado di raggiungere prestazioni paragonabili al framework InternVL-Chat-19B con quasi 8 volte il numero di parametri attivati.

Potenti Modelli di Linguaggio di Grande Scala con forti capacità di generalizzazione e di esecuzione di istruzioni sono stati implementati per i Modelli di Visione-Linguaggio di Grande Scala. I primi LLM come BLIP hanno codificato i segnali visivi in una sequenza di token visivi, permettendo loro di adattare la visione agli LLM con successo utilizzando più layer di proiezione. Allo stesso tempo, lavori recenti si concentrano sul miglioramento delle prestazioni del modello implementando metodi come l’espansione del set di dati di istruzioni, l’aumento della risoluzione dell’immagine, l’ottimizzazione delle strategie di addestramento, l’allineamento dell’input, il miglioramento degli encoder di immagini e molto altro. Questi approcci hanno aiutato a potenziare gli LVLM con potenti capacità di comprensione visiva espandendo il set di dati di istruzioni visive e la scala del modello. Inoltre, alcuni LVLM possiedono anche capacità di comprensione di immagini a grana fine, come la comprensione di regioni e multi-regioni, insieme a capacità di grounding a livello di pixel. Tuttavia, il costo computazionale accompagnato alla scalabilità dei dati visivi densi e dei modelli è spesso molto alto, il che lo rende difficile da gestire. D’altra parte, il framework MoE-LLaVA mira a rendere la ricerca sugli LVLM più accessibile sfruttando le capacità dei modelli MoE.

MoE-LLaVA: Metodo e Architettura

Al suo nucleo, il framework MoE-LLaVA consiste in un layer di proiezione visiva (Multilayer Perceptron), un encoder di visione, blocchi MoE, più blocchi LLM impilati e un layer di incorporamento di parole.

Architettura

La seguente tabella riassume le configurazioni dettagliate del framework MoE-LLaVA.

Per un’immagine RGB data, l’encoder di visione elabora le immagini per ottenere una sequenza di token visivi con un layer di proiezione visiva che mappa la sequenza di token visivi alle immagini di input. Gli input di testo vengono elaborati dal layer di incorporamento di parole che li proietta per ottenere la sequenza di token. Allo stesso tempo, il framework MoE-LLaVA collega i token di testo e visivi insieme e li alimenta all’LLM. Tuttavia, il framework addestra solo il layer di proiezione visiva con il modello di linguaggio di grande scala costituito da FFN o layer di attenzione self-multi-head. Infine, il framework applica connessioni residue e normalizzazione di layer a ogni blocco.

Proseguendo, il framework MoE-LLaVA replica il FFN o la Rete Neurale Feed Forward più volte per formare un insieme di esperti come passo di inizializzazione. Il router, essendo un layer lineare, prevede la probabilità di ogni token di essere assegnato a ogni esperto. Ogni token viene elaborato dagli esperti top-k con la somma pesata calcolata in base al risultato softmax delle probabilità. Una volta attivati gli esperti top-k, il modello disattiva gli esperti rimanenti, un approccio che equipaggia il framework MoE-LLaVA con percorsi sparsi infinitamente possibili, dotando così il modello di una vasta gamma di capacità.

MoE-Tuning

MoE-Tuning è una strategia di addestramento a tre fasi semplice ma efficace che addestra prima un MLP o un Multilayer Perceptron che adatta i token visivi a un Modello di Linguaggio di Grande Scala nel primo stadio. Il framework addestra poi tutti i parametri dell’LLM per pre-potenziare il Modello di Visione-Linguaggio di Grande Scala con capacità di comprensione multi-modale generali. Infine, nel terzo stadio, il framework replica il FFN o la Rete Neurale Feed Forward come pesi di inizializzazione per gli esperti e addestra solo i layer della Miscela di Esperti.

Stage 1

Nel primo stadio, l’obiettivo principale è adattare i token di immagine al modello di linguaggio di grande scala, permettendo all’LLM di comprendere le istanze nell’immagine. Il framework MoE-LLaVA impiega un multilayer perceptron per proiettare i token di immagine nel dominio di input del modello di linguaggio di grande scala e tratta i patch di immagine come token di testo pseudo. In questo stadio, il framework MoE-LLaVA addestra l’LLM per descrivere le immagini e non applica i layer MoE all’LLM durante questo stadio.

Stage 2

Nel secondo stadio, il framework MoE-LLaVA tenta di migliorare le capacità e la controllabilità del framework sintonizzando il modello con dati di istruzioni multi-modalità. Il framework MoE-LLaVA raggiunge ciò regolando l’LLM per renderlo un LVLM con capacità di comprensione multi-modale. Il framework impiega istruzioni più complesse, tra cui riconoscimento di testo e compiti di ragionamento logico su immagini che richiedono al modello di possedere capacità multi-modalità più forti. Tradizionalmente, il processo di addestramento per modelli densi è considerato completo a questo punto. Tuttavia, il framework MoE-LLaVA ha incontrato sfide nel trasformare l’LLM in un LVLM contemporaneamente alla sparsificazione del LVLM. Per contrastare questa sfida, il framework utilizza i pesi da questo stadio come inizializzazione per lo stadio successivo, cercando di alleviare la difficoltà di apprendimento del modello sparsa.

Stage 3

Nel terzo stadio, il modello replica la rete neurale feed forward più volte per inizializzare gli esperti come procedura di inizializzazione. Il framework alimenta poi i token di testo e visivi nei layer della miscela di esperti, dopo di che il router calcola i pesi di corrispondenza tra esperti e token. Ogni token viene elaborato dagli esperti top-k con la somma pesata calcolata in base ai pesi del router. Una volta attivati gli esperti top-k, il modello disattiva gli esperti rimanenti, un approccio che equipaggia il framework MoE-LLaVA con percorsi sparsi infinitamente possibili, dotando così il modello di una vasta gamma di capacità.

MoE-LLaVA: Risultati e Esperimenti

Il framework MoE-LLaVA adotta CLIP-Large come encoder di visione con il Multilayer Perceptron costituito da due layer con un layer di attivazione GELU che separa i due. Per impostazione predefinita, il framework impiega un’alternanza di sostituzione delle reti neurali feed forward con i layer della miscela di esperti, il che significa che i layer della miscela di esperti costituiscono il 50% del numero totale di layer. La seguente tabella contiene i diversi set di dati insieme alle loro dimensioni di campione utilizzati per addestrare e valutare il framework MoE-LLaVA.

Risposte a Domande su Immagini Zero-Shot

La figura seguente dimostra che MoE-LLaVA è un modello sparsa con un router soft basato su LVLM. Il framework viene valutato su 5 benchmark di risposte a domande su immagini e, come si può osservare, il framework MoE-LLaVA dimostra notevoli capacità di comprensione di immagini e fornisce prestazioni paragonabili al framework LLaVA 1.5 di stato dell’arte su cinque diversi benchmark.

Valutazione dell’Allucinazione di Oggetti

Per valutare l’allucinazione di oggetti, il framework MoE-LLaVA adotta la pipeline di valutazione POPE, un metodo di query basato sul sondaggio, e i risultati sono dimostrati nella tabella seguente. Come si può osservare, tra tutti i framework, MoE-LLaVA fornisce i risultati più forti, indicando la capacità del framework di generare oggetti coerenti con l’immagine di input. Inoltre, è degno di nota che il framework MoE-LLaVA bilancia bene il rapporto sì, indicando la capacità del modello sparsa di fornire feedback precisi per la domanda data.

La figura seguente contiene la distribuzione dei carichi degli esperti, dove le linee discontinue rappresentano una distribuzione ben bilanciata dei token tra le modalità o gli esperti. La prima figura illustra il carico di lavoro all’interno degli esperti, mentre le immagini rimanenti dimostrano le prestazioni degli esperti verso diverse modalità.

Inoltre, la figura seguente dimostra la distribuzione delle modalità tra gli esperti diversi.

Pensieri Finali

In questo articolo abbiamo parlato di MoE-LLaVA, una baseline per i Modelli di Visione-Linguaggio di Grande Scala con modelli di esperti che incorporano router apprendibili e modelli MoE. Al suo nucleo, il modello MoE-LLaVA consiste in più percorsi sparsi, e il framework utilizza questi percorsi per inviare ogni token a diversi esperti attraverso il router apprendibile. I token vengono quindi elaborati collettivamente dagli esperti attivati mentre si mantengono i percorsi inattivi silenziosi. Il framework impila poi i layer dell’encoder della Miscela di Esperti in modo iterativo per fornire un percorso sparsa verso un LVLM più grande e potente. La strategia di addestramento MoE-Tuning affronta in modo innovativo il problema del degrado delle prestazioni nell’apprendimento della sparsità multi-modale, costruendo così un modello con un gran numero di parametri ma con costi di addestramento e inferenza coerenti. L’architettura del framework MoE-LLaVA è progettata per attivare solo gli esperti top-k durante la distribuzione, mantenendo gli esperti rimanenti inattivi.

Kunal Kejriwal è un ingegnere backend specializzato in Python, PostgreSQL, Redis e infrastrutture cloud su GCP e AWS. Con tre anni di esperienza nella costruzione e nella scalabilità di sistemi di produzione, scrive di infrastruttura AI, sistemi distribuiti e dell'architettura alla base del deployment di workload di machine learning.