KI-Modelle und Plattformen

MoE-LLaVA: Mischung aus Experten für große Vision-Sprachmodelle

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Die jüngsten Fortschritte bei großen Vision-Sprachmodellen (LVLMs) haben gezeigt, dass die Skalierung dieser Rahmenwerke die Leistung bei einer Vielzahl von Downstream-Aufgaben erheblich verbessert. LVLMs wie MiniGPT, LLaMA und andere haben bemerkenswerte Fähigkeiten durch die Integration von visuellen Projektionsschichten und einem Bildencoder in ihre Architektur erlangt. Durch die Implementierung dieser Komponenten verbessern LVLMs die visuellen Wahrnehmungsfähigkeiten von Large Language Models (LLMs). Die Leistung kann weiter verbessert werden, indem die Größe des Modells und die Anzahl der Parameter erhöht und die Datenskala erweitert werden.

Modelle wie InternVL haben ihren Bildencoder auf über 6 Milliarden Parameter erweitert, während andere den Backend von LVLMs auf 13 Milliarden Parameter erweitert haben und damit eine überlegene Leistung bei einer Vielzahl von Aufgaben erzielt haben. IDEFICS hat ein LVLM mit über 80 Milliarden Parametern trainiert. Diese Skalierungsverfahren haben die Leistung von LLMs, die auf über 34, 70 oder sogar 100 Milliarden Parametern vorgebildet wurden, erreicht oder übertroffen. Allerdings hat die Skalierung einen Nachteil: Sie erhöht die Trainings- und Inferenzkosten erheblich. Dies liegt daran, dass alle Parameter für jeden Token in der Berechnung aktiv sein müssen, was zu hohen Rechenanforderungen und damit höheren Kosten führt.

In diesem Artikel wird MoE-LLaVA diskutiert, ein Mixture-of-Experts-basiertes (MoE) sparsames LVLM-Framework, das eine effektive Trainingsstrategie, MoE-Tuning, für LVLMs verwendet. MoE-Tuning adressiert die Leistungsverschlechterung bei multi-modaler Spärlichkeit innovativ und resultiert in einem Modell mit einer großen Anzahl von Parametern, aber konsistenten Trainings- und Inferenzkosten. Die Architektur von MoE-LLaVA ist so konzipiert, dass sie nur die Top-k-Experten während der Bereitstellung aktiviert und die restlichen Experten inaktiv hält.

Wir werden das MoE-LLaVA-Framework untersuchen, indem wir seine Mechanismen, Methoden, Architektur und wie es sich mit führenden Bild- und Video-Generierungsframeworks vergleicht.

MoE-LLaVA: Skalierung großer Vision-Sprachmodelle zu geringen Kosten

Neben der Nutzung von visuellen Projektionsschichten und Bildencodern skalieren große Vision-Sprachmodelle auch die Modellgröße, indem die Anzahl der Parameter erhöht wird, um die Leistung des Modells zu verbessern. Einige bemerkenswerte Beispiele für große Vision-Sprachmodelle, die diesem Ansatz gefolgt sind, um ihre Leistung zu verbessern, sind MiniGPT-4, InternGPT, InternVL und andere. In realen Anwendungen wird die Skalierung eines großen Sprachmodells oder eines großen Vision-Sprachmodells mit hochwertigen Trainingsdaten oft notwendig, um die Leistung des Modells zu verbessern. Obwohl die Skalierung eines Modells die Leistung verbessert, erhöht sie auch die Rechenkosten für das Training und die Bereitstellung des Modells und erhöht die Komplexität und Effizienz der Bereitstellung des Modells auf parallelen Geräten. Ein wichtiger Grund für die erhöhten Trainings- und Inferenzkosten sowie die Rechenanforderungen ist, dass jeder Token im Framework die Berechnung mit jedem einzelnen Parameter im Modell erfordert, was als dichtes Modell bezeichnet wird.

Andererseits haben sparse MoE- oder Mixture-of-Expert-Modelle eine effektive Skalierung von Frameworks durch die Verarbeitung von Daten mit Hilfe von festen aktivierten Parametern demonstriert, ein Ansatz, der im Bereich der natürlichen Sprachverarbeitung weithin akzeptiert wurde. Allerdings ist es herausfordernd, Mixture-of-Expert-Modelle direkt zum Training von sparsamen großen Vision-Sprachmodellen zu verwenden, da die Umwandlung von LLMs in LVLMs und die Spärlichkeit des Modells gleichzeitig zu einer erheblichen Leistungsverschlechterung führt. Um Mixture-of-Expert-Modelle zum Skalieren von LLMs und LVLMs zu implementieren, ist es erforderlich, das LVLM zunächst für die Spärlichkeit zu initialisieren. Zu diesem Zweck führt das MoE-LLaVA-Framework MoE-Tuning ein, eine einfache, aber effektive dreiphasige Trainingsstrategie.

Wie in der obigen Abbildung gezeigt, trainiert der MoE-Tuning-Prozess zunächst ein MLP oder ein Multilayer-Perceptron, das die visuellen Token an ein großes Sprachmodell anpasst, in der ersten Phase. Das Framework trainiert dann alle Parameter des LLMs, um das große Vision-Sprachmodell mit allgemeinen multi-modalen Verständnisfähigkeiten zu befähigen. Schließlich trainiert das Framework in der dritten Phase die Mixture-of-Expert-Schichten, indem es das FFN oder Feed-Forward-Netzwerk als Initialisierungsgewichte für die Experten repliziert. Insgesamt hilft der Trainingsprozess bei der allmählichen Umstellung des sparsamen Modells von einer LVLM-Initialisierung auf ein sparsames Mixture-of-Expert-Modell.

Mit dem Trainingsprozess wird uns nun das MoE-LLaVA-Framework näher betrachtet, ein Basismodell für große Vision-Sprachmodelle mit Mixture-of-Expert-Modellen, das lernbare Router und MoE-Modelle integriert. Im Kern besteht das MoE-LLaVA-Modell aus mehreren sparsamen Pfaden, und das Framework verwendet diese Pfade, um jeden Token an verschiedene Experten durch den lernbaren Router zu senden. Die Token werden dann kollektiv von den aktivierten Experten verarbeitet, während die inaktiven Pfade still gehalten werden. Das Framework stapelt dann die Mixture-of-Expert-Encoder-Schichten iterativ, um einen sparsamen Pfad zu einem größeren und leistungsfähigeren LVLM zu bieten.

Dank des Ansatzes, der vom MoE-LLaVA-Framework implementiert wird, kann es Modelle mit einer ähnlichen Anzahl von aktivierten Parametern überbieten und sie um einen großen Unterschied auf dem POPE-Objekt-Halluzinations-Benchmark überbieten, obwohl es nur 2,2 Milliarden Parameter hat. Darüber hinaus kann das MoE-LLaVA-Framework mit 2,2 Milliarden Parametern eine Leistung erzielen, die mit dem InternVL-Chat-19B-Framework vergleichbar ist, das fast 8-mal so viele aktivierte Parameter hat.

Mächtige große Sprachmodelle mit starken Verallgemeinerungs- und Anweisungsfolgefähigkeiten wurden in große Vision-Sprachmodelle implementiert. Frühe LLMs wie BLIP kodierten visuelle Signale in eine Sequenz von visuellen Token, um Vision auf LLMs erfolgreich mithilfe mehrerer Projektionsschichten anzupassen. Gleichzeitig konzentrieren sich aktuelle Arbeiten auf die Verbesserung der Modellleistung durch die Implementierung von Methoden wie der Erweiterung des Anweisungs-Trainingsdatensatzes, der Erhöhung der Bildauflösung, der Optimierung von Trainingsstrategien, der Ausrichtung der Eingabe, der Verbesserung der Bildencoder und vielem mehr. Diese Ansätze haben dazu beigetragen, LVLMs mit leistungsfähigen visuellen Verständnisfähigkeiten auszustatten, indem sie den visuellen Anweisungs-Feinabstimmungsdatensatz und die Modellskala erweitert haben. Darüber hinaus verfügen einige LVLMs auch über feinkörnige Bildverständnisfähigkeiten wie Regionen- und Multi-Regionen-Verständnis sowie pixelweise Grundierungsfähigkeiten. Allerdings sind die Rechenkosten, die mit der Skalierung von dichten visuellen Daten und Modellen verbunden sind, oft sehr hoch, was es schwierig macht, sie zu tragen. Andererseits zielt das MoE-LLaVA-Framework darauf ab, die Forschung an LVLMs erschwinglicher zu machen, indem es die Fähigkeiten von MoE-Modellen nutzt.

MoE-LLaVA: Methode und Architektur

Im Kern besteht das MoE-LLaVA-Framework aus einer visuellen Projektionsschicht (Multilayer-Perceptron), einem Bildencoder, MoE-Blöcken, mehreren gestapelten LLM-Blöcken und einer Wort-Einbettungsschicht.

Architektur

Die folgende Tabelle fasst die detaillierten Konfigurationen des MoE-LLaVA-Frameworks zusammen.

Für ein gegebenes RGB-Bild verarbeitet der Bildencoder das Bild, um eine Sequenz von visuellen Token zu erhalten, und die visuelle Projektionsschicht kartiert die visuelle Token-Sequenz auf die Eingabebilder. Die Texteingaben werden von der Wort-Einbettungsschicht verarbeitet, die sie dann auf die Sequenz-Token projiziert. Gleichzeitig verbindet das MoE-LLaVA-Framework die Text- und visuellen Token und füttert sie in das LLM ein. Allerdings trainiert das Framework nur die visuelle Projektionsschicht mit dem großen Sprachmodell, das aus FFN oder Feed-Forward-Neural-Networks und Multi-Head-Self-Attention-Layer besteht. Schließlich wendet das Framework Rest-Verbindungen und Layer-Normalisierung auf jeden Block an.

Weiterhin repliziert das MoE-LLaVA-Framework das FFN oder Feed-Forward-Netzwerk mehrmals, um die Experten als Initialisierungsschritt zu bilden. Der Router, der eine lineare Schicht ist, prognostiziert die Wahrscheinlichkeit, dass jedes Token jedem Experten zugewiesen wird. Jedes Token wird von den Top-k-Experten mit der maximalen Wahrscheinlichkeit verarbeitet, und die gewichtete Summe wird auf der Grundlage des Softmax-Ergebnisses der Wahrscheinlichkeiten berechnet.

MoE-Tuning

MoE-Tuning ist eine einfache, aber effektive dreiphasige Trainingsstrategie, die zunächst ein MLP oder ein Multilayer-Perceptron trainiert, das die visuellen Token an ein großes Sprachmodell anpasst, in der ersten Phase. Das Framework trainiert dann alle Parameter des LLMs, um das große Vision-Sprachmodell mit allgemeinen multi-modalen Verständnisfähigkeiten zu befähigen. Schließlich trainiert das Framework in der dritten Phase die Mixture-of-Expert-Schichten, indem es das FFN oder Feed-Forward-Netzwerk als Initialisierungsgewichte für die Experten repliziert.

Stufe 1

In der ersten Stufe besteht das primäre Ziel darin, die Bildtoken an das große Sprachmodell anzupassen, um es zu ermöglichen, dass das LLM die Instanzen im Bild versteht. Das MoE-LLaVA-Framework verwendet ein Multilayer-Perceptron, um die Bildtoken in den Eingabebereich des großen Sprachmodells zu projizieren, und behandelt Bildpatches als Pseudo-Text-Token. In dieser Stufe trainiert das MoE-LLaVA-Framework das LLM, um die Bilder zu beschreiben, und wendet die MoE-Schichten nicht auf das LLM in dieser Stufe an.

Stufe 2

In der zweiten Stufe versucht das MoE-LLaVA, die Fähigkeiten und die Steuerbarkeit des Frameworks durch das Abstimmen des Modells mit multi-modalen Anweisungsdaten zu verbessern. Das MoE-LLaVA-Framework erreicht dies, indem es das LLM anpasst, um ein LVLM mit multi-modalen Verständnisfähigkeiten zu werden. Das Framework verwendet komplexere Anweisungen, einschließlich Texterkennung und logischer Bildbegründungsaufgaben, die erfordern, dass das Modell über stärkere multi-modale Fähigkeiten verfügt. Traditionell gilt der Trainingsprozess für dichte Modelle als abgeschlossen, wenn diese Stufe erreicht ist. Allerdings stieß das MoE-LLaVA-Framework auf Herausforderungen bei der Umwandlung des LLMs in ein LVLM und der gleichzeitigen Spärlichkeit des LVLMs. Um diese Herausforderung zu überwinden, verwendet das Framework die Gewichte aus der vorherigen Stufe als Initialisierung für die nächste Stufe, um die Lernschwierigkeit des sparsamen Modells zu erleichtern.

Stufe 3

In der dritten Stufe repliziert das Modell das Feed-Forward-Netzwerk mehrmals, um die Experten als Initialisierungsschritt zu bilden. Das Framework füttert dann die Text- und Bildtoken in die Mixture-of-Expert-Schichten ein, woraufhin der Router die Übereinstimmungsgewichte zwischen Experten und jedem Token berechnet. Jedes Token wird von den Top-k-Experten mit der maximalen Wahrscheinlichkeit verarbeitet, und die gewichtete Summe wird auf der Grundlage des Softmax-Ergebnisses der Wahrscheinlichkeiten berechnet. Sobald die Top-k-Experten aktiviert sind, schaltet das Modell die restlichen Experten aus, ein Ansatz, der das MoE-LLaVA-Framework mit unendlich vielen möglichen sparsamen Pfaden ausstattet und es damit mit einer Vielzahl von Fähigkeiten ausstattet.

MoE-LLaVA: Ergebnisse und Experimente

Das MoE-LLaVA-Framework verwendet CLIP-Large als Bildencoder und ein Multilayer-Perceptron mit zwei Schichten und einer GELU-Aktivierungsschicht, die die beiden Schichten trennt. Standardmäßig verwendet das Framework eine abwechselnde Ersetzung der Feed-Forward-Netzwerke durch die Mixture-of-Expert-Schichten, was bedeutet, dass die Mixture-of-Expert-Schichten 50 % der Gesamtzahl der Schichten ausmachen. Die folgende Tabelle enthält die verschiedenen Datensätze mit ihrer Stichprobengröße, die zum Trainieren und Auswerten des MoE-LLaVA-Frameworks verwendet werden.

Bildfragebeantwortung ohne Vorbildung

Die folgende Abbildung zeigt, dass MoE-LLaVA ein sparsames Modell mit einem weichen Router auf Basis von LVLM ist. Das Framework wird auf 5 Bildfragebeantwortungsbenchmarks ausgewertet, und wie es zu sehen ist, zeigt das MoE-LLaVA-Framework bemerkenswerte Bildverständnisfähigkeiten und liefert eine vergleichbare Leistung mit dem LLaVA 1.5-Framework auf fünf verschiedenen Benchmarks.

Objekt-Halluzinationsevaluierung

Um die Objekt-Halluzination zu bewerten, verwendet das MoE-LLaVA-Framework die POPE-Evaluierungspipeline, eine pollingbasierte Abfrage-Methode, und die Ergebnisse werden in der folgenden Tabelle gezeigt. Wie zu sehen ist, liefert das MoE-LLaVA-Framework von allen Frameworks die stärksten Ergebnisse, was auf die Fähigkeit des Frameworks hinweist, Objekte zu generieren, die mit dem Eingabebild konsistent sind. Darüber hinaus ist es erwähnenswert, dass das MoE-LLaVA-Framework das Ja-Verhältnis gut ausgleicht, was auf die Fähigkeit des sparsamen Modells hinweist, genaue Rückmeldungen für die gegebene Frage zu liefern.

Das folgende Bild enthält die Verteilung der Expertenlasten, wobei die unterbrochenen Linien eine gut ausgewogene Verteilung der Token zwischen den Modalitäten oder Experten darstellen. Die erste Abbildung zeigt die Arbeitslast innerhalb der Experten, während die restlichen Bilder die Leistung der Experten in Bezug auf verschiedene Modalitäten zeigen.

Darüber hinaus zeigt das folgende Bild die Verteilung der Modalitäten über verschiedene Experten.

Schlussgedanken

In diesem Artikel haben wir über MoE-LLaVA gesprochen, ein Basismodell für große Vision-Sprachmodelle mit Mixture-of-Expert-Modellen, das lernbare Router und MoE-Modelle integriert. Im Kern besteht das MoE-LLaVA-Modell aus mehreren sparsamen Pfaden, und das Framework verwendet diese Pfade, um jeden Token an verschiedene Experten durch den lernbaren Router zu senden. Die Token werden dann kollektiv von den aktivierten Experten verarbeitet, während die inaktiven Pfade still gehalten werden. Das Framework stapelt dann die Mixture-of-Expert-Encoder-Schichten iterativ, um einen sparsamen Pfad zu einem größeren und leistungsfähigeren LVLM zu bieten. Die MoE-Tuning-Strategie adressiert das häufige Problem der Leistungsverschlechterung bei multi-modalen Spärlichkeitslernprozessen innovativ, indem es ein Modell mit einer erheblich großen Anzahl von Parametern, aber konsistenten Trainings- und Inferenzkosten, konstruiert. Die Architektur des MoE-LLaVA-Frameworks wurde so konzipiert, dass sie nur die Top-k-Experten während der Bereitstellung aktiviert und die restlichen Experten inaktiv hält.

Kunal Kejriwal ist Backend‑Entwickler und spezialisiert auf Python, PostgreSQL, Redis sowie Cloud‑Infrastruktur auf GCP und AWS. Mit drei Jahren Erfahrung im Aufbau und Skalieren von Produktionssystemen schreibt er über KI‑Infrastruktur, verteilte Systeme und die Architektur hinter der Bereitstellung von Machine‑Learning‑Arbeitslasten.