Modèles et plateformes d’IA

MoE-LLaVA : Mélange d’experts pour les grands modèles de vision et de langage

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les récentes avancées dans les grands modèles de vision et de langage (LVLM) ont montré que l’augmentation de l’échelle de ces cadres améliore considérablement les performances dans une variété de tâches en aval. Les LVLM, notamment MiniGPT, LLaMA et d’autres, ont atteint des capacités remarquables en intégrant des couches de projection visuelles et un encodeur d’image dans leur architecture. En mettant en œuvre ces composants, les LVLM améliorent les capacités de perception visuelle des grands modèles de langage (LLM). Les performances peuvent être encore améliorées en augmentant la taille du modèle et le nombre de paramètres, ainsi qu’en élargissant l’échelle des données.

Des modèles comme InternVL ont élargi leur encodeur d’image à plus de 6 milliards de paramètres, tandis que d’autres ont étendu le backend des LVLM à 13 milliards de paramètres, atteignant des performances supérieures dans une large gamme de tâches. IDEFICS a formé un LVLM avec plus de 80 milliards de paramètres. Ces méthodes d’augmentation de l’échelle ont égalé ou dépassé les performances des LLM pré-entraînés sur plus de 34, 70 ou même 100 milliards de paramètres. Cependant, l’augmentation de l’échelle a un inconvénient : elle augmente considérablement les coûts de formation et d’inférence. En effet, cela nécessite que tous les paramètres soient actifs pour chaque jeton dans le calcul, ce qui entraîne des besoins computationnels élevés et, par conséquent, des coûts plus élevés.

Cet article traite de MoE-LLaVA, une architecture de modèle de vision et de langage basée sur un mélange d’experts (MoE) qui emploie une stratégie de formation efficace, MoE-Tuning, pour les LVLM. MoE-Tuning aborde de manière innovante la dégradation des performances dans l’apprentissage de la parcimonie multi-modale, aboutissant à un modèle avec un grand nombre de paramètres mais des coûts de formation et d’inférence constants. L’architecture de MoE-LLaVA est conçue pour activer uniquement les meilleurs experts pendant le déploiement, en gardant les autres experts inactifs.

Nous allons explorer le cadre de MoE-LLaVA, en examinant son mécanisme, sa méthodologie, son architecture et comment il se compare aux principaux cadres de génération d’images et de vidéos.

MoE-LLaVA : Mettre à l’échelle les grands modèles de vision et de langage de manière abordable

En plus d’utiliser des couches de projection visuelles et des encodeurs d’images, les grands modèles de vision et de langage augmentent également la taille du modèle en augmentant le nombre de paramètres pour améliorer les performances du modèle. Certains exemples notables de grands modèles de vision et de langage qui ont suivi cette approche pour améliorer leurs performances sont MiniGPT-4, InternGPT, InternVL et d’autres. Dans les applications réelles, l’augmentation de la taille d’un grand modèle de langage ou d’un grand modèle de vision et de langage avec des données de formation de haute qualité devient souvent une nécessité pour améliorer les performances du modèle. Bien que l’augmentation de la taille du modèle améliore les performances, elle augmente également les coûts computationnels de formation et de déploiement du modèle, et augmente encore les complications et l’efficacité du déploiement du modèle sur des appareils parallèles simultanément. Une raison majeure derrière l’augmentation des coûts de formation et d’inférence, ainsi que des exigences computationnelles, est que chaque jeton dans le cadre nécessite un calcul avec chaque paramètre unique dans le modèle, appelé modèle dense.

D’un autre côté, les modèles MoE ou les modèles d’experts parcimonieux ont démontré une mise à l’échelle efficace des cadres en traitant les données à l’aide de paramètres activés fixes, une approche qui a été largement adoptée dans le domaine du traitement du langage naturel. Cependant, utiliser un mélange d’experts pour former directement des grands modèles de vision et de langage parcimonieux est difficile, car la conversion des LLM en LVLM et la parcimonie du modèle simultanément entraînent une dégradation significative des performances. Pour mettre en œuvre un mélange de modèles pour mettre à l’échelle les LLM et les LVLM, il est essentiel de initialiser d’abord le LVLM pour la parcimonie. Pour atteindre cet objectif, le cadre de MoE-LLaVA introduit MoE-Tuning, une stratégie de formation simple mais efficace en trois phases.

Comme le montre la figure ci-dessus, le processus de MoE-Tuning forme d’abord un MLP ou un perceptron multi-couche qui adapte les jetons visuels à un grand modèle de langage dans la première phase. Le cadre forme ensuite l’ensemble des paramètres du LLM pour pré-équiper le grand modèle de vision et de langage avec des capacités de compréhension multi-modale générales. Enfin, dans la troisième phase, le cadre réplique le FFN ou le réseau de neurones à propagation avant comme les poids d’initialisation pour les experts, et forme uniquement les couches de mélange d’experts. Dans l’ensemble, le processus de formation aide à la transition progressive du modèle parcimonieux de l’initialisation du LVLM à un mélange de modèles d’experts parcimonieux.

Avec le processus de formation couvert, éclairons un peu MoE-LLaVA, une base pour les grands modèles de vision et de langage avec des modèles d’experts qui incorporent des routeurs apprenables et des modèles MoE. Au cœur du modèle MoE-LLaVA, il y a plusieurs chemins parcimonieux, et le cadre utilise ces chemins pour acheminer chaque jeton vers différents experts via le routeur apprenable. Les jetons sont ensuite traités collectivement par les experts activés, tandis que les chemins inactifs restent silencieux. Le cadre empile ensuite les couches d’encodeur de mélange d’experts de manière itérative pour fournir un chemin parcimonieux vers un LVLM plus grand et plus puissant.

Grâce à l’approche mise en œuvre par le cadre de MoE-LLaVA, il est capable de surpasser les modèles avec un nombre similaire de paramètres activés, et de les dépasser avec une grande différence sur le benchmark de hallucination d’objets POPE, malgré avoir seulement 2,2 milliards de paramètres. De plus, le cadre de MoE-LLaVA avec 2,2 milliards de paramètres est capable d’atteindre des performances comparables au cadre InternVL-Chat-19B avec presque 8 fois le nombre de paramètres activés.

Des grands modèles de langage puissants avec de fortes capacités de généralisation et de suivi d’instructions ont été mis en œuvre pour les grands modèles de vision et de langage. Les premiers LLM, tels que BLIP, ont codé des signaux visuels dans une séquence de jetons visuels, leur permettant d’adapter la vision aux LLM avec succès en utilisant plusieurs couches de projection. Dans le même temps, les travaux récents se concentrent sur l’amélioration des performances du modèle en mettant en œuvre des méthodes telles que l’expansion du jeu de données d’ajustement des instructions, l’augmentation de la résolution de l’image, l’optimisation des stratégies de formation, l’alignement des entrées, l’amélioration des encodeurs d’images et bien plus encore. Ces approches ont aidé à doter les LVLM de puissantes capacités de compréhension visuelle en élargissant le jeu de données de formation et d’ajustement des instructions visuelles et en augmentant l’échelle du modèle. De plus, certains LVLM possèdent également des capacités de compréhension d’images fines, telles que la compréhension de régions et de multi-régions, ainsi que des capacités de mise au sol de pixels. Cependant, le coût computationnel qui accompagne l’augmentation de l’échelle des données visuelles denses et des modèles est souvent très élevé, ce qui le rend difficile à mettre en œuvre. D’un autre côté, le cadre de MoE-LLaVA vise à rendre la recherche sur les LVLM plus abordable en exploitant les capacités des modèles MoE.

MoE-LLaVA : Méthode et architecture

Au cœur du cadre de MoE-LLaVA, il y a une couche de projection visuelle (perceptron multi-couche), un encodeur de vision, des blocs MoE, plusieurs blocs LLM empilés et une couche d’intégration de mots.

Architecture

Le tableau suivant résume les configurations détaillées du cadre de MoE-LLaVA.

Pour une image RGB donnée, l’encodeur de vision traite les images pour obtenir une séquence de jetons visuels avec une couche de projection visuelle qui mappe la séquence de jetons visuels aux images d’entrée. Les entrées de texte sont traitées par la couche d’intégration de mots qui les projette pour obtenir la séquence de jetons. Dans le même temps, le cadre de MoE-LLaVA relie les jetons de texte et les jetons visuels ensemble, et les alimente au LLM. Cependant, le cadre ne forme que la couche de projection visuelle avec le grand modèle de langage composé de FFN ou de couches d’auto-attention multi-tête. Enfin, le cadre applique des connexions résiduelles et une normalisation de couche à chaque bloc.

Ensuite, le cadre de MoE-LLaVA réplique le FFN ou le réseau de neurones à propagation avant à plusieurs reprises pour former un ensemble d’experts comme étape d’initialisation. Le routeur, qui est une couche linéaire, prédit la probabilité de chaque jeton étant affecté à chaque expert. Chaque jeton est traité par les meilleurs experts avec la somme pondérée calculée en fonction du résultat softmax des probabilités. Une fois les meilleurs experts activés, le modèle ferme les experts restants, une approche qui dote le cadre de MoE-LLaVA de chemins parcimonieux possibles infinis, dotant ainsi le modèle d’une large gamme de capacités.

MoE-Tuning

MoE-Tuning est une stratégie de formation simple mais efficace en trois phases qui forme d’abord un MLP ou un perceptron multi-couche qui adapte les jetons visuels à un grand modèle de langage dans la première phase. Le cadre forme ensuite l’ensemble des paramètres du LLM pour pré-équiper le grand modèle de vision et de langage avec des capacités de compréhension multi-modale générales. Enfin, dans la troisième phase, le cadre réplique le FFN ou le réseau de neurones à propagation avant comme les poids d’initialisation pour les experts, et forme uniquement les couches de mélange d’experts.

Étape 1

Dans la première phase, l’objectif principal est d’adapter les jetons d’images au grand modèle de langage qui permet au LLM de comprendre les instances dans l’image. Le cadre de MoE-LLaVA utilise un perceptron multi-couche pour projeter les jetons d’images dans le domaine d’entrée du grand modèle de langage, et traite les patches d’images comme des jetons de texte pseudo. Dans cette phase, le cadre de MoE-LLaVA forme le LLM pour décrire les images, et n’applique pas les couches MoE au LLM pendant cette phase.

Étape 2

Dans la deuxième phase, le cadre de MoE-LLaVA tente d’améliorer les capacités et la contrôlabilité du cadre en l’ajustant avec des données d’instruction multi-modales. Le cadre de MoE-LLaVA atteint cet objectif en ajustant le LLM pour le transformer en un LVLM avec des capacités de compréhension multi-modale. Le cadre utilise des instructions plus complexes, notamment la reconnaissance de texte et les tâches de raisonnement logique d’images qui nécessitent que le modèle possède des capacités multi-modales plus solides. Traditionnellement, le processus de formation pour les modèles denses est considéré comme terminé à cette étape. Cependant, le cadre de MoE-LLaVA a rencontré des défis pour transformer le LLM en un LVLM simultanément avec la parcimonie du LVLM. Pour contrer ce défi, le cadre utilise les poids de la phase comme initialisation pour la phase suivante dans une tentative pour alléger la difficulté d’apprentissage du modèle parcimonieux.

Étape 3

Dans la troisième phase, le modèle réplique le réseau de neurones à propagation avant à plusieurs reprises pour initialiser les experts comme étape d’initialisation. Le cadre alimente ensuite les jetons de texte et les jetons d’images dans les couches de mélange d’experts, après quoi le routeur calcule les poids de correspondance entre les experts et chaque jeton. Chaque jeton est ensuite traité par les meilleurs experts avec la somme pondérée calculée en fonction des poids du routeur. Une fois les meilleurs experts activés, le modèle ferme les experts restants, une approche qui dote le cadre de MoE-LLaVA de chemins parcimonieux possibles infinis, dotant ainsi le modèle d’une large gamme de capacités.

MoE-LLaVA : Résultats et expériences

Le cadre de MoE-LLaVA adopte CLIP-Large comme encodeur de vision avec le perceptron multi-couche composé de deux couches avec une couche d’activation GELU séparant les deux. Par défaut, le cadre utilise un remplacement alternatif des réseaux de neurones à propagation avant avec les couches de mélange d’experts, ce qui signifie que les couches de mélange d’experts constituent 50% du nombre total de couches. Le tableau suivant contient les différents jeux de données avec leur taille d’échantillon utilisés pour former et évaluer le cadre de MoE-LLaVA.

Question-réponse d’image sans entraînement

La figure suivante démontre que MoE-LLaVA est un modèle parcimonieux avec un routeur basé sur LVLM. Le cadre est évalué sur 5 benchmarks de question-réponse d’images, et comme on peut l’observer, le cadre de MoE-LLaVA démontre des capacités remarquables de compréhension d’images, et offre des performances comparables au cadre LLaVA 1.5 sur cinq benchmarks différents.

Évaluation de l’hallucination d’objets

Pour évaluer l’hallucination d’objets, le cadre de MoE-LLaVA adopte le pipeline d’évaluation POPE, une méthode de requête basée sur le vote, et les résultats sont présentés dans le tableau suivant. Comme on peut l’observer, parmi tous les cadres, le cadre de MoE-LLaVA offre les résultats les plus forts, indiquant la capacité du cadre à générer des objets cohérents avec l’image d’entrée. De plus, il est important de noter que le cadre de MoE-LLaVA équilibre bien le rapport de oui, indiquant la capacité du modèle parcimonieux à fournir des rétroactions précises pour la question donnée.

La figure suivante contient la distribution des charges d’experts, où les lignes discontinues représentent une distribution bien équilibrée des jetons entre les modalités ou les experts. La première figure illustre la charge de travail à l’intérieur des experts, tandis que les images restantes démontrent les performances des experts pour différentes modalités.

De plus, la figure suivante démontre la distribution des modalités à travers différents experts.

Pensées finales

Dans cet article, nous avons parlé de MoE-LLaVA, une base pour les grands modèles de vision et de langage avec des modèles d’experts qui incorporent des routeurs apprenables et des modèles MoE. Au cœur du modèle MoE-LLaVA, il y a plusieurs chemins parcimonieux, et le cadre utilise ces chemins pour acheminer chaque jeton vers différents experts via le routeur apprenable. Les jetons sont ensuite traités collectivement par les experts activés, tandis que les chemins inactifs restent silencieux. Le cadre empile ensuite les couches d’encodeur de mélange d’experts de manière itérative pour fournir un chemin parcimonieux vers un LVLM plus grand et plus puissant. La stratégie de MoE-Tuning aborde de manière innovante la dégradation des performances dans l’apprentissage de la parcimonie multi-modale, aboutissant à un modèle avec un grand nombre de paramètres mais des coûts de formation et d’inférence constants. L’architecture du cadre de MoE-LLaVA a été conçue pour activer uniquement les meilleurs experts pendant le déploiement, en gardant les autres experts inactifs.

Kunal Kejriwal est ingénieur backend spécialisé en Python, PostgreSQL, Redis et en infrastructure cloud sur GCP et AWS. Fort de trois ans d'expérience dans la construction et la mise à l'échelle de systèmes de production, il écrit sur l'infrastructure IA, les systèmes distribués et l'architecture du déploiement des charges de travail d'apprentissage automatique.