Modèles et plateformes d’IA

Uni-MoE : Mettre à l’échelle des modèles de langage multimodaux unifiés avec un mélange d’experts

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les récentes avancées dans l’architecture et les performances des modèles de langage multimodaux (MLLM) ont mis en évidence l’importance de données et de modèles évolutifs pour améliorer les performances. Bien que cette approche améliore les performances, elle entraîne des coûts computationnels substantiels qui limitent la praticité et l’utilité de ces approches. Au fil des ans, les modèles de mélange d’experts (MoE) sont apparus comme une approche alternative réussie pour mettre à l’échelle les modèles d’image-texte et les modèles de langage de manière efficace, car les modèles de mélange d’experts ont des coûts computationnels nettement inférieurs et de fortes performances. Cependant, malgré leurs avantages, les modèles de mélange d’experts ne sont pas l’approche idéale pour mettre à l’échelle les modèles de langage, car ils impliquent souvent moins d’experts et des modalités limitées, ce qui limite les applications.

Pour contrer les obstacles rencontrés par les approches actuelles et pour mettre à l’échelle les modèles de langage de manière efficace, dans cet article, nous allons discuter de Uni-MoE, un modèle de langage multimodal unifié avec une architecture de mélange d’experts (MoE) capable de gérer un large éventail de modalités et d’experts. Le cadre Uni-MoE met également en œuvre une architecture de mélange d’experts épars dans les modèles de langage pour tenter de rendre le processus d’entraînement et d’inférence plus efficace en employant un parallélisme de modèle et de données au niveau de l’expert. De plus, pour améliorer la généralisation et la collaboration multi-experts, le cadre Uni-MoE présente une stratégie d’entraînement progressive qui est une combinaison de trois processus différents. Dans le premier, le cadre Uni-MoE réalise l’alignement cross-modalité en utilisant divers connecteurs avec différents données cross-modales. Deuxièmement, le cadre Uni-MoE active la préférence des composants experts en formant des experts spécifiques à la modalité avec des données d’instruction cross-modales. Enfin, le modèle Uni-MoE met en œuvre la technique d’apprentissage LoRA (Low-Rank Adaptation) sur des données d’instruction multimodales mélangées pour ajuster le modèle. Lorsque le cadre Uni-MoE ajusté a été évalué sur un ensemble complet de jeux de données multimodaux, les résultats expérimentaux extensifs ont mis en évidence le principal avantage du cadre Uni-MoE pour réduire les biais de performance dans le traitement de jeux de données multimodaux mélangés de manière significative. Les résultats ont également indiqué une amélioration significative de la collaboration multi-experts et de la généralisation.

Cet article vise à couvrir le cadre Uni-MoE en profondeur, et nous explorons le mécanisme, la méthodologie, l’architecture du cadre ainsi que sa comparaison avec les cadres de l’état de l’art. Alors, commençons.

Uni-MoE : Mettre à l’échelle des modèles de langage multimodaux unifiés

L’avènement de modèles de langage multimodaux open source, notamment LLama et InstantBlip, a souligné le succès notable et les progrès réalisés dans les tâches impliquant la compréhension d’images et de textes au cours des dernières années. De plus, la communauté de l’IA travaille activement à la construction d’un modèle de langage multimodal unifié qui pourrait accueillir un large éventail de modalités, notamment des images, du texte, de l’audio, de la vidéo et plus, allant au-delà du paradigme traditionnel image-texte. Une approche courante suivie par la communauté open source pour améliorer les capacités des modèles de langage multimodaux consiste à augmenter la taille des modèles de fondation de vision et à les intégrer avec des modèles de langage de grande taille dotés de milliards de paramètres, et à utiliser des jeux de données multimodaux diversifiés pour améliorer l’ajustement des instructions. Ces développements ont mis en évidence la capacité croissante des modèles de langage multimodaux à raisonner et à traiter plusieurs modalités, soulignant l’importance de l’expansion des données d’instruction multimodales et de la mise à l’échelle des modèles.

Bien que la mise à l’échelle d’un modèle soit une approche éprouvée qui donne des résultats substantiels, la mise à l’échelle d’un modèle est un processus computationnellement coûteux pour les processus d’entraînement et d’inférence.

Pour contrer le problème des coûts computationnels élevés, la communauté open source se tourne vers l’intégration de l’architecture de mélange d’experts (MoE) dans les modèles de langage pour améliorer l’efficacité de l’entraînement et de l’inférence. Contrairement aux modèles de langage multimodaux et aux modèles de langage qui utilisent tous les paramètres disponibles pour traiter chaque entrée, ce qui aboutit à une approche computationnelle dense, l’architecture de mélange d’experts n’exige que l’activation d’un sous-ensemble de paramètres d’experts pour chaque entrée. Par conséquent, l’approche de mélange d’experts émerge comme une voie viable pour améliorer l’efficacité des grands modèles sans activation extensive de paramètres et sans coûts computationnels élevés. Bien que les travaux existants aient souligné la mise en œuvre réussie et l’intégration de modèles de mélange d’experts dans la construction de modèles de langage texte-seulement et texte-image, les chercheurs n’ont pas encore pleinement exploré le potentiel de développement de l’architecture de mélange d’experts pour construire des modèles de langage multimodaux unifiés puissants.

Uni-MoE est un modèle de langage multimodal qui utilise des modèles de mélange d’experts épars pour interpréter et gérer plusieurs modalités dans le but d’explorer la mise à l’échelle de modèles de langage multimodaux unifiés avec l’architecture de mélange d’experts. Comme le montre l’image suivante, le cadre Uni-MoE obtient d’abord le codage de différentes modalités à l’aide d’encodeurs spécifiques à la modalité, puis mappe ces codages dans l’espace de représentation linguistique des modèles de langage à l’aide de connecteurs conçus. Ces connecteurs contiennent un modèle de transformateur entraînable avec des projections linéaires consécutives pour distiller et projeter les représentations de sortie de l’encodeur figé. Le cadre Uni-MoE introduit ensuite des couches de mélange d’experts éparses dans le bloc interne du modèle de langage dense. Chaque bloc basé sur le mélange d’experts comporte une couche d’auto-attention partagée applicable à toutes les modalités, un routeur épars pour allouer l’expertise au niveau du jeton, et des experts divers basés sur le réseau feedforward. Grâce à cette approche, le cadre Uni-MoE est capable de comprendre plusieurs modalités, notamment la parole, l’audio, le texte, la vidéo, l’image, et n’exige que l’activation de paramètres partiels pendant l’inférence.

De plus, pour améliorer la collaboration multi-experts et la généralisation, le cadre Uni-MoE met en œuvre une stratégie d’entraînement en trois étapes. Dans la première étape, le cadre utilise des paires image/son-langage étendues pour former le connecteur correspondant en raison de la représentation unifiée de la modalité dans l’espace linguistique du modèle de langage. Deuxièmement, le modèle Uni-MoE forme des experts spécifiques à la modalité en employant des jeux de données cross-modales séparément dans le but de raffiner la compétence de chaque expert dans son domaine respectif. Dans la troisième étape, le cadre Uni-MoE intègre ces experts formés dans la couche de mélange d’experts du modèle de langage, et forme l’ensemble du cadre Uni-MoE avec des données d’instruction multimodales mélangées. Pour réduire le coût de formation encore plus, le cadre Uni-MoE emploie l’approche d’apprentissage LoRA pour affiner ces couches d’auto-attention et les experts pré-formés.

Uni-MoE : Méthodologie et Architecture

La motivation de base derrière le cadre Uni-MoE est le coût élevé de formation et d’inférence des modèles de langage multimodaux, ainsi que l’efficacité des modèles de mélange d’experts, et explore la possibilité de créer un modèle de langage multimodal unifié efficace, puissant et utilisant l’architecture de mélange d’experts. La figure suivante présente une représentation de l’architecture mise en œuvre dans le cadre Uni-MoE, montrant la conception qui inclut des encodeurs individuels pour différentes modalités, c’est-à-dire l’audio, la parole et les visuels, ainsi que leurs connecteurs respectifs.

Le cadre Uni-MoE intègre ensuite l’architecture de mélange d’experts avec les blocs de base du modèle de langage, un processus crucial pour améliorer l’efficacité globale des processus d’entraînement et d’inférence. Le cadre Uni-MoE réalise cela en mettant en œuvre un mécanisme de routage épars. Le processus d’entraînement global du cadre Uni-MoE peut être divisé en trois phases : l’alignement cross-modalité, la formation d’experts spécifiques à la modalité et l’ajustement de Uni-MoE à l’aide d’un ensemble diversifié de jeux de données d’instruction multimodales. Pour transformer efficacement les entrées modales diverses en un format linguistique, le cadre Uni-MoE est construit sur la base de LLaVA, un cadre de langage visuel pré-formé. Le modèle de base LLaVA intègre CLIP comme encodeur visuel, ainsi qu’une couche de projection linéaire qui convertit les caractéristiques d’image en jetons d’image douce. De plus, pour traiter le contenu vidéo, le cadre Uni-MoE sélectionne huit cadres représentatifs de chaque vidéo et les transforme en jetons vidéo en effectuant un poolage moyen pour agréger leur représentation basée sur l’image ou le cadre. Pour les tâches audio, le cadre Uni-MoE déploie deux encodeurs, BEATs et l’encodeur Whisper, pour améliorer l’extraction de caractéristiques. Le modèle distille ensuite les caractéristiques audio et les discours à longueur fixe, et les mappe en jetons de parole et en audio doux via une couche de projection linéaire.

Stratégie d’Entraînement

Le cadre Uni-MoE introduit une stratégie d’entraînement progressive pour le développement incrémental du modèle. La stratégie d’entraînement progressive visait à exploiter les capacités distinctes de divers experts, à améliorer l’efficacité de la collaboration multi-experts et à renforcer la généralisabilité globale du cadre. Le processus d’entraînement est divisé en trois étapes dans le but de concrétiser la structure MLLM construite sur le mélange d’experts intégrés.

Étape 1 : Alignement Cross-Modalité

Dans la première étape, le cadre Uni-MoE tente d’établir une connectivité entre différentes linguistiques et modalités. Le cadre Uni-MoE réalise cela en traduisant les données modales en jetons doux en construisant des connecteurs. L’objectif principal de la première étape d’entraînement est de minimiser la perte d’entropie générative. Dans le cadre Uni-MoE, le modèle de langage est optimisé pour générer des descriptions pour les entrées à travers différentes modalités, et le modèle ne soumet les connecteurs à la formation, une stratégie qui permet au cadre Uni-MoE d’intégrer différentes modalités dans un cadre linguistique unifié.

Étape 2 : Formation d’Experts Spécifiques à la Modalité

Dans la deuxième étape, le cadre Uni-MoE se concentre sur le développement d’experts à une modalité unique en formant le modèle dédié à des données cross-modales spécifiques. L’objectif principal est de raffiner la compétence de chaque expert dans son domaine respectif, améliorant ainsi les performances globales du système de mélange d’experts sur un large éventail de données multimodales. De plus, le cadre Uni-MoE adapte les réseaux feedforward pour s’aligner plus étroitement sur les caractéristiques de la modalité, tout en maintenant la perte d’entropie générative comme mesure de formation ciblée.

Étape 3 : Ajustement de Uni-MoE

Dans la troisième et dernière étape, le cadre Uni-MoE intègre les poids ajustés par les experts pendant l’étape 2 dans les couches de mélange d’experts. Le cadre Uni-MoE ajuste ensuite les MLLM en utilisant des données d’instruction multimodales mélangées de manière conjointe. Les courbes de perte dans l’image suivante reflètent la progression du processus d’entraînement.

L’analyse comparative entre les configurations du mélange d’experts a révélé que les experts que le modèle a raffinés pendant la deuxième étape d’entraînement ont présenté une stabilité améliorée et ont atteint une convergence plus rapide sur les jeux de données multimodaux mélangés. De plus, sur les tâches impliquant des données multimodales complexes, notamment le texte, les images, l’audio et les vidéos, le cadre Uni-MoE a démontré des performances de formation plus cohérentes et une variabilité de perte réduite lorsqu’il a employé quatre experts par rapport à deux experts.

Uni-MoE : Expériences et Résultats

Le tableau suivant résume les spécifications architecturales du cadre Uni-MoE. L’objectif principal du cadre Uni-MoE, construit sur l’architecture LLaMA-7B, est de mettre à l’échelle la taille du modèle.

Le tableau suivant résume la conception et l’optimisation du cadre Uni-MoE, guidées par des tâches d’entraînement spécialisées. Ces tâches sont instrumentales pour raffiner les capacités des couches MLP, en exploitant ainsi leurs connaissances spécialisées pour améliorer les performances du modèle. Le cadre Uni-MoE entreprend huit tâches d’experts à une modalité unique pour élucider les impacts différents des diverses méthodologies d’entraînement.

Le modèle évalue les performances de diverses variantes de modèles sur un ensemble diversifié de références qui englobe deux tâches de compréhension de vidéos, trois tâches de compréhension audio et cinq tâches liées à la parole. Tout d’abord, le modèle est testé sur sa capacité à comprendre les tâches de parole-image et de parole-texte, et les résultats sont contenus dans le tableau suivant.

Comme on peut l’observer, les modèles de référence précédents livrent des résultats inférieurs sur les tâches de compréhension de la parole, ce qui affecte les performances sur les tâches de raisonnement image-parole. Les résultats indiquent que l’introduction de l’architecture de mélange d’experts peut améliorer la généralisabilité des MLLM sur les tâches de raisonnement audio-image non vues de manière significative. Les résultats ont également indiqué une amélioration significative de la collaboration multi-experts et de la généralisation.

Pensées Finales

Dans cet article, nous avons discuté de Uni-MoE, un modèle de langage multimodal unifié avec une architecture de mélange d’experts (MoE) capable de gérer un large éventail de modalités et d’experts. Le cadre Uni-MoE met également en œuvre une architecture de mélange d’experts épars dans les modèles de langage pour tenter de rendre le processus d’entraînement et d’inférence plus efficace en employant un parallélisme de modèle et de données au niveau de l’expert. De plus, pour améliorer la généralisation et la collaboration multi-experts, le cadre Uni-MoE présente une stratégie d’entraînement progressive qui est une combinaison de trois processus différents. Dans le premier, le cadre Uni-MoE réalise l’alignement cross-modalité en utilisant divers connecteurs avec différents données cross-modales. Deuxièmement, le cadre Uni-MoE active la préférence des composants experts en formant des experts spécifiques à la modalité avec des données d’instruction cross-modales. Enfin, le modèle Uni-MoE met en œuvre la technique d’apprentissage LoRA (Low-Rank Adaptation) sur des données d’instruction multimodales mélangées pour ajuster le modèle.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.