Modèles et plateformes d’IA

Le dernier modèle Mixture of Experts (MoE) 8x7B de Mistral AI

mm
Ajouter Unite.AI à vos sources préférées sur Google

Mistral AI

qui est une startup de modèles open-source basée à Paris, a remis en question les normes en lançant son dernier modèle de langage (LLM), MoE 8x7B, via un simple lien torrent. Cela contraste avec l’approche traditionnelle de Google (GOOGL ) avec leur sortie de Gemini, suscitant des conversations et de l’excitation au sein de la communauté de l’IA.

L’approche de Mistral AI en matière de sorties a toujours été non conventionnelle. Souvent, elle renonce aux accompagnements habituels de documents de recherche, de blogs ou de communiqués de presse, et sa stratégie a été unique et efficace pour capter l’attention de la communauté de l’IA.

Récemment, l’entreprise a réalisé une valorisation remarquable de $2 milliards suite à un cycle de financement mené par Andreessen Horowitz. Ce cycle de financement a été historique, établissant un record avec un cycle de démarrage de 118 millions de dollars, le plus important de l’histoire européenne. Au-delà des succès en matière de financement, Mistral AI s’implique activement dans les discussions autour de la loi européenne sur l’IA, plaidant pour une réglementation réduite dans l’IA open-source.

Pourquoi MoE 8x7B attire l’attention

Decrit comme un “GPT-4 réduit”, Mixtral 8x7B utilise un cadre de Mixture of Experts (MoE) avec huit experts. Chaque expert dispose de 111 milliards de paramètres, couplés avec 55 milliards de paramètres d’attention partagés, pour un total de 166 milliards de paramètres par modèle. Ce choix de conception est important car il permet à seulement deux experts de participer à l’inférence de chaque jeton, mettant en évidence un déplacement vers un traitement de l’IA plus efficace et plus ciblé.

L’un des points forts de Mixtral est sa capacité à gérer un contexte étendu de 32 000 jetons, offrant un large champ d’action pour la gestion de tâches complexes. Les capacités multilingues du modèle incluent un support robuste pour l’anglais, le français, l’italien, l’allemand et l’espagnol, répondant aux besoins d’une communauté de développeurs mondiaux.

La pré-formation de Mixtral implique des données provenant du Web ouvert, avec une approche d’entraînement simultané pour les experts et les routeurs. Cette méthode garantit que le modèle n’est pas seulement vaste dans son espace de paramètres, mais également finement réglé pour les nuances des données auxquelles il a été exposé.

Mixtral 8x7B obtient un score impressionnant

Mixtral 8x7B obtient un score impressionnant

Mixtral 8x7B surpasse LLaMA 2 70B et rivalise avec GPT-3.5, en particulier dans la tâche MBPP avec un taux de réussite de 60,7 %, nettement supérieur à celui de ses homologues. Même dans la tâche rigoureuse MT-Bench conçue pour les modèles de suivi d’instructions, Mixtral 8x7B obtient un score impressionnant, presque égal à celui de GPT-3.5

Comprendre le cadre de Mixture of Experts (MoE)

Le modèle de Mixture of Experts (MoE), qui a récemment attiré l’attention en raison de son incorporation dans les modèles de langage de pointe comme MoE 8x7B de Mistral AI, repose en fait sur des concepts fondamentaux qui remontent à plusieurs années. Revisons les origines de cette idée à travers des documents de recherche seminaux.

Le concept de MoE

La Mixture of Experts (MoE) représente un changement de paradigme dans l’architecture des réseaux de neurones. Contrairement aux modèles traditionnels qui utilisent un réseau homogène unique pour traiter tous les types de données, MoE adopte une approche plus spécialisée et modulaire. Il se compose de plusieurs réseaux d’experts, chacun conçu pour gérer des types de données ou des tâches spécifiques, supervisés par un réseau de gestion qui dirige dynamiquement les données d’entrée vers l’expert le plus approprié.

Une couche de Mixture of Experts (MoE) intégrée dans un modèle de langage récurrent

Une couche de Mixture of Experts (MoE) intégrée dans un modèle de langage récurrent (Source)

 

L’image ci-dessus présente une vue d’ensemble d’une couche MoE intégrée dans un modèle de langage. En son essence, la couche MoE se compose de plusieurs sous-réseaux feed-forward, appelés experts, chacun ayant le potentiel de se spécialiser dans le traitement de différents aspects des données. Un réseau de gestion, mis en évidence dans le diagramme, détermine quel ensemble d’experts est engagé pour une entrée donnée. Cette activation conditionnelle permet au réseau d’augmenter considérablement sa capacité sans une augmentation correspondante de la demande de calcul.

Fonctionnalité de la couche MoE

En pratique, le réseau de gestion évalue l’entrée (notée G(x) dans le diagramme) et sélectionne un ensemble restreint d’experts pour la traiter. Cette sélection est modulée par les sorties du réseau de gestion, déterminant effectivement la « voix » ou la contribution de chaque expert à la sortie finale. Par exemple, comme le montre le diagramme, seuls deux experts peuvent être choisis pour calculer la sortie pour chaque jeton d’entrée spécifique, rendant le processus efficace en concentrant les ressources de calcul où elles sont le plus nécessaires.

 

Encodeur Transformer avec des couches MoE (Source)

La deuxième illustration ci-dessus contraste un encodeur Transformer traditionnel avec un encodeur augmenté d’une couche MoE. L’architecture Transformer, largement connue pour son efficacité dans les tâches liées au langage, se compose traditionnellement de couches d’auto-attention et de couches feed-forward empilées en séquence. L’introduction de couches MoE remplace certaines de ces couches feed-forward, permettant au modèle de s’étendre en termes de capacité de manière plus efficace.

Dans le modèle augmenté, les couches MoE sont réparties sur plusieurs appareils, mettant en évidence une approche parallèle de modèle. Cela est crucial lors de l’étalonnage de modèles très grands, car cela permet de répartir la charge de calcul et les exigences de mémoire sur un cluster d’appareils, tels que des GPU ou des TPU. Cette répartition est essentielle pour former et déployer des modèles avec des milliards de paramètres de manière efficace, comme en témoigne la formation de modèles avec des centaines de milliards à plus d’un trillion de paramètres sur des clusters de calcul à grande échelle.

L’approche MoE éparse avec l’ajustement d’instruction sur les LLM

L’article intitulé “Mixture of Experts (MoE) éparse pour la modélisation du langage à grande échelle” discute d’une approche innovante pour améliorer les modèles de langage à grande échelle (LLM) en intégrant l’architecture de Mixture of Experts avec des techniques d’ajustement d’instruction.

Il met en évidence un défi courant où les modèles MoE sous-performent par rapport aux modèles denses de capacité de calcul égale lors de l’ajustement pour des tâches spécifiques en raison de désaccords entre la pré-formation générale et l’ajustement pour des tâches spécifiques.

L’ajustement d’instruction est une méthodologie de formation qui affine les modèles pour mieux suivre les instructions en langage naturel, améliorant ainsi leur performance dans les tâches. L’article suggère que les modèles MoE présentent une amélioration notable lorsqu’ils sont combinés avec l’ajustement d’instruction, plus que leurs homologues denses. Cette technique aligne les représentations pré-formées du modèle pour suivre les instructions plus efficacement, conduisant à des gains de performance importants.

Les chercheurs ont mené des études dans trois configurations expérimentales, révélant que les modèles MoE sous-performent initialement lors de l’ajustement pour des tâches spécifiques. Cependant, lorsque l’ajustement d’instruction est appliqué, les modèles MoE excellent, en particulier lorsqu’ils sont complétés par un ajustement pour des tâches spécifiques. Cela suggère que l’ajustement d’instruction est une étape cruciale pour que les modèles MoE surpassent les modèles denses dans les tâches en aval.

L'effet de l'ajustement d'instruction sur MOE

L’effet de l’ajustement d’instruction sur MOE

Il présente également FLAN-MOE32B, un modèle qui démontre l’application réussie de ces concepts. Notamment, il surpasse FLAN-PALM62B, un modèle dense, dans les tâches de référence, tout en utilisant seulement un tiers des ressources de calcul. Cela met en évidence le potentiel des modèles MoE éparse combinés avec l’ajustement d’instruction pour établir de nouvelles normes d’efficacité et de performance pour les LLM.

Mise en œuvre de la Mixture of Experts dans les scénarios du monde réel

La polyvalence des modèles MoE les rend idéaux pour une gamme d’applications :

  • Traitement du langage naturel (NLP) : les modèles MoE peuvent gérer les nuances et les complexités du langage humain de manière plus efficace, les rendant idéaux pour les tâches NLP avancées.
  • Traitement d’images et de vidéos : dans les tâches nécessitant un traitement de haute résolution, MoE peut gérer différents aspects des images ou des cadres de vidéos, améliorant à la fois la qualité et la vitesse de traitement.
  • Solutions d’IA personnalisées : les entreprises et les chercheurs peuvent adapter les modèles MoE à des tâches spécifiques, conduisant à des solutions d’IA plus ciblées et efficaces.

Defis et considérations

Bien que les modèles MoE offrent de nombreux avantages, ils présentent également des défis uniques :

  • Complexité dans la formation et l’ajustement : la nature distribuée des modèles MoE peut compliquer le processus de formation, nécessitant un équilibrage et un ajustement soigneux des experts et du réseau de gestion.
  • Gestion des ressources : la gestion efficace des ressources de calcul sur plusieurs experts est cruciale pour maximiser les avantages des modèles MoE.

L’intégration de couches MoE dans les réseaux de neurones, en particulier dans le domaine des modèles de langage, offre un chemin vers l’étalonnage de modèles à des tailles précédemment inenvisageables en raison des contraintes de calcul. Le calcul conditionnel activé par les couches MoE permet une répartition plus efficace des ressources de calcul, rendant possible la formation de modèles plus grands et plus capables. À mesure que nous exigeons davantage de nos systèmes d’IA, des architectures comme le Transformer équipé de MoE sont susceptibles de devenir la norme pour la gestion de tâches complexes et à grande échelle dans divers domaines.

J'ai passé les cinq dernières années à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de génie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiosité continue m'a également attiré vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.