Modèles et plateformes d’IA

MambaOut : Mamba est-il vraiment nécessaire pour la vision ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Dans les cadres modernes d’apprentissage automatique et d’intelligence artificielle, les transformateurs sont l’un des composants les plus largement utilisés dans divers domaines, notamment les séries GPT, BERT en traitement du langage naturel et les transformateurs de vision dans les tâches de vision par ordinateur. Bien que l’inclusion de transformateurs dans l’architecture du modèle donne un boost significatif aux performances du modèle, le module d’attention dans les transformateurs évolue de manière quadratique avec la longueur de la séquence, ce qui entraîne des défis de calcul importants. Au fil des ans, différents modèles ont exploré différentes stratégies pour relever les défis de calcul, notamment des méthodes telles que la kernelisation, la compression de la mémoire historique, la limitation de la portée du mélange de jetons et les approches de faible rang. Récemment, les réseaux de neurones récurrents (RNN) comme les méthodes Mamba et RWKV ont attiré une attention considérable en raison de leurs résultats prometteurs dans les grands modèles de langage.

Mamba, une famille de modèles, a une architecture avec un mélangeur de jetons de type RNN d’un modèle d’espace d’état qui a été récemment introduit pour résoudre la complexité quadratique des mécanismes d’attention et a été appliqué aux tâches de vision par la suite. Les chercheurs ont déjà exploré des moyens d’intégrer Mamba et SSM (ou modèle d’espace d’état) dans les tâches de reconnaissance visuelle, et Vision Mamba, qui intègre Mamba pour développer des modèles de vision isotropiques similaires aux transformateurs de vision, est un excellent exemple de cela. D’un autre côté, LocalMamba intègre des biais inductifs locaux pour améliorer les modèles de vision Mamba, et le cadre VMamba utilise le modèle Mamba de base pour construire des modèles hiérarchiques similaires à ResNet et AlexNet. Cependant, est-ce que le cadre Mamba est vraiment essentiel pour les tâches de contexte de reconnaissance visuelle ? La question se pose parce que les performances de la famille de modèles Mamba pour les tâches de vision ont été décevantes jusqu’à présent par rapport aux modèles traditionnels basés sur l’attention et les modèles de convolution.

MambaOut tente de répondre à la question de savoir si Mamba est idéalement adapté aux tâches avec des caractéristiques autoregressives et de longue séquence. Le cadre MambaOut suppose que Mamba n’est pas nécessaire pour les tâches de vision, car la classification d’images ne correspond ni aux caractéristiques autoregressives ni à celles de longue séquence. Bien que les tâches de segmentation et de détection ne soient pas non plus autoregressives, elles présentent des caractéristiques de longue séquence, ce qui amène le cadre MambaOut à supposer le potentiel de Mamba pour ces tâches. Le cadre MambaOut est construit en empilant des blocs Mamba les uns sur les autres tout en supprimant le modèle d’espace d’état, son mélangeur de jetons principal. Les résultats expérimentaux soutiennent l’hypothèse avancée par le cadre MambaOut, car il est capable de surpasser tous les modèles de vision Mamba sur le cadre de classification d’images ImageNet, indiquant que Mamba n’est pas nécessaire pour les tâches de vision. D’un autre côté, pour les tâches de détection et de segmentation, le cadre MambaOut est incapable de reproduire les performances offertes par le modèle Mamba à l’état de l’art, démontrant le potentiel de la famille de modèles Mamba pour les tâches de vision à longue séquence.

Cet article vise à couvrir en profondeur le cadre MambaOut, et nous explorons le mécanisme, la méthodologie, l’architecture du cadre ainsi que sa comparaison avec les cadres à l’état de l’art. Alors, commençons.

MambaOut : Mamba est-il vraiment nécessaire pour la vision ?

Avec les progrès des applications et des capacités d’apprentissage automatique, les transformateurs sont devenus le squelette mainstream pour une gamme de tâches, alimentant des modèles éminents tels que les transformateurs de vision, les séries de modèles GPT, BERT, et quelques autres. Cependant, le mélangeur de jetons du transformateur implique une complexité quadratique par rapport à la longueur de la séquence, et pose des défis de calcul importants. Pour résoudre ce problème, de nombreux mélangeurs de jetons avec une complexité linéaire par rapport à la longueur des jetons, tels que Linformer, Longformer, Performer, Dynamic Convolution et Big Bird, ont été introduits. Cependant, ces derniers temps, les modèles de type RNN sont de plus en plus populaires en raison de leur capacité de formation parallèle et de leur performance efficace sur les longues séquences. Guidés par les résultats remarquables offerts par les modèles de type RNN, les chercheurs tentent d’introduire et d’utiliser la famille de modèles Mamba dans les tâches de reconnaissance visuelle, car le mélangeur de jetons des modèles Mamba est le modèle d’espace d’état structuré sous l’esprit des RNN. Cependant, les résultats expérimentaux indiquent que les cadres basés sur le modèle d’espace d’état pour la vision performe de manière sous-optimale sur les tâches de vision réelles par rapport aux modèles basés sur l’attention et aux modèles de convolution à l’état de l’art.

MambaOut est une tentative pour investiguer la nature de la famille de modèles Mamba, et résume que Mamba est adapté aux tâches qui sont soit autoregressives, soit à longue séquence, car le modèle d’espace d’état a un mécanisme RNN inhérent. Cependant, la majorité des tâches de vision ne présentent pas ces deux caractéristiques, et sur la base de certaines expériences, MambaOut propose les deux hypothèses suivantes. Premièrement, le modèle d’espace d’état n’est pas nécessaire pour la classification d’images, car la tâche de classification d’images ne correspond ni aux caractéristiques autoregressives ni à celles de longue séquence. Deuxièmement, les modèles d’espace d’état peuvent être bénéfiques pour la segmentation d’instances et la segmentation sémantique, ainsi que pour la détection d’objets, car ils suivent les caractéristiques de longue séquence, même s’ils ne sont pas autoregressifs. Les résultats expérimentaux menés pour analyser le mécanisme de type RNN du modèle d’espace d’état concluent que le cadre Mamba est adapté aux tâches avec des caractéristiques autoregressives ou à longue séquence, et est inutile pour les tâches de classification d’images. En ce qui concerne le cadre MambaOut lui-même, il s’agit d’une série de modèles Mamba basés sur des blocs de neurones de convolution à grille sans le modèle d’espace d’état, et les résultats expérimentaux indiquent que le cadre MambaOut est capable de surpasser les modèles Mamba dans les tâches de classification d’images, mais échoue à reproduire les performances sur les tâches de détection et de segmentation d’images.

Quelles tâches Mamba est-il adapté ?

Le mélangeur de jetons du cadre Mamba est un modèle d’espace d’état sélectif qui définit quatre paramètres dépendants de l’entrée. La propriété récurrente du cadre distingue les modèles d’espace d’état de type RNN de l’attention causale. L’état caché peut être vu comme une mémoire de taille fixe qui stocke les informations historiques. La taille fixe signifie que la mémoire est perte, mais elle garantit également que la complexité de calcul pour intégrer la mémoire avec l’entrée actuelle reste constante. À l’inverse, les couches d’attention causale stockent toutes les clés et les valeurs des jetons précédents, et s’étendent en ajoutant la clé et la valeur du jeton actuel avec chaque nouvelle entrée, et cette mémoire est sans perte, théoriquement. Cependant, la taille de la mémoire augmente à mesure que davantage de jetons sont entrés, ce qui augmente la complexité de l’intégration de la mémoire avec l’entrée actuelle. La différence entre les mécanismes de mémoire entre l’attention causale et les modèles de type RNN est illustrée dans la figure suivante.

Puisque la mémoire du modèle d’espace d’état est inhérentement perte, elle est inférieure à la mémoire sans perte de l’attention causale, et en conséquence, les modèles Mamba ne peuvent pas démontrer leur force dans la gestion des courtes séquences, un domaine où le mécanisme d’attention causale performe avec facilité. Cependant, dans les scénarios qui impliquent des longues séquences, l’approche d’attention causale échoue en raison de la complexité quadratique. Dans ce scénario, le cadre Mamba montre son efficacité pour intégrer la mémoire avec l’entrée actuelle, et est capable de gérer les longues séquences en douceur, indiquant que la famille de modèles Mamba est bien adaptée pour traiter les longues séquences.

Il est également important de noter que d’une part, la nature récurrente du modèle d’espace d’état permet aux modèles Mamba de gérer efficacement les longues séquences, elle introduit une certaine limitation, car elle ne peut accéder qu’aux informations des étapes de temps actuelles et précédentes, et ce type de mélange de jetons est appelé mode causal, et est illustré dans la figure suivante. En raison de sa nature causale, cette méthode est adaptée aux tâches de génération autoregressive.

Le mode entièrement visible est adapté pour les tâches de compréhension où le modèle peut accéder à toutes les entrées à la fois. De plus, l’attention est en mode entièrement visible par défaut, et elle peut être transformée en mode causal en appliquant des masques causaux aux cartes d’attention, et les modèles de type RNN opèrent inhérentement en mode causal en raison de leurs propriétés récurrentes. Pour résumer, le cadre Mamba est adapté aux tâches qui impliquent soit des longues séquences, soit des tâches qui nécessitent un mode de mélange de jetons causal.

Tâches de reconnaissance visuelle, code de mélange de jetons causal et très longues séquences

Comme discuté plus tôt, le mode de mélange de jetons entièrement visible permet une plage de mélange sans restriction, tandis que le mode causal limite le jeton actuel pour n’accéder qu’aux informations des jetons précédents. De plus, la reconnaissance visuelle est catégorisée comme une tâche de compréhension où le modèle peut voir l’ensemble de l’image à la fois, et cela élimine le besoin de restrictions sur le mélange de jetons, et imposer des contraintes supplémentaires sur le mélange de jetons peut potentiellement dégrader les performances du modèle. Généralement, le mode entièrement visible est approprié pour les tâches de compréhension, tandis que le mode causal convient mieux aux tâches autoregressives. De plus, cette affirmation est étayée par le fait que les modèles BeRT et ViT sont utilisés pour les tâches de compréhension plus que les modèles GPT.

Vérification expérimentale et résultats

L’étape suivante consiste à vérifier les hypothèses proposées par le cadre MambaOut de manière expérimentale. Comme démontré dans l’image suivante, le bloc Mamba est basé sur le bloc de neurones de convolution à grille, et la meta-architecture des blocs Mamba et Gated CNN peut être traitée comme une intégration simplifiée du mélangeur de jetons du cadre MetaFormer et d’un MLP.

Le bloc Mamba étend le bloc de neurones de convolution à grille avec un modèle d’espace d’état supplémentaire, et la présence d’un SSm est ce qui distingue le bloc Gated CNN et le bloc Mamba. De plus, pour améliorer la vitesse pratique, le cadre MambaOut ne réalise que des convolutions de profondeur sur les canaux partiels, et comme démontré dans l’algorithme suivant, la mise en œuvre du bloc Gated CNN est simple, élégante et efficace.

Tâche de classification d’images

ImageNet sert de référence pour les tâches de classification d’images, car il se compose de plus de mille classes communes, de plus de 1,3 million d’images d’entraînement et de plus de 50 000 images de validation. L’augmentation de données utilisée pour l’expérience consiste en une réduction aléatoire de taille, Mixup, une variation de couleur, Random Erasing, CutMix et Rand Augment. Le tableau suivant résume les performances de la famille de modèles Mamba, du modèle MambaOut et d’autres modèles basés sur l’attention et les modèles de convolution sur le jeu de données ImageNet. Comme on peut le voir, le cadre MambaOut sans le modèle d’espace d’état surpasse de manière cohérente les modèles de vision Mamba avec SSm sur toutes les tailles de modèles.

Par exemple, le modèle MambaOut-Small retourne un score de précision de niveau 1 supérieur à 84 %, 0,4 % de plus que son concurrent Mamba le plus proche. Ce résultat soutient fortement la première hypothèse qui affirme que l’introduction d’un modèle d’espace d’état pour les tâches de classification d’images n’est pas nécessaire.

Tâches de détection d’objets et de segmentation d’instances

COCO sert de référence pour les tâches de détection d’objets et de segmentation d’instances. Bien que le cadre MambaOut soit capable de surpasser les performances de certains modèles de vision Mamba, il échoue encore à reproduire les performances des modèles de vision Mamba à l’état de l’art, notamment LocalVMamba et VMamba. La disparité dans les performances de MambaOut par rapport aux modèles visuels à l’état de l’art met en évidence les avantages de l’intégration de la famille de modèles Mamba dans les tâches de vision à longue séquence. Cependant, il est important de noter qu’un écart de performance significatif subsiste encore entre les modèles hybrides à l’état de l’art basés sur l’attention et les convolution et les modèles de vision Mamba.

Pensées finales

La famille de modèles Mamba semble être adaptée aux tâches qui impliquent des caractéristiques autoregressives et de longue séquence. Le cadre MambaOut suppose que Mamba n’est pas nécessaire pour les tâches de vision, car la classification d’images ne correspond ni aux caractéristiques autoregressives ni à celles de longue séquence. Bien que les tâches de segmentation et de détection ne soient pas non plus autoregressives, elles présentent des caractéristiques de longue séquence, ce qui amène le cadre MambaOut à supposer le potentiel de Mamba pour ces tâches. Le cadre MambaOut est construit en empilant des blocs Mamba les uns sur les autres tout en supprimant le modèle d’espace d’état, son mélangeur de jetons principal. Les résultats expérimentaux soutiennent l’hypothèse avancée par le cadre MambaOut, car il est capable de surpasser tous les modèles de vision Mamba sur le cadre de classification d’images ImageNet, indiquant que Mamba n’est pas nécessaire pour les tâches de vision. D’un autre côté, pour les tâches de détection et de segmentation, le cadre MambaOut est incapable de reproduire les performances offertes par le modèle Mamba à l’état de l’art, démontrant le potentiel de la famille de modèles Mamba pour les tâches de vision à longue séquence.

Kunal Kejriwal est ingénieur backend spécialisé en Python, PostgreSQL, Redis et en infrastructure cloud sur GCP et AWS. Fort de trois ans d'expérience dans la construction et la mise à l'échelle de systèmes de production, il écrit sur l'infrastructure IA, les systèmes distribués et l'architecture du déploiement des charges de travail d'apprentissage automatique.