ModÃĻles et plateformes d’IA

MambaOut : Mamba est-il vraiment nÃĐcessaire pour la vision ?

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

Dans les cadres modernes d’apprentissage automatique et d’intelligence artificielle, les transformateurs sont l’un des composants les plus largement utilisÃĐs dans divers domaines, notamment les sÃĐries GPT, BERT en traitement du langage naturel et les transformateurs de vision dans les tÃĒches de vision par ordinateur. Bien que l’inclusion de transformateurs dans l’architecture du modÃĻle donne un boost significatif aux performances du modÃĻle, le module d’attention dans les transformateurs ÃĐvolue de maniÃĻre quadratique avec la longueur de la sÃĐquence, ce qui entraÃŪne des dÃĐfis de calcul importants. Au fil des ans, diffÃĐrents modÃĻles ont explorÃĐ diffÃĐrentes stratÃĐgies pour relever les dÃĐfis de calcul, notamment des mÃĐthodes telles que la kernelisation, la compression de la mÃĐmoire historique, la limitation de la portÃĐe du mÃĐlange de jetons et les approches de faible rang. RÃĐcemment, les rÃĐseaux de neurones rÃĐcurrents (RNN) comme les mÃĐthodes Mamba et RWKV ont attirÃĐ une attention considÃĐrable en raison de leurs rÃĐsultats prometteurs dans les grands modÃĻles de langage.

Mamba, une famille de modÃĻles, a une architecture avec un mÃĐlangeur de jetons de type RNN d’un modÃĻle d’espace d’ÃĐtat qui a ÃĐtÃĐ rÃĐcemment introduit pour rÃĐsoudre la complexitÃĐ quadratique des mÃĐcanismes d’attention et a ÃĐtÃĐ appliquÃĐ aux tÃĒches de vision par la suite. Les chercheurs ont dÃĐjà explorÃĐ des moyens d’intÃĐgrer Mamba et SSM (ou modÃĻle d’espace d’ÃĐtat) dans les tÃĒches de reconnaissance visuelle, et Vision Mamba, qui intÃĻgre Mamba pour dÃĐvelopper des modÃĻles de vision isotropiques similaires aux transformateurs de vision, est un excellent exemple de cela. D’un autre cÃītÃĐ, LocalMamba intÃĻgre des biais inductifs locaux pour amÃĐliorer les modÃĻles de vision Mamba, et le cadre VMamba utilise le modÃĻle Mamba de base pour construire des modÃĻles hiÃĐrarchiques similaires à ResNet et AlexNet. Cependant, est-ce que le cadre Mamba est vraiment essentiel pour les tÃĒches de contexte de reconnaissance visuelle ? La question se pose parce que les performances de la famille de modÃĻles Mamba pour les tÃĒches de vision ont ÃĐtÃĐ dÃĐcevantes jusqu’à prÃĐsent par rapport aux modÃĻles traditionnels basÃĐs sur l’attention et les modÃĻles de convolution.

MambaOut tente de rÃĐpondre à la question de savoir si Mamba est idÃĐalement adaptÃĐ aux tÃĒches avec des caractÃĐristiques autoregressives et de longue sÃĐquence. Le cadre MambaOut suppose que Mamba n’est pas nÃĐcessaire pour les tÃĒches de vision, car la classification d’images ne correspond ni aux caractÃĐristiques autoregressives ni à celles de longue sÃĐquence. Bien que les tÃĒches de segmentation et de dÃĐtection ne soient pas non plus autoregressives, elles prÃĐsentent des caractÃĐristiques de longue sÃĐquence, ce qui amÃĻne le cadre MambaOut à supposer le potentiel de Mamba pour ces tÃĒches. Le cadre MambaOut est construit en empilant des blocs Mamba les uns sur les autres tout en supprimant le modÃĻle d’espace d’ÃĐtat, son mÃĐlangeur de jetons principal. Les rÃĐsultats expÃĐrimentaux soutiennent l’hypothÃĻse avancÃĐe par le cadre MambaOut, car il est capable de surpasser tous les modÃĻles de vision Mamba sur le cadre de classification d’images ImageNet, indiquant que Mamba n’est pas nÃĐcessaire pour les tÃĒches de vision. D’un autre cÃītÃĐ, pour les tÃĒches de dÃĐtection et de segmentation, le cadre MambaOut est incapable de reproduire les performances offertes par le modÃĻle Mamba à l’ÃĐtat de l’art, dÃĐmontrant le potentiel de la famille de modÃĻles Mamba pour les tÃĒches de vision à longue sÃĐquence.

Cet article vise à couvrir en profondeur le cadre MambaOut, et nous explorons le mÃĐcanisme, la mÃĐthodologie, l’architecture du cadre ainsi que sa comparaison avec les cadres à l’ÃĐtat de l’art. Alors, commençons.

MambaOut : Mamba est-il vraiment nÃĐcessaire pour la vision ?

Avec les progrÃĻs des applications et des capacitÃĐs d’apprentissage automatique, les transformateurs sont devenus le squelette mainstream pour une gamme de tÃĒches, alimentant des modÃĻles ÃĐminents tels que les transformateurs de vision, les sÃĐries de modÃĻles GPT, BERT, et quelques autres. Cependant, le mÃĐlangeur de jetons du transformateur implique une complexitÃĐ quadratique par rapport à la longueur de la sÃĐquence, et pose des dÃĐfis de calcul importants. Pour rÃĐsoudre ce problÃĻme, de nombreux mÃĐlangeurs de jetons avec une complexitÃĐ linÃĐaire par rapport à la longueur des jetons, tels que Linformer, Longformer, Performer, Dynamic Convolution et Big Bird, ont ÃĐtÃĐ introduits. Cependant, ces derniers temps, les modÃĻles de type RNN sont de plus en plus populaires en raison de leur capacitÃĐ de formation parallÃĻle et de leur performance efficace sur les longues sÃĐquences. GuidÃĐs par les rÃĐsultats remarquables offerts par les modÃĻles de type RNN, les chercheurs tentent d’introduire et d’utiliser la famille de modÃĻles Mamba dans les tÃĒches de reconnaissance visuelle, car le mÃĐlangeur de jetons des modÃĻles Mamba est le modÃĻle d’espace d’ÃĐtat structurÃĐ sous l’esprit des RNN. Cependant, les rÃĐsultats expÃĐrimentaux indiquent que les cadres basÃĐs sur le modÃĻle d’espace d’ÃĐtat pour la vision performe de maniÃĻre sous-optimale sur les tÃĒches de vision rÃĐelles par rapport aux modÃĻles basÃĐs sur l’attention et aux modÃĻles de convolution à l’ÃĐtat de l’art.

MambaOut est une tentative pour investiguer la nature de la famille de modÃĻles Mamba, et rÃĐsume que Mamba est adaptÃĐ aux tÃĒches qui sont soit autoregressives, soit à longue sÃĐquence, car le modÃĻle d’espace d’ÃĐtat a un mÃĐcanisme RNN inhÃĐrent. Cependant, la majoritÃĐ des tÃĒches de vision ne prÃĐsentent pas ces deux caractÃĐristiques, et sur la base de certaines expÃĐriences, MambaOut propose les deux hypothÃĻses suivantes. PremiÃĻrement, le modÃĻle d’espace d’ÃĐtat n’est pas nÃĐcessaire pour la classification d’images, car la tÃĒche de classification d’images ne correspond ni aux caractÃĐristiques autoregressives ni à celles de longue sÃĐquence. DeuxiÃĻmement, les modÃĻles d’espace d’ÃĐtat peuvent Être bÃĐnÃĐfiques pour la segmentation d’instances et la segmentation sÃĐmantique, ainsi que pour la dÃĐtection d’objets, car ils suivent les caractÃĐristiques de longue sÃĐquence, mÊme s’ils ne sont pas autoregressifs. Les rÃĐsultats expÃĐrimentaux menÃĐs pour analyser le mÃĐcanisme de type RNN du modÃĻle d’espace d’ÃĐtat concluent que le cadre Mamba est adaptÃĐ aux tÃĒches avec des caractÃĐristiques autoregressives ou à longue sÃĐquence, et est inutile pour les tÃĒches de classification d’images. En ce qui concerne le cadre MambaOut lui-mÊme, il s’agit d’une sÃĐrie de modÃĻles Mamba basÃĐs sur des blocs de neurones de convolution à grille sans le modÃĻle d’espace d’ÃĐtat, et les rÃĐsultats expÃĐrimentaux indiquent que le cadre MambaOut est capable de surpasser les modÃĻles Mamba dans les tÃĒches de classification d’images, mais ÃĐchoue à reproduire les performances sur les tÃĒches de dÃĐtection et de segmentation d’images.

Quelles tÃĒches Mamba est-il adaptÃĐ ?

Le mÃĐlangeur de jetons du cadre Mamba est un modÃĻle d’espace d’ÃĐtat sÃĐlectif qui dÃĐfinit quatre paramÃĻtres dÃĐpendants de l’entrÃĐe. La propriÃĐtÃĐ rÃĐcurrente du cadre distingue les modÃĻles d’espace d’ÃĐtat de type RNN de l’attention causale. L’ÃĐtat cachÃĐ peut Être vu comme une mÃĐmoire de taille fixe qui stocke les informations historiques. La taille fixe signifie que la mÃĐmoire est perte, mais elle garantit ÃĐgalement que la complexitÃĐ de calcul pour intÃĐgrer la mÃĐmoire avec l’entrÃĐe actuelle reste constante. À l’inverse, les couches d’attention causale stockent toutes les clÃĐs et les valeurs des jetons prÃĐcÃĐdents, et s’ÃĐtendent en ajoutant la clÃĐ et la valeur du jeton actuel avec chaque nouvelle entrÃĐe, et cette mÃĐmoire est sans perte, thÃĐoriquement. Cependant, la taille de la mÃĐmoire augmente à mesure que davantage de jetons sont entrÃĐs, ce qui augmente la complexitÃĐ de l’intÃĐgration de la mÃĐmoire avec l’entrÃĐe actuelle. La diffÃĐrence entre les mÃĐcanismes de mÃĐmoire entre l’attention causale et les modÃĻles de type RNN est illustrÃĐe dans la figure suivante.

Puisque la mÃĐmoire du modÃĻle d’espace d’ÃĐtat est inhÃĐrentement perte, elle est infÃĐrieure à la mÃĐmoire sans perte de l’attention causale, et en consÃĐquence, les modÃĻles Mamba ne peuvent pas dÃĐmontrer leur force dans la gestion des courtes sÃĐquences, un domaine oÃđ le mÃĐcanisme d’attention causale performe avec facilitÃĐ. Cependant, dans les scÃĐnarios qui impliquent des longues sÃĐquences, l’approche d’attention causale ÃĐchoue en raison de la complexitÃĐ quadratique. Dans ce scÃĐnario, le cadre Mamba montre son efficacitÃĐ pour intÃĐgrer la mÃĐmoire avec l’entrÃĐe actuelle, et est capable de gÃĐrer les longues sÃĐquences en douceur, indiquant que la famille de modÃĻles Mamba est bien adaptÃĐe pour traiter les longues sÃĐquences.

Il est ÃĐgalement important de noter que d’une part, la nature rÃĐcurrente du modÃĻle d’espace d’ÃĐtat permet aux modÃĻles Mamba de gÃĐrer efficacement les longues sÃĐquences, elle introduit une certaine limitation, car elle ne peut accÃĐder qu’aux informations des ÃĐtapes de temps actuelles et prÃĐcÃĐdentes, et ce type de mÃĐlange de jetons est appelÃĐ mode causal, et est illustrÃĐ dans la figure suivante. En raison de sa nature causale, cette mÃĐthode est adaptÃĐe aux tÃĒches de gÃĐnÃĐration autoregressive.

Le mode entiÃĻrement visible est adaptÃĐ pour les tÃĒches de comprÃĐhension oÃđ le modÃĻle peut accÃĐder à toutes les entrÃĐes à la fois. De plus, l’attention est en mode entiÃĻrement visible par dÃĐfaut, et elle peut Être transformÃĐe en mode causal en appliquant des masques causaux aux cartes d’attention, et les modÃĻles de type RNN opÃĻrent inhÃĐrentement en mode causal en raison de leurs propriÃĐtÃĐs rÃĐcurrentes. Pour rÃĐsumer, le cadre Mamba est adaptÃĐ aux tÃĒches qui impliquent soit des longues sÃĐquences, soit des tÃĒches qui nÃĐcessitent un mode de mÃĐlange de jetons causal.

TÃĒches de reconnaissance visuelle, code de mÃĐlange de jetons causal et trÃĻs longues sÃĐquences

Comme discutÃĐ plus tÃīt, le mode de mÃĐlange de jetons entiÃĻrement visible permet une plage de mÃĐlange sans restriction, tandis que le mode causal limite le jeton actuel pour n’accÃĐder qu’aux informations des jetons prÃĐcÃĐdents. De plus, la reconnaissance visuelle est catÃĐgorisÃĐe comme une tÃĒche de comprÃĐhension oÃđ le modÃĻle peut voir l’ensemble de l’image à la fois, et cela ÃĐlimine le besoin de restrictions sur le mÃĐlange de jetons, et imposer des contraintes supplÃĐmentaires sur le mÃĐlange de jetons peut potentiellement dÃĐgrader les performances du modÃĻle. GÃĐnÃĐralement, le mode entiÃĻrement visible est appropriÃĐ pour les tÃĒches de comprÃĐhension, tandis que le mode causal convient mieux aux tÃĒches autoregressives. De plus, cette affirmation est ÃĐtayÃĐe par le fait que les modÃĻles BeRT et ViT sont utilisÃĐs pour les tÃĒches de comprÃĐhension plus que les modÃĻles GPT.

VÃĐrification expÃĐrimentale et rÃĐsultats

L’ÃĐtape suivante consiste à vÃĐrifier les hypothÃĻses proposÃĐes par le cadre MambaOut de maniÃĻre expÃĐrimentale. Comme dÃĐmontrÃĐ dans l’image suivante, le bloc Mamba est basÃĐ sur le bloc de neurones de convolution à grille, et la meta-architecture des blocs Mamba et Gated CNN peut Être traitÃĐe comme une intÃĐgration simplifiÃĐe du mÃĐlangeur de jetons du cadre MetaFormer et d’un MLP.

Le bloc Mamba ÃĐtend le bloc de neurones de convolution à grille avec un modÃĻle d’espace d’ÃĐtat supplÃĐmentaire, et la prÃĐsence d’un SSm est ce qui distingue le bloc Gated CNN et le bloc Mamba. De plus, pour amÃĐliorer la vitesse pratique, le cadre MambaOut ne rÃĐalise que des convolutions de profondeur sur les canaux partiels, et comme dÃĐmontrÃĐ dans l’algorithme suivant, la mise en œuvre du bloc Gated CNN est simple, ÃĐlÃĐgante et efficace.

TÃĒche de classification d’images

ImageNet sert de rÃĐfÃĐrence pour les tÃĒches de classification d’images, car il se compose de plus de mille classes communes, de plus de 1,3 million d’images d’entraÃŪnement et de plus de 50 000 images de validation. L’augmentation de donnÃĐes utilisÃĐe pour l’expÃĐrience consiste en une rÃĐduction alÃĐatoire de taille, Mixup, une variation de couleur, Random Erasing, CutMix et Rand Augment. Le tableau suivant rÃĐsume les performances de la famille de modÃĻles Mamba, du modÃĻle MambaOut et d’autres modÃĻles basÃĐs sur l’attention et les modÃĻles de convolution sur le jeu de donnÃĐes ImageNet. Comme on peut le voir, le cadre MambaOut sans le modÃĻle d’espace d’ÃĐtat surpasse de maniÃĻre cohÃĐrente les modÃĻles de vision Mamba avec SSm sur toutes les tailles de modÃĻles.

Par exemple, le modÃĻle MambaOut-Small retourne un score de prÃĐcision de niveau 1 supÃĐrieur à 84 %, 0,4 % de plus que son concurrent Mamba le plus proche. Ce rÃĐsultat soutient fortement la premiÃĻre hypothÃĻse qui affirme que l’introduction d’un modÃĻle d’espace d’ÃĐtat pour les tÃĒches de classification d’images n’est pas nÃĐcessaire.

TÃĒches de dÃĐtection d’objets et de segmentation d’instances

COCO sert de rÃĐfÃĐrence pour les tÃĒches de dÃĐtection d’objets et de segmentation d’instances. Bien que le cadre MambaOut soit capable de surpasser les performances de certains modÃĻles de vision Mamba, il ÃĐchoue encore à reproduire les performances des modÃĻles de vision Mamba à l’ÃĐtat de l’art, notamment LocalVMamba et VMamba. La disparitÃĐ dans les performances de MambaOut par rapport aux modÃĻles visuels à l’ÃĐtat de l’art met en ÃĐvidence les avantages de l’intÃĐgration de la famille de modÃĻles Mamba dans les tÃĒches de vision à longue sÃĐquence. Cependant, il est important de noter qu’un ÃĐcart de performance significatif subsiste encore entre les modÃĻles hybrides à l’ÃĐtat de l’art basÃĐs sur l’attention et les convolution et les modÃĻles de vision Mamba.

PensÃĐes finales

La famille de modÃĻles Mamba semble Être adaptÃĐe aux tÃĒches qui impliquent des caractÃĐristiques autoregressives et de longue sÃĐquence. Le cadre MambaOut suppose que Mamba n’est pas nÃĐcessaire pour les tÃĒches de vision, car la classification d’images ne correspond ni aux caractÃĐristiques autoregressives ni à celles de longue sÃĐquence. Bien que les tÃĒches de segmentation et de dÃĐtection ne soient pas non plus autoregressives, elles prÃĐsentent des caractÃĐristiques de longue sÃĐquence, ce qui amÃĻne le cadre MambaOut à supposer le potentiel de Mamba pour ces tÃĒches. Le cadre MambaOut est construit en empilant des blocs Mamba les uns sur les autres tout en supprimant le modÃĻle d’espace d’ÃĐtat, son mÃĐlangeur de jetons principal. Les rÃĐsultats expÃĐrimentaux soutiennent l’hypothÃĻse avancÃĐe par le cadre MambaOut, car il est capable de surpasser tous les modÃĻles de vision Mamba sur le cadre de classification d’images ImageNet, indiquant que Mamba n’est pas nÃĐcessaire pour les tÃĒches de vision. D’un autre cÃītÃĐ, pour les tÃĒches de dÃĐtection et de segmentation, le cadre MambaOut est incapable de reproduire les performances offertes par le modÃĻle Mamba à l’ÃĐtat de l’art, dÃĐmontrant le potentiel de la famille de modÃĻles Mamba pour les tÃĒches de vision à longue sÃĐquence.

Un ingÃĐnieur de profession, un ÃĐcrivain de cœur. Kunal est un rÃĐdacteur technique avec une profonde affection et une comprÃĐhension de l'IA et du ML, dÃĐdiÃĐ Ã  simplifier les concepts complexes dans ces domaines grÃĒce à sa documentation engageante et informative.