ModÃĻles et plateformes dâIA
MambaOut : Mamba est-il vraiment nÃĐcessaire pour la vision ?
Dans les cadres modernes dâapprentissage automatique et dâintelligence artificielle, les transformateurs sont lâun des composants les plus largement utilisÃĐs dans divers domaines, notamment les sÃĐries GPT, BERT en traitement du langage naturel et les transformateurs de vision dans les tÃĒches de vision par ordinateur. Bien que lâinclusion de transformateurs dans lâarchitecture du modÃĻle donne un boost significatif aux performances du modÃĻle, le module dâattention dans les transformateurs ÃĐvolue de maniÃĻre quadratique avec la longueur de la sÃĐquence, ce qui entraÃŪne des dÃĐfis de calcul importants. Au fil des ans, diffÃĐrents modÃĻles ont explorÃĐ diffÃĐrentes stratÃĐgies pour relever les dÃĐfis de calcul, notamment des mÃĐthodes telles que la kernelisation, la compression de la mÃĐmoire historique, la limitation de la portÃĐe du mÃĐlange de jetons et les approches de faible rang. RÃĐcemment, les rÃĐseaux de neurones rÃĐcurrents (RNN) comme les mÃĐthodes Mamba et RWKV ont attirÃĐ une attention considÃĐrable en raison de leurs rÃĐsultats prometteurs dans les grands modÃĻles de langage.
Mamba, une famille de modÃĻles, a une architecture avec un mÃĐlangeur de jetons de type RNN dâun modÃĻle dâespace dâÃĐtat qui a ÃĐtÃĐ rÃĐcemment introduit pour rÃĐsoudre la complexitÃĐ quadratique des mÃĐcanismes dâattention et a ÃĐtÃĐ appliquÃĐ aux tÃĒches de vision par la suite. Les chercheurs ont dÃĐjà explorÃĐ des moyens dâintÃĐgrer Mamba et SSM (ou modÃĻle dâespace dâÃĐtat) dans les tÃĒches de reconnaissance visuelle, et Vision Mamba, qui intÃĻgre Mamba pour dÃĐvelopper des modÃĻles de vision isotropiques similaires aux transformateurs de vision, est un excellent exemple de cela. Dâun autre cÃītÃĐ, LocalMamba intÃĻgre des biais inductifs locaux pour amÃĐliorer les modÃĻles de vision Mamba, et le cadre VMamba utilise le modÃĻle Mamba de base pour construire des modÃĻles hiÃĐrarchiques similaires à ResNet et AlexNet. Cependant, est-ce que le cadre Mamba est vraiment essentiel pour les tÃĒches de contexte de reconnaissance visuelle ? La question se pose parce que les performances de la famille de modÃĻles Mamba pour les tÃĒches de vision ont ÃĐtÃĐ dÃĐcevantes jusquâà prÃĐsent par rapport aux modÃĻles traditionnels basÃĐs sur lâattention et les modÃĻles de convolution.
MambaOut tente de rÃĐpondre à la question de savoir si Mamba est idÃĐalement adaptÃĐ aux tÃĒches avec des caractÃĐristiques autoregressives et de longue sÃĐquence. Le cadre MambaOut suppose que Mamba nâest pas nÃĐcessaire pour les tÃĒches de vision, car la classification dâimages ne correspond ni aux caractÃĐristiques autoregressives ni à celles de longue sÃĐquence. Bien que les tÃĒches de segmentation et de dÃĐtection ne soient pas non plus autoregressives, elles prÃĐsentent des caractÃĐristiques de longue sÃĐquence, ce qui amÃĻne le cadre MambaOut à supposer le potentiel de Mamba pour ces tÃĒches. Le cadre MambaOut est construit en empilant des blocs Mamba les uns sur les autres tout en supprimant le modÃĻle dâespace dâÃĐtat, son mÃĐlangeur de jetons principal. Les rÃĐsultats expÃĐrimentaux soutiennent lâhypothÃĻse avancÃĐe par le cadre MambaOut, car il est capable de surpasser tous les modÃĻles de vision Mamba sur le cadre de classification dâimages ImageNet, indiquant que Mamba nâest pas nÃĐcessaire pour les tÃĒches de vision. Dâun autre cÃītÃĐ, pour les tÃĒches de dÃĐtection et de segmentation, le cadre MambaOut est incapable de reproduire les performances offertes par le modÃĻle Mamba à lâÃĐtat de lâart, dÃĐmontrant le potentiel de la famille de modÃĻles Mamba pour les tÃĒches de vision à longue sÃĐquence.
Cet article vise à couvrir en profondeur le cadre MambaOut, et nous explorons le mÃĐcanisme, la mÃĐthodologie, lâarchitecture du cadre ainsi que sa comparaison avec les cadres à lâÃĐtat de lâart. Alors, commençons.
MambaOut : Mamba est-il vraiment nÃĐcessaire pour la vision ?
Avec les progrÃĻs des applications et des capacitÃĐs dâapprentissage automatique, les transformateurs sont devenus le squelette mainstream pour une gamme de tÃĒches, alimentant des modÃĻles ÃĐminents tels que les transformateurs de vision, les sÃĐries de modÃĻles GPT, BERT, et quelques autres. Cependant, le mÃĐlangeur de jetons du transformateur implique une complexitÃĐ quadratique par rapport à la longueur de la sÃĐquence, et pose des dÃĐfis de calcul importants. Pour rÃĐsoudre ce problÃĻme, de nombreux mÃĐlangeurs de jetons avec une complexitÃĐ linÃĐaire par rapport à la longueur des jetons, tels que Linformer, Longformer, Performer, Dynamic Convolution et Big Bird, ont ÃĐtÃĐ introduits. Cependant, ces derniers temps, les modÃĻles de type RNN sont de plus en plus populaires en raison de leur capacitÃĐ de formation parallÃĻle et de leur performance efficace sur les longues sÃĐquences. GuidÃĐs par les rÃĐsultats remarquables offerts par les modÃĻles de type RNN, les chercheurs tentent dâintroduire et dâutiliser la famille de modÃĻles Mamba dans les tÃĒches de reconnaissance visuelle, car le mÃĐlangeur de jetons des modÃĻles Mamba est le modÃĻle dâespace dâÃĐtat structurÃĐ sous lâesprit des RNN. Cependant, les rÃĐsultats expÃĐrimentaux indiquent que les cadres basÃĐs sur le modÃĻle dâespace dâÃĐtat pour la vision performe de maniÃĻre sous-optimale sur les tÃĒches de vision rÃĐelles par rapport aux modÃĻles basÃĐs sur lâattention et aux modÃĻles de convolution à lâÃĐtat de lâart.
MambaOut est une tentative pour investiguer la nature de la famille de modÃĻles Mamba, et rÃĐsume que Mamba est adaptÃĐ aux tÃĒches qui sont soit autoregressives, soit à longue sÃĐquence, car le modÃĻle dâespace dâÃĐtat a un mÃĐcanisme RNN inhÃĐrent. Cependant, la majoritÃĐ des tÃĒches de vision ne prÃĐsentent pas ces deux caractÃĐristiques, et sur la base de certaines expÃĐriences, MambaOut propose les deux hypothÃĻses suivantes. PremiÃĻrement, le modÃĻle dâespace dâÃĐtat nâest pas nÃĐcessaire pour la classification dâimages, car la tÃĒche de classification dâimages ne correspond ni aux caractÃĐristiques autoregressives ni à celles de longue sÃĐquence. DeuxiÃĻmement, les modÃĻles dâespace dâÃĐtat peuvent Être bÃĐnÃĐfiques pour la segmentation dâinstances et la segmentation sÃĐmantique, ainsi que pour la dÃĐtection dâobjets, car ils suivent les caractÃĐristiques de longue sÃĐquence, mÊme sâils ne sont pas autoregressifs. Les rÃĐsultats expÃĐrimentaux menÃĐs pour analyser le mÃĐcanisme de type RNN du modÃĻle dâespace dâÃĐtat concluent que le cadre Mamba est adaptÃĐ aux tÃĒches avec des caractÃĐristiques autoregressives ou à longue sÃĐquence, et est inutile pour les tÃĒches de classification dâimages. En ce qui concerne le cadre MambaOut lui-mÊme, il sâagit dâune sÃĐrie de modÃĻles Mamba basÃĐs sur des blocs de neurones de convolution à grille sans le modÃĻle dâespace dâÃĐtat, et les rÃĐsultats expÃĐrimentaux indiquent que le cadre MambaOut est capable de surpasser les modÃĻles Mamba dans les tÃĒches de classification dâimages, mais ÃĐchoue à reproduire les performances sur les tÃĒches de dÃĐtection et de segmentation dâimages.
Quelles tÃĒches Mamba est-il adaptÃĐ ?
Le mÃĐlangeur de jetons du cadre Mamba est un modÃĻle dâespace dâÃĐtat sÃĐlectif qui dÃĐfinit quatre paramÃĻtres dÃĐpendants de lâentrÃĐe. La propriÃĐtÃĐ rÃĐcurrente du cadre distingue les modÃĻles dâespace dâÃĐtat de type RNN de lâattention causale. LâÃĐtat cachÃĐ peut Être vu comme une mÃĐmoire de taille fixe qui stocke les informations historiques. La taille fixe signifie que la mÃĐmoire est perte, mais elle garantit ÃĐgalement que la complexitÃĐ de calcul pour intÃĐgrer la mÃĐmoire avec lâentrÃĐe actuelle reste constante. à lâinverse, les couches dâattention causale stockent toutes les clÃĐs et les valeurs des jetons prÃĐcÃĐdents, et sâÃĐtendent en ajoutant la clÃĐ et la valeur du jeton actuel avec chaque nouvelle entrÃĐe, et cette mÃĐmoire est sans perte, thÃĐoriquement. Cependant, la taille de la mÃĐmoire augmente à mesure que davantage de jetons sont entrÃĐs, ce qui augmente la complexitÃĐ de lâintÃĐgration de la mÃĐmoire avec lâentrÃĐe actuelle. La diffÃĐrence entre les mÃĐcanismes de mÃĐmoire entre lâattention causale et les modÃĻles de type RNN est illustrÃĐe dans la figure suivante.

Puisque la mÃĐmoire du modÃĻle dâespace dâÃĐtat est inhÃĐrentement perte, elle est infÃĐrieure à la mÃĐmoire sans perte de lâattention causale, et en consÃĐquence, les modÃĻles Mamba ne peuvent pas dÃĐmontrer leur force dans la gestion des courtes sÃĐquences, un domaine oÃđ le mÃĐcanisme dâattention causale performe avec facilitÃĐ. Cependant, dans les scÃĐnarios qui impliquent des longues sÃĐquences, lâapproche dâattention causale ÃĐchoue en raison de la complexitÃĐ quadratique. Dans ce scÃĐnario, le cadre Mamba montre son efficacitÃĐ pour intÃĐgrer la mÃĐmoire avec lâentrÃĐe actuelle, et est capable de gÃĐrer les longues sÃĐquences en douceur, indiquant que la famille de modÃĻles Mamba est bien adaptÃĐe pour traiter les longues sÃĐquences.
Il est ÃĐgalement important de noter que dâune part, la nature rÃĐcurrente du modÃĻle dâespace dâÃĐtat permet aux modÃĻles Mamba de gÃĐrer efficacement les longues sÃĐquences, elle introduit une certaine limitation, car elle ne peut accÃĐder quâaux informations des ÃĐtapes de temps actuelles et prÃĐcÃĐdentes, et ce type de mÃĐlange de jetons est appelÃĐ mode causal, et est illustrÃĐ dans la figure suivante. En raison de sa nature causale, cette mÃĐthode est adaptÃĐe aux tÃĒches de gÃĐnÃĐration autoregressive.

Le mode entiÃĻrement visible est adaptÃĐ pour les tÃĒches de comprÃĐhension oÃđ le modÃĻle peut accÃĐder à toutes les entrÃĐes à la fois. De plus, lâattention est en mode entiÃĻrement visible par dÃĐfaut, et elle peut Être transformÃĐe en mode causal en appliquant des masques causaux aux cartes dâattention, et les modÃĻles de type RNN opÃĻrent inhÃĐrentement en mode causal en raison de leurs propriÃĐtÃĐs rÃĐcurrentes. Pour rÃĐsumer, le cadre Mamba est adaptÃĐ aux tÃĒches qui impliquent soit des longues sÃĐquences, soit des tÃĒches qui nÃĐcessitent un mode de mÃĐlange de jetons causal.
TÃĒches de reconnaissance visuelle, code de mÃĐlange de jetons causal et trÃĻs longues sÃĐquences
Comme discutÃĐ plus tÃīt, le mode de mÃĐlange de jetons entiÃĻrement visible permet une plage de mÃĐlange sans restriction, tandis que le mode causal limite le jeton actuel pour nâaccÃĐder quâaux informations des jetons prÃĐcÃĐdents. De plus, la reconnaissance visuelle est catÃĐgorisÃĐe comme une tÃĒche de comprÃĐhension oÃđ le modÃĻle peut voir lâensemble de lâimage à la fois, et cela ÃĐlimine le besoin de restrictions sur le mÃĐlange de jetons, et imposer des contraintes supplÃĐmentaires sur le mÃĐlange de jetons peut potentiellement dÃĐgrader les performances du modÃĻle. GÃĐnÃĐralement, le mode entiÃĻrement visible est appropriÃĐ pour les tÃĒches de comprÃĐhension, tandis que le mode causal convient mieux aux tÃĒches autoregressives. De plus, cette affirmation est ÃĐtayÃĐe par le fait que les modÃĻles BeRT et ViT sont utilisÃĐs pour les tÃĒches de comprÃĐhension plus que les modÃĻles GPT.
VÃĐrification expÃĐrimentale et rÃĐsultats
LâÃĐtape suivante consiste à vÃĐrifier les hypothÃĻses proposÃĐes par le cadre MambaOut de maniÃĻre expÃĐrimentale. Comme dÃĐmontrÃĐ dans lâimage suivante, le bloc Mamba est basÃĐ sur le bloc de neurones de convolution à grille, et la meta-architecture des blocs Mamba et Gated CNN peut Être traitÃĐe comme une intÃĐgration simplifiÃĐe du mÃĐlangeur de jetons du cadre MetaFormer et dâun MLP.

Le bloc Mamba ÃĐtend le bloc de neurones de convolution à grille avec un modÃĻle dâespace dâÃĐtat supplÃĐmentaire, et la prÃĐsence dâun SSm est ce qui distingue le bloc Gated CNN et le bloc Mamba. De plus, pour amÃĐliorer la vitesse pratique, le cadre MambaOut ne rÃĐalise que des convolutions de profondeur sur les canaux partiels, et comme dÃĐmontrÃĐ dans lâalgorithme suivant, la mise en Åuvre du bloc Gated CNN est simple, ÃĐlÃĐgante et efficace.

TÃĒche de classification dâimages
ImageNet sert de rÃĐfÃĐrence pour les tÃĒches de classification dâimages, car il se compose de plus de mille classes communes, de plus de 1,3 million dâimages dâentraÃŪnement et de plus de 50 000 images de validation. Lâaugmentation de donnÃĐes utilisÃĐe pour lâexpÃĐrience consiste en une rÃĐduction alÃĐatoire de taille, Mixup, une variation de couleur, Random Erasing, CutMix et Rand Augment. Le tableau suivant rÃĐsume les performances de la famille de modÃĻles Mamba, du modÃĻle MambaOut et dâautres modÃĻles basÃĐs sur lâattention et les modÃĻles de convolution sur le jeu de donnÃĐes ImageNet. Comme on peut le voir, le cadre MambaOut sans le modÃĻle dâespace dâÃĐtat surpasse de maniÃĻre cohÃĐrente les modÃĻles de vision Mamba avec SSm sur toutes les tailles de modÃĻles.

Par exemple, le modÃĻle MambaOut-Small retourne un score de prÃĐcision de niveau 1 supÃĐrieur à 84 %, 0,4 % de plus que son concurrent Mamba le plus proche. Ce rÃĐsultat soutient fortement la premiÃĻre hypothÃĻse qui affirme que lâintroduction dâun modÃĻle dâespace dâÃĐtat pour les tÃĒches de classification dâimages nâest pas nÃĐcessaire.
TÃĒches de dÃĐtection dâobjets et de segmentation dâinstances
COCO sert de rÃĐfÃĐrence pour les tÃĒches de dÃĐtection dâobjets et de segmentation dâinstances. Bien que le cadre MambaOut soit capable de surpasser les performances de certains modÃĻles de vision Mamba, il ÃĐchoue encore à reproduire les performances des modÃĻles de vision Mamba à lâÃĐtat de lâart, notamment LocalVMamba et VMamba. La disparitÃĐ dans les performances de MambaOut par rapport aux modÃĻles visuels à lâÃĐtat de lâart met en ÃĐvidence les avantages de lâintÃĐgration de la famille de modÃĻles Mamba dans les tÃĒches de vision à longue sÃĐquence. Cependant, il est important de noter quâun ÃĐcart de performance significatif subsiste encore entre les modÃĻles hybrides à lâÃĐtat de lâart basÃĐs sur lâattention et les convolution et les modÃĻles de vision Mamba.

PensÃĐes finales
La famille de modÃĻles Mamba semble Être adaptÃĐe aux tÃĒches qui impliquent des caractÃĐristiques autoregressives et de longue sÃĐquence. Le cadre MambaOut suppose que Mamba nâest pas nÃĐcessaire pour les tÃĒches de vision, car la classification dâimages ne correspond ni aux caractÃĐristiques autoregressives ni à celles de longue sÃĐquence. Bien que les tÃĒches de segmentation et de dÃĐtection ne soient pas non plus autoregressives, elles prÃĐsentent des caractÃĐristiques de longue sÃĐquence, ce qui amÃĻne le cadre MambaOut à supposer le potentiel de Mamba pour ces tÃĒches. Le cadre MambaOut est construit en empilant des blocs Mamba les uns sur les autres tout en supprimant le modÃĻle dâespace dâÃĐtat, son mÃĐlangeur de jetons principal. Les rÃĐsultats expÃĐrimentaux soutiennent lâhypothÃĻse avancÃĐe par le cadre MambaOut, car il est capable de surpasser tous les modÃĻles de vision Mamba sur le cadre de classification dâimages ImageNet, indiquant que Mamba nâest pas nÃĐcessaire pour les tÃĒches de vision. Dâun autre cÃītÃĐ, pour les tÃĒches de dÃĐtection et de segmentation, le cadre MambaOut est incapable de reproduire les performances offertes par le modÃĻle Mamba à lâÃĐtat de lâart, dÃĐmontrant le potentiel de la famille de modÃĻles Mamba pour les tÃĒches de vision à longue sÃĐquence.












