AI-modellen en platforms
MambaOut: Is Mamba Echt Nodig voor Visie?
In moderne machine learning- en artificial intelligence-kaders zijn transformatoren een van de meest gebruikte componenten in verschillende domeinen, waaronder de GPT-serie en BERT in Natural Language Processing, en Vision Transformers in computer vision-taken. Hoewel het opnemen van transformatoren in de modelarchitectuur een aanzienlijke boost geeft aan de modelprestaties, heeft de aandachtmodule in Transformatoren een kwadratische complexiteit met betrekking tot de sequentielengte, wat leidt tot hoge computationele uitdagingen. In de loop der jaren hebben verschillende modellen verschillende strategieën onderzocht om de computationele uitdagingen aan te pakken, waaronder methoden zoals kernelisatie, historische geheugendruk, tokenmixingbereikbeperking en lage-rangbenaderingen. Onlangs hebben Recurrent Neural Networks zoals Mamba en RWKV aanzienlijke aandacht gekregen vanwege hun veelbelovende resultaten in grote taalmodellen.
Mamba, een familie van modellen met een architectuur met een Recurrent Neural Network-achtige tokenmixer van een staatruimtemodel, is onlangs geïntroduceerd om de kwadratische complexiteit van de aandachtmechanismen aan te pakken en is vervolgens toegepast op visietaken. Onderzoekers hebben al manieren onderzocht om Mamba en SSM of State Space Model op te nemen in visuele herkenningstaken, en Vision Mamba, die Mamba gebruikt om isotrope visiemodellen te ontwikkelen die vergelijkbaar zijn met Vision Transformer, is een goed voorbeeld hiervan. Aan de andere kant neemt LocalMamba lokale inductieve vooroordelen op om visuele Mamba-modellen te verbeteren, en het VMamba-kader gebruikt het basis-Mamba-model om hiërarchische modellen te construeren die vergelijkbaar zijn met ResNet en AlexNet. Maar is het Mamba-kader echt essentieel voor visuele herkenningstaken? Deze vraag rijst omdat de prestaties van de Mamba-familie van modellen voor visietaken tot nu toe teleurstellend zijn geweest in vergelijking met traditionele aandacht-gebaseerde en convolutionele modellen.
MambaOut probeert te beantwoorden of Mamba ideaal is voor taken met autoregressieve en lange-sequentiekenmerken. Het MambaOut-kader veronderstelt dat Mamba niet nodig is voor visietaken, aangezien beeldclassificatie noch autoregressieve noch lange-sequentiekenmerken heeft. Hoewel segmentatie- en detectietaken ook niet autoregressief zijn, vertonen ze lange-sequentiekenmerken, waardoor het MambaOut-kader veronderstelt dat Mamba mogelijk geschikt is voor deze taken. Het MambaOut-kader is opgebouwd door Mamba-blokken op elkaar te stapelen terwijl het staatruimtemodel, de kern van de tokenmixer, wordt verwijderd. De experimentele resultaten ondersteunen de hypothese die door het MambaOut-kader wordt gesteld, aangezien het in staat is om alle visuele Mamba-modellen te overtreffen op het ImageNet-beeldclassificatiekader, wat aangeeft dat Mamba niet nodig is voor visietaken. Aan de andere kant kan het MambaOut-kader de prestaties van de state-of-the-art Mamba-modellen niet evenaren voor detectie- en segmentatietaken, wat de potentie van de Mamba-familie van modellen voor lange-sequentievisietaken aantoont.
Dit artikel heeft als doel het MambaOut-kader in detail te behandelen, en we onderzoeken de mechanisme, de methodologie, de architectuur van het kader, evenals de vergelijking met state-of-the-art-kaders. Laten we dus beginnen.
MambaOut: Is Mamba Echt Nodig voor Visie?
Met de vooruitgang van machine learning-toepassingen en -mogelijkheden zijn transformatoren opgekomen als de mainstream-ruggengraat voor een reeks taken, waaronder Vision Transformers, de GPT-serie van modellen, BERT en enkele andere. Echter, de tokenmixer van de transformatoren heeft een kwadratische complexiteit met betrekking tot de sequentielengte en stelt significante uitdagingen voor langere sequenties. Om dit probleem aan te pakken, zijn verschillende tokenmixers met lineaire complexiteit tot tokenlengte geïntroduceerd, zoals Linformer, Longformer, Performer, Dynamic Convolution en Big Bird. Echter, in recente tijden winnen Recurrent Neural Network-achtige modellen aan populariteit vanwege hun vermogen om parallelle trainingen uit te voeren en efficiënte prestaties te leveren op langere sequenties. Geleid door de opmerkelijke prestaties van RNN-achtige modellen, proberen onderzoekers de Mamba-familie van modellen in visuele herkenningstaken op te nemen, aangezien de tokenmixer van de Mamba-modellen het gestructureerde staatruimtemodel is onder de geest van de Recurrent Neural Networks. Echter, experimentele resultaten geven aan dat staatruimtemodel-gebaseerde kaders voor visie ondermaats presteren in vergelijking met aandacht-gebaseerde en state-of-the-art convolutionele modellen.
MambaOut is een poging om de aard van de Mamba-familie van modellen te onderzoeken en concludeert dat Mamba geschikt is voor taken die autoregressief of lange-sequentie zijn, aangezien het staatruimtemodel een inherente RNN-mechanisme heeft. Echter, de meeste visietaken hebben geen van beide kenmerken, en op basis van enkele experimenten, stelt MambaOut de volgende twee hypothesen. Ten eerste is het staatruimtemodel niet nodig voor beeldclassificatie, aangezien de beeldclassificatietaken noch autoregressieve noch lange-sequentiekenmerken hebben. Ten tweede kunnen staatruimtemodellen mogelijk gunstig zijn voor instantie-segmentatie en semantische segmentatie, evenals objectdetectie, aangezien ze lange-sequentiekenmerken vertonen, hoewel ze niet autoregressief zijn. Experimentele resultaten die zijn uitgevoerd om de RNN-achtige mechanisme van het staatruimtemodel te analyseren, concluderen dat het Mamba-kader geschikt is voor taken met autoregressieve of lange-sequentiekenmerken en niet nodig is voor beeldclassificatietaken. Wat het MambaOut-kader zelf betreft, is het een reeks Mamba-modellen op basis van Gated Convolutional Neural Network-blokken zonder het staatruimtemodel, en experimentele resultaten geven aan dat het MambaOut-kader in staat is om Mamba-modellen te overtreffen in beeldclassificatietaken, maar niet in staat is om de prestaties te evenaren op beelddetectie- en segmentatietaken.
Welke taken is Mamba geschikt voor?
De tokenmixer van het Mamba-kader is een selectief staatruimtemodel dat vier invoer-afhankelijke parameters definieert. De recurrente eigenschap van het kader onderscheidt RNN-achtige staatruimtemodellen van causale aandacht. De verborgen staat kan worden gezien als een vaste-grootte-geheugen dat historische informatie opslaat. De vaste grootte betekent dat het geheugen verliesgevoelig is, maar het zorgt er ook voor dat de computationele complexiteit van het integreren van geheugen met de huidige invoer constant blijft. Omgekeerd slaan causale aandachtlagen alle sleutels en waarden van voorgaande tokens op en breiden uit door de sleutel en waarde van de huidige token toe te voegen met elke nieuwe invoer, en dit geheugen is verliesvrij, in theorie. Echter, de geheugengrootte groeit naarmate meer tokens worden ingevoerd, waardoor de complexiteit van het integreren van geheugen met de huidige invoer toeneemt. Het verschil tussen de geheugemechanismen tussen causale aandacht en RNN-achtige modellen wordt geïllustreerd in de volgende figuur.

Aangezien het geheugen van het staatruimtemodel inherent verliesgevoelig is, komt het tekort aan het verliesvrije geheugen van causale aandacht, en als gevolg hiervan kunnen de Mamba-modellen hun kracht niet demonstreren in het omgaan met korte sequenties, een gebied waar causale aandachtmecanismen gemakkelijk presteren. Echter, in scenario’s die lange sequenties betreffen, faalt de causale aandachtbenedenweg vanwege de kwadratische complexiteit. In dit scenario toont het Mamba-kader zijn efficiëntie in het mengen van geheugen met de huidige invoer en is in staat om lange sequenties soepel te verwerken, wat aangeeft dat de Mamba-familie van modellen goed geschikt is voor het verwerken van lange sequenties.
Het is ook de moeite waard om op te merken dat, waar de recurrente aard van het staatruimtemodel de Mamba-modellen in staat stelt om efficiënt lange sequenties te verwerken, het een bepaalde beperking introduceert, aangezien het alleen informatie kan benaderen van de huidige en voorgaande tijdstappen, en dit type tokenmixing wordt causale modus genoemd, en wordt geïllustreerd in de volgende figuur. Vanwege de causale aard is deze methode geschikt voor autoregressieve generatietaken.

De fully-visible-modus is geschikt voor taken waarbij het model alle invoer tegelijk kan benaderen. Bovendien is aandacht in fully-visible-modus standaard en kan het gemakkelijk worden omgezet in causale modus door causale maskers toe te passen op de aandachtskaarten, en RNN-achtige modellen werken inherent in causale modus vanwege hun recurrente eigenschappen. Om alles samen te vatten, is het Mamba-kader geschikt voor taken die lange sequenties verwerken of taken die causale tokenmixingmodus vereisen.
Visuele Herkenningstaken, Causale Tokenmixingcode en Zeer Lange Sequenties
Zoals eerder besproken, staat de fully-visible-tokenmixingmodus een onbeperkt bereik van mixing toe, terwijl de causale modus de huidige token beperkt tot het benaderen van alleen de informatie van de voorgaande tokens. Bovendien wordt visuele herkenning gecategoriseerd als een begrijpende taak waarbij het model het hele beeld tegelijk kan zien, en dit elimineert de noodzaak voor beperkingen op tokenmixing, en het opleggen van extra beperkingen op tokenmixing kan de modelprestaties potentieel verslechteren.
Experimentele Verificatie en Resultaten
De volgende stap is om de hypothesen die door het MambaOut-kader worden gesteld, experimenteel te verifiëren. Zoals wordt aangetoond in de volgende afbeelding, is het Mamba-blok gebaseerd op het Gated Convolutional Neural Network-blok, en de meta-architectuur van de Mamba- en Gated CNN-blokken kan worden behandeld als een vereenvoudigde integratie van de tokenmixer van het MetaFormer-kader en een MLP.

Het Mamba-blok breidt het Gated Convolutional Neural Network-blok uit met een extra State Space Model, en de aanwezigheid van een SSm is wat het Gated CNN-blok en het Mamba-blok onderscheidt. Bovendien, om de praktische snelheid te verbeteren, voert het MambaOut-kader alleen diepte-convolutie uit op gedeeltelijke kanalen, en zoals wordt aangetoond in de volgende algoritme, is de implementatie van het Gated CNN-blok eenvoudig, maar effectief en elegant.

Beeldclassificatietaken
ImageNet dient als de benchmark voor beeldclassificatietaken, aangezien het bestaat uit meer dan duizend algemene klassen, meer dan 1,3 miljoen trainingsbeelden en meer dan 50.000 validatiebeelden. De gegevensaugmentatie die voor het experiment wordt gebruikt, bestaat uit willekeurige verkleinde oogst, Mixup, kleurjitter, Random Erasing, CutMix en Rand Augment. De volgende tabel samenvat de prestaties van de Mamba-familie van modellen, het MambaOut-model en andere aandacht-gebaseerde en convolutionele modellen op de ImageNet-dataset. Zoals te zien is, overtreft het MambaOut-kader zonder het staatruimtemodel de visuele Mamba-modellen met SSM consistent over alle modelgroottes.

Bijvoorbeeld retourneert het MambaOut-Small-model een top-1-accuratiescore van meer dan 84%, 0,4% hoger dan zijn dichtstbijzijnde Mamba-concurrent. Dit resultaat ondersteunt sterk de eerste hypothese die beweert dat het introduceren van een staatruimtemodel voor beeldclassificatietaken niet nodig is.
Objectdetectie- en Instantie-segmentatietaken
COCO dient als de benchmark voor objectdetectie- en instantie-segmentatietaken. Hoewel het MambaOut-kader in staat is om de prestaties van sommige visuele Mamba-modellen te overtreffen, komt het nog steeds tekort van state-of-the-art visuele Mamba-modellen, waaronder LocalVMamba en VMamba. Het verschil in prestaties van MambaOut tegenover state-of-the-art visuele modellen benadrukt de voordelen van het integreren van de Mamba-familie van modellen in lange-sequentievisietaken. Echter, het is de moeite waard om op te merken dat een aanzienlijk prestatieverschil nog steeds bestaat tussen state-of-the-art convolutioneel-aandacht-hybride modellen en visuele Mamba-modellen.

Finale Gedachten
De Mamba-familie van modellen lijkt geschikt te zijn voor taken met autoregressieve en lange-sequentiekenmerken. Het MambaOut-kader veronderstelt dat Mamba niet nodig is voor visietaken, aangezien beeldclassificatie noch autoregressieve noch lange-sequentiekenmerken heeft. Hoewel segmentatie- en detectietaken ook niet autoregressief zijn, vertonen ze lange-sequentiekenmerken, waardoor het MambaOut-kader veronderstelt dat Mamba mogelijk geschikt is voor deze taken. Het MambaOut-kader is opgebouwd door Mamba-blokken op elkaar te stapelen terwijl het staatruimtemodel, de kern van de tokenmixer, wordt verwijderd. De experimentele resultaten ondersteunen de hypothese die door het MambaOut-kader wordt gesteld, aangezien het in staat is om alle visuele Mamba-modellen te overtreffen op het ImageNet-beeldclassificatiekader, wat aangeeft dat Mamba niet nodig is voor visietaken. Aan de andere kant kan het MambaOut-kader de prestaties van de state-of-the-art Mamba-modellen niet evenaren voor detectie- en segmentatietaken, wat de potentie van de Mamba-familie van modellen voor lange-sequentievisietaken aantoont.












