AI-modeller og platforme
MambaOut: Er Mamba virkelig nødvendig for vision?
I moderne maskinlærings- og kunstig intelligens-rammer er transformers en af de mest anvendte komponenter på tværs af forskellige domæner, herunder GPT-serien og BERT i naturlig sprogbehandling samt Vision Transformers i computer vision-opgaver. Selvom inklusion af transformers i modelarkitekturen giver en betydelig forbedring af modelpræstationen, skalérer attention-modulen i Transformers kvadratisk med sekvenslængden, hvilket fører til store beregningsmæssige udfordringer. Gennem årene har forskellige modeller udforsket forskellige strategier for at tackle de beregningsmæssige udfordringer, herunder metoder som kernelisering, historik hukommelseskompression, token mixing-rækkegrænse og lav-rang-tilgange. For nylig har Recurrent Neural Networks som Mamba og RWKV samlet betydelig opmærksomhed på grund af deres lovende resultater i store sprogmodeller.
Mamba, en familie af modeller, har en arkitektur med en Recurrent Neural Network-lignende token-mixer af en tilstandsspace-model, der blev introduceret for at tackle den kvadratiske kompleksitet af attention-mekanismerne og blev anvendt på vision-opgaver herefter. Forskere har allerede udforsket måder at inkorporere Mamba og SSM eller State Space Model i visuel genkendelse-opgaver, og Vision Mamba, der inkorporerer Mamba for at udvikle isotrope vision-modeller lignende Vision Transformer, er et godt eksempel herpå. På den anden side inkorporerer LocalMamba lokale induktive fordomme for at forbedre visuelle Mamba-modeller, og VMamba-rammen anvender den grundlæggende Mamba-model til at konstruere hierarkiske modeller lignende ResNet og AlexNet. Men er Mamba-rammen virkelig essentiel for visuel genkendelse kontekst-opgaver? Spørgsmålet opstår, fordi præstationen af Mamba-familien af modeller for vision-opgaver har været skuffende hidtil i forhold til traditionelle attention-baserede og convolutionelle modeller.
MambaOut forsøger at besvare, om Mamba er ideelt egnet til opgaver med autoregressive og lange-sekvens-karakteristika. MambaOut-rammen hypotiserer, at Mamba ikke er nødvendig for vision-opgaver, da billedklassifikation ikke stemmer overens med lange-sekvens- eller autoregressive karakteristika. Selvom segmentering og detektion-opgaver ikke er autoregressive, viser de lange-sekvens-karakteristika, hvilket fører MambaOut-rammen til at hypotisere potentialet for Mamba i disse opgaver. MambaOut-rammen er konstrueret ved at stable Mamba-blokke oven på hinanden, mens den fjerner tilstandsspace-modellen, dens kerne-token-mixer. De eksperimentelle resultater støtter hypotesen, der er fremsat af MambaOut-rammen, da den er i stand til at overgå alle visuelle Mamba-modeller på ImageNet-billedklassifikations-rammen, hvilket indikerer, at Mamba ikke er nødvendig for vision-opgaver. På den anden side er MambaOut-rammen ikke i stand til at genskabe præstationen på billed-detektion og segmenterings-opgaver, hvilket demonstrerer potentialet for Mamba-familien af modeller for lange-sekvens visuelle opgaver.
Denne artikel har til formål at dække MambaOut-rammen i dybden, og vi udforsker mekanismen, metoden, arkitekturen af rammen samt dens sammenligning med state-of-the-art-rammer. Så lad os komme i gang.
MambaOut: Er Mamba virkelig nødvendig for vision?
Med fremgangen af maskinlæringsapplikationer og -kapaciteter er Transformers blevet det mest anvendte backbone for en række opgaver, herunder Vision Transformers, GPT-serien af modeller, BERT og flere andre. Men token-mixeren i transformeren medfører en kvadratisk kompleksitet i forhold til sekvenslængden og stiller betydelige udfordringer for længere sekvenser. For at tackle dette problem er forskellige token-mixere med lineær kompleksitet i forhold til token-længde som Linformer, Longformer, Performer, Dynamic Convolution og Big Bird blevet introduceret. Men i nyere tid er Recurrent Neural Network-lignende modeller blevet mere fremtrædende på grund af deres evne til paralleliserbar træning og effektiv præstation på længere sekvenser. Guidet af de bemærkelsesværdige resultater, der er blevet opnået af RNN-lignende modeller, forsøger forskere at introducere og anvende Mamba-familien af modeller i visuel genkendelse-opgaver, da token-mixeren af Mamba-modellerne er den strukturerede tilstandsspace-model under ånden af Recurrent Neural Networks. Men eksperimentelle resultater indikerer, at tilstandsspace-model-baserede rammer for vision præsterer underwhelmingly på tværs af virkelige vision-opgaver i forhold til attention-baserede og state-of-the-art convolutionelle modeller.
MambaOut er et forsøg på at undersøge naturen af Mamba-familien af modeller og summerer, at Mamba er egnet til opgaver, der er enten autoregressive eller lange-sekvens, da tilstandsspace-modellen har en indbygget RNN-mekanisme. Men da de fleste vision-opgaver ikke har disse karakteristika, og på baggrund af nogle eksperimenter, foreslår MambaOut følgende to hypoteser. Først er tilstandsspace-modellen ikke nødvendig for billedklassifikation, da billedklassifikations-opgaven ikke stemmer overens med autoregressive eller lange-sekvens-karakteristika. Anden er, at tilstandsspace-modeller kan være hypotetisk gavnligt for instans-segmentering og semantisk segmentering samt objekt-detektion, da de følger lange-sekvens-karakteristika, selvom de ikke er autoregressive. Eksperimentelle resultater, der er udført for at analysere den Recurrent Neural Network-lignende mekanisme af tilstandsspace-modellen, konkluderer, at Mamba-rammen er egnet til opgaver med autoregressive eller lange-sekvens-karakteristika og er unødvendig for billedklassifikations-opgaver. Når det kommer til MambaOut-rammen selv, er det en række Mamba-modeller baseret på Gated Convolutional Neural Network-blokke uden tilstandsspace-modellen, og eksperimentelle resultater indikerer, at MambaOut-rammen er i stand til at overgå Mamba-modellerne i billedklassifikations-opgaver, men ikke kan genskabe præstationen på billed-detektion og segmenterings-opgaver.
Hvilke opgaver er Mamba egnet til?
Token-mixeren af Mamba-rammen er en selektiv tilstandsspace-model, der definerer fire input-afhængige parametre. Den rekurrente egenskab af rammen adskiller RNN-lignende tilstandsspace-modeller fra causal attention. Den skjulte tilstand kan ses som en fast-størrelses hukommelse, der gemmer historisk information. Den faste størrelse betyder, at hukommelsen er tabt, men den sikrer også, at den beregningsmæssige kompleksitet af at integrere hukommelse med den aktuelle input forbliver konstant. Omvendt gemmer causal attention-lagre alle nøgler og værdier fra tidligere tokens og udvider ved at tilføje nøglen og værdien af den aktuelle token med hver ny input, og denne hukommelse er tabløs, teoretisk. Men hukommelsesstørrelsen vokser, når flere tokens indtastes, og kompleksiteten af at integrere hukommelsen med den aktuelle input øges. Forskellen mellem hukommelsesmekanismerne mellem causal attention og RNN-lignende modeller er illustreret i følgende figur.

Da hukommelsen af tilstandsspace-modellen er indbygget tabt, kommer den til kort i forhold til den tabløse hukommelse af causal attention, og som resultat kan Mamba-modellerne ikke demonstrere deres styrke i håndtering af korte sekvenser, et område, hvor causal attention-mekanismen præsterer godt med lethed. Men i scenarier, der involverer lange sekvenser, svigter causal attention-tilgange på grund af den kvadratiske kompleksitet. I dette scenarie viser Mamba-rammen sin effektivitet i at integrere hukommelse med den aktuelle input og kan håndtere lange sekvenser glat, hvilket indikerer, at Mamba-familien af modeller er egnet til at håndtere lange sekvenser.
Det er også værd at bemærke, at på den ene side, hvor den rekurrente natur af tilstandsspace-modellen tillader Mamba-modellerne at håndtere lange sekvenser effektivt, introducerer den en vis begrænsning, da den kun kan adgang til information fra den aktuelle og tidligere tidsrum, og denne type token-mixing kaldes causal mode, og illustreres i følgende figur. På grund af sin causale natur er denne metode egnet til autoregressive generation-opgaver.

Den fuldt-synlige mode er egnet til forståelses-opgaver, hvor modellen kan adgang til alle input på én gang. Desuden er attention i fuldt-synlig mode som standard, og det kan omdannes til causal mode let ved at anvende causale masker til attention-kortene, og RNN-lignende modeller opererer indbygget i causal mode på grund af deres rekurrente egenskaber. For at summerer tingene er Mamba-rammen egnet til opgaver, der enten involverer håndtering af lange sekvenser eller opgaver, der kræver causal token-mixing-mode.
Visuel genkendelse-opgaver, causal token-mixing-kode og meget lange sekvenser
Som diskuteret tidligere tillader den fuldt-synlige token-mixing-mode en ubegrænset række af mixing, mens den causale mode begrænser den aktuelle token til at adgang til kun information fra de foregående tokens. Desuden er visuel genkendelse kategoriseret som en forståelses-opgave, hvor modellen kan se hele billedet på én gang, og dette eliminerer behovet for begrænsninger på token-mixing, og påføring af yderligere begrænsninger på token-mixing kan potentielt degradere modelpræstationen. Generelt er den fuldt-synlige mode egnet til forståelses-opgaver, mens den causale mode passer bedre til autoregressive opgaver. Desuden støttes dette krav yderligere af det faktum, at BeRT- og ViT-modeller anvendes mere til forståelses-opgaver end GPT-modeller.
Eksperimentel verificering og resultater
Det næste skridt er at verificere hypoteserne, der er foreslået af MambaOut-rammen, eksperimentelt. Som demonstreret i følgende billed, er Mamba-blokken baseret på Gated Convolutional Neural Network-blokken, og meta-arkitekturen af Mamba- og Gated CNN-blokke kan behandles som en simplificeret integration af token-mixeren af MetaFormer-rammen og en MLP.

Mamba-blokken udvider Gated Convolutional Neural Network med en ekstra tilstandsspace-model, og tilstedeværelsen af en SSm er, hvad der adskiller Gated CNN- og Mamba-blokke. Desuden til at forbedre den praktiske hastighed, udfører MambaOut-rammen kun dybdevis convolution på del-kanaler, og som demonstreret i følgende algoritme, er implementeringen af Gated CNN-blokken enkel, men effektiv og elegant.

Billedklassifikations-opgave
ImageNet fungerer som benchmark for billedklassifikations-opgaver, da det består af over 1000 almindelige klasser, over 1,3 millioner træningsbilleder og over 50.000 valideringsbilleder. Data-forstærkningen, der anvendes til eksperimentet, består af tilfældig resized crop, Mixup, farve-jitter, Random Erasing, CutMix og Rand Augment. Følgende tabel summerer præstationen af Mamba-familien af modeller, MambaOut-modellen og andre attention-baserede og convolutionelle modeller på ImageNet-datasættet. Som det kan ses, overgår MambaOut-rammen uden tilstandsspace-modellen konsekvent alle visuelle Mamba-modeller på tværs af alle modelstørrelser.

For eksempel returnerer MambaOut-Small-modellen en top-1 nøjagtighedsscore på over 84%, 0,4% højere end dens nærmeste Mamba-konkurrent. Dette resultat støtter stærkt den første hypotese, der påstår, at introduktion af en tilstandsspace-model for billedklassifikations-opgaver ikke er nødvendig.
Objekt-detektion og instans-segmenterings-opgaver
COCO fungerer som benchmark for objekt-detektion og instans-segmenterings-opgaver. Selvom MambaOut-rammen er i stand til at overgå præstationen af nogle visuelle Mamba-modeller, kommer den stadig til kort i forhold til state-of-the-art visuelle Mamba-modeller, herunder LocalVMamba og VMamba. Forskellen i præstation af MambaOut mod state-of-the-art visuelle modeller understreger fordelene ved at integrere Mamba-familien af modeller i lange-sekvens visuelle opgaver. Men det er værd at bemærke, at en betydelig præstationsforskel stadig eksisterer mellem state-of-the-art convolution-attention-hybrid-modeller og visuelle Mamba-modeller.

Endelige tanker
Mamba-familien af modeller synes at være egnet til opgaver, der involverer autoregressive og lange-sekvens-karakteristika. MambaOut-rammen hypotiserer, at Mamba ikke er nødvendig for vision-opgaver, da billedklassifikation ikke stemmer overens med lange-sekvens- eller autoregressive karakteristika. Selvom segmentering og detektion-opgaver ikke er autoregressive, viser de lange-sekvens-karakteristika, hvilket fører MambaOut-rammen til at hypotisere potentialet for Mamba i disse opgaver. MambaOut-rammen er konstrueret ved at stable Mamba-blokke oven på hinanden, mens den fjerner tilstandsspace-modellen, dens kerne-token-mixer. De eksperimentelle resultater støtter hypotesen, der er fremsat af MambaOut-rammen, da den er i stand til at overgå alle visuelle Mamba-modeller på ImageNet-billedklassifikations-rammen, hvilket indikerer, at Mamba ikke er nødvendig for vision-opgaver. På den anden side er MambaOut-rammen ikke i stand til at genskabe præstationen på billed-detektion og segmenterings-opgaver, hvilket demonstrerer potentialet for Mamba-familien af modeller for lange-sekvens visuelle opgaver.












