Modely a platformy AI
BlackMamba: Směs odborníků pro modely s prostorovým stavem
Vývoj velkých jazykových modelů (LLM) postavených na dekodérech pouze transformátorových modelů sehrál zásadní roli v transformaci oblasti zpracování přirozeného jazyka (NLP) a pokroku v různých aplikacích hlubokého učení, včetně učení s posilováním, analýzy časových řad, zpracování obrazu a mnoha dalších. Nicméně, navzdory jejich škálovatelnosti a silnému výkonu, LLM postavené na dekodérech pouze transformátorových modelů stále čelí významným nedostatkům. Ačkoli jsou expresivní, mechanismus pozornosti v transformátorových modelech vyžaduje vysoké výpočetní zdroje během inference a trénování, což vyžaduje podstatnou paměť pro délku sekvence a kvadratické FLOPy. Tato vysoká výpočetní náročnost omezuje délku kontextu modelů, zvyšuje náklady na autoregresivní generaci úkolů s rostoucí škálou a brání schopnosti modelů učit se z kontinuálních datových toků a zpracovávat sekvence neomezené délky efektivně.
V posledních letech se modely s prostorovým stavem (SSM) ukázaly jako velmi schopné a výkonné, soutěží s transformátorovými architekturami v velkých modelovacích benchmarcích a dosahují lineární složitosti v závislosti na délce sekvence a lineárním čase. Navíc, Mamba, nedávno vydaný model s prostorovým stavem, prokázal vynikající výkon v řadě úkolů zpracování jazyka a zpracování dlouhých sekvencí. Současně, modely s mixem odborníků (MoE) také prokázaly vynikající výkon, zatímco významně snižují latenci a výpočetní náklady inference, byť za cenu větší paměťové stopy. Tento článek bude diskutovat o BlackMamba, novém architektu, který kombinuje model Mamba s prostorovým stavem s modely MoE, aby využil výhod obou rámců. Experimenty na BlackMamba prokázaly jeho schopnost překonat existující rámec Mamba a transformátorové baseline v obou trénovacích FLOPech a inference.
Cílem tohoto článku je pokrýt rámec BlackMamba do hloubky. Prozkoumáme mechanismus, metodologii a architekturu rámců, spolu s jeho srovnáním se stávajícími obrazovými a videovými generativními rámci. Pojďme začít.
BlackMamba: Úvod do MoE pro modely s prostorovým stavem
Progrese velkých jazykových modelů (LLM), zejména těch postavených na dekodérech pouze transformátorových architektur, měla významný vliv na oblast zpracování přirozeného jazyka (NLP) a rozšířila se do různých aplikací hlubokého učení, včetně učení s posilováním, analýzy časových řad, zpracování obrazu a dalších. Nicméně, navzdory jejich škálovatelnosti a silnému výkonu, tyto dekodéry pouze transformátorové LLM stále čelí významným nedostatkům. Mechanismus pozornosti, klíčová součást transformátorových modelů, vyžaduje vysoké výpočetní zdroje během inference a trénování, což vyžaduje podstatnou paměť pro délku sekvence a kvadratické FLOPy.
BlackMamba: Architektura a metodologie
Modely s prostorovým stavem
Modely s prostorovým stavem patří do skupiny sekvencových modelů s lineární složitostí v závislosti na délce vstupní sekvence. Architektura modelů s prostorovým stavem se více podobá rekurentním neuronovým sítím a konvolučním neuronovým sítím než architektuře založené na pozornosti a je inspirována kontinuálním dynamickým systémem, který mapuje 1-dimenzionální funkci přes implicitní latentní prostor.
Modely s mixem odborníků
Modely s mixem odborníků (MoE) dosahují oddělení mezi náklady na inference a celkovým počtem parametrů, selektivně aktivují parametry během forward passu. Místo použití všech parametrů, tyto modely směrují tokeny do specifických Multilayer Perceptron (MLP) odborníků.
Architektura
BlackMamba využívá standardní transformátorový model, skládající se z Multilayer Perceptron bloků a bloků pozornosti, které jsou přidány v sekvenci podél reziduální streamu. BlackMamba nahrazuje Multilayer Perceptron bloky v transformátoru s routovaným expertním vrstvami a nahrazuje blok pozornosti s modelem Mamba s prostorovým stavem.
Trénování a dataset
BlackMamba model je trénován na více než 300 miliardách tokenů na vlastním datasetu a využívá SwiGLU aktivaci pro expertní Multilayer Perceptron. Rámec trénuje s 8 experty, což je číslo, které vývojáři považovali za správnou rovnováhu mezi paměťovou stopou a náklady na inference modelu.
BlackMamba: Výsledky
Experimenty na BlackMamba prokázaly jeho schopnost překonat existující rámec Mamba a transformátorové baseline v obou trénovacích FLOPech a inference. Výjimečný výkon rámců BlackMamba prokázal, že je schopen kombinovat schopnosti rámců Mamba a MoE výjimečně dobře, kombinuje levkou a rychlou inference z MoE s lineární složitostí generace z Mamba.
Závěrečné myšlenky
V tomto článku jsme diskutovali o BlackMamba, novém architektu, který kombinuje model Mamba s prostorovým stavem s modely MoE, aby využil výhod obou rámců. Experimenty na BlackMamba prokázaly jeho schopnost překonat existující rámec Mamba a transformátorové baseline v obou trénovacích FLOPech a inference. Výjimečný výkon rámců BlackMamba prokázal, že je schopen kombinovat schopnosti rámců Mamba a MoE výjimečně dobře, kombinuje levkou a rychlou inference z MoE s lineární složitostí generace z Mamba.












