Modely a platformy AI

Nejnovější model Mistral AI Mixture of Experts (MoE) 8x7B

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Mistral AI, který je pařížskou open-source modelovou startupem, vyhodil rukavici tradičnímu přístupu, když vydal svůj nejnovější velký jazykový model (LLM), MoE 8x7B, prostřednictvím jednoduchého torrent linku. To kontrastuje s tradičním přístupem Googlu při vydání Gemini, což vyvolává konverzace a vzrušení v komunitě AI.

Mistral AI vždy měl netradiční přístup k vydání. Často se vzdává obvyklých doprovodů, jako jsou články, blogy nebo tiskové zprávy, a jeho strategie byla jedinečně efektivní při získávání pozornosti komunity AI.

Nedávno společnost dosáhla pozoruhodné $2 miliardové valuace po kole fundingu vedeném Andreessen Horowitz. Tento fundingový kolo bylo historicky rekordní, s $118 miliony seed kola, největší v evropské historii. Kromě úspěchů v oblasti financování je Mistral AI aktivně zapojen do diskusí kolem evropského zákona o AI, kdy prosazuje snížení regulace v oblasti open-source AI.

Proč MoE 8x7B přitahuje pozornost

Popisovaný jako “škálovatelný GPT-4”, Mixtral 8x7B využívá architekturu Mixture of Experts (MoE) se sedmi odborníky. Každý odborník má 111B parametrů, spojených se 55B sdílenými pozornostními parametry, aby poskytli celkový počet 166B parametrů na model. Tento designový výběr je významný, protože umožňuje, aby se do inferencing každého tokenu zapojily pouze dva odborníci, což naznačuje posun směrem k efektivnějšímu a zaměřenému zpracování AI.

Jednou z hlavních výhod Mixtralu je jeho schopnost zvládat rozsáhlý kontext 32 000 tokenů, poskytující dostatek prostoru pro zpracování složitých úkolů. Modelové multilingvální schopnosti zahrnují robustní podporu pro angličtinu, francouzštinu, italštinu, němčinu a španělštinu, čímž se zaměřuje na globální komunitu vývojářů.

Předtrénování Mixtralu zahrnuje data z otevřeného webu, souběžné trénování pro odborníky i routery. Tato metoda zajišťuje, že model není pouze rozsáhlý ve svém parametrickém prostoru, ale také jemně naladěn na nuance rozsáhlých dat, kterým byl vystaven.

Mixtral 8x7B dosahuje působivého skóre

Mixtral 8x7B dosahuje působivého skóre

Mixtral 8x7B překonává LLaMA 2 70B a soupeří s GPT-3.5, zejména pozoruhodně v úkolu MBPP s 60,7% úspěšností, což je výrazně vyšší než u jeho protějšků. I v náročném úkolu MT-Bench, který je přizpůsoben pro modely, které následují instrukce, Mixtral 8x7B dosahuje působivého skóre, téměř se rovnajícího GPT-3.5

Pochopení architektury Mixture of Experts (MoE)

Model Mixture of Experts (MoE), který nedávno získal pozornost díky své inkorporaci do špičkových jazykových modelů, jako je Mistral AI MoE 8x7B, má své kořeny v základních konceptech, které sahají několik let zpět. Připomeňme si původní myšlenku prostřednictvím seminárních výzkumných prací.

Koncept MoE

Mixture of Experts (MoE) představuje posun v architektuře neuronových sítí. Na rozdíl od tradičních modelů, které používají jeden homogenní síť pro zpracování všech typů dat, MoE přijímá specializovanější a modulárnější přístup. Skládá se z více “odbornických” sítí, každá z nich je navržena pro zpracování specifických typů dat nebo úkolů, a “gating síť”, která dynamicky směruje vstupní data k nejpříslušnějšímu odborníkovi.

Mixture of Experts (MoE) vrstva vložená do rekurentního jazykového modelu

Mixture of Experts (MoE) vrstva vložená do rekurentního jazykového modelu (Zdroj)

 

Vyšší pohled na MoE vrstvu v jazykovém modelu. V jeho podstatě se MoE vrstva skládá z více feed-forward podsítí, nazývaných “odborníci”, každý z nich má potenciál specializovat se na zpracování různých aspektů dat. Gating síť, zvýrazněná v diagramu, určuje, která kombinace těchto odborníků se zapojí pro daný vstup. Tato podmíněná aktivace umožňuje síti výrazně zvýšit její kapacitu bez odpovídajícího nárůstu výpočetní náročnosti.

Funkce MoE vrstvy

V praxi gating síť vyhodnotí vstup (označený jako G(x) v diagramu) a vybere sparse sadu odborníků pro jeho zpracování. Tento výběr je modulován výstupy gating sítě, efektivní určující “hlas” nebo příspěvek každého odborníka k finálnímu výstupu. Například, jak je ukázáno v diagramu, mohou být pro výpočet výstupu pro každý specifický token vybráni pouze dva odborníci, což činí proces efektivní koncentrací výpočetních zdrojů tam, kde jsou nejvíce potřeba.

 

Transformer Encoder s MoE vrstvami (Zdroj)

Druhá ilustrace výše kontrastuje tradiční Transformer encoder s tím, který je doplněn o MoE vrstvu. Architektura Transformer, široce známá pro svou efektivitu v jazykových úkolech, tradičně se skládá z self-attention a feed-forward vrstev, které jsou navrstveny v sekvenci. Zavedení MoE vrstev nahrazuje některé z těchto feed-forward vrstev, umožňující modelu lépe škálovat s ohledem na kapacitu.

V doplněném modelu jsou MoE vrstvy rozděleny napříč několika zařízeními, což ukazuje model-paralelní přístup. To je kritické při škálování na velmi velké modely, protože umožňuje distribuci výpočetní zátěže a paměťových požadavků napříč clusterem zařízení, jako jsou GPU nebo TPU. Tento přístup je nezbytný pro efektivní trénování a nasazení modelů s miliardami parametrů, jak je dokázáno trénováním modelů s stovkami miliard až biliony parametrů na velkých výpočetních clusterech.

Škálovatelný přístup MoE s instrukční optimalizací na LLM

Článek s názvem “Sparse Mixture-of-Experts (MoE) for Scalable Language Modeling” diskutuje o inovativním přístupu ke zlepšení Large Language Modelů (LLM) integrací architektury Mixture of Experts s instrukční optimalizací.

To zdůrazňuje společnou výzvu, kdy MoE modely podávají horší výkon ve srovnání s hustými modely stejné výpočetní kapacity, když jsou jemně optimalizovány pro specifické úkoly, kvůli nesrovnalostem mezi obecným předtrénováním a úkol-specifickým jemným optimalizováním.

Instrukční optimalizace je trénovací metodologií, při které se modely rafinují, aby lépe následovaly přirozené jazykové instrukce, efektivní zlepšují jejich úkolový výkon. Článek naznačuje, že MoE modely vykazují pozoruhodné zlepšení, když jsou kombinovány s instrukční optimalizací, více než jejich husté protějšky. Tato technika zarovnává modelovy předtrénované reprezentace, aby lépe následovaly instrukce, vedoucí k významným výkonovým impulzům.

Výzkumníci provedli studie napříč třemi experimentálními nastaveními, odhalující, že MoE modely initially podávají horší výkon v přímém úkol-specifickém jemném optimalizování. Nicméně, když je aplikována instrukční optimalizace, MoE modely vynikají, zvláště když jsou dále doplněny o úkol-specifické jemné optimalizování. To naznačuje, že instrukční optimalizace je klíčovým krokem pro MoE modely, aby překonaly husté modely v downstream úkolech.

Účinek instrukční optimalizace na MOE

Účinek instrukční optimalizace na MOE

To také představuje FLAN-MOE32B, model, který demonstruje úspěšnou aplikaci těchto konceptů. Pozoruhodně, překonává FLAN-PALM62B, hustý model, v benchmark úkolech, zatímco využívá pouze jednu třetinu výpočetních zdrojů. To ukazuje potenciál pro sparse MoE modely kombinované s instrukční optimalizací, aby nastavily nové standardy pro LLM efektivitu a výkon.

Implementace Mixture of Experts v reálných scénářích

Univerzálnost MoE modelů je ideální pro řadu aplikací:

  • Přirozený jazykový procesing (NLP): MoE modely mohou lépe zvládat nuance a složitosti lidského jazyka, což je činí ideálními pro pokročilé NLP úkoly.
  • Obraz a video zpracování: V úkolech, které vyžadují vysoké rozlišení zpracování, MoE může zvládat různé aspekty obrazů nebo video snímků, zlepšující jak kvalitu, tak zpracování.
  • Vlastní AI řešení: Podniky a výzkumníci mohou přizpůsobit MoE modely specifickým úkolem, vedoucí k více cíleným a efektivnímu AI řešením.

Výzvy a úvahy

Zatímco MoE modely nabízejí řadu výhod, také představují jedinečné výzvy:

  • Složitost trénování a optimalizace: Distribuovaná povaha MoE modelů může komplikovat trénovací proces, vyžadující pečlivé vyvážení a optimalizaci odborníků a gating sítě.
  • Správa zdrojů: Efektivní správa výpočetních zdrojů napříč několika odborníky je zásadní pro maximalizaci výhod MoE modelů.

Inkorporace MoE vrstev do neuronových sítí, zvláště v oblasti jazykových modelů, nabízí cestu ke škálování modelů na velikosti, které byly dříve kvůli výpočetním omezením nevýhodné. Kondicionální výpočet umožněný MoE vrstvami umožňuje více efektivní distribuci výpočetních zdrojů, což umožňuje trénovat větší, schopnější modely. Jak budeme vyžadovat více od našich AI systémů, architektury, jako je MoE vybavený Transformer, budou pravděpodobně stanoveny jako standard pro zpracování komplexních, velkých úkolů napříč různými domény.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.