Modely a platformy AI

Mistral AI: Nová výzva v otevřeném prostoru Large Language Models

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Velké jazykové modely (LLM) se nedávno staly středem pozornosti, díky vynikajícím výkonům jako je ChatGPT. Když Meta představila své modely Llama, vyvolala to nový zájem o otevřené jazykové modely. Cílem je vytvořit dostupné, otevřené LLM, které jsou stejně dobré jako špičkové modely jako GPT-4, ale bez vysoké ceny nebo složitosti.

Tato kombinace dostupnosti a efektivity nejen otevřela nové cesty pro výzkumníky a vývojáře, ale také nastartovala novou éru technologických pokroků v oblasti zpracování přirozeného jazyka.

Nedávno získaly startupy zaměřené na generativní AI značné financování. Společně vybrala 20 milionů dolarů, aby vytvořila otevřené AI modely. Anthropic také získal působivých 450 milionů dolarů a Cohere, který spolupracuje s Google Cloud, získal 270 milionů dolarů v červnu tohoto roku.

Úvod do Mistral 7B: Velikost a dostupnost

mistral AI

Mistral AI, se sídlem v Paříži a založená bývalými zaměstnanci Google DeepMind a Meta, představila svůj první velký jazykový model: Mistral 7B. Tento model lze snadno stáhnout z GitHubu a dokonce i prostřednictvím 13,4gigabytového torrentu.

Tato společnost získala rekordní seed financování, aniž by měla produkt na trhu. Mistral AI první model s 7 miliardami parametrů překonává výkon Llama 2 13B ve všech testech a překonává Llama 1 34B ve mnoha metrikách.

V porovnání s jinými modely, jako je Llama 2, nabízí Mistral 7B podobné nebo lepší schopnosti, ale s nižší výpočetní náročností. Zatímco základní modely jako GPT-4 mohou dosáhnout více, jsou spojeny s vyššími náklady a nejsou tak uživatelsky přívětivé, protože jsou主要 přístupné prostřednictvím API.

Při úkolech souvisejících s kódováním nabízí Mistral 7B CodeLlama 7B konkurenceschopnou možnost. Kromě toho je kompaktní, pouze 13,4 GB, a lze jej spustit na standardních strojích.

Dále nabízí Mistral 7B Instruct, který je speciálně navržen pro instruktážní datové sady na Hugging Face, a prokázal vynikající výkon. Překonává ostatní 7B modely na MT-Bench a stojí ramen u ramen s 13B chat modely.

Testování výkonu

V podrobné analýze výkonu byl Mistral 7B měřen proti modelům Llama 2. Výsledky byly jasné: Mistral 7B podstatně překonává Llama 2 13B ve všech testech. Ve skutečnosti se vyrovnal výkonu Llama 34B, zejména vynikající v testech kódu a rozumění.

Testy byly rozděleny do několika kategorií, jako je rozumění, znalosti, čtení, matematika a kód, mezi jinými. Zvláště pozoruhodným pozorováním bylo, že Mistral 7B prokázal výkon podobný Llama 2 modelu třikrát větší, což naznačuje potenciální úspory v paměti a zvýšení propustnosti. Nicméně, v testech znalostí se Mistral 7B vyrovnal Llama 2 13B, což je pravděpodobně způsobeno omezeními parametrů, které ovlivňují kompresi znalostí.

Co dělá model Mistral 7B lepší než většina ostatních jazykových modelů?

Zjednodušení mechanismů pozornosti

Zatímco technické detaily mechanismů pozornosti jsou složité, jejich základní myšlenka je relativně jednoduchá. Představte si, že čtete knihu a zvýrazňujete důležité věty; to je podobné tomu, jak mechanismy pozornosti “zvýrazňují” nebo dávají důležitost konkrétním datovým bodům v sekvenci.

V kontextu jazykových modelů tyto mechanismy umožňují modelu soustředit se na nejrelevantnější části vstupních dat, aby výstup byl koherentní a kontextuálně přesný.

V standardních transformerech se pozornostní skóre vypočítávají pomocí vzorce:

Transformers attention Formula

Transformers Attention Formula

Vzorec pro tyto skóre zahrnuje kritický krok – maticové násobení Q a K. Výzvou zde je, že se zvyšující se délkou sekvence expandují obě matice, což vede k výpočetně náročnému procesu. Tato škálovatelnost je jedním z hlavních důvodů, proč standardní transformery mohou být pomalé, zejména při zpracování dlouhých sekvencí.

transformerMechanismy pozornosti pomáhají modelům soustředit se na konkrétní části vstupních dat. Typicky tyto mechanismy používají “hlavy” pro řízení pozornosti. Čím více hlav máte, tím specifičtější pozornost, ale také se stává komplexnější a pomalejší. Prohlédněte si tento odkaz pro hlubší pochopení transformerů a mechanismů pozornosti.

Multi-dotazová pozornost (MQA) zrychluje proces pomocí jedné sady “klíč-hodnota” hlav, ale někdy obětuje kvalitu. Teď se můžete ptát, proč nekombinovat rychlost MQA s kvalitou multi-hlavové pozornosti? To je místo, kde přichází Skupinová dotazovaná pozornost (GQA).

Skupinová dotazovaná pozornost (GQA)

Grouped-query attention

Skupinová dotazovaná pozornost

GQA je kompromisní řešení. Místo použití pouze jedné nebo více “klíč-hodnota” hlav, GQA skupiny. Tímto způsobem GQA dosahuje výkonu blízkého podrobné multi-hlavové pozornosti, ale s rychlostí MQA. Pro modely jako Mistral to znamená efektivní výkon bez kompromisů v kvalitě.

Klouzavá okenní pozornost (SWA)

longformer transformers sliding window

Metoda klouzavého okna je další metodou zpracování sekvencí pozornosti. Tato metoda používá pevně veliké okno pozornosti kolem každého tokenu v sekvenci. S více vrstvami, které zásobují tuto okenní pozornost, horní vrstvy nakonec získávat širší perspektivu, zahrnující informace z celého vstupu. Tento mechanismus je analogický k receptivním polím pozorovaným v Konvolučních neuronových sítích (CNN).

Na druhé straně “dilatovaná klouzavá okenní pozornost” modelu Longformer, který je konceptuálně podobný metodě klouzavého okna, počítá pouze několik diagonál matice. Tato změna vede k lineárnímu nárůstu paměťového využití, namísto kvadratického, což z ní činí efektivnější metodu pro delší sekvence.

Transparentnost Mistral AI vs. bezpečnostní obavy v decentralizaci

V svém oznámení Mistral AI zdůraznila transparentnost prohlášením: “Žádné triky, žádné proprietární údaje.” Ale současně je jejich jediným dostupným modelem v současnosti ‘Mistral-7B-v0.1’, který je předtrénovaný základní model, a proto může generovat odpověď na jakoukoli otázku bez moderace, což vyvolává potenciální bezpečnostní obavy. Zatímco modely jako GPT a Llama mají mechanismy pro rozpoznání, kdy odpovědět, plně decentralizovaná povaha Mistralu by mohla být zneužita špatnými aktéry.

Nicméně, decentralizace velkých jazykových modelů má své výhody. Zatímco někteří ji mohou zneužít, lidé mohou využít její sílu pro společenské dobro a zpřístupnit inteligenci všem.

Flexibilita nasazení

Jedním z hlavních výhod je, že Mistral 7B je dostupný pod licencí Apache 2.0. To znamená, že neexistují žádné skutečné bariéry pro jeho použití – ať už jej používáte pro osobní účely, velkou korporaci nebo dokonce vládní entitu. Stačí vám pouze správný systém pro jeho spuštění, nebo můžete investovat do cloudových zdrojů.

Zatímco existují další licence, jako je jednodušší licence MIT a kooperativní licence CC BY-SA-4.0, která vyžaduje uvedení zdroje a podobnou licenci pro odvozená díla, licence Apache 2.0 poskytuje robustní základ pro velké podniky.

Závěrečné myšlenky

Růst otevřených velkých jazykových modelů, jako je Mistral 7B, signalizuje zásadní změnu v odvětví AI, zpřístupňující kvalitní jazykové modely širšímu publiku. Inovativní přístupy Mistral AI, jako je Skupinová dotazovaná pozornost a Klouzavá okenní pozornost, slibují efektivní výkon bez kompromisů v kvalitě.

Zatímco decentralizovaná povaha Mistralu představuje určité výzvy, jeho flexibilita a otevřená licence podtrhují potenciál pro demokratizaci AI. Jak se krajina vyvíjí, bude se zaměřovat na vyvážení síly těchto modelů s etickými úvahami a bezpečnostními mechanismy.

Co je další krok pro Mistral? Model 7B byl pouze začátek. Tým plánuje spuštění ještě větších modelů brzy. Pokud tyto nové modely odpovídají výkonu 7B, Mistral by mohl rychle vystoupit jako jeden z nejlepších hráčů v odvětví, a to vše během svého prvního roku.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.