Modely a platformy AI

Mistral AI: NovÃĄ vÃ―zva v otevřenÃĐm prostoru Large Language Models

mm
Přidejte Unite.AI mezi svÃĐ preferovanÃĐ zdroje na Google

VelkÃĐ jazykovÃĐ modely (LLM) se nedÃĄvno staly středem pozornosti, díky vynikajícím vÃ―konÅŊm jako je ChatGPT. KdyÅū Meta představila svÃĐ modely Llama, vyvolala to novÃ― zÃĄjem o otevřenÃĐ jazykovÃĐ modely. Cílem je vytvořit dostupnÃĐ, otevřenÃĐ LLM, kterÃĐ jsou stejně dobrÃĐ jako ÅĄpičkovÃĐ modely jako GPT-4, ale bez vysokÃĐ ceny nebo sloÅūitosti.

Tato kombinace dostupnosti a efektivity nejen otevřela novÃĐ cesty pro vÃ―zkumníky a vÃ―vojÃĄÅ™e, ale takÃĐ nastartovala novou ÃĐru technologickÃ―ch pokrokÅŊ v oblasti zpracovÃĄní přirozenÃĐho jazyka.

NedÃĄvno získaly startupy zaměřenÃĐ na generativní AI značnÃĐ financovÃĄní. Společně vybrala 20 milionÅŊ dolarÅŊ, aby vytvořila otevřenÃĐ AI modely. Anthropic takÃĐ získal pÅŊsobivÃ―ch 450 milionÅŊ dolarÅŊ a Cohere, kterÃ― spolupracuje s Google Cloud, získal 270 milionÅŊ dolarÅŊ v červnu tohoto roku.

Úvod do Mistral 7B: Velikost a dostupnost

mistral AI

Mistral AI, se sídlem v PaříÅūi a zaloÅūenÃĄ bÃ―valÃ―mi zaměstnanci Google DeepMind a Meta, představila svÅŊj první velkÃ― jazykovÃ― model: Mistral 7B. Tento model lze snadno stÃĄhnout z GitHubu a dokonce i prostřednictvím 13,4gigabytovÃĐho torrentu.

Tato společnost získala rekordní seed financovÃĄní, aniÅū by měla produkt na trhu. Mistral AI první model s 7 miliardami parametrÅŊ překonÃĄvÃĄ vÃ―kon Llama 2 13B ve vÅĄech testech a překonÃĄvÃĄ Llama 1 34B ve mnoha metrikÃĄch.

V porovnÃĄní s jinÃ―mi modely, jako je Llama 2, nabízí Mistral 7B podobnÃĐ nebo lepÅĄÃ­ schopnosti, ale s niÅūÅĄÃ­ vÃ―početní nÃĄročností. Zatímco zÃĄkladní modely jako GPT-4 mohou dosÃĄhnout více, jsou spojeny s vyÅĄÅĄÃ­mi nÃĄklady a nejsou tak uÅūivatelsky přívětivÃĐ, protoÅūe jsouäļŧč́ přístupnÃĐ prostřednictvím API.

Při Úkolech souvisejících s kÃģdovÃĄním nabízí Mistral 7B CodeLlama 7B konkurenceschopnou moÅūnost. Kromě toho je kompaktní, pouze 13,4 GB, a lze jej spustit na standardních strojích.

DÃĄle nabízí Mistral 7B Instruct, kterÃ― je speciÃĄlně navrÅūen pro instruktÃĄÅūní datovÃĐ sady na Hugging Face, a prokÃĄzal vynikající vÃ―kon. PřekonÃĄvÃĄ ostatní 7B modely na MT-Bench a stojí ramen u ramen s 13B chat modely.

TestovÃĄní vÃ―konu

V podrobnÃĐ analÃ―ze vÃ―konu byl Mistral 7B měřen proti modelÅŊm Llama 2. VÃ―sledky byly jasnÃĐ: Mistral 7B podstatně překonÃĄvÃĄ Llama 2 13B ve vÅĄech testech. Ve skutečnosti se vyrovnal vÃ―konu Llama 34B, zejmÃĐna vynikající v testech kÃģdu a rozumění.

Testy byly rozděleny do několika kategorií, jako je rozumění, znalosti, čtení, matematika a kÃģd, mezi jinÃ―mi. ZvlÃĄÅĄtě pozoruhodnÃ―m pozorovÃĄním bylo, Åūe Mistral 7B prokÃĄzal vÃ―kon podobnÃ― Llama 2 modelu třikrÃĄt větÅĄÃ­, coÅū naznačuje potenciÃĄlní Úspory v paměti a zvÃ―ÅĄení propustnosti. NicmÃĐně, v testech znalostí se Mistral 7B vyrovnal Llama 2 13B, coÅū je pravděpodobně zpÅŊsobeno omezeními parametrÅŊ, kterÃĐ ovlivňují kompresi znalostí.

Co dělÃĄ model Mistral 7B lepÅĄÃ­ neÅū větÅĄina ostatních jazykovÃ―ch modelÅŊ?

ZjednoduÅĄení mechanismÅŊ pozornosti

Zatímco technickÃĐ detaily mechanismÅŊ pozornosti jsou sloÅūitÃĐ, jejich zÃĄkladní myÅĄlenka je relativně jednoduchÃĄ. Představte si, Åūe čtete knihu a zvÃ―razňujete dÅŊleÅūitÃĐ věty; to je podobnÃĐ tomu, jak mechanismy pozornosti “zvÃ―razňují” nebo dÃĄvají dÅŊleÅūitost konkrÃĐtním datovÃ―m bodÅŊm v sekvenci.

V kontextu jazykovÃ―ch modelÅŊ tyto mechanismy umoÅūňují modelu soustředit se na nejrelevantnějÅĄÃ­ ÄÃĄsti vstupních dat, aby vÃ―stup byl koherentní a kontextuÃĄlně přesnÃ―.

V standardních transformerech se pozornostní skÃģre vypočítÃĄvají pomocí vzorce:

Transformers attention Formula

Transformers Attention Formula

Vzorec pro tyto skÃģre zahrnuje kritickÃ― krok – maticovÃĐ nÃĄsobení Q a K. VÃ―zvou zde je, Åūe se zvyÅĄující se dÃĐlkou sekvence expandují obě matice, coÅū vede k vÃ―početně nÃĄročnÃĐmu procesu. Tato ÅĄkÃĄlovatelnost je jedním z hlavních dÅŊvodÅŊ, proč standardní transformery mohou bÃ―t pomalÃĐ, zejmÃĐna při zpracovÃĄní dlouhÃ―ch sekvencí.

transformerMechanismy pozornosti pomÃĄhají modelÅŊm soustředit se na konkrÃĐtní ÄÃĄsti vstupních dat. Typicky tyto mechanismy pouÅūívají “hlavy” pro řízení pozornosti. Čím více hlav mÃĄte, tím specifičtějÅĄÃ­ pozornost, ale takÃĐ se stÃĄvÃĄ komplexnějÅĄÃ­ a pomalejÅĄÃ­. ProhlÃĐdněte si tento odkaz pro hlubÅĄÃ­ pochopení transformerÅŊ a mechanismÅŊ pozornosti.

Multi-dotazovÃĄ pozornost (MQA) zrychluje proces pomocí jednÃĐ sady “klíč-hodnota” hlav, ale někdy obětuje kvalitu. Teď se mÅŊÅūete ptÃĄt, proč nekombinovat rychlost MQA s kvalitou multi-hlavovÃĐ pozornosti? To je místo, kde přichÃĄzí SkupinovÃĄ dotazovanÃĄ pozornost (GQA).

SkupinovÃĄ dotazovanÃĄ pozornost (GQA)

Grouped-query attention

SkupinovÃĄ dotazovanÃĄ pozornost

GQA je kompromisní řeÅĄení. Místo pouÅūití pouze jednÃĐ nebo více “klíč-hodnota” hlav, GQA skupiny. Tímto zpÅŊsobem GQA dosahuje vÃ―konu blízkÃĐho podrobnÃĐ multi-hlavovÃĐ pozornosti, ale s rychlostí MQA. Pro modely jako Mistral to znamenÃĄ efektivní vÃ―kon bez kompromisÅŊ v kvalitě.

KlouzavÃĄ okenní pozornost (SWA)

longformer transformers sliding window

Metoda klouzavÃĐho okna je dalÅĄÃ­ metodou zpracovÃĄní sekvencí pozornosti. Tato metoda pouÅūívÃĄ pevně velikÃĐ okno pozornosti kolem kaÅūdÃĐho tokenu v sekvenci. S více vrstvami, kterÃĐ zÃĄsobují tuto okenní pozornost, horní vrstvy nakonec získÃĄvat ÅĄirÅĄÃ­ perspektivu, zahrnující informace z celÃĐho vstupu. Tento mechanismus je analogickÃ― k receptivním polím pozorovanÃ―m v Konvolučních neuronovÃ―ch sítích (CNN).

Na druhÃĐ straně “dilatovanÃĄ klouzavÃĄ okenní pozornost” modelu Longformer, kterÃ― je konceptuÃĄlně podobnÃ― metodě klouzavÃĐho okna, počítÃĄ pouze několik diagonÃĄl matice. Tato změna vede k lineÃĄrnímu nÃĄrÅŊstu paměÅĨovÃĐho vyuÅūití, namísto kvadratickÃĐho, coÅū z ní činí efektivnějÅĄÃ­ metodu pro delÅĄÃ­ sekvence.

Transparentnost Mistral AI vs. bezpečnostní obavy v decentralizaci

V svÃĐm oznÃĄmení Mistral AI zdÅŊraznila transparentnost prohlÃĄÅĄením: â€œÅ―ÃĄdnÃĐ triky, ÅūÃĄdnÃĐ proprietÃĄrní Údaje.” Ale současně je jejich jedinÃ―m dostupnÃ―m modelem v současnosti ‘Mistral-7B-v0.1’, kterÃ― je předtrÃĐnovanÃ― zÃĄkladní model, a proto mÅŊÅūe generovat odpověď na jakoukoli otÃĄzku bez moderace, coÅū vyvolÃĄvÃĄ potenciÃĄlní bezpečnostní obavy. Zatímco modely jako GPT a Llama mají mechanismy pro rozpoznÃĄní, kdy odpovědět, plně decentralizovanÃĄ povaha Mistralu by mohla bÃ―t zneuÅūita ÅĄpatnÃ―mi aktÃĐry.

NicmÃĐně, decentralizace velkÃ―ch jazykovÃ―ch modelÅŊ mÃĄ svÃĐ vÃ―hody. Zatímco někteří ji mohou zneuÅūít, lidÃĐ mohou vyuÅūít její sílu pro společenskÃĐ dobro a zpřístupnit inteligenci vÅĄem.

Flexibilita nasazení

Jedním z hlavních vÃ―hod je, Åūe Mistral 7B je dostupnÃ― pod licencí Apache 2.0. To znamenÃĄ, Åūe neexistují ÅūÃĄdnÃĐ skutečnÃĐ bariÃĐry pro jeho pouÅūití – aÅĨ uÅū jej pouÅūívÃĄte pro osobní Účely, velkou korporaci nebo dokonce vlÃĄdní entitu. Stačí vÃĄm pouze sprÃĄvnÃ― systÃĐm pro jeho spuÅĄtění, nebo mÅŊÅūete investovat do cloudovÃ―ch zdrojÅŊ.

Zatímco existují dalÅĄÃ­ licence, jako je jednoduÅĄÅĄÃ­ licence MIT a kooperativní licence CC BY-SA-4.0, kterÃĄ vyÅūaduje uvedení zdroje a podobnou licenci pro odvozenÃĄ díla, licence Apache 2.0 poskytuje robustní zÃĄklad pro velkÃĐ podniky.

ZÃĄvěrečnÃĐ myÅĄlenky

RÅŊst otevřenÃ―ch velkÃ―ch jazykovÃ―ch modelÅŊ, jako je Mistral 7B, signalizuje zÃĄsadní změnu v odvětví AI, zpřístupňující kvalitní jazykovÃĐ modely ÅĄirÅĄÃ­mu publiku. Inovativní přístupy Mistral AI, jako je SkupinovÃĄ dotazovanÃĄ pozornost a KlouzavÃĄ okenní pozornost, slibují efektivní vÃ―kon bez kompromisÅŊ v kvalitě.

Zatímco decentralizovanÃĄ povaha Mistralu představuje určitÃĐ vÃ―zvy, jeho flexibilita a otevřenÃĄ licence podtrhují potenciÃĄl pro demokratizaci AI. Jak se krajina vyvíjí, bude se zaměřovat na vyvÃĄÅūení síly těchto modelÅŊ s etickÃ―mi Úvahami a bezpečnostními mechanismy.

Co je dalÅĄÃ­ krok pro Mistral? Model 7B byl pouze zaÄÃĄtek. TÃ―m plÃĄnuje spuÅĄtění jeÅĄtě větÅĄÃ­ch modelÅŊ brzy. Pokud tyto novÃĐ modely odpovídají vÃ―konu 7B, Mistral by mohl rychle vystoupit jako jeden z nejlepÅĄÃ­ch hrÃĄÄÅŊ v odvětví, a to vÅĄe během svÃĐho prvního roku.

JÃĄ pět let se ponořím do fascinujícího světa strojovÃĐho učení a hlubokÃĐho učení. MÃĐ vÃĄÅĄně a odbornÃĐ znalosti mě vedly k tomu, abych se podílel na více neÅū 50 rÅŊznÃ―ch projektech softwarovÃĐho inÅūenÃ―rství, se zvlÃĄÅĄtním zaměřením na AI/ML. MÃĐ pokračující zvědavosti mě takÃĐ přivedly k přirozenÃĐmu jazykovÃĐmu zpracovÃĄní, oblasti, kterou jsem ochoten prozkoumat dÃĄle.