Modely a platformy AI
MPT-30B: MosaicML předehrává GPT-3 s novým LLM, který rozšiřuje hranice NLP
MosaicML je společnost pro generativní AI, která poskytuje řešení pro nasazení a škálovatelnost AI. Jejich nejnovější velký jazykový model (LLM) MPT-30B způsobuje vlny v komunitě AI.
Cesta MosaicML k LLM začala vydáním MPT-7B (Mosaic Pretrained Transformer) v květnu 2023, který měl tři varianty:
- MPT-7B-StoryWriter-65k+ (pro generování dlouhých příběhů)
- MPT-7B-Instruct (pro krátké instrukce)
- MPT-7B-Chat (pro generování dialogů)
Tyto modely zaznamenaly obrovský úspěch v komunitě ML díky své otevřené povaze, komerční využitelnosti a výjimečné schopnosti zpracovávat prodloužené kontextové okna.
Nejvíce důležité je, že model byl na stejné úrovni a v některých případech dokonce předčil ostatní srovnatelné modely (LLaMA-7B, StableLM 7B atd.). Do června 2023 byl MPT-7B série stažen více než 3 milionykrát. Dne 22. června 2023 MosaicML vydal MPT-30B, který ještě více zvýšil laťku pro otevřené základy modelů.
MPT-30B: Silný LLM, který předehrává GPT-3
MPT-30B je otevřený a komerčně licencovaný dekodér-založený LLM, který je silnější než GPT-3-175B s pouze 17% parametrů GPT-3, tj. 30B. Předehrává GPT-3 v několika úkolech. Zde je srovnání mezi MPT-30B a GPT-3.
MPT-30B vychází z předchozího modelu MPT-7B. Je výpočetně efektivnější pro trénink ve srovnání s modely podobné velikosti. Například LLaMA-30B používal přibližně 1,44krát více FLOPs rozpočtu než MPT-30B, zatímco Falcon-40B měl 1,27krát vyšší FLOPs rozpočet než MPT-30B. Zde je ilustrace zlepšení MPT-30B na různých úkolech oproti jeho předchůdci.
Některé speciální funkce MPT-30B jsou následující:
8k Token Kontextové Okno
Kontextové okno v LLM označuje rozsah tokenů, které model může zpracovat před generováním výstupu. MPT-30B měl kontextové okno 8000 tokenů během tréninku. Nejprve byl trénován na 1T token pomocí 2k tokenových sekvencí a poté na dalších 50B tokenů 8k tokenových sekvencí (přibližně 6000 slov).
ALiBi Podpora
Pro vysvětlení této funkce si položme otázku:
Jak může MPT-30B pochopit a předpovídat delší sekvence, než na kterých byl trénován?
MPT-30B používá techniku Attention with Linear Biases (ALiBi) pro pochopení delších sekvencí a prodloužení kontextového okna beyond 8k tokenů během jemného tréninku nebo inference.
Místo výpočtu positionálních vložených vektorů, kde přiřazujeme vektor každému slovu v sekvenci, ALiBi počítá pozornostní skóre mezi klíčovými a dotazovacími tokeny. Když jsou klíčové a dotazovací tokeny blízko sebe, je penalizace nízká, jinak vyšší. Výsledkem je, že základní transformer architektura může extrapolovat na dlouhé formy vstupů.
Účinná Inferencia & Tréninkový Proces prostřednictvím FlashAttention
Pozornost, tj. soustředění na relevantní části vstupní sekvence, je kritickou součástí transformerů, ale může být pomalá a náročná na paměť, zejména při zpracování dlouhých textových sekvencí.
FlashAttention je přístup navržen výzkumníky z Cornell University, který řeší tento problém pro MPT-30B. Používá techniku nazvanou tiling, FlashAttention snižuje početkrát, kolikrát model potřebuje číst nebo zapisovat do paměti, urychluje tak zpracování. Proto model využívá nejmodernější techniku FlashAttention a NVIDIA’s (NVDA ) FasterTransformer optimalizační knihovnu pro efektivní trénink a inferenci.
Snadnost Tréninku & Nasazení
Vývojáři mohou trénovat MPT-30B od začátku nebo použít MosaicML’s kontrolní body pro rychlejší nasazení. Kromě toho lze jej jemně trénovat pro konkrétní použití v doméně na specifickém datasetu.
Velikost modelu byla zvolena tak, aby umožňovala bezproblémové nasazení na jediném GPU, konkrétně 1xA100-80GB v 16bitové přesnosti nebo 1xA100-40GB v 8bitové přesnosti. To znamená, že model byl navržen tak, aby se vešel do paměťových omezení těchto GPU.
Kódovací Schopnosti
MPT-30B poskytuje výjimečné kódovací schopnosti. HumanEval je dataset vydaný OpenAI, který obsahuje 164 ručně vytvořených programovacích problémů. Na datasetu HumanEval model předehrává účelově postavené LLM modely, jako je série StarCoder.
Jemně Trénované Varianty: MPT-30B-Instruct & MPT-30B-Chat
MPT-30B-Instruct
LLM jsou primárně používány pro instrukce, jako je zodpovězení otázek, shrnutí textu, překlad jazyka atd. MPT-30B-Instruct je komerčně využitelná (udržuje komerční licenci CC-By-SA-3.0) varianta MPT-30B jemně trénovaná speciálně pro úkoly následování instrukcí. Pro jemné trénink byly použity následující datasety:
- FLAN
- P3
- Alpaca
- Dolly-15k
Dataset Dolly byl dále rozšířen o Anthropic’s Helpful and Harmless dataset pro jemné trénink instrukcí. Kromě toho byl použit rozmanitý rozsah datasetů pro data augmentation, které jsou následující:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat je jemně trénovaná verze MPT-30B pro generování dialogů. Je to výzkumný artefakt vydaný pod licencí CC-By-NC-SA-4.0, která umožňuje pouze nekomerční použití. Model byl jemně trénován pomocí různých jazykových datasetů, včetně:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM sdílejí velký podíl miliardového dolaru trhu generativní AI, který zaznamenal enormní růst bezprostředně po revoluci ChatGPT loni. MPT rodina je zakládající částí této revoluce. V blízké budoucnosti můžeme očekávat komerčně dostupné otevřené modely, které jsou ještě silnější a efektivnější než MPT rodina.
Pro nejnovější zprávy o AI navštivte unite.ai.















