Modely a platformy AI
Gemma: Google přináší pokročilé AI schopnosti prostřednictvím open source
Obor umělé inteligence (AI) zaznamenal v posledních letech obrovský pokrok, který je způsoben především pokroky v hlubokém učení a zpracování přirozeného jazyka (NLP). V čele těchto pokroků jsou velké jazykové modely (LLM) – AI systémy trénované na obrovských množstvích textových dat, které mohou generovat text podobný lidskému a účastnit se konverzačních úkolů.
LLM jako Google’s PaLM, Anthropic’s Claude a DeepMind’s Gopher prokázaly pozoruhodné schopnosti, od programování po rozumové uvažování. Nicméně, většina těchto modelů nebyla otevřeně vydána, což omezuje jejich přístup pro výzkum, vývoj a prospěšné aplikace.
To se změnilo s nedávným otevřením Gemma – rodiny LLM od Google’s DeepMind založené na jejich výkonných proprietárních modelech Gemini. V tomto blogovém příspěvku se budeme zabývat Gemma, analyzovat její architekturu, trénovací proces, výkon a zodpovědné vydání.
Přehled Gemma
V únoru 2023 DeepMind otevřeně vydal dvě velikosti modelů Gemma – verzi s 2 miliardami parametrů optimalizovanou pro nasazení na zařízení a větší verzi s 7 miliardami parametrů navrženou pro použití na GPU/TPU.
Gemma využívá podobnou architekturu transformátoru a trénovací metodologii jako DeepMind’s vedoucí modely Gemini. Byla trénována na až 6 bilionech tokenů textových dat z webových dokumentů, matematiky a kódu.
DeepMind vydal jak surová předtrénovaná kontrolní body Gemma, tak i verze upravené pomocí supervizovaného učení a lidské zpětné vazby pro vylepšení schopností v oblastech, jako je dialog, následování pokynů a programování.
Zahájení práce s Gemma
Otevřené vydání Gemma činí její pokročilé AI schopnosti dostupné pro vývojáře, výzkumníky a nadšence. Zde je rychlý průvodce pro zahájení práce:
Platformově nezávislé nasazení
Klíčovou silou Gemma je její flexibilita – můžete ji spustit na CPU, GPU nebo TPU. Pro CPU využijte TensorFlow Lite nebo HuggingFace Transformers. Pro urychlený výkon na GPU/TPU použijte TensorFlow. Cloudové služby, jako je Google Cloud’s Vertex AI, také poskytují bezproblémové škálování.
Přístup k předtrénovaným modelům
Gemma je k dispozici v různých předtrénovaných variantách v závislosti na vašich potřebách. Modely 2B a 7B nabízejí silné generativní schopnosti přímo z krabice. Pro vlastní jemné doladění jsou modely 2B-FT a 7B-FT ideálními výchozími body.
Vytvoření zajímavých aplikací
Můžete vytvořit širokou škálu aplikací s Gemma, jako je generování příběhů, překlad jazyka, zodpovězení otázek a tvorba kreativního obsahu. Klíčem je využití silných stránek Gemma prostřednictvím jemného doladění na vašich vlastních datech.
Architektura
Gemma využívá architekturu dekodéru pouze, která vychází z pokroků, jako je multi-dotazová pozornost a rotační polohová vložení:
- Transformátory: Zavedené v roce 2017, architektura transformátoru založená pouze na mechanismech pozornosti se stala všudypřítomnou v NLP. Gemma zdědila transformátorovu schopnost modelovat dlouhé závislosti v textu.
- Dekodér pouze: Gemma používá pouze zásobník dekodéru transformátoru, na rozdíl od modelů encoder-dekodér, jako je BART nebo T5. To poskytuje silné generativní schopnosti pro úkoly, jako je generování textu.
- Multi-dotazová pozornost: Gemma využívá multi-dotazovou pozornost ve svém větším modelu, což umožňuje každé hlavě pozornosti zpracovat více dotazů paralelně pro rychlejší inferenci.
- Rotační polohová vložení: Gemma reprezentuje polohové informace pomocí rotačních vložení místo absolutních polohových kódování. Tato technika snižuje velikost modelu, zatímco zachovává polohové informace.
Použití technik, jako je multi-dotazová pozornost a rotační polohová vložení, umožňuje modelům Gemma dosáhnout optimálního kompromisu mezi výkonem, rychlostí inferenze a velikostí modelu.
Data a trénovací proces
Gemma byla trénována na až 6 bilionech tokenů textových dat, především v angličtině. To zahrnovalo webové dokumenty, matematický text a zdrojový kód. DeepMind investoval značné úsilí do filtrování dat, odstranění toxického nebo škodlivého obsahu pomocí klasifikátorů a heuristik.
Trénování bylo provedeno pomocí Google’s TPUv5 infrastruktury, s až 4096 TPU použitémi pro trénování Gemma-7B. Efektivní model a datová paralelizace umožnily trénovat masivní modely s komoditní hardwarovou výbavou.
Byl použit postupný trénink, který neustále upravoval distribuci dat, aby se zaměřil na vysoce kvalitní, relevantní text. Finální fáze jemného doladění využívaly kombinaci lidsky generovaných a syntetických příkladů pro vylepšení schopností.
Výkon modelu
DeepMind důkladně vyhodnotil modely Gemma na široké škále více než 25 benchmarků pokrývajících otázku a odpověď, rozumové uvažování, matematiku, programování, zdravý rozum a dialogové schopnosti.
Gemma dosahuje špičkových výsledků ve srovnání s podobně velkými otevřenými modely napříč většinou benchmarků. Některé výšky:
- Matematika: Gemma vyniká v matematických testech, jako je GSM8K a MATH, překonávající modely, jako je Codex a Anthropic’s Claude, o více než 10 bodů.
- Programování: Gemma dosahuje nebo překonává výkon Codexu na programovacích benchmarcích, jako je MBPP, a to navzdory tomu, že nebyla speciálně trénována na kódu.
- Dialog: Gemma prokazuje silné konverzační schopnosti s 51,7% výhrou nad Anthropic’s Mistral-7B v testech lidské preference.
- Rozumové uvažování: Na úkolech, které vyžadují inferenci, jako je ARC a Winogrande, Gemma překonává ostatní 7B modely o 5-10 bodů.
Univerzálnost Gemma napříč disciplínami demonstruje její silné obecné inteligentní schopnosti. Ačkoli zbývají mezery k lidskému výkonu, Gemma představuje skok vpřed v otevřeném NLP.
Bezpečnost a zodpovědnost
Vydání otevřených modelů velkých velikostí představuje výzvy kolem úmyslného zneužití a vrozených modelových偏见. DeepMind podnikl kroky, aby zmírnil rizika:
- Filtrování dat: Potenciálně toxické, nelegální nebo zaujaté texty byly odstraněny z trénovacích dat pomocí klasifikátorů a heuristik.
- Hodnocení: Gemma byla testována na 30+ benchmarcích, které hodnotily bezpečnost, spravedlnost a robustnost. Dosáhla nebo překonala ostatní modely.
- Jemné doladění: Jemné doladění modelu se zaměřilo na zlepšení bezpečnostních schopností, jako je filtrování informací a vhodné chování odmítnutí.
- Podmínky použití: Podmínky použití zakazují útočný, nelegální nebo neetický použití modelů Gemma. Nicméně, vynucení zůstává výzvou.
- Modelové karty: Karty podrobně popisující modelové schopnosti, omezení a zaujatosti byly vydány, aby podporovaly transparentnost.
Ačkoli existují rizika spojená s otevřeným vydáním, DeepMind dospěl k závěru, že vydání Gemma poskytuje čistou společenskou výhodu na základě její bezpečnostní profilu a umožnění výzkumu. Nicméně, bdělá kontrola potenciálních škod bude mít zásadní význam.
Povolení další vlny AI inovací
Vydání Gemma jako otevřené modelové rodiny má potenciál odemknout pokrok napříč AI komunitou:
- Přístupnost: Gemma snižuje bariéry pro organizace, aby mohly stavět s nejnovějšími NLP, které dříve čelily vysokým nákladům na výpočetní výkon a data pro trénování vlastních LLM.
- Nové aplikace: Otevřeným vydáním předtrénovaných a upravených kontrolních bodů DeepMind umožňuje snadnější vývoj prospěšných aplikací v oblastech, jako je vzdělávání, věda a přístupnost.
- Customizace: Vývojáři mohou dále přizpůsobit Gemma pro průmyslové nebo doménově specifické aplikace prostřednictvím pokračujícího tréninku na vlastních datech.
- Výzkum: Otevřené modely, jako je Gemma, podporují větší transparentnost a auditování současných NLP systémů, osvětlují budoucí směry výzkumu.
- Inovace: Dostupnost silných základních modelů, jako je Gemma, urychlí pokrok v oblastech, jako je zmírnění zaujatosti, faktičnost a AI bezpečnost.
DeepMind doufá, že poskytnutím schopností Gemma všem prostřednictvím otevřeného vydávání, bude možné podnítit zodpovědný vývoj AI pro společenské dobro.
Cesta vpřed
S každým skokem v AI se blížíme k modelům, které se rovnají nebo překonávají lidskou inteligenci ve všech oblastech. Systémy, jako je Gemma, zdůrazňují, jak rychlý pokrok v samo-supervizovaných modelech odemyká stále pokročilejší kognitivní schopnosti.
Nicméně, zbývá práce na zlepšení spolehlivosti, interpretovatelnosti a ovladatelnosti AI – oblastech, kde lidská inteligence stále dominuje. Oblasti, jako je matematika, zdůrazňují tyto přetrvávající mezery, s Gemma, která dosahuje 64% na MMLU ve srovnání s odhadovanými 89% lidským výkonem.
Zavření těchto mezer, zatímco zajištění bezpečnosti a etiky stále schopnějších AI systémů, bude ústřední výzvou v nadcházejících letech. Nacházení správné rovnováhy mezi otevřeností a opatrností bude zásadní, protože DeepMind cílí na demokratizaci přístupu k výhodám AI, zatímco spravuje vznikající rizika.
Iniciativy na podporu AI bezpečnosti – jako je Dario Amodei’s ANC, DeepMind’s Ethics & Society tým a Anthropic’s Constitutional AI – signalizují rostoucí uznání této potřeby nuance. Smysluplný pokrok bude vyžadovat otevřenou, založenou na důkazech diskusi mezi výzkumníky, vývojáři, politiky a veřejností.
Pokud se bude Gemma navigovat zodpovědně, představuje ne vrchol AI, ale základnu pro další generaci AI výzkumníků, kteří následují DeepMind’s kroky směrem k férové, prospěšné umělé obecné inteligenci.
Závěr
Vydání modelů Gemma DeepMindem představuje novou éru pro otevřenou AI – jednu, která přesahuje úzké benchmaky do obecných inteligentních schopností. Testovaná rozsáhle pro bezpečnost a široce dostupná, Gemma stanoví nový standard pro zodpovědné otevřené vydávání v AI.
Vedená soutěživým duchem, který je vyvážen kooperativními hodnotami, sdílení průlomů, jako je Gemma, zvyšuje všechny lodě v AI ekosystému. Celá komunita nyní má přístup k univerzální LLM rodině, aby poháněla nebo podporovala své iniciativy.
Ačkoli zbývají rizika, technická a etická důkladnost DeepMindu poskytuje důvěru, že výhody Gemma převyšují její potenciální škody. Jak se AI schopnosti stávají stále pokročilejšími, udržování této nuance mezi otevřeností a opatrností bude zásadní.
Gemma nás přivádí o krok blíže k AI, která prospívá všem lidem. Nicméně, mnoho velkých výzev ještě čeká na cestě k benevolentní umělé obecné inteligenci. Pokud AI výzkumníci, vývojáři a společnost jako celek mohou udržet spolupráci, Gemma může být jednou viděna jako historická základna, spíše než konečná vrchol.












