Modely a platformy AI

Gemma: Google přináší pokročilé AI schopnosti prostřednictvím open source

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Obor umělé inteligence (AI) zaznamenal v posledních letech obrovský pokrok, který je způsoben především pokroky v hlubokém učení a zpracování přirozeného jazyka (NLP). V čele těchto pokroků jsou velké jazykové modely (LLM) – AI systémy trénované na obrovských množstvích textových dat, které mohou generovat text podobný lidskému a účastnit se konverzačních úkolů.

LLM jako Google’s PaLM, Anthropic’s Claude a DeepMind’s Gopher prokázaly pozoruhodné schopnosti, od programování po rozumové uvažování. Nicméně, většina těchto modelů nebyla otevřeně vydána, což omezuje jejich přístup pro výzkum, vývoj a prospěšné aplikace.

To se změnilo s nedávným otevřením Gemma – rodiny LLM od Google’s DeepMind založené na jejich výkonných proprietárních modelech Gemini. V tomto blogovém příspěvku se budeme zabývat Gemma, analyzovat její architekturu, trénovací proces, výkon a zodpovědné vydání.

Přehled Gemma

V únoru 2023 DeepMind otevřeně vydal dvě velikosti modelů Gemma – verzi s 2 miliardami parametrů optimalizovanou pro nasazení na zařízení a větší verzi s 7 miliardami parametrů navrženou pro použití na GPU/TPU.

Gemma využívá podobnou architekturu transformátoru a trénovací metodologii jako DeepMind’s vedoucí modely Gemini. Byla trénována na až 6 bilionech tokenů textových dat z webových dokumentů, matematiky a kódu.

DeepMind vydal jak surová předtrénovaná kontrolní body Gemma, tak i verze upravené pomocí supervizovaného učení a lidské zpětné vazby pro vylepšení schopností v oblastech, jako je dialog, následování pokynů a programování.

Zahájení práce s Gemma

Otevřené vydání Gemma činí její pokročilé AI schopnosti dostupné pro vývojáře, výzkumníky a nadšence. Zde je rychlý průvodce pro zahájení práce:

Platformově nezávislé nasazení

Klíčovou silou Gemma je její flexibilita – můžete ji spustit na CPU, GPU nebo TPU. Pro CPU využijte TensorFlow Lite nebo HuggingFace Transformers. Pro urychlený výkon na GPU/TPU použijte TensorFlow. Cloudové služby, jako je Google Cloud’s Vertex AI, také poskytují bezproblémové škálování.

Přístup k předtrénovaným modelům

Gemma je k dispozici v různých předtrénovaných variantách v závislosti na vašich potřebách. Modely 2B a 7B nabízejí silné generativní schopnosti přímo z krabice. Pro vlastní jemné doladění jsou modely 2B-FT a 7B-FT ideálními výchozími body.

Vytvoření zajímavých aplikací

Můžete vytvořit širokou škálu aplikací s Gemma, jako je generování příběhů, překlad jazyka, zodpovězení otázek a tvorba kreativního obsahu. Klíčem je využití silných stránek Gemma prostřednictvím jemného doladění na vašich vlastních datech.

Architektura

Gemma využívá architekturu dekodéru pouze, která vychází z pokroků, jako je multi-dotazová pozornost a rotační polohová vložení:

  • Transformátory: Zavedené v roce 2017, architektura transformátoru založená pouze na mechanismech pozornosti se stala všudypřítomnou v NLP. Gemma zdědila transformátorovu schopnost modelovat dlouhé závislosti v textu.
  • Dekodér pouze: Gemma používá pouze zásobník dekodéru transformátoru, na rozdíl od modelů encoder-dekodér, jako je BART nebo T5. To poskytuje silné generativní schopnosti pro úkoly, jako je generování textu.
  • Multi-dotazová pozornost: Gemma využívá multi-dotazovou pozornost ve svém větším modelu, což umožňuje každé hlavě pozornosti zpracovat více dotazů paralelně pro rychlejší inferenci.
  • Rotační polohová vložení: Gemma reprezentuje polohové informace pomocí rotačních vložení místo absolutních polohových kódování. Tato technika snižuje velikost modelu, zatímco zachovává polohové informace.

Použití technik, jako je multi-dotazová pozornost a rotační polohová vložení, umožňuje modelům Gemma dosáhnout optimálního kompromisu mezi výkonem, rychlostí inferenze a velikostí modelu.

Data a trénovací proces

Gemma byla trénována na až 6 bilionech tokenů textových dat, především v angličtině. To zahrnovalo webové dokumenty, matematický text a zdrojový kód. DeepMind investoval značné úsilí do filtrování dat, odstranění toxického nebo škodlivého obsahu pomocí klasifikátorů a heuristik.

Trénování bylo provedeno pomocí Google’s TPUv5 infrastruktury, s až 4096 TPU použitémi pro trénování Gemma-7B. Efektivní model a datová paralelizace umožnily trénovat masivní modely s komoditní hardwarovou výbavou.

Byl použit postupný trénink, který neustále upravoval distribuci dat, aby se zaměřil na vysoce kvalitní, relevantní text. Finální fáze jemného doladění využívaly kombinaci lidsky generovaných a syntetických příkladů pro vylepšení schopností.

Výkon modelu

DeepMind důkladně vyhodnotil modely Gemma na široké škále více než 25 benchmarků pokrývajících otázku a odpověď, rozumové uvažování, matematiku, programování, zdravý rozum a dialogové schopnosti.

Gemma dosahuje špičkových výsledků ve srovnání s podobně velkými otevřenými modely napříč většinou benchmarků. Některé výšky:

  • Matematika: Gemma vyniká v matematických testech, jako je GSM8K a MATH, překonávající modely, jako je Codex a Anthropic’s Claude, o více než 10 bodů.
  • Programování: Gemma dosahuje nebo překonává výkon Codexu na programovacích benchmarcích, jako je MBPP, a to navzdory tomu, že nebyla speciálně trénována na kódu.
  • Dialog: Gemma prokazuje silné konverzační schopnosti s 51,7% výhrou nad Anthropic’s Mistral-7B v testech lidské preference.
  • Rozumové uvažování: Na úkolech, které vyžadují inferenci, jako je ARC a Winogrande, Gemma překonává ostatní 7B modely o 5-10 bodů.

Univerzálnost Gemma napříč disciplínami demonstruje její silné obecné inteligentní schopnosti. Ačkoli zbývají mezery k lidskému výkonu, Gemma představuje skok vpřed v otevřeném NLP.

Bezpečnost a zodpovědnost

Vydání otevřených modelů velkých velikostí představuje výzvy kolem úmyslného zneužití a vrozených modelových偏见. DeepMind podnikl kroky, aby zmírnil rizika:

  • Filtrování dat: Potenciálně toxické, nelegální nebo zaujaté texty byly odstraněny z trénovacích dat pomocí klasifikátorů a heuristik.
  • Hodnocení: Gemma byla testována na 30+ benchmarcích, které hodnotily bezpečnost, spravedlnost a robustnost. Dosáhla nebo překonala ostatní modely.
  • Jemné doladění: Jemné doladění modelu se zaměřilo na zlepšení bezpečnostních schopností, jako je filtrování informací a vhodné chování odmítnutí.
  • Podmínky použití: Podmínky použití zakazují útočný, nelegální nebo neetický použití modelů Gemma. Nicméně, vynucení zůstává výzvou.
  • Modelové karty: Karty podrobně popisující modelové schopnosti, omezení a zaujatosti byly vydány, aby podporovaly transparentnost.

Ačkoli existují rizika spojená s otevřeným vydáním, DeepMind dospěl k závěru, že vydání Gemma poskytuje čistou společenskou výhodu na základě její bezpečnostní profilu a umožnění výzkumu. Nicméně, bdělá kontrola potenciálních škod bude mít zásadní význam.

Povolení další vlny AI inovací

Vydání Gemma jako otevřené modelové rodiny má potenciál odemknout pokrok napříč AI komunitou:

  • Přístupnost: Gemma snižuje bariéry pro organizace, aby mohly stavět s nejnovějšími NLP, které dříve čelily vysokým nákladům na výpočetní výkon a data pro trénování vlastních LLM.
  • Nové aplikace: Otevřeným vydáním předtrénovaných a upravených kontrolních bodů DeepMind umožňuje snadnější vývoj prospěšných aplikací v oblastech, jako je vzdělávání, věda a přístupnost.
  • Customizace: Vývojáři mohou dále přizpůsobit Gemma pro průmyslové nebo doménově specifické aplikace prostřednictvím pokračujícího tréninku na vlastních datech.
  • Výzkum: Otevřené modely, jako je Gemma, podporují větší transparentnost a auditování současných NLP systémů, osvětlují budoucí směry výzkumu.
  • Inovace: Dostupnost silných základních modelů, jako je Gemma, urychlí pokrok v oblastech, jako je zmírnění zaujatosti, faktičnost a AI bezpečnost.

DeepMind doufá, že poskytnutím schopností Gemma všem prostřednictvím otevřeného vydávání, bude možné podnítit zodpovědný vývoj AI pro společenské dobro.

Cesta vpřed

S každým skokem v AI se blížíme k modelům, které se rovnají nebo překonávají lidskou inteligenci ve všech oblastech. Systémy, jako je Gemma, zdůrazňují, jak rychlý pokrok v samo-supervizovaných modelech odemyká stále pokročilejší kognitivní schopnosti.

Nicméně, zbývá práce na zlepšení spolehlivosti, interpretovatelnosti a ovladatelnosti AI – oblastech, kde lidská inteligence stále dominuje. Oblasti, jako je matematika, zdůrazňují tyto přetrvávající mezery, s Gemma, která dosahuje 64% na MMLU ve srovnání s odhadovanými 89% lidským výkonem.

Zavření těchto mezer, zatímco zajištění bezpečnosti a etiky stále schopnějších AI systémů, bude ústřední výzvou v nadcházejících letech. Nacházení správné rovnováhy mezi otevřeností a opatrností bude zásadní, protože DeepMind cílí na demokratizaci přístupu k výhodám AI, zatímco spravuje vznikající rizika.

Iniciativy na podporu AI bezpečnosti – jako je Dario Amodei’s ANC, DeepMind’s Ethics & Society tým a Anthropic’s Constitutional AI – signalizují rostoucí uznání této potřeby nuance. Smysluplný pokrok bude vyžadovat otevřenou, založenou na důkazech diskusi mezi výzkumníky, vývojáři, politiky a veřejností.

Pokud se bude Gemma navigovat zodpovědně, představuje ne vrchol AI, ale základnu pro další generaci AI výzkumníků, kteří následují DeepMind’s kroky směrem k férové, prospěšné umělé obecné inteligenci.

Závěr

Vydání modelů Gemma DeepMindem představuje novou éru pro otevřenou AI – jednu, která přesahuje úzké benchmaky do obecných inteligentních schopností. Testovaná rozsáhle pro bezpečnost a široce dostupná, Gemma stanoví nový standard pro zodpovědné otevřené vydávání v AI.

Vedená soutěživým duchem, který je vyvážen kooperativními hodnotami, sdílení průlomů, jako je Gemma, zvyšuje všechny lodě v AI ekosystému. Celá komunita nyní má přístup k univerzální LLM rodině, aby poháněla nebo podporovala své iniciativy.

Ačkoli zbývají rizika, technická a etická důkladnost DeepMindu poskytuje důvěru, že výhody Gemma převyšují její potenciální škody. Jak se AI schopnosti stávají stále pokročilejšími, udržování této nuance mezi otevřeností a opatrností bude zásadní.

Gemma nás přivádí o krok blíže k AI, která prospívá všem lidem. Nicméně, mnoho velkých výzev ještě čeká na cestě k benevolentní umělé obecné inteligenci. Pokud AI výzkumníci, vývojáři a společnost jako celek mohou udržet spolupráci, Gemma může být jednou viděna jako historická základna, spíše než konečná vrchol.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.