Modely a platformy AI
Nejvýkonnější open-source LLM dosud: Meta LLAMA 3.1-405B
Llama 3.1-405B, vyvinutý společností Meta AI, představuje významný pokrok v oblasti open-source jazykových modelů. S 405 miliardami parametrů se jedná o největší veřejně dostupný jazykový model dosud, který se vyrovná a někdy dokonce překonává některé z nej pokročilejších proprietárních modelů v různých benchmarcích.
Klíčové funkce:
- 405 miliard parametrů
- 128K tokenů kontextová délka
- Multijazyčná podpora (8 jazyků)
- Instruction-tuned verze dostupná
- Open-source s permissivní licencí
Vydaní takového výkonného modelu v oblasti open-source je zásadním krokem, který demokratizuje přístup k nejnovějším AI schopnostem a podporuje inovace v celém odvětví.
Architektura modelu a trénink
Proces začíná konverzí vstupních textových tokenů na tokenové vložky. Tyto vložky procházejí několika vrstvami sebe-pozornosti a feedforward sítí, což umožňuje modelu zachytit komplexní vztahy a závislosti v textu. Autoregresivní dekódovací mechanismus poté generuje výstupní textové tokeny, čímž se dokončuje proces.

-
Grouped Query Attention (GQA)
Llama 3.1 využívá Grouped Query Attention, což je důležitá optimalizační technika, která nebyla plně pokryta v předchozí odpovědi. Pojďme se na to podívat podrobněji:
Grouped Query Attention (GQA) je varianta multi-head pozornosti, která má za cíl snížit výpočetní náklady a spotřebu paměti během inference, zejména pro dlouhé sekvence. V modelu Llama 3.1 405B je GQA implementován s 8 hlavami klíčových hodnot.
Zde je vysvětlení, jak GQA funguje:
- Místo toho, aby měly samostatné klíčové a hodnotové projekce pro každou hlavu pozornosti, GQA seskupuje více dotazovacích hlav, aby sdílely stejné klíčové a hodnotové hlavy.
- Toto seskupování významně snižuje počet parametrů v klíčových a hodnotových projekcích, což vede k menším modelům a rychlejšímu inference.
- Pozornost lze vyjádřit jako:
Attention(Q, K, V) = softmax(QK^T / sqrt(d_k))VKde Q je seskupeno do g skupin, a K a V mají méně hlav než Q.
Výhody GQA v Llama 3.1 405B zahrnují:
- Snižená spotřeba paměti: Méně klíčových a hodnotových projekcí znamená méně paměti, která je vyžadována pro uložení modelových parametrů.
- Rychlejší inference: S méně výpočty potřebnými pro klíčové a hodnotové projekce je inference rychlost zlepšena.
- Udržená výkonnost: Navzdory snížení parametrů GQA prokázal srovnatelnou výkonnost s standardní multi-head pozorností v mnoha úkolech.
-
Dvěfázový předtrénink pro prodloužený kontext
Článek zmiňuje dvoufázový předtréninkový proces pro dosažení 128K tokenů kontextového okna. To je zásadní aspekt schopností Llama 3.1 405B:
Fáze 1: Předtrénink na 8K tokenů
- Model je nejprve trénován na sekvencích až 8K tokenů.
- Tato fáze umožňuje modelu naučit se obecné jazykové porozumění a generování.
Fáze 2: Pokračující předtrénink pro prodloužení kontextu
- Po počátečním tréninku prochází model pokračujícím předtréninkem pro prodloužení kontextu na 128K tokenů.
- Tato fáze zahrnuje pečlivě navržené tréninkové režimy, aby model zobecněl na delší sekvence bez ztráty schopnosti zpracovat kratší kontexty.
-
Multimodální schopnosti
Zatímco předchozí odpověď se dotkla multimodálních schopností, můžeme se na to podívat podrobněji:
Kompoziční přístup:
- Llama 3.1 405B používá samostatné kodéry pro různé modality (například obrázky, řeč).
- Tyto kodéry transformují vstup z různých modalit do sdíleného prostoru vložek, který jazykový model může pochopit.
Integrace s jazykovým modelem:
- Výstupy z těchto specializovaných kodérů jsou poté vloženy do hlavního jazykového modelu.
- To umožňuje Llama 3.1 405B zpracovat a pochopit různé typy dat současně, což umožňuje modelu provádět úkoly, které zahrnují více modalit.
Příčinné mechanismy:
- Pro zpracování integrace různých modalit Llama 3.1 405B pravděpodobně využívá příčinné mechanismy.
- Tyto mechanismy umožňují modelu zaměřit se na relevantní informace z různých modalit při generování textu nebo provádění jiných úkolu.
Multimodální schopnosti Llama 3.1 405B otevírají širokou škálu aplikací, jako jsou:
- Popis obrázků a vizuální otázka a odpověď
- Přepis řeči s kontextovým porozuměním
- Multimodální úkoly, které kombinují text, obrázky a potentially další typy dat
Podrobnosti o tréninku
- Trénován na více než 15 bilionech tokenů
- Vlastní GPU cluster s 39,3M GPU hodin pro model 405B
- Rozmanitá kurace dat pro multijazyčné schopnosti
Verze instruction-tuned prošla dodatečným tréninkem:
- Jemné naladění na veřejně dostupných instrukčních datech
- Více než 25M synteticky generovaných příkladů
- Supervised Fine-Tuning (SFT) a Reinforcement Learning with Human Feedback (RLHF)
Performance Benchmarks
Tabulka srovnává Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni a Claude 3.5 Sonnet. Klíčové benchmarky zahrnují obecné úkoly, jako jsou MMLU a IFEval, úkoly s kódem, jako jsou HumanEval a GSM8K, a úkoly s rozumováním, jako je ARC Challenge. Každý benchmarkový skóre odráží schopnost modelu porozumět a generovat lidsky podobný text, řešit komplexní problémy a provádět kód. Zvláště Llama 3.1 405B a Claude 3.5 Sonnet vynikají v několika benchmarkách, což ukazuje jejich pokročilé schopnosti v obou obecných a doménově specifických úkolech.
Budoucí směry
Vydaní Llama 3.1-405B pravděpodobně urychlí inovace v několika oblastech:
- Vylepšené techniky jemného naladění pro specializované domény
- Vývoj efektivnějších metod inference
- Pokroky v kompresi modelů a distilaci
Závěr
Llama 3.1-405B představuje významný milník v oblasti open-source AI, nabízející schopnosti, které byly dříve výhradně dostupné v uzavřených modelech.
Při dalším zkoumání možností tohoto modelu je zásadní přístup k jeho použití zodpovědně a s ohledem na etické aspekty. Nástroje a pojistky poskytované spolu s modelem nabízejí rámec pro zodpovědné nasazení, ale bude třeba pokračující bdělost a spolupráci komunity, aby se zajistilo, že tato výkonná technologie bude využita pro prospěch společnosti.














