Modely a platformy AI

Odhalení Meta Llama 3: Skok vpřed v oblasti velkých jazykových modelů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V oblasti generativní umělé inteligence Meta pokračuje ve vedení se svým závazkem k otevřenému zdrojovému kódu, distribuci svých pokročilých velkých jazykových modelů Meta AI (Llama) série globálně vývojářům a výzkumníkům. Na základě svých progresivních iniciativ Meta nedávno představila třetí iteraci této série, Llama 3. Tato nová edice významně vylepšuje Llama 2, nabízí řadu vylepšení a stanovuje standardy, které vyzývají konkurenty v oboru, jako je Google (GOOGL ), Mistral a Anthropic. Tento článek zkoumá významné pokroky Llama 3 a jak se srovnává se svým předchůdcem, Llama 2.

Meta Llama Series: Od Exkluzivity k Otevřenému Zdrojovému Kódu a Vylepšenému Provozu

Meta zahájila svou Llama sérii v roce 2022 s uvedením Llama 1, modelu omezeného na nekomerční použití a dostupného pouze vybraným výzkumným institucím kvůli enormním výpočetním nárokům a proprietární povaze, která charakterizovala špičkové LLM v té době. V roce 2023, s uvedením Llama 2, Meta AI směřovala k větší otevřenosti, nabízející model zdarma pro výzkumné i komerční účely. Tento krok byl navržen tak, aby demokratizoval přístup k sofistikovaným generativním technologiím umělé inteligence, umožňujícím širšímu okruhu uživatelů, včetně startupů a menších výzkumných týmů, inovovat a vyvíjet aplikace bez vysokých nákladů, které jsou obvykle spojeny s velkými modely. Pokračujíc v tomto trendu směrem k otevřenosti, Meta představila Llama 3, která se zaměřuje na zlepšení výkonu menších modelů napříč různými průmyslovými standardy.

Představení Llama 3

Llama 3 je druhou generací otevřených velkých jazykových modelů Meta (LLM), nabízející předtrénované a instrukčně jemně naladěné modely s 8B a 70B parametry. V souladu se svými předchůdci Llama 3 využívá decoder-only transformer architekturu a pokračuje v praxi autoregresivního, sebe-supervizovaného tréninku k předpovídání následujících tokenů v textových sekvencích. Llama 3 je předtrénována na datové sadě, která je sedmkrát větší než ta, která byla použita pro Llama 2, s více než 15 biliony tokenů z nově kurátorované směsi veřejně dostupných online dat. Tato rozsáhlá datová sada je zpracována pomocí dvou clusterů vybavených 24 000 GPU. Pro udržení vysoké kvality tohoto tréninkového data byly použity různé data-centric AI techniky, včetně heuristických a NSFW filtrů, semantické deduplikace a textové kvalitativní klasifikace. Přizpůsobeno pro dialogové aplikace, Llama 3 Instruct model byl významně vylepšen, zahrnující více než 10 milionů lidsky anotovaných datových vzorků a využívající sofistikovanou směs tréninkových metod, jako je supervizované jemné ladění (SFT), rejection sampling, proximální policy optimalizace (PPO) a přímá policy optimalizace (DPO).

Llama 3 vs. Llama 2: Klíčová Vylepšení

Llama 3 přináší několik vylepšení oproti Llama 2, významně zvyšujících její funkčnost a výkon:

  • Rozšířená Slovní Zásoba: Llama 3 rozšířila svou slovní zásobu na 128 256 tokenů, oproti 32 000 tokenům Llama 2. Toto vylepšení podporuje efektivnější textové kódování pro jak vstupy, tak výstupy, a posiluje její multilingvální schopnosti.
  • Prodloužená Délka Kontextu: Llama 3 modely poskytují délku kontextu 8 000 tokenů, což je dvojnásobek 4 090 tokenů podporovaných Llama 2. Toto zvýšení umožňuje rozsáhlejší zpracování obsahu, zahrnující jak uživatelské výzvy, tak modelové odpovědi.
  • Vylepšená Tréninková Data: Tréninková datová sada pro Llama 3 je sedmkrát větší než ta pro Llama 2, včetně čtyřnásobně více kódu. Obsahuje více než 5% vysoce kvalitních, neanglických dat pokrývajících více než 30 jazyků, což je zásadní pro podporu multilingválních aplikací. Tato data podléhají přísné kontrole kvality pomocí pokročilých technik, jako jsou heuristické a NSFW filtry, semantická deduplikace a textové klasifikátory.
  • Upravené Instrukční Ladění a Evaluace: Na rozdíl od Llama 2, Llama 3 využívá pokročilé instrukční ladění techniky, včetně supervizovaného jemného ladění (SFT), rejection sampling, proximální policy optimalizace (PPO) a přímé policy optimalizace (DPO). Pro doplnění tohoto procesu byla zavedena nová vysoce kvalitní lidská evaluace sada, skládající se z 1 800 výzev pokrývajících rozmanité použití, jako je poradenství, brainstorming, klasifikace, kódování a další, zajišťující komplexní hodnocení a jemné ladění modelových schopností.
  • Pokročilá AI Bezpečnost: Llama 3, stejně jako Llama 2, zahrnuje přísná bezpečnostní opatření, jako je instrukční ladění a komplexní red teaming, aby zmírnila rizika, zejména v kritických oblastech, jako je kybernetická bezpečnost a biologické hrozby. Na podporu těchto úsilí Meta také představila Llama Guard 2, jemně laděnou na 8B verzi Llama 3. Tento nový model vylepšuje Llama Guard sérii klasifikací LLM vstupů a odpovědí pro identifikaci potenciálně nebezpečného obsahu, čímž je ideální pro produkční prostředí.

Dostupnost Llama 3

Llama 3 modely jsou nyní integrovány do Hugging Face ekosystému, zvyšujících dostupnost pro vývojáře. Modely jsou také dostupné prostřednictvím model-as-a-service platforem, jako je Perplexity Labs a Fireworks.ai, a na cloudových platformách, jako je AWS SageMaker, Azure ML a Vertex AI. Meta plánuje dále rozšířit dostupnost Llama 3, včetně platforem, jako je Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM a Snowflake. Kromě toho bude hardwarová podpora pro Llama 3 rozšířena na platformy od AMD, AWS, Dell, Intel (INTC ), NVIDIA a Qualcomm.

Nadcházející Vylepšení v Llama 3

Meta odhalila, že současná verze Llama 3 je pouze počáteční fází v jejich širším vidění pro plnou verzi Llama 3. Rozvíjí pokročilý model s více než 400 miliardami parametrů, který zavede nové funkce, včetně multimodality a schopnosti zpracovávat více jazyků. Tato vylepšená verze bude také nabízet významně prodloužené kontextové okno a vylepšené celkové výkonnostní schopnosti.

Závěrečné Shrnutí

Meta Llama 3 představuje významný vývoj v oblasti velkých jazykových modelů, posouvající sérii nejen směrem k větší otevřenosti, ale také podstatně vylepšujících její výkonnostní schopnosti. S tréninkovou datovou sadou sedmkrát větší než u svého předchůdce a funkcemi, jako je rozšířená slovní zásoba a prodloužená délka kontextu, Llama 3 stanovuje nové standardy, které vyzývají i ty nejsilnější konkurenty v oboru.

Tato třetí iterace nejenom pokračuje v demokratizaci technologií umělé inteligence, poskytujícím vysokou úroveň schopností širšímu spektru vývojářů, ale také představuje významná vylepšení v oblasti bezpečnosti a tréninkové přesnosti. Integrací těchto modelů do platforem, jako je Hugging Face, a rozšířením dostupnosti prostřednictvím hlavních cloudových služeb, Meta zajišťuje, že Llama 3 je nejen všudypřítomná, ale také výkonná.

Pohledem do budoucna, Meta pokračující vývoj slibuje ještě robustnější schopnosti, včetně multimodality a rozšířené jazykové podpory, vytvářející podmínky pro Llama 3, aby nejen soutěžila, ale potenciálně i přesáhla ostatní hlavní modely umělé inteligence na trhu. Llama 3 je důkazem Meta závazku vést revoluci umělé inteligence, poskytujícím nástroje, které nejsou pouze více dostupné, ale také podstatně pokročilejší a bezpečnější pro globální uživatele.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.