AI-modellen en platforms

Ontdekking van Meta Llama 3: een sprong voorwaarts in grote taalmodellen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Op het gebied van generatieve AI leidt Meta met zijn toewijding aan open-source beschikbaarheid, waarbij hij zijn geavanceerde Large Language Model Meta AI (Llama) serie wereldwijd ter beschikking stelt aan ontwikkelaars en onderzoekers. Met zijn progressieve initiatieven heeft Meta onlangs de derde iteratie van deze serie geïntroduceerd, Llama 3. Deze nieuwe editie verbetert aanzienlijk ten opzichte van Llama 2, met talrijke verbeteringen en het stellen van benchmarks die de concurrenten in de industrie, zoals Google (GOOGL ), Mistral en Anthropic, uitdagen. Dit artikel verkent de significante vooruitgang van Llama 3 en hoe het zich verhoudt tot zijn voorganger, Llama 2.

Meta’s Llama Series: Van Exclusief naar Open Access en Verbeterde Prestaties

Meta startte zijn Llama serie in 2022 met de lancering van Llama 1, een model dat beperkt was tot niet-commercieel gebruik en alleen toegankelijk was voor geselecteerde onderzoeksinstellingen vanwege de immense computationele eisen en propriëtaire aard die kenmerkend waren voor cutting-edge LLM’s op dat moment. In 2023, met de introductie van Llama 2, verschoof Meta AI naar grotere openheid, waarbij het model gratis werd aangeboden voor zowel onderzoek als commerciële doeleinden. Deze stap was bedoeld om toegang tot geavanceerde generatieve AI technologieën te democratiseren, waardoor een breder scala aan gebruikers, waaronder start-ups en kleinere onderzoeksteams, innovaties konden ontwikkelen en toepassingen konden maken zonder de hoge kosten die typisch geassocieerd worden met grote modellen. Met de introductie van Llama 3 zet Meta deze trend naar openheid voort, met een focus op het verbeteren van de prestaties van kleinere modellen op verschillende industriële benchmarks.

Introductie van Llama 3

Llama 3 is de tweede generatie van Meta’s open-source grote taalmodellen (LLM’s), met zowel vooraf getrainde als instructie-gefinede modellen met 8B en 70B parameters. In overeenstemming met zijn voorgangers, gebruikt Llama 3 een decoder-only transformer architectuur en zet de praktijk van autoregressieve, zelf-superviserende training voort om vervolg tokens in tekstsequenties te voorspellen. Llama 3 is voorgetraind op een dataset die zeven keer groter is dan die gebruikt voor Llama 2, met meer dan 15 biljoen tokens afkomstig van een nieuw gecuronde mix van openbaar beschikbare online gegevens. Deze enorme dataset wordt verwerkt met behulp van twee clusters met 24.000 GPU’s. Om de hoge kwaliteit van deze trainingsgegevens te behouden, werden verschillende data-centric AI technieken toegepast, waaronder heuristische en NSFW filters, semantische deduplicatie en tekstkwaliteitsclassificatie. Geschikt voor dialoogtoepassingen is het Llama 3 Instruct model aanzienlijk verbeterd, met meer dan 10 miljoen door mensen geannoteerde gegevenssamples en het gebruik van geavanceerde trainingsmethoden zoals supervised fine-tuning (SFT), rejection sampling, proximal policy optimization (PPO) en direct policy optimization (DPO).

Llama 3 vs. Llama 2: Sleutelverbeteringen

Llama 3 brengt verschillende verbeteringen ten opzichte van Llama 2, waarbij het zowel de functionaliteit als de prestaties aanzienlijk verhoogt:

  • Uitgebreid vocabulaire: Llama 3 heeft zijn vocabulaire uitgebreid tot 128.256 tokens, van 32.000 tokens in Llama 2. Deze verbetering ondersteunt efficiëntere tekstcodering voor zowel invoer als uitvoer en versterkt zijn multilinguale mogelijkheden.
  • Verlengde contextlengte: Llama 3 modellen bieden een contextlengte van 8.000 tokens, het dubbele van de 4.090 tokens die door Llama 2 worden ondersteund. Deze toename stelt gebruikers in staat om uitgebreidere inhoud te verwerken, waaronder zowel gebruikersprompts als modelreacties.
  • Verbeterde trainingsgegevens: De trainingsdataset voor Llama 3 is zeven keer groter dan die van Llama 2, met vier keer meer code. Het bevat meer dan 5% hoge kwaliteit, niet-Engelse gegevens die meer dan 30 talen omvatten, wat essentieel is voor multilinguale toepassingsondersteuning. Deze gegevens worden onderworpen aan een strenge kwaliteitscontrole met behulp van geavanceerde technieken zoals heuristische en NSFW filters, semantische deduplicatie en tekstclassificatie.
  • Verfijnde instructie-afstemming en evaluatie: In tegenstelling tot Llama 2, gebruikt Llama 3 geavanceerde instructie-afstemmingstechnieken, waaronder supervised fine-tuning (SFT), rejection sampling, proximal policy optimization (PPO) en direct policy optimization (DPO). Om dit proces te ondersteunen, is een nieuwe hoge kwaliteit humane evaluatieset geïntroduceerd, bestaande uit 1.800 prompts die diverse gebruikscases zoals advies, brainstormen, classificatie, codering en meer omvatten, waardoor een uitgebreide beoordeling en afstemming van de modelcapaciteiten mogelijk wordt.
  • Geavanceerde AI-veiligheid: Llama 3, net als Llama 2, omvat strikte veiligheidsmaatregelen zoals instructie-afstemming en uitgebreide red teaming om risico’s te mitigeren, met name in kritieke gebieden zoals cybersecurity en biologische bedreigingen. Ter ondersteuning van deze inspanningen heeft Meta ook Llama Guard 2 geïntroduceerd, afgestemd op de 8B versie van Llama 3. Dit nieuwe model versterkt de Llama Guard serie door LLM invoer en uitvoer te classificeren om mogelijk onveilig materiaal te identificeren, waardoor het ideaal is voor productieomgevingen.

Beschikbaarheid van Llama 3

Llama 3 modellen zijn nu geïntegreerd in de Hugging Face ecosystem, waardoor ontwikkelaars gemakkelijker toegang hebben. De modellen zijn ook beschikbaar via model-as-a-service platforms zoals Perplexity Labs en Fireworks.ai, en op cloud platforms zoals AWS SageMaker, Azure ML en Vertex AI. Meta plant om de beschikbaarheid van Llama 3 verder uit te breiden, waaronder platforms zoals Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM en Snowflake. Bovendien zal de hardwareondersteuning voor Llama 3 worden uitgebreid naar platforms van AMD, AWS, Dell, Intel (INTC ), NVIDIA en Qualcomm.

Aankomende Verbeteringen in Llama 3

Meta heeft onthuld dat de huidige release van Llama 3 slechts de eerste fase is in hun bredere visie voor de volledige versie van Llama 3. Zij ontwikkelen een geavanceerd model met meer dan 400 miljard parameters dat nieuwe functies zal introduceren, waaronder multimodaliteit en de capaciteit om meerdere talen te verwerken. Deze verbeterde versie zal ook een aanzienlijk verlengde contextwindow en verbeterde algehele prestatiecapaciteiten hebben.

De Bottom Line

Meta’s Llama 3 markeert een significante evolutie in het landschap van grote taalmodellen, waarbij de serie niet alleen naar grotere open-source toegankelijkheid gaat, maar ook aanzienlijk de prestatiecapaciteiten verbetert. Met een trainingsdataset die zeven keer groter is dan zijn voorganger en functies zoals uitgebreid vocabulaire en verlengde contextlengte, stelt Llama 3 nieuwe benchmarks die zelfs de sterkste concurrenten in de industrie uitdagen.

Dit derde iteratie zet niet alleen de democratisering van AI technologie voort door hoge niveau capaciteiten beschikbaar te stellen aan een breder spectrum van ontwikkelaars, maar introduceert ook significante vooruitgang in veiligheid en trainingsprecisie. Door deze modellen te integreren in platforms zoals Hugging Face en de beschikbaarheid uit te breiden via grote cloudservices, zorgt Meta ervoor dat Llama 3 niet alleen alomtegenwoordig is, maar ook krachtig.

Als we vooruitkijken, belooft Meta’s voortdurende ontwikkeling nog robuustere capaciteiten, waaronder multimodaliteit en uitgebreide talenondersteuning, waardoor Llama 3 niet alleen kan concurreren met, maar mogelijk zelfs de belangrijkste AI modellen in de markt kan overtreffen. Llama 3 is een getuigenis van Meta’s toewijding aan het leiden van de AI revolutie, waarbij tools worden geboden die niet alleen toegankelijker, maar ook aanzienlijk geavanceerder en veiliger zijn voor een wereldwijd gebruikersbestand.

Dr. Tehseen Zia is een gewaardeerd associate professor aan de COMSATS University Islamabad, met een PhD in AI van de Vienna University of Technology, Oostenrijk. Hij specialiseert zich in Artificial Intelligence, Machine Learning, Data Science en Computer Vision, en heeft significante bijdragen geleverd met publicaties in gerenommeerde wetenschappelijke tijdschriften. Dr. Tehseen heeft ook verschillende industriële projecten geleid als hoofdonderzoeker en heeft gediend als AI-consultant.