AI-modellen en platforms
De meest krachtige open-source LLM tot nu toe: Meta LLAMA 3.1-405B
Llama 3.1-405B, ontwikkeld door Meta AI, vertegenwoordigt een significante stap voorwaarts in open-source taalmodellen. Met 405 miljard parameters is het het grootste openbaar beschikbare taalmodel tot nu toe, dat enkele van de meest geavanceerde propriëtaire modellen in verschillende benchmarks evenaart en zelfs overtreft.
Sleutelfuncties:
- 405 miljard parameters
- 128K token contextlengte
- Meertalige ondersteuning (8 talen)
- Instruction-tuned versie beschikbaar
- Open-source met een permissieve licentie
De release van zo’n krachtig model in de open-source domein is een game-changer, waardoor toegang tot state-of-the-art AI-mogelijkheden wordt gedemocratiseerd en innovatie in de hele industrie wordt gestimuleerd.
Modelarchitectuur en training
Het proces begint met het omzetten van invoerteksttokens in token-embeddings. Deze embeddings gaan door meerdere lagen van self-attention en feedforward-netwerken, waardoor het model complexe relaties en afhankelijkheden binnen de tekst kan vastleggen. De autoregressieve decodingsmechanisme genereert vervolgens de uitvoerteksttokens, waarmee het proces wordt voltooid.

-
Groepsgewijs query-attention (GQA)
Llama 3.1 maakt gebruik van Grouped Query Attention, een belangrijke optimalisatietechniek die niet volledig is behandeld in het vorige antwoord. Laten we dit nader bekijken:
Grouped Query Attention (GQA) is een variant van multi-head attention die gericht is op het verlagen van de berekeningskosten en het geheugengebruik tijdens inferentie, met name voor lange sequenties. In het Llama 3.1 405B-model wordt GQA geïmplementeerd met 8 key-value heads.
Hieronder volgt een overzicht van hoe GQA werkt:
- In plaats van aparte key- en value-projecties voor elke attention-head, groepeert GQA meerdere query-heads om dezelfde key- en value-heads te delen.
- Deze groepering vermindert aanzienlijk het aantal parameters in de key- en value-projecties, wat resulteert in kleinere modelgroottes en snellere inferentie.
- De attentieberekening kan worden uitgedrukt als:
Attention(Q, K, V) = softmax(QK^T / sqrt(d_k))VWaar Q is gegroepeerd in g groepen, en K en V hebben minder heads dan Q.
De voordelen van GQA in Llama 3.1 405B zijn:
- Verlaagd geheugengebruik: Minder key- en value-projecties betekenen minder geheugen dat nodig is om de modelparameters op te slaan.
- Snellere inferentie: Met minder berekeningen die nodig zijn voor key- en value-projecties, wordt de inferentiesnelheid verbeterd.
- Behouden prestaties: Ondanks de reductie in parameters, heeft GQA een vergelijkbare prestatie getoond als standaard multi-head attention in veel taken.
-
Tweestaps vooraftraining voor uitgebreide context
Het artikel noemt een tweestaps vooraftrainingsproces om de 128K token contextwindow te bereiken. Dit is een cruciaal aspect van de mogelijkheden van Llama 3.1 405B:
Stap 1: Initiële vooraftraining op 8K tokens
- Het model wordt eerst getraind op sequenties van maximaal 8K tokens.
- Deze stap stelt het model in staat om algemene taalbegrip en generatiemogelijkheden te leren.
Stap 2: Voortgezette vooraftraining voor contextuitbreiding
- Na de initiële training, ondergaat het model een voortgezette vooraftraining om de contextlengte tot 128K tokens te verlengen.
- Deze stap omvat zorgvuldig ontworpen trainingsregimes om het model te helpen generaliseren naar langere sequenties zonder het vermogen te verliezen om met kortere contexten om te gaan.
-
Meertalige mogelijkheden
Terwijl het vorige antwoord de meertalige mogelijkheden aanraakte, kunnen we dit nader bekijken:
Compositorische benadering:
- Llama 3.1 405B gebruikt aparte encoders voor verschillende modaliteiten (bijv. afbeeldingen, spraak).
- Deze encoders transformeren invoer van verschillende modaliteiten in een gedeelde embeddingruimte die het taalmodel kan begrijpen.
Integratie met taalmodel:
- De uitvoer van deze gespecialiseerde encoders wordt vervolgens ingevoerd in het hoofdtaalmodel.
- Dit stelt Llama 3.1 405B in staat om verschillende soorten data tegelijkertijd te verwerken en te begrijpen, waardoor het in staat is om taken uit te voeren die meerdere modaliteiten betreffen.
Cross-attention-mechanismen:
- Om de integratie van verschillende modaliteiten te verwerken, gebruikt Llama 3.1 405B waarschijnlijk cross-attention-mechanismen.
- Deze mechanismen stellen het model in staat om relevante informatie van verschillende modaliteiten te selecteren wanneer het tekst genereert of andere taken uitvoert.
De meertalige mogelijkheden van Llama 3.1 405B openen een breed scala aan toepassingen, zoals:
- Afbeelding-onderschriften en visuele vraagbeantwoording
- Spraak-naar-tekst-transcriptie met contextueel begrip
- Meertalige redeneertaken die tekst, afbeeldingen en mogelijk andere datatypen combineren
Trainingsdetails
- Getraind op meer dan 15 biljoen tokens
- Aangepaste GPU-cluster met 39,3M GPU-uren voor het 405B-model
- Gevarieerde datasetcuratie voor meertalige mogelijkheden
De instruction-tuned versie onderging aanvullende training:
- Fijn afgestemd op openbaar beschikbare instructiedatasets
- Meer dan 25M synthetisch gegenereerde voorbeelden
- Gesuperviseerde fijne afstemming (SFT) en Versterking van het leren met menselijke feedback (RLHF)
Prestatiebenchmarks
De tabel vergelijkt Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni en Claude 3.5 Sonnet. Belangrijke benchmarks omvatten algemene taken zoals MMLU en IFEval, codetaken zoals HumanEval en GSM8K, en redeneertaken zoals ARC Challenge. Elke benchmarkscore weerspiegelt de capaciteit van het model om menselijke tekst te begrijpen en te genereren, complexe problemen op te lossen en code uit te voeren. Opvallend is dat Llama 3.1 405B en Claude 3.5 Sonnet uitblinken in verschillende benchmarks, waarmee ze hun geavanceerde capaciteiten in zowel algemene als domeinspecifieke taken demonstreren.
Toekomstige richtingen
De release van Llama 3.1-405B zal waarschijnlijk innovatie versnellen in verschillende gebieden:
- Verbeterde fijne afstemmingsmethoden voor gespecialiseerde domeinen
- Ontwikkeling van meer efficiënte inferentiemethoden
- Vooruitgang in modelcompressie en -distillatie
Conclusie
Llama 3.1-405B vertegenwoordigt een significante mijlpaal in open-source AI, met mogelijkheden die voorheen exclusief waren voor gesloten modellen.
Terwijl we de kracht van dit model blijven verkennen, is het essentieel om zijn gebruik met verantwoordelijkheid en ethische overweging te benaderen. De tools en waarborgen die samen met het model worden geleverd, bieden een kader voor verantwoordelijke implementatie, maar voortdurende waakzaamheid en samenwerking binnen de gemeenschap zullen cruciaal zijn om ervoor te zorgen dat deze krachtige technologie ten goede van de samenleving wordt gebruikt.














