AI-modeller og platforme
Den mest kraftfulde open-source LLM endnu: Meta LLAMA 3.1-405B
Llama 3.1-405B, udviklet af Meta AI, repræsenterer et betydeligt skridt fremad i open-source sprogmodeller. Med 405 milliarder parametre er det den største offentligt tilgængelige sprogmodel til dato, og det kan sammenlignes med og endda overgå nogle af de mest avancerede proprietære modeller i forskellige benchmarks.
Nøglefunktioner:
- 405 milliarder parametre
- 128K token kontekstlængde
- Flersproget understøttelse (8 sprog)
- Instruction-tuned version tilgængelig
- Open-source med en tilladelig licens
Udgivelsen af en så kraftfuld model i open-source-domænet er en game-changer, der demokratiserer adgangen til state-of-the-art AI-kapaciteter og fremmer innovation på tværs af branchen.
Modelarkitektur og træning
Processen begynder med, at inputteksttokenene konverteres til token-embeddings. Disse embeddings passerer gennem multiple lag af selv-opmærksomhed og feedforward-netværk, hvilket giver modelen mulighed for at fange komplekse relationer og afhængigheder inden for teksten. Den autoregressive dekodningsmekanisme genererer derefter outputteksttokenene, og processen er fuldført.

-
Grupperet forespørgselsopmærksomhed (GQA)
Llama 3.1 anvender Grupperet forespørgselsopmærksomhed, som er en vigtig optimeringsteknik, der ikke er fuldt dækket i den foregående besvarelse. Lad os udforske dette nærmere:
Grupperet forespørgselsopmærksomhed (GQA) er en variant af multi-head-opmærksomhed, der sigter mod at reducere beregningsomkostninger og hukommelsesbrug under inferens, især for lange sekvenser. I Llama 3.1 405B-modellen implementeres GQA med 8 nøgle-værdi-hoveder.
Her er, hvordan GQA fungerer:
- I stedet for at have separate nøgle- og værdiprojektioner for hver opmærksomhedshead, grupperer GQA multiple forespørgselsheads for at dele de samme nøgle- og værdiheads.
- Denne gruppering reducerer betydeligt antallet af parametre i nøgle- og værdiprojektionerne, hvilket resulterer i mindre modellær og hurtigere inferens.
- Opmærksomhedsberegningen kan udtrykkes som:
Opmærksomhed(Q, K, V) = softmax(QK^T / sqrt(d_k))VHvor Q er grupperet i g grupper, og K og V har færre hoveder end Q.
Fordelene ved GQA i Llama 3.1 405B omfatter:
- Reduceret hukommelsesaftryk: Færre nøgle- og værdiprojektioner betyder, at der kræves mindre hukommelse til at gemme modellens parametre.
- Hurtigere inferens: Med færre beregninger, der er nødvendige for nøgle- og værdiprojektioner, forbedres inferenshastigheden.
- Bevaret ydelse: Trods reduktionen i parametre har GQA vist sig at bevare en sammenlignelig ydelse med standard multi-head-opmærksomhed i mange opgaver.
-
To-trins prætræning for udvidet kontekst
Artiklen nævner en to-trins prætræningsproces for at opnå den 128K token kontekstvindue. Dette er en afgørende aspekt af Llama 3.1 405B’s kapaciteter:
Trin 1: Initial prætræning på 8K tokens
- Modellen trænes først på sekvenser på op til 8K tokens.
- Dette trin giver modellen mulighed for at lære generel sprogforståelse og genereringskapaciteter.
Trin 2: Fortsat prætræning for kontekstudvidelse
- Efter den initielle træning undergår modellen en fortsat prætræning for at øge kontekstlængden til 128K tokens.
- Dette trin involverer omhyggeligt designede træningsregimer for at hjælpe modellen med at generalisere til længere sekvenser uden at miste evnen til at håndtere kortere kontekster.
-
Flersproget kapacitet
Selvom den foregående besvarelse berørte flersproget kapacitet, kan vi udvide på, hvordan Llama 3.1 405B implementerer dette:
Kompositionel tilgang:
- Llama 3.1 405B anvender separate encodere for forskellige modaliteter (f.eks. billeder, tale).
- Disse encodere transformerer input fra forskellige modaliteter til et fælles embeddingsrum, som sprogmodellen kan forstå.
Integration med sprogmodellen:
- Outputtet fra disse specialiserede encodere indføres derefter i den primære sprogmodel.
- Dette giver Llama 3.1 405B mulighed for at behandle og forstå forskellige typer data samtidig, hvilket muliggør opgaver, der involverer multiple modaliteter.
Krydsovmærksomhedsmekanismer:
- For at håndtere integrationen af forskellige modaliteter anvender Llama 3.1 405B sandsynligvis krydsovmærksomhedsmekanismer.
- Disse mekanismer giver modellen mulighed for at fokusere på relevant information fra forskellige modaliteter under tekstgenerering eller andre opgaver.
Den flersprogede kapacitet i Llama 3.1 405B åbner op for en bred vifte af anvendelser, såsom:
- Billede-underskrift og visuel spørgsmålssvar
- Tale-til-tekst-transkription med kontekstforståelse
- Flersproget resonering, der kombinerer tekst, billeder og potentiellement andre datatyper
Træningsdetaljer
- Trænet på over 15 billioner tokens
- Tilpasset bygget GPU-cluster med 39,3M GPU-timer til 405B-modellen
- Mangfoldig datasætskurering for flersproget kapacitet
Den instruction-tuned version gennemgik yderligere træning:
- Finjusteret på offentligt tilgængelige instruktionsdatasæt
- Over 25 millioner syntetisk genererede eksempler
- Overvåget finjustering (SFT) og Forstærket læring med menneskelig feedback (RLHF)
Ydelsesbenchmarks
Tabellen sammenligner Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni og Claude 3.5 Sonnet. Nøglebenchmarks omfatter generelle opgaver som MMLU og IFEval, kodeopgaver som HumanEval og GSM8K, og resoneringopgaver som ARC Challenge. Hver benchmarkscore afspejler modellens evne til at forstå og generere menneske-lignende tekst, løse komplekse problemer og udføre kode. Det er værd at bemærke, at Llama 3.1 405B og Claude 3.5 Sonnet excellerer i flere benchmarks, hvilket viser deres avancerede kapaciteter i både generelle og domænespecifikke opgaver.
Fremtidige retninger
Udgivelsen af Llama 3.1-405B vil sandsynligvis accelerere innovation i flere områder:
- Forbedrede finjusteringsteknikker for specialiserede domæner
- Udvikling af mere effektive inferensmetoder
- Fremgang i modellkomprimering og -distillering
Konklusion
Llama 3.1-405B repræsenterer et betydeligt skridt i open-source AI, tilbydende kapaciteter, der tidligere var forbeholdt lukkede modeller.
Da vi fortsætter med at udforske kraften i denne model, er det afgørende at tilgangen til dens brug sker med ansvar og etisk overvejelse. Værktøjerne og sikkerhedsforanstaltningerne, der følger med modellen, giver en ramme for ansvarlig implementering, men fortsat opmærksomhed og fællesskabs-samarbejde vil være nødvendigt for at sikre, at denne kraftfulde teknologi bliver brugt til gavn for samfundet.














