AI-modeller og plattformer
Avduking av Meta Llama 3: Et sprang fremover i store språkmodeller
I feltet generativ AI fortsetter Meta å lede med sitt engasjement for åpen kildekode og distribuerer sine avanserte store språkmodeller Meta AI (Llama) serie globalt til utviklere og forskere. Bygget på sine progressive initiativer, har Meta nylig introdusert den tredje iterasjonen av denne serien, Llama 3. Denne nye utgaven forbedrer betydelig på Llama 2, og tilbyr flere forbedringer og setter standarder som utfordrer bransje konkurranter som Google (GOOGL ), Mistral og Anthropic. Denne artikkelen utforsker de betydelige fremgangene i Llama 3 og hvordan det sammenlignes med sin forgjenger, Llama 2.
Meta’s Llama-serie: Fra eksklusiv til åpen tilgang og forbedret ytelse
Meta initierte sin Llama-serie i 2022 med lanseringen av Llama 1, en modell begrenset til ikke-kommersiell bruk og tilgjengelig kun for utvalgte forskningsinstitusjoner på grunn av de enorme beregningskravene og proprietære natur som karakteriserte fremtredende LLM’er på den tiden. I 2023, med lanseringen av Llama 2, skiftet Meta AI mot større åpenhet, og tilbød modellen fritt for både forskning og kommersielle formål. Dette skiftet var designet for å demokratisere tilgangen til avansert generativ AI-teknologi, og tillot en bredere rekke brukere, inkludert start-ups og mindre forskningsteam, å innovere og utvikle applikasjoner uten de høye kostnadene som vanligvis er forbundet med store modeller. Fortsetter denne trenden mot åpenhet, har Meta introdusert Llama 3, som fokuserer på å forbedre ytelsen av mindre modeller på ulike industrielle benchmark.
Introducing Llama 3
Llama 3 er den andre generasjonen av Meta’s åpne store språkmodeller (LLM’er), med både forhånds-trente og instruksjons-finetuned modeller med 8B og 70B parametre. I linje med sine forgjengere, bruker Llama 3 en decoder-only transformer-arkitektur og fortsetter praksisen med autoregressiv, selv-supervisert trening for å forutsi påfølgende token i tekstsekvenser. Llama 3 er forhånds-trent på en datasett som er syv ganger større enn den som ble brukt for Llama 2, med over 15 billioner token hentet fra en ny kurert blanding av offentlig tilgjengelige nettdata. Denne enorme datasetten blir prosessert ved hjelp av to cluster med 24 000 GPU’er. For å opprettholde den høye kvaliteten på denne treningsdataen, ble en rekke data-sentrerte AI-teknikker brukt, inkludert heuristiske og NSFW-filtre, semantisk deduplisering og tekstkvalitetsklassifisering. Tilpasset for dialog-applikasjoner, har Llama 3 Instruct-modellen blitt betydelig forbedret, med over 10 millioner menneske-annoterte datasamlinger og en sofistikert blanding av treningsmetoder som supervisert finjustering (SFT), rejection sampling, proximal policy-optimisering (PPO) og direkte policy-optimisering (DPO).
Llama 3 vs. Llama 2: Nøkkel-forbedringer
Llama 3 bringer flere forbedringer over Llama 2, og øker betydelig funksjonaliteten og ytelsen:
- Utvidet Vokabular: Llama 3 har økt sitt vokabular til 128 256 token, opp fra Llama 2’s 32 000 token. Denne forbedringen støtter mer effektiv tekstkoding for både inndata og utdata og styrker dens multilinguale evner.
- Utvidet Kontekstlengde: Llama 3-modellene tilbyr en kontekstlengde på 8 000 token, dobbelt så lang som Llama 2’s 4 090 token. Denne økningen tillater mer omfattende innholdshåndtering, som omfatter både bruker-prompter og modell-respons.
- Oppgradert Treningsdata: Treningsdatasettet for Llama 3 er syv ganger større enn det for Llama 2, og inneholder fire ganger mer kode. Det inneholder over 5% høykvalitets, ikke-engelsk data som omfatter over 30 språk, som er avgjørende for multilinguale applikasjoner. Denne dataen undergår strenge kvalitetskontroller ved hjelp av avanserte teknikker som heuristiske og NSFW-filtre, semantisk deduplisering og tekstklassifisering.
- Raffinert Instruksjons-finjustering og Evaluering: I motsetning til Llama 2, bruker Llama 3 avanserte instruksjons-finjusteringsteknikker, inkludert supervisert finjustering (SFT), rejection sampling, proximal policy-optimisering (PPO) og direkte policy-optimisering (DPO). For å støtte denne prosessen, er en ny høykvalitets menneske-evalueringssett introdusert, bestående av 1 800 prompter som dekker diverse bruksscenarier som råd, brainstorming, klassifisering, kodning og mer, og sikrer en omfattende vurdering og finjustering av modellens evner.
- Avansert AI-Sikkerhet: Llama 3, som Llama 2, inkorporerer strenge sikkerhetsforanstaltninger som instruksjons-finjustering og omfattende red-teaming for å mitigere risiko, spesielt i kritiske områder som cybersikkerhet og biologiske trusler. For å støtte disse innsatsene, har Meta også introdusert Llama Guard 2, finjustert på 8B-versjonen av Llama 3. Denne nye modellen forbedrer Llama Guard-serien ved å klassifisere LLM-inndata og -respons for å identifisere potensielt usikker innhold, og gjør den ideell for produksjonsmiljøer.
Tilgjengelighet av Llama 3
Llama 3-modellene er nå integrert i Hugging Face-økosystemet, og forbedrer tilgjengeligheten for utviklere. Modellene er også tilgjengelige gjennom modell-til-tjeneste-plattformer som Perplexity Labs og Fireworks.ai, og på sky-plattformer som AWS SageMaker, Azure ML og Vertex AI. Meta planlegger å utvide Llama 3’s tilgjengelighet videre, inkludert plattformer som Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM og Snowflake. I tillegg vil hårdvaruestøtte for Llama 3 utvides til å inkludere plattformer fra AMD, AWS, Dell, Intel (INTC ), NVIDIA og Qualcomm.
Kommende Forbedringer i Llama 3
Meta har avslørt at den nåværende utgaven av Llama 3 bare er den første fasen i deres bredere visjon for den fullstendige utgaven av Llama 3. De utvikler en avansert modell med over 400 milliarder parametre som vil introdusere nye funksjoner, inkludert multimodalitet og evnen til å håndtere flere språk. Denne forbedrede utgaven vil også ha en betydelig utvidet kontekstvindu og forbedret ytelse.
Sluttkonklusjon
Meta’s Llama 3 markerer en betydelig utvikling i landskapet av store språkmodeller, og driver serien ikke bare mot større åpen tilgang, men også vesentlig forbedrer ytelsen. Med en treningsdatasett som er syv ganger større enn sin forgjenger og funksjoner som utvidet vokabular og økt kontekstlengde, setter Llama 3 nye standarder som utfordrer selv de sterkeste bransje-konkurrentene.
Denne tredje iterasjonen fortsetter ikke bare å demokratisere AI-teknologi ved å gjøre høy-nivå funksjoner tilgjengelige for en bredere rekke utviklere, men introduserer også betydelige fremgang i sikkerhet og treningspresisjon. Ved å integrere disse modellene i plattformer som Hugging Face og utvide tilgjengeligheten gjennom større sky-tjenester, sikrer Meta at Llama 3 er like ubikkvit som den er kraftig.
Ser vi fremover, lover Meta’s pågående utvikling enda mer robuste funksjoner, inkludert multimodalitet og utvidet språkstøtte, og setter scenen for Llama 3 til ikke bare å konkurrere med, men potensielt overgå andre store AI-modeller på markedet. Llama 3 er et vitnesbyrd om Meta’s engasjement for å lede AI-revolusjonen, og tilbyr verktøy som ikke bare er mer tilgjengelige, men også vesentlig mer avanserte og sikrere for en global brukerbase.










