AI-modeller og platforme

Præsentation af Meta Llama 3: Et spring fremad for store sprogmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

I feltet for genererende AI fører Meta an med sin tilgang til åben kildekode, hvor de distribuerer deres avancerede store sprogmodel Meta AI (Llama) til udviklere og forskere over hele verden. Bygget på deres progressive initiativer har Meta nylig introduceret den tredje iteration af denne serie, Llama 3. Denne nye udgave forbedrer betydeligt på Llama 2, og tilbyder mange forbedringer og sætter nye standarder, der udfordrer branchekonkurrenter som Google (GOOGL ), Mistral og Anthropic. Denne artikel udforsker de betydelige fremskridt i Llama 3 og hvordan den sammenlignes med sin forgænger, Llama 2.

Meta’s Llama-serie: Fra eksklusiv til åben adgang og forbedret ydelse

Meta startede sin Llama-serie i 2022 med lanceringen af Llama 1, en model begrænset til ikke-kommerciel brug og kun tilgængelig for udvalgte forskningsinstitutioner på grund af de enorme beregningskrav og proprietære karakter, der kendetegnede avancerede LLM’er på det tidspunkt. I 2023, med udgivelsen af Llama 2, skiftede Meta AI til en mere åben tilgang, hvor modellen blev tilbudt gratis til både forskning og kommercielle formål. Dette skridt var designet til at demokratisere adgangen til avanceret genererende AI-teknologi, så en bredere gruppe af brugere, herunder startups og mindre forskningsteams, kunne innovere og udvikle applikationer uden de høje omkostninger, der normalt er forbundet med store modeller. I denne ånd har Meta introduceret Llama 3, der fokuserer på at forbedre ydelsen af mindre modeller på tværs af forskellige industrielle benchmarks.

Præsentation af Llama 3

Llama 3 er den anden generation af Meta’s åbne sprogmodeller (LLM’er), der omfatter både forudtrænede og instruktions-finetunede modeller med 8B og 70B parametre. I overensstemmelse med sine forgængere bruger Llama 3 en decoder-kun transformatorarkitektur og fortsætter praksis med autoregressiv, selv-superveret træning for at forudsige efterfølgende tokens i tekstsekvenser. Llama 3 er forudtrænet på en dataset, der er syv gange større end den brugt til Llama 2, og omfatter over 15 billioner tokens trukket fra en nyt kurateret blanding af offentligt tilgængelige online-data. Denne enorme dataset behandles ved hjælp af to clusters udstyret med 24.000 GPU’er. For at opretholde den høje kvalitet af denne træningsdata er en række data-centrisk AI-teknikker blevet anvendt, herunder heuristiske og NSFW-filtre, semantisk deduplikation og tekstkvalitetsklassifikation. Tilpasset til dialogapplikationer er Llama 3 Instruct-modellen blevet betydeligt forbedret, og omfatter over 10 millioner menneske-annoterede dataeksempler og udnytter en sofistikeret blanding af træningsmetoder som overvåget finjustering (SFT), rejection sampling, proximal policy optimering (PPO) og direkte politikoptimering (DPO).

Llama 3 vs. Llama 2: Nøgleforbedringer

Llama 3 bringer flere forbedringer med sig i forhold til Llama 2, og forbedrer betydeligt både funktionalitet og ydelse:

  • Udvidet vokabular: Llama 3 har øget sit vokabular til 128.256 tokens, op fra Llama 2’s 32.000 tokens. Denne forbedring støtter mere effektiv tekstkodning for både input og output og styrker dens multilingvale evner.
  • Forlænget kontekstlængde: Llama 3-modellerne tilbyder en kontekstlængde på 8.000 tokens, og fordobler dermed den 4.090 tokens, der blev understøttet af Llama 2. Denne øgning tillader mere omfattende indholdshåndtering, der omfatter både brugerprompter og modellsvar.
  • Opgraderet træningsdata: Træningsdatasettet for Llama 3 er syv gange større end det for Llama 2, og omfatter fire gange mere kode. Det indeholder over 5% højkvalitets, ikke-engelsk data, der dækker mere end 30 sprog, hvilket er afgørende for multilingval applikationsstøtte. Denne data undergår strenge kvalitetskontroller ved hjælp af avancerede teknikker som heuristiske og NSFW-filtre, semantisk deduplikation og tekstklassifikatorer.
  • Finjusteret instruktions-tuning og evaluering: I modsætning til Llama 2 bruger Llama 3 avancerede instruktions-tuning-teknikker, herunder overvåget finjustering (SFT), rejection sampling, proximal policy optimering (PPO) og direkte politikoptimering (DPO). For at supplere denne proces er der introduceret en ny højkvalitets menneske-evalueringssæt, der består af 1.800 prompter, der dækker diverse brugsområder som råd, brainstorming, klassifikation, kodning og mere, hvilket sikrer en omfattende vurdering og finjustering af modellens evner.
  • Avanceret AI-sikkerhed: Llama 3, ligesom Llama 2, inkorporerer strenge sikkerhedsforanstaltninger som instruktionsfinjustering og omfattende red-teaming for at minimere risici, især i kritiske områder som cybersikkerhed og biologiske trusler. For at støtte disse bestræbelser har Meta også introduceret Llama Guard 2, der er finjusteret på den 8B-version af Llama 3. Denne nye model forbedrer Llama Guard-serien ved at klassificere LLM-input og -output for at identificere potentielt usikker indhold, hvilket gør den ideel til produktionsmiljøer.

Tilgængelighed af Llama 3

Llama 3-modellerne er nu integreret i Hugging Face-økosystemet, hvilket forbedrer tilgængeligheden for udviklere. Modellerne er også tilgængelige gennem model-as-a-service-platforme som Perplexity Labs og Fireworks.ai, og på cloud-platforme som AWS SageMaker, Azure ML og Vertex AI. Meta planlægger at udvide Llama 3’s tilgængelighed yderligere, herunder platforme som Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM og Snowflake. Derudover vil hardware-støtte til Llama 3 blive udvidet til at omfatte platforme fra AMD, AWS, Dell, Intel (INTC ), NVIDIA og Qualcomm.

Kommercielle forbedringer i Llama 3

Meta har afsløret, at den nuværende udgave af Llama 3 kun er den første fase i deres bredere vision for den fulde version af Llama 3. De udvikler en avanceret model med over 400 milliarder parametre, der vil introducere nye funktioner, herunder multimodalitet og evnen til at håndtere multiple sprog. Denne forbedrede version vil også have en betydeligt forlænget kontekstvindue og forbedret ydelse.

Det endelige punkt

Meta’s Llama 3 markerer en betydelig udvikling i landskabet af store sprogmodeller, der ikke kun driver serien mod større åben adgang, men også betydeligt forbedrer dens ydelse. Med en træningsdataset, der er syv gange større end dens forgænger, og funktioner som udvidet vokabular og forlænget kontekstlængde, sætter Llama 3 nye standarder, der udfordrer selv de stærkeste branchekonkurrenter.

Denne tredje iteration fortsætter ikke kun med at demokratisere AI-teknologi ved at gøre højniveaufunktioner tilgængelige for en bredere gruppe af udviklere, men introducerer også betydelige fremskridt i sikkerhed og træningspræcision. Ved at integrere disse modeller i platforme som Hugging Face og udvide tilgængeligheden gennem større cloud-tjenester sikrer Meta, at Llama 3 er lige så almindelig som det er kraftfuldt.

Settende blikket fremad lover Meta’s fortsatte udvikling endnu mere robuste funktioner, herunder multimodalitet og udvidet sprogstøtte, hvilket sætter scenen for Llama 3 til ikke kun at konkurrere med, men potentielt overgå andre store AI-modeller på markedet. Llama 3 er et vidnesbyrd om Meta’s engagement i at føre AI-revolutionen, og tilbyder værktøjer, der ikke kun er mere tilgængelige, men også betydeligt mere avancerede og sikrere for en global brugerbase.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.