AI-modeller och plattformar
Avslöja Meta Llama 3: Ett stort steg framåt för stora språkmodeller
Inom generativ AI fortsätter Meta att leda med sitt åtagande att göra sina avancerade stora språkmodeller tillgängliga för utvecklare och forskare över hela världen. Byggande på sina progressiva initiativ har Meta nyligen introducerat den tredje iterationen av denna serie, Llama 3. Denna nya utgåva förbättrar betydligt Llama 2, med många förbättringar och som sätter benchmark som utmanar branschens konkurrenter som Google (GOOGL ), Mistral och Anthropic. Denna artikel utforskar de betydande framstegen med Llama 3 och hur den jämför med sin föregångare, Llama 2.
Metas Llama-serie: Från exklusiv till öppen tillgång och förbättrad prestanda
Meta initierade sin Llama-serie 2022 med lanseringen av Llama 1, en modell som var begränsad till icke-kommersiellt bruk och endast var tillgänglig för utvalda forskningsinstitutioner på grund av de enorma beräkningskraven och den proprietära natur som kännetecknade avancerade LLM:er vid den tiden. 2023, med lanseringen av Llama 2, skiftade Meta AI mot större öppenhet, och erbjöd modellen fritt för både forskning och kommersiella ändamål. Detta steg var avsett att demokratisera tillgången till avancerad generativ AI-teknologi, och tillåta en bredare skara användare, inklusive startups och mindre forskningsteam, att innovera och utveckla applikationer utan de höga kostnader som vanligtvis förknippas med stora modeller. Fortsättande på denna trend mot öppenhet, har Meta introducerat Llama 3, som fokuserar på att förbättra prestandan hos mindre modeller över olika industriella benchmark.
Introduktion av Llama 3
Llama 3 är den andra generationen av Metas öppna stora språkmodeller (LLM), med både förtränade och instruktionsfinjusterade modeller med 8B och 70B parametrar. I linje med sina föregångare, använder Llama 3 en decoder-only transformatorarkitektur och fortsätter praxisen med autoregressiv, självständig träning för att förutsäga efterföljande token i textsekvenser. Llama 3 är förtränad på en dataset som är sju gånger större än den som användes för Llama 2, med över 15 biljoner token hämtade från en ny kuraterad mix av offentligt tillgängliga online-data. Denna enorma dataset bearbetas med hjälp av två kluster utrustade med 24 000 GPU:er. För att upprätthålla den höga kvaliteten på denna träningsdata, användes en mängd olika datacentrerade AI-tekniker, inklusive heuristiska och NSFW-filter, semantisk deduplicering och textkvalitetsklassificering. Anpassad för dialogapplikationer, har Llama 3 Instruct-modellen förbättrats betydligt, med över 10 miljoner mänskligt annoterade dataexempel och som använder en sofistikerad mix av träningsmetoder som övervakad finjustering (SFT), rejection sampling, proximal policyoptimering (PPO) och direkt policyoptimering (DPO).
Llama 3 vs. Llama 2: Nyckelförbättringar
Llama 3 medför flera förbättringar jämfört med Llama 2, och förbättrar betydligt dess funktionalitet och prestanda:
- Utökat ordförråd: Llama 3 har ökat sitt ordförråd till 128 256 token, upp från Llama 2:s 32 000 token. Denna förbättring stöder mer effektiv textkodning för både in- och utdata och stärker dess multilingvistiska förmågor.
- Förlängd kontextlängd: Llama 3-modellerna erbjuder en kontextlängd på 8 000 token, dubbelt så lång som de 4 090 token som stöds av Llama 2. Denna ökning möjliggör mer omfattande innehållshantering, som omfattar både användarprompt och modellsvar.
- Uppgraderad träningsdata: Träningsdataset för Llama 3 är sju gånger större än den för Llama 2, och innehåller fyra gånger mer kod. Den innehåller över 5 % högkvalitativ, icke-engelsk data som omfattar mer än 30 språk, vilket är avgörande för multilingvistiskt stöd. Denna data genomgår rigorös kvalitetskontroll med hjälp av avancerade tekniker som heuristiska och NSFW-filter, semantisk deduplicering och textklassificering.
- Raffinerad instruktionsfinjustering och utvärdering: Till skillnad från Llama 2, använder Llama 3 avancerade instruktionsfinjusteringstekniker, inklusive övervakad finjustering (SFT), rejection sampling, proximal policyoptimering (PPO) och direkt policyoptimering (DPO). För att komplettera denna process, har en ny högkvalitativ mänsklig utvärderingsuppsättning introducerats, bestående av 1 800 prompt som täcker olika användningsfall som råd, brainstorming, klassificering, kodning och mer, vilket säkerställer en omfattande utvärdering och finjustering av modellens förmågor.
- Avancerad AI-säkerhet: Llama 3, liksom Llama 2, inkorporerar strikta säkerhetsåtgärder som instruktionsfinjustering och omfattande red-teaming för att mildra risker, särskilt inom kritiska områden som cybersäkerhet och biologiska hot. I stöd för dessa ansträngningar, har Meta också introducerat Llama Guard 2, som är finjusterad på 8B-versionen av Llama 3. Denna nya modell förbättrar Llama Guard-serien genom att klassificera LLM-in- och utdata för att identifiera potentiellt farligt innehåll, vilket gör den idealisk för produktionsmiljöer.
Tillgänglighet för Llama 3
Llama 3-modellerna är nu integrerade i Hugging Face-ekosystemet, vilket förbättrar tillgängligheten för utvecklare. Modellerna är också tillgängliga via modell-tjänsteplattformar som Perplexity Labs och Fireworks.ai, och på molnplattformar som AWS SageMaker, Azure ML och Vertex AI. Meta planerar att ytterligare utöka tillgängligheten för Llama 3, inklusive plattformar som Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM och Snowflake. Dessutom kommer hårdvarustöd för Llama 3 att utökas till att omfatta plattformar från AMD, AWS, Dell, Intel (INTC ), NVIDIA och Qualcomm.
Kommande förbättringar i Llama 3
Meta har avslöjat att den nuvarande versionen av Llama 3 endast är den första fasen i deras breda vision för den fullständiga versionen av Llama 3. De utvecklar en avancerad modell med över 400 miljarder parametrar som kommer att introducera nya funktioner, inklusive multimodalitet och förmågan att hantera flera språk. Denna förbättrade version kommer också att ha en betydligt förlängd kontextfönster och förbättrade prestandaförmågor.
Slutsatsen
Metas Llama 3 markerar en betydande utveckling i landskapet för stora språkmodeller, och driver serien inte bara mot större öppenhet utan också mot betydligt förbättrad prestanda. Med en träningsdataset som är sju gånger större än sin föregångare och funktioner som utökat ordförråd och förlängd kontextlängd, sätter Llama 3 nya benchmark som utmanar även de starkaste branschkonkurrenterna.
Denna tredje iteration fortsätter inte bara att demokratisera AI-teknologi genom att göra högnivåfunktioner tillgängliga för en bredare skara utvecklare, utan introducerar också betydande framsteg inom säkerhet och träningsprecision. Genom att integrera dessa modeller i plattformar som Hugging Face och utöka tillgängligheten via stora molntjänster, säkerställer Meta att Llama 3 är lika allmänt tillgänglig som den är kraftfull.
Om man ser framåt, lovar Metas pågående utveckling ännu mer robusta funktioner, inklusive multimodalitet och utökat språkstöd, och skapar därmed scenen för Llama 3 att inte bara konkurrera med, utan potentiellt överträffa andra stora AI-modeller på marknaden. Llama 3 är ett bevis på Metas åtagande att leda AI-revolutionen, och tillhandahåller verktyg som inte bara är mer tillgängliga, utan också betydligt mer avancerade och säkrare för en global användarbas.










