AI-modeller og plattformer

Meta’s Llama 3.2: Gjendefinerer ÃĨpen kildekode-generativ AI med on-device og multimodal funksjoner

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Meta’s nylige lansering av Llama 3.2, den nyeste iterasjonen i sin Llama-serie av store sprÃĨkmodeller, er en betydelig utvikling i evolusjonen av ÃĨpen kildekode-generativ AI-Ãļkosystem. Denne oppgraderingen utvider Llamas funksjoner i to dimensjoner. PÃĨ den ene siden, tillater Llama 3.2 prosessering av multimodal data—integrerende bilder, tekst og mer—gjÃļr avanserte AI-funksjoner mer tilgjengelige for et bredere publikum. PÃĨ den andre siden, utvider den sin distribusjonsmulighet pÃĨ kantenheter, skaper spennende muligheter for sanntids-, on-device AI-applikasjoner. I denne artikkelen vil vi utforske denne utviklingen og dens implikasjoner for fremtiden til AI-distribusjon.

Llamas utvikling

Metas reise med Llama begynte tidlig i 2023, og i den tiden har serien opplevd eksplosiv vekst og adopsjon. Fra Llama 1, som var begrenset til ikke-kommersiell bruk og bare tilgjengelig for utvalgte forskningsinstitusjoner, gikk serien over til ÃĨpen kildekode-domene med lanseringen av Llama 2 i 2023. Lanseringen av Llama 3.1 tidligere i ÃĨr, var et stort skritt fremover i utviklingen, da den introduserte den stÃļrste ÃĨpen kildekode-modellen pÃĨ 405 milliarder parametre, som er pÃĨ lik linje med eller overgÃĨr sine proprietÃĶre konkurrenter. Den nyeste utgaven, Llama 3.2, tar dette et skritt videre ved ÃĨ introdusere nye lettvinte og visjon-fokuserte modeller, gjÃļr on-device AI og multimodal funksjoner mer tilgjengelige. Metas dedikasjon til ÃĨpenhet og modifiserbarhet har gjort Llama til en ledende modell i ÃĨpen kildekode-samfunnet. Selskapet mener at ved ÃĨ forbli dedikert til transparens og tilgjengelighet, kan vi mer effektivt drive AI-innovasjon fremover—ikke bare for utviklere og bedrifter, men for alle over hele verden.

Introduksjon av Llama 3.2

Llama 3.2 er den nyeste versjonen av Metas Llama-serie, inkludert en rekke sprÃĨkmodeller designet for ÃĨ mÃļte diverse krav. De stÃļrste og medium-stÃļrrelse modellene, inkludert 90 og 11 milliarder parametre, er designet for ÃĨ hÃĨndtere prosessering av multimodal data, inkludert tekst og bilder. Disse modellene kan effektivt tolke diagrammer, grafer og andre former for visuell data, gjÃļr dem egnet for ÃĨ bygge applikasjoner i omrÃĨder som datavisjon, dokumentanalyse og forbedrede virkelighetsverktÃļy. De lettvinte modellene, med 1 milliard og 3 milliarder parametre, er adoptert spesifikt for mobile enheter. Disse tekst-baserte modellene excellerer i flersprÃĨklig tekstgenerering og verktÃļy-aktiveringsfunksjoner, gjÃļr dem hÃļyt effektive for oppgaver som innhenting-utvidet generering, sammenfatting og skapelse av personlige agent-baserte applikasjoner pÃĨ kantenheter.

Betydningen av Llama 3.2

Denne utgaven av Llama 3.2 kan gjenkjennes for sine fremsteg i to nÃļkkelomrÃĨder.

En ny ÃĶra for multimodal AI

Llama 3.2 er Metas fÃļrste ÃĨpen kildekode-modell som har bÃĨde tekst- og bildeprosesseringsfunksjoner. Dette er en betydelig utvikling i evolusjonen av ÃĨpen kildekode-generativ AI, da det gjÃļr det mulig for modellen ÃĨ analysere og respondere pÃĨ visuelle innputt sammen med tekstdata. For eksempel kan brukerne nÃĨ laste opp bilder og motta detaljerte analyser eller modifikasjoner basert pÃĨ naturlige sprÃĨklig instruksjoner, som ÃĨ identifisere objekter eller generere undertekster. Mark Zuckerberg betonet denne funksjonen under lanseringen, og sa at Llama 3.2 er designet for ÃĨ “muliggjÃļre en rekke interessante applikasjoner som krever visuell forstÃĨelse” . Denne integrasjonen utvider Llamas omfang for industrier som er avhengige av multimodal informasjon, inkludert detaljhandel, helse, utdanning og underholdning.

On-device funksjonalitet for tilgjengelighet

En av de fremstÃĨende funksjonene i Llama 3.2 er dens optimalisering for on-device-distribusjon, spesielt i mobile miljÃļer. Modellens lettvinte versjoner med 1 milliard og 3 milliarder parametre, er spesifikt designet for ÃĨ kjÃļre pÃĨ smarttelefoner og andre kantenheter drevet av Qualcomm (QCOM ) og MediaTek-hardware. Denne funksjonen gjÃļr det mulig for utviklere ÃĨ skape applikasjoner uten behov for omfattende beregningsressurser. I tillegg excellerer disse modellversjonene i flersprÃĨklig tekstprosesserings- og stÃļtter en lengre kontekstlengde pÃĨ 128K token, gjÃļr det mulig for brukerne ÃĨ utvikle naturlige sprÃĨkbehandlingsapplikasjoner pÃĨ sine lokale sprÃĨk. Dessuten har disse modellene verktÃļy-aktiveringsfunksjoner, som gjÃļr det mulig for brukerne ÃĨ engasjere i agens-applikasjoner, som ÃĨ hÃĨndtere kalenderinvitasjoner og planlegge reiser direkte pÃĨ sine enheter.

Evnen til ÃĨ distribuere AI-modeller lokalt gjÃļr det mulig for ÃĨpen kildekode-AI ÃĨ overvinne utfordringene forbundet med skytjenester, inkludert forsinkelser, sikkerhetsrisiko, hÃļye driftskostnader og avhengighet av internetttilkobling. Denne fremgangen har potensialet til ÃĨ transformere industrier som helse, utdanning og logistikk, som kan anvende AI uten begrensningene til skyinfrastruktur eller personvernsproblemer, og i sanntidssituasjoner. Dette ÃĨpner ogsÃĨ dÃļren for AI ÃĨ nÃĨ regioner med begrensede nettverksforbindelser, demokratiserer tilgangen til fremtidsrettet teknologi.

Konkurranserfordel

Meta rapporterer at Llama 3.2 har utfÃļrt konkurrerende mot ledende modeller fra OpenAI og Anthropic nÃĨr det gjelder ytelse. De hevder at Llama 3.2 overgÃĨr rivaler som Claude 3-Haiku og GPT-4o-mini i ulike benchmark, inkludert instruksjonsfÃļlging og innholdssammenfatting. Denne konkurranserfordelen er vital for Meta, da de sikrer at ÃĨpen kildekode-AI forblir pÃĨ lik linje med proprietÃĶre modeller i det raskt utviklende feltet generativ AI.

Llama Stack: Forenkling av AI-distribusjon

En av de viktigste aspektene ved Llama 3.2-utgaven er introduksjonen av Llama Stack. Denne samlingen av verktÃļy gjÃļr det enklere for utviklere ÃĨ arbeide med Llama-modeller over ulike miljÃļer, inkludert enkelt-node, pÃĨ-premis, sky og on-device-oppsÃĶtninger. Llama Stack inkluderer stÃļtte for RAG og verktÃļy-aktiveringsapplikasjoner, og gir en fleksibel, omfattende ramme for ÃĨ distribuere generativ AI-modeller. Ved ÃĨ forenkle distribusjonsprosessen, gjÃļr Meta det mulig for utviklere ÃĨ uten vanskeligheter integrere Llama-modeller i sine applikasjoner, enten for sky, mobil eller skrivebordsmiljÃļer.

Bunnen av saken

Metas Llama 3.2 er et viktig Ãļyeblikk i evolusjonen av ÃĨpen kildekode-generativ AI, setter nye standarder for tilgjengelighet, funksjonalitet og fleksibilitet. Med sine on-device-egenskaper og multimodal prosessering, ÃĨpner denne modellen transformative muligheter over industrier, fra helse til utdanning, samtidig som den addreserer kritiske bekymringer som personvern, forsinkelser og infrastrukturbegrensninger. Ved ÃĨ gi utviklere mulighet til ÃĨ distribuere avansert AI lokalt og effektivt, utvider Llama 3.2 ikke bare omfanget av AI-applikasjoner, men demokratiserer ogsÃĨ tilgangen til fremtidsrettet teknologi pÃĨ en global skala.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlÃĶring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har ogsÃĨ ledet flere industriprosjekter som hovedundersÃļker og tjenestegjort som AI-konsulent.