AI-modeller og plattformer

Inn i Microsofts Phi-3 Mini: En kompakt AI-modell som slår over sin vekt

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Microsoft (MSFT ) har nylig lansert sin nyeste kompakte språkmodell, kalt Phi-3 Mini, som er en del av en trio kompakte AI-modeller som er designet for å levere toppkvalitet-ytelse samtidig som de er små nok til å kjøre effektivt på enheter med begrensede beregningsressurser. Med bare 3,8 milliarder parametre er Phi-3 Mini en brøkdel av størrelsen på AI-giganter som GPT-4, men den lover å matche deres evner i mange nøkkelområder.

Utviklingen av Phi-3 Mini representerer en betydelig milepæl i jakten på å demokratisere avanserte AI-evner ved å gjøre dem tilgjengelige på en bredere rekke hardware. Den lille fotavtrykket tillater den å bli deployert lokalt på smarttelefoner, nettbrett og andre edge-enheter, og overvinne forsinkelses- og personvernsproblemer forbundet med skybaserte modeller. Dette åpner opp nye muligheter for intelligente på-enhet-erfaringer over ulike domener, fra virtuelle assistenter og konversasjons-AI til kodeassistenter og språkforståelsesoppgaver.

4-bit kvantisert phi-3-mini som kjører nativt på en iPhone
4-bit kvantisert phi-3-mini som kjører nativt på en iPhone

Under Hood: Arkitektur og Trening

I kjernen er Phi-3 Mini en transformer-dekodermodell bygget på en lignende arkitektur som den åpne kildekode Llama-2-modellen. Den har 32 lag, 3072 skjulte dimensjoner og 32 oppmerksomhets-hoder, med en standard kontekstlengde på 4 000 token. Microsoft har også introdusert en lang kontekst-versjon kalt Phi-3 Mini-128K, som utvider kontekstlengden til en imponerende 128 000 token ved hjelp av tekniker som LongRope.

Hva som skiller Phi-3 Mini fra andre modeller, er dens treningsmetodologi. I stedet for å bare basere seg på den brutale kraften av massive datasett og beregningskraft, har Microsoft fokusert på å kuratere en høykvalitets, resonningstett treningsdatasett. Denne data består av tungt filtrert webdata, samt syntetisk data generert av større språkmodeller.

Treningsprosessen følger en to-fase-tilnærming. I den første fasen blir modellen eksponert for en mangfoldig rekke webkilder som er designet for å undervise den i generell kunnskap og språkforståelse. Den andre fasen kombinerer enda mer tungt filtrert webdata med syntetisk data designet for å innføre logisk resonning og niche-domene-ekspertise.

Microsoft omtaler denne tilnærmingen som “data-optimal regime”, en avvik fra den tradisjonelle “beregning-optimal regime” eller “over-trening-regime” som brukes av mange store språkmodeller. Målet er å kalibrere treningsdataene til å matche modellens skala, og gi riktig nivå av kunnskap og resonningsevne, samtidig som det etterlater nok kapasitet for andre evner.

Kvalitet på nye Phi-3-modeller, målt etter ytelse på Massive Multitask Language Understanding (MMLU) benchmark
Kvalitet på nye Phi-3-modeller, målt etter ytelse på Massive Multitask Language Understanding (MMLU) benchmark

Denne data-sentriske tilnærmingen har gitt resultater, da Phi-3 Mini oppnår bemerkelsesverdig ytelse på en rekke akademiske benchmark, ofte rivende eller overgående mye større modeller. For eksempel scorer den 69% på MMLU-benchmark for multi-task-læring og forståelse, og 8,38 på MT-benchmark for matematisk resonning – resultater som er på linje med modeller som Mixtral 8x7B og GPT-3.5.

Sikkerhet og Robusthet

I tillegg til sin imponerende ytelse, har Microsoft lagt stor vekt på sikkerhet og robusthet i utviklingen av Phi-3 Mini. Modellen har gjennomgått en rigorøs post-trening-prosess som involverer overvåket finjustering (SFT) og direkte preferanse-optimering (DPO).

SFT-stadiet utnytter høyt kuraterte data over diverse domener, inkludert matematikk, kode, resonning, samtale, modell-identitet og sikkerhet. Dette hjelper til å forsterke modellens evner i disse områdene, samtidig som det innfører en sterk identitet og etisk atferd.

DPO-stadiet, på den andre siden, fokuserer på å styre modellen bort fra uønskede atferder ved å bruke avviste responser som negative eksempler. Denne prosessen dekker chat-format-data, resonning-oppgaver og ansvarlig AI (RAI)-innsats, og sikrer at Phi-3 Mini overholder Microsofts prinsipper for etisk og pålitelig AI.

For å ytterligere forbedre sin sikkerhetsprofil, har Phi-3 Mini vært utsatt for omfattende red-teaming og automatisert testing over dusinvis av RAI-skade-kategorier. En uavhengig red-team i Microsoft har iterativt undersøkt modellen, identifisert områder for forbedring, og adressert disse gjennom ytterligere kuraterte datasett og om-trening.

Denne multi-prongede tilnærmingen har betydelig redusert forekomsten av skadelige responser, faktiske unøyaktigheter og fordommer, som demonstrert av Microsofts interne RAI-benchmark. For eksempel viser modellen lav feilrate for skadelig innhold-videreføring (0,75%) og sammenfatting (10%), samt en lav rate av ugрундет (0,603), som indikerer at dens responser er fast forankret i den gitt konteksten.

Anvendelser og Bruksområder

Med sin imponerende ytelse og robuste sikkerhetstiltak, er Phi-3 Mini godt egnet for en rekke anvendelser, spesielt i ressurssbegrensede miljøer og latency-bundne scenarioer.

En av de mest spennende prospektene er deployeringen av intelligente virtuelle assistenter og konversasjons-AI direkte på mobile enheter. Ved å kjøre lokalt, kan disse assistentene gi umiddelbare responser uten å måtte ha en nettverksforbindelse, samtidig som de sikrer at sensitive data forblir på enheten, og adresserer personvernsproblemer.

Phi-3 Minis sterke resonningsevner gjør den også til en verdifull ressurs for kodeassistenter og matematisk problemløsing. Utviklere og studenter kan dra nytte av på-enhet-kode-fullføring, feil-oppdaging og forklaringer, som strømlinjeformer utviklings- og læringsprosessen.

Forbi disse anvendelsene åpner modellens fleksibilitet opp muligheter i områder som språkforståelse, tekst-sammenfatting og spørsmål-svar. Den lille størrelsen og effisiensen gjør den til et attraktivt valg for å integrere AI-kapasiteter i en rekke enheter og systemer, fra smarte hjemme-applianser til industrielle automatiseringssystemer.

Se Fremover: Phi-3 Small og Phi-3 Medium

Mens Phi-3 Mini er en bemerkelsesverdig prestasjon i seg selv, har Microsoft enda større planer for Phi-3-familien. Selskapet har allerede vist frem to større modeller, Phi-3 Small (7 milliarder parametre) og Phi-3 Medium (14 milliarder parametre), som begge forventes å drive grensene for ytelse av kompakte språkmodeller.

Phi-3 Small, for eksempel, utnytter en mer avansert tokenizer (tiktoken) og en gruppert-spørrings-mekanisme, sammen med en ny blokk-sparse oppmerksomhets-lag, for å optimere sin minne-avtrykk samtidig som den opprettholder lang kontekst-oppføring. Den inkorporerer også en ekstra 10% multilingual data, som forbedrer dens evner i språkforståelse og generering på flere språk.

Phi-3 Medium, på den andre siden, representerer en betydelig økning i skala, med 40 lag, 40 oppmerksomhets-hoder og en innbeddings-dimensjon på 5 120. Mens Microsoft merker at noen benchmark kan kreve ytterligere finjustering av treningsdata-blandingen for å fullt ut kapitalisere på denne økte kapasiteten, er de innledende resultater lovende, med betydelige forbedringer over Phi-3 Small på oppgaver som MMLU, TriviaQA og HumanEval.

Begrensninger og Fremtidige Retninger

Til tross for sin imponerende ytelse, er Phi-3 Mini, som alle språkmodeller, ikke uten begrensninger. En av de mest bemerkelsesverdige svakheter er dens relativt begrensede kapasitet for å lagre faktiske kunnskaper, som vist gjennom dens lavere ytelse på benchmark som TriviaQA.

Likevel mener Microsoft at denne begrensningen kan mildnes ved å supplere modellen med søke-motor-kapasiteter, som tillater den å hente og resonere over relevante informasjon på forespørsel. Denne tilnærmingen demonstreres i Hugging Face Chat-UI, hvor Phi-3 Mini kan utnytte søk for å forbedre sine responser.

Et annet område for forbedring er modellens multilinguale evner. Mens Phi-3 Small har tatt de første skrittene ved å inkorporere ekstra multilingual data, er det fortsatt arbeid å gjøre for å fullt ut åpne opp mulighetene for disse kompakte modellene for cross-linguale anvendelser.

Fremover er Microsoft dedikert til å videreutvikle Phi-familien av modeller, og å adresse deres begrensninger og utvide deres evner. Dette kan involvere ytterligere finjustering av treningsdata og metodologi, samt utforskning av nye arkitekturer og tekniker som er spesifikt tilpasset for kompakte, høy-ytelses språkmodeller.

Konklusjon

Microsofts Phi-3 Mini representerer et betydelig skritt fremover i demokratiseringen av avanserte AI-kapasiteter. Ved å levere toppkvalitet-ytelse i en kompakt, ressurs-effektiv pakke, åpner den opp nye muligheter for intelligente på-enhet-erfaringer over en rekke anvendelser.

Modellens innovative trenings-tilnærming, som legger vekt på høykvalitets, resonningstette data fremfor ren beregningskraft, har vist seg å være en game-changer, og tillater Phi-3 Mini å slå over sin vekt-klasse. Kombinert med dens robuste sikkerhetstiltak og pågående utviklingsinnsats, er Phi-3-familien av modeller godt posisjonert til å spille en avgjørende rolle i å forme fremtiden for intelligente systemer, og gjøre AI mer tilgjengelig, effektiv og pålitelig enn noensinne før.

Som teknologi-industrien fortsetter å drive grensene for hva som er mulig med AI, representerer Microsofts fokus på kompakte, høy-ytelses modeller som Phi-3 Mini en frisk avvik fra den konvensjonelle visdommen om at “større er bedre”. Ved å demonstrere at størrelse ikke er alt, har Phi-3 Mini potensialet til å inspirere en ny bølge av innovasjon som fokuserer på å maksimere verdien og impakten av AI gjennom intelligent data-kurering, omtenksom modell-design og ansvarlig utviklingspraksis.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.