AI-modeller og platforme

Indenfor Microsofts Phi-3 Mini: En Letvægts AI-Model, der Slår over sin Vægt

mm
Føj Unite.AI til dine foretrukne kilder på Google

Microsoft (MSFT ) har nylig afsløret sin seneste letvægts sprogmodel kaldet Phi-3 Mini, der er det første af en række kompakte AI-modeller, der er designede til at levere state-of-the-art-ydelse, samtidig med at de er små nok til at køre effektivt på enheder med begrænsede beregningsressourcer. Med kun 3,8 milliarder parametre er Phi-3 Mini en brøkdel af størrelsen på AI-giganter som GPT-4, men den lover at matche deres evner på mange nøgleområder.

Udviklingen af Phi-3 Mini repræsenterer en betydelig milepæl i bestræbelserne på at demokratisere avancerede AI-kapaciteter ved at gøre dem tilgængelige på en bredere række af hardware. Dens lille fodaftryk tillader den at blive deployet lokalt på smartphones, tabletter og andre edge-enheder, og overvinde latency og privatlivsproblemer forbundet med cloud-baserede modeller. Dette åbner op for nye muligheder for intelligente on-device-oplevelser på tværs af forskellige domæner, fra virtuelle assistenter og konversations-AI til kodestøtte og sprogforståelsesopgaver.

4-bit kvantiseret phi-3-mini, der kører nativt på en iPhone
4-bit kvantiseret phi-3-mini, der kører nativt på en iPhone

Under Hood: Arkitektur og Træning

I sin kerne er Phi-3 Mini en transformer-decoder-model bygget på en lignende arkitektur som den open-source Llama-2-model. Den har 32 lag, 3072 skjulte dimensioner og 32 opmærksomheds-hoveder, med en standard kontekstlængde på 4.000 tokens. Microsoft har også introduceret en lang kontekst-version kaldet Phi-3 Mini-128K, der udvider kontekstlængden til 128.000 tokens ved hjælp af teknikker som LongRope.

Hvad adskiller Phi-3 Mini, er dog dens træningsmetode. I stedet for at afhænge udelukkende af den brutale kraft af massive datasæt og beregningskraft, har Microsoft fokuseret på at kuraterer et højkvalitets, reasonings-tæt træningsdatasæt. Dette datasæt består af tungt filtreret webdata samt syntetisk data genereret af større sprogmodeller.

Træningsprocessen følger en to-fase-tilgang. I den første fase bliver modellen udsat for en diversificeret række af webkilder, der er designet til at undervise den i generel viden og sprogforståelse. Den anden fase kombinerer endnu mere tungt filtreret webdata med syntetisk data, der er designet til at give logisk reasoneringsevner og niche-domæneekspertise.

Microsoft kalder denne tilgang for “data-optimal-regimet”, en afvigelse fra den traditionelle “compute-optimal-regime” eller “over-træning-regime”, der anvendes af mange store sprogmodeller. Målet er at kalibrere træningsdataene til at matche modellens skala, og give den rette niveau af viden og reasoneringsevne, samtidig med at der efterlades tilstrækkelig kapacitet til andre evner.

Kvaliteten af de nye Phi-3-modeller, målt på Massive Multitask Language Understanding (MMLU)-benchmark
Kvaliteten af de nye Phi-3-modeller, målt på Massive Multitask Language Understanding (MMLU)-benchmark

Denne data-centrererede tilgang har betalt sig, da Phi-3 Mini opnår bemærkelsesværdig ydelse på en bred række af akademiske benchmarks, ofte rivaliserende eller overgående langt større modeller. For eksempel scorer den 69% på MMLU-benchmark for multi-task-læring og forståelse, og 8,38 på MT-bench for matematisk reasonering – resultater, der er på niveau med modeller som Mixtral 8x7B og GPT-3,5.

Sikkerhed og Robusthed

Sammen med dens imponerende ydelse, har Microsoft lagt stor vægt på sikkerhed og robusthed i udviklingen af Phi-3 Mini. Modellen har gennemgået en rigorøs post-træning-proces, der involverer superviseret finjustering (SFT) og direkte præference-optimering (DPO).

SFT-stadiet udnytter højkvalitets-data fra diverse domæner, herunder matematik, kodning, reasonering, samtale, model-identitet og sikkerhed. Dette hjælper med at forstærke modellens evner i disse områder, samtidig med at den indpodrer en stærk følelse af identitet og etisk adfærd.

DPO-stadiet fokuserer på at styre modellen væk fra uønskede adfærdsmønstre ved at bruge afviste svar som negative eksempler. Denne proces dækker chat-format-data, reasonering-opgaver og ansvarlig AI (RAI)-indsats, og sikrer, at Phi-3 Mini overholder Microsofts principper for etisk og troværdig AI.

For at yderligere forbedre sin sikkerhedsprofil, har Phi-3 Mini været udsat for omfattende red-teaming og automatiseret testning på tværs af dusinvis af RAI-skadecategorier. En uafhængig red-team i Microsoft har iterativt undersøgt modellen, identificeret områder for forbedring, og derefter adresseret disse gennem yderligere kuraterede datasæt og gen-træning.

Denne multi-prongede tilgang har betydeligt reduceret forekomsten af skadelige svar, faktuelle uøjeligheder og bias, som demonstreret af Microsofts interne RAI-benchmarks. For eksempel viser modellen lav fejlrate for skadeligt indhold (0,75%) og sammenfatning (10%), samt en lav rate af ugrundethed (0,603), hvilket indikerer, at dens svar er fast forankret i den givne kontekst.

Anvendelser og Brugsområder

Med dens imponerende ydelse og robuste sikkerhedsforanstaltninger er Phi-3 Mini velegnet til en bred række af anvendelser, især i ressource-begrænsede miljøer og latency-bundne scenarier.

En af de mest spændende muligheder er udrulningen af intelligente virtuelle assistenter og konversations-AI direkte på mobile enheder. Ved at køre lokalt kan disse assistenter give øjeblikkelige svar uden behov for en netværksforbindelse, og samtidig sikre, at følsomme data forbliver på enheden, og adressere privatlivsproblemer.

Phi-3 Minis stærke reasoneringsevner gør den også til en værdifuld ressource til kodestøtte og matematisk problemløsning. Udviklere og studerende kan drage fordel af on-device-kodekomplettering, fejldetektion og forklaringer, og strømline udviklings- og læringsprocessen.

Uden for disse anvendelser åbner modellens fleksibilitet op for muligheder i områder som sprogforståelse, tekst-sammenfatning og spørgsmål-svar. Dens lille størrelse og effektivitet gør den til en attraktiv valg til at integrere AI-kapaciteter i en bred række af enheder og systemer, fra smarte hjemmeapplikationer til industrielle automatiseringssystemer.

Udsigt Fremad: Phi-3 Small og Phi-3 Medium

Selvom Phi-3 Mini er en bemærkelsesværdig præstation i sig selv, har Microsoft endnu større planer for Phi-3-familien. Selskabet har allerede præsenteret to større modeller, Phi-3 Small (7 milliarder parametre) og Phi-3 Medium (14 milliarder parametre), der begge forventes at udvide grænserne for ydelse hos kompakte sprogmodeller.

Phi-3 Small, for eksempel, udnytter en mere avanceret tokenizer (tiktoken) og en gruppe-forespørgsels-mekanisme, samt en ny blocksparse-opmærksomheds-lag, til at optimere sin hukommelsesaftryk, samtidig med at den opretholder lang kontekst-hentning. Den inkorporerer også yderligere 10% multilingual data, og forbedrer dens evner i sprogforståelse og generering på tværs af flere sprog.

Phi-3 Medium repræsenterer en betydelig skalaforøgelse, med 40 lag, 40 opmærksomheds-hoveder og en indlejring-dimension på 5.120. Selvom Microsoft bemærker, at nogle benchmarks måske kræver yderligere finjustering af træningsdata-blandingen for at fuldt ud at udnytte denne øgede kapacitet, er de første resultater lovende, med betydelige forbedringer over Phi-3 Small på opgaver som MMLU, TriviaQA og HumanEval.

Begrænsninger og Fremtidige Retninger

Trods dens imponerende evner er Phi-3 Mini, som alle sprogmodeller, ikke uden begrænsninger. En af de mest bemærkelsesværdige svagheder er dens relativt begrænsede kapacitet til at gemme faktuel viden, som demonstreret af dens lavere ydelse på benchmarks som TriviaQA.

Microsoft mener dog, at denne begrænsning kan mildnes ved at supplere modellen med søgemaskine-kapaciteter, og tillade den at hente og forstå relevant information på krav. Denne tilgang demonstreres i Hugging Face Chat-UI, hvor Phi-3 Mini kan udnytte søgning til at forbedre dens svar.

Et andet område for forbedring er modellens multilinguale evner. Selvom Phi-3 Small har taget de første skridt ved at inkorporere yderligere multilingual data, er der stadig behov for yderligere arbejde for at fuldt ud at udnytte potentialet for disse kompakte modeller i cross-lingual-applikationer.

Udsigten fremad er, at Microsoft vil fortsætte med at udvikle Phi-familien af modeller, og adressere deres begrænsninger og udvide deres evner. Dette kan involvere yderligere finjustering af træningsdata og -metodik, samt udforskning af nye arkitekturer og teknikker specifikt designet til kompakte, høj-ydelses sprogmodeller.

Konklusion

Microsofts Phi-3 Mini repræsenterer et betydeligt skridt fremad i demokratiseringen af avancerede AI-kapaciteter. Ved at levere state-of-the-art-ydelse i en kompakt, ressource-effektiv pakke åbner den op for nye muligheder for intelligente on-device-oplevelser på tværs af en bred række af applikationer.

Modellens innovative trænings-tilgang, der fokuserer på højkvalitets, reasonings-tæt data frem for ren beregningskraft, har vist sig at være en game-changer, og har enablede Phi-3 Mini til at slå over sin vægtklasse. Kombineret med dens robuste sikkerhedsforanstaltninger og fortsatte udviklingsindsats er Phi-3-familien af modeller godt positioneret til at spille en afgørende rolle i fremtidens intelligente systemer, og gøre AI mere tilgængelig, effektiv og troværdig end nogensinde før.

Da tech-industrien fortsætter med at udvide grænserne for, hvad der er muligt med AI, repræsenterer Microsofts engagement i letvægts-, høj-ydelses-modeller som Phi-3 Mini en frisk afvigelse fra den konventionelle visdom om, at “større er bedre”. Ved at demonstrere, at størrelse ikke er alt, har Phi-3 Mini potentialet til at inspirere en ny bølge af innovation, der fokuserer på at maksimere værdien og impakten af AI gennem intelligent data-kuratering, omhyggelig model-design og ansvarlig udviklingspraksis.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.