AI-modellen en platforms

Binnenin Microsoft’s Phi-3 Mini: een lichtgewicht AI-model dat boven zijn gewicht uitstijgt

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Microsoft (MSFT ) heeft onlangs zijn nieuwste lichtgewicht taalmodel genaamd Phi-3 Mini onthuld, waarmee een reeks compacte AI-modellen wordt gestart die zijn ontworpen om state-of-the-art prestaties te leveren terwijl ze klein genoeg zijn om efficiënt te draaien op apparaten met beperkte rekenbronnen. Met slechts 3,8 miljard parameters is Phi-3 Mini een fractie van de grootte van AI-reuzen zoals GPT-4, maar het belooft om hun capaciteiten in veel sleutelgebieden te evenaren.

De ontwikkeling van Phi-3 Mini vertegenwoordigt een belangrijke mijlpaal in de zoektocht naar het democratiseren van geavanceerde AI-mogelijkheden door ze toegankelijk te maken op een breder scala aan hardware. De kleine voetafdruk van het model maakt het mogelijk om het lokaal te implementeren op smartphones, tablets en andere edge-apparaten, waardoor de latentie en privacyproblemen die samenhangen met cloudgebaseerde modellen worden overwonnen. Dit opent nieuwe mogelijkheden voor intelligente on-device-ervaringen in verschillende domeinen, van virtuele assistenten en conversational AI tot code-assistenten en taalbegripstaken.

4-bit gequantiseerde phi-3-mini die native draait op een iPhone
4-bit gequantiseerde phi-3-mini die native draait op een iPhone

Onder de motorkap: architectuur en training

In zijn kern is Phi-3 Mini een transformer-decodermodel gebouwd op een soortgelijke architectuur als het open-source Llama-2-model. Het heeft 32 lagen, 3072 verborgen dimensies en 32 aandachthoofden, met een standaardcontextlengte van 4.000 tokens. Microsoft heeft ook een lange contextversie genaamd Phi-3 Mini-128K geïntroduceerd, die de contextlengte uitbreidt tot een indrukwekkende 128.000 tokens met behulp van technieken zoals LongRope.

Wat Phi-3 Mini onderscheidt, is zijn trainingsmethodologie. In plaats van te vertrouwen op de brute kracht van enorme datasets en rekenkracht, heeft Microsoft zich gericht op het cureren van een high-kwaliteit, redeneringsdichte trainingsdataset. Deze data bestaat uit zwaar gefilterde webdata, evenals synthetische data gegenereerd door grotere taalmodellen.

Het trainingsproces volgt een tweefasenbenadering. In de eerste fase wordt het model blootgesteld aan een diverse reeks websources gericht op het onderwijzen van algemene kennis en taalbegrip. De tweede fase combineert nog zwaarder gefilterde webdata met synthetische data ontworpen om logische redeneervaardigheden en niche-domeinexpertise over te dragen.

Microsoft noemt deze benadering de “data-optimale regime”, een afwijking van de traditionele “compute-optimale regime” of “over-trainingsregime” die door veel grote taalmodellen wordt gebruikt. Het doel is om de trainingsdata af te stemmen op de schaal van het model, waardoor de juiste niveau van kennis en redeneervaardigheid wordt geboden, terwijl voldoende capaciteit overblijft voor andere capaciteiten.

Kwaliteit van de nieuwe Phi-3-modellen, gemeten door prestaties op de Massive Multitask Language Understanding (MMLU)-benchmark
Kwaliteit van de nieuwe Phi-3-modellen, gemeten door prestaties op de Massive Multitask Language Understanding (MMLU)-benchmark

Deze data-georiënteerde benadering heeft zijn vruchten afgeworpen, aangezien Phi-3 Mini opmerkelijke prestaties levert op een breed scala aan academische benchmarks, vaak rivaliserend of overtreffend veel grotere modellen. Zo scoort het 69% op de MMLU-benchmark voor multitask learning en begrip, en 8,38 op de MT-bench voor wiskundige redenering – resultaten die gelijk zijn aan modellen zoals Mixtral 8x7B en GPT-3.5.

Veiligheid en robuustheid

Naast zijn indrukwekkende prestaties, heeft Microsoft een sterke nadruk gelegd op veiligheid en robuustheid bij de ontwikkeling van Phi-3 Mini. Het model is onderworpen aan een rigoureuze post-trainingsprocedure met behulp van begeleide fine-tuning (SFT) en directe voorkeursoptimalisatie (DPO).

De SFT-fase maakt gebruik van zwaar gecureerde data uit diverse domeinen, waaronder wiskunde, codering, redenering, conversatie, modelidentiteit en veiligheid. Dit helpt om de capaciteiten van het model in deze gebieden te versterken, terwijl het een sterk gevoel van identiteit en ethisch gedrag inprent.

De DPO-fase richt zich op het afleiden van het model van ongewenst gedrag door gebruik te maken van afgewezen reacties als negatieve voorbeelden. Deze procedure omvat chatformatdata, redeneertaken en inspanningen voor verantwoorde AI (RAI), waardoor Phi-3 Mini voldoet aan Microsofts principes van ethische en betrouwbare AI.

Om zijn veiligheidsprofiel verder te verbeteren, is Phi-3 Mini onderworpen aan uitgebreide red teaming en geautomatiseerde tests over tientallen RAI-schadecategorieën. Een onafhankelijk red team van Microsoft heeft het model iteratief onderzocht, verbeteringsgebieden geïdentificeerd, die vervolgens zijn aangepakt met behulp van aanvullende gecureerde datasets en opnieuw trainen.

Deze multi-prongbenadering heeft het aantal schadelijke reacties, feitelijke onnauwkeurigheden en vooroordelen aanzienlijk verlaagd, zoals aangetoond door Microsofts interne RAI-benchmarks. Zo vertoont het model lage defecten voor schadelijke inhoud (0,75%) en samenvatting (10%), evenals een lage mate van ongegrondheid (0,603), wat aangeeft dat de reacties van het model stevig geworteld zijn in de gegeven context.

Toepassingen en gebruikscases

Met zijn indrukwekkende prestaties en robuuste veiligheidsmaatregelen is Phi-3 Mini goed geschikt voor een breed scala aan toepassingen, met name in omgevingen met beperkte middelen en latentiegebonden scenario’s.

Een van de meest spannende vooruitzichten is de implementatie van intelligente virtuele assistenten en conversational AI rechtstreeks op mobiele apparaten. Door lokaal te draaien, kunnen deze assistenten directe antwoorden geven zonder dat een netwerkverbinding nodig is, terwijl ze ook ervoor zorgen dat gevoelige gegevens op het apparaat blijven, waardoor privacyproblemen worden aangepakt.

Phi-3 Mini’s sterke redeneervaardigheden maken het ook een waardevolle asset voor coderingshulp en wiskundige probleemoplossing. Ontwikkelaars en studenten kunnen profiteren van on-device code-completie, bugdetectie en uitleg, waardoor de ontwikkelings- en leerprocessen worden gestroomlijnd.

Verder dan deze toepassingen opent het model zijn veelzijdigheid kansen in gebieden zoals taalbegrip, tekstsamenvatting en vraagbeantwoording. De kleine omvang en efficiëntie van het model maken het een aantrekkelijke keuze voor het integreren van AI-mogelijkheden in een breed scala aan apparaten en systemen, van slimme huishoudelijke apparaten tot industriële automatiseringssystemen.

Kijkend naar de toekomst: Phi-3 Small en Phi-3 Medium

Terwijl Phi-3 Mini een opmerkelijke prestatie is op zichzelf, heeft Microsoft nog grotere plannen voor de Phi-3-familie. Het bedrijf heeft al twee grotere modellen aangekondigd, Phi-3 Small (7 miljard parameters) en Phi-3 Medium (14 miljard parameters), die beiden de prestatiegrenzen voor compacte taalmodellen zullen verleggen.

Phi-3 Small maakt bijvoorbeeld gebruik van een geavanceerdere tokenizer (tiktoken) en een gegroepeerde query-aandachtmethode, evenals een novum blocksparse aandachtlagen, om zijn geheugenvoetafdruk te optimaliseren terwijl hij de prestaties van lange contextopname behoudt. Het model omvat ook een extra 10% multilinguale data, waardoor zijn capaciteiten in taalbegrip en generatie over meerdere talen worden verbeterd.

Phi-3 Medium vertegenwoordigt daarentegen een aanzienlijke stap in schaal, met 40 lagen, 40 aandachthoofden en een embeddingdimensie van 5.120. Hoewel Microsoft opmerkt dat sommige benchmarks mogelijk verdere verfijning van de trainingsdatamengeling vereisen om volledig te profiteren van deze verhoogde capaciteit, zijn de eerste resultaten veelbelovend, met aanzienlijke verbeteringen ten opzichte van Phi-3 Small op taken zoals MMLU, TriviaQA en HumanEval.

Beperkingen en toekomstige richtingen

Ondanks zijn indrukwekkende capaciteiten is Phi-3 Mini, net als alle taalmodellen, niet zonder zijn beperkingen. Een van de meest opvallende zwakheden is zijn relatief beperkte capaciteit voor het opslaan van feitelijke kennis, zoals aangetoond door zijn lagere prestaties op benchmarks zoals TriviaQA.

Microsoft gelooft echter dat deze beperking kan worden gemilderd door het model aan te vullen met zoekmachinecapaciteiten, waardoor het relevante informatie op aanvraag kan ophalen en redeneren. Deze benadering wordt gedemonstreerd in de Hugging Face Chat-UI, waar Phi-3 Mini zoekopdrachten kan gebruiken om zijn antwoorden te verbeteren.

Een ander gebied voor verbetering is de multilinguale capaciteit van het model. Hoewel Phi-3 Small een eerste stap heeft gezet door extra multilinguale data op te nemen, is verdere werk nodig om het volledige potentieel van deze compacte modellen voor cross-linguale toepassingen te ontsluiten.

Microsoft is toegewijd om de Phi-familie van modellen voortdurend te verbeteren, hun beperkingen aan te pakken en hun capaciteiten uit te breiden. Dit kan verdere verfijning van de trainingsdata en methodologie omvatten, evenals het verkennen van nieuwe architectuur en technieken specifiek ontworpen voor compacte, high-performance taalmodellen.

Conclusie

Microsofts Phi-3 Mini vertegenwoordigt een significante stap voorwaarts in de democratisering van geavanceerde AI-mogelijkheden. Door state-of-the-art prestaties te leveren in een compact, efficiënt pakket, opent het nieuwe mogelijkheden voor intelligente on-device-ervaringen over een breed scala aan toepassingen.

Het innovatieve trainingsbenadering van het model, dat de nadruk legt op high-kwaliteit, redeneringsdichte data boven brute rekenkracht, heeft zich bewezen als een game-changer, waardoor Phi-3 Mini boven zijn gewichtsklasse uitstijgt. In combinatie met zijn robuuste veiligheidsmaatregelen en voortdurende ontwikkelingsinspanningen is de Phi-3-familie van modellen goed gepositioneerd om een cruciale rol te spelen in het vormgeven van de toekomst van intelligente systemen, waardoor AI meer toegankelijk, efficiënt en betrouwbaar wordt dan ooit tevoren.

Terwijl de technologie-industrie de grenzen van wat mogelijk is met AI blijft verleggen, vertegenwoordigt Microsofts toewijding aan lichtgewicht, high-performance modellen zoals Phi-3 Mini een verfrissende afwijking van de conventionele wijsheid dat “groter beter is”. Door te demonstreren dat omvang niet alles is, heeft Phi-3 Mini het potentieel om een nieuwe golf van innovatie te inspireren die zich richt op het maximaliseren van de waarde en impact van AI door intelligente datacuratie, zorgvuldige modelontwerp en verantwoorde ontwikkelingspraktijken.

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.