AI-mallit ja alustat
Microsoftin Phi-3 Mini: Kevyt AI-malli, joka lyö yli painoonsa
Microsoft (MSFT ) on vastaanottanut viimeisimmän kevyen kielen mallinsa, Phi-3 Minin, joka on osa kolmen kompaktin AI-mallin joukkoa, jotka on suunniteltu toimimaan valtavien laskentaresurssien kanssa. Vain 3,8 miljardia parametriä, Phi-3 Mini on murto-osa suurten AI-mallien koko, kuten GPT-4, mutta se lupailee vastata heidän kykyjensä monilla tärkeillä alueilla.
Phi-3 Minin kehitys edustaa merkittävää merkkipaaluja AI-kapasiteettien demokratisoinnissa, tekemällä niistä saatavilla laajemmalle laitteistolle. Sen pieni jalanjälki mahdollistaa sen käytön paikallisesti älypuhelimissa, tableteissa ja muissa reunalaiteissa, voittamalla viive- ja tietosuojauksen huolenaiheita, jotka liittyvät pilvipohjaisiin malleihin. Tämä avaa uusia mahdollisuuksia älykkäille laitteille eri alueilla, virtuaaliavustajista ja keskusteluroboteista koodiavustajiin ja kielentunnistustehtäviin.

- 4-bittinen phi-3-mini toimii älypuhelimessa
Arkkitehtuuri ja koulutus
Phi-3 Minin ydin on transformer-dekooderimalli, joka perustuu avoimeen Llama-2-malliin. Se sisältää 32 kerrosta, 3072 piilokokoelmaa ja 32 huomioheadia, oletuskontekstin pituus on 4 000 merkkiä. Microsoft on myös esitellyt pitkän kontekstin version, Phi-3 Mini-128K, joka laajentaa kontekstin pituutta 128 000 merkkiin LongRope-tekniikoiden avulla.
Phi-3 Minin erottaa kuitenkin sen koulutusmenetelmä. Sen sijaan, että se riippuisi ainoastaan massiivisten tietokantojen ja laskentatehon raakavoimasta, Microsoft on keskittynyt korkealaatuisen, logiikkaa tiheän koulutusaineiston kuratointiin. Tämä aineisto koostuu voimakkaasti suodatetusta web-aineistosta sekä suuremmista kielimalleista generoidusta synteettisestä aineistosta.
Koulutusprosessi noudattaa kaksivaiheista lähestymistapaa. Ensimmäisessä vaiheessa malli altistetaan monipuoliseen joukkoon web-lähteisiin, joiden tavoitteena on opettaa yleistietoa ja kielentunnistusta. Toisessa vaiheessa yhdistetään vielä enemmän suodatettua web-aineistoa ja synteettistä aineistoa, joka on tarkoitettu antamaan logiikkaa ja erikoisalaa koskevia taitoja.
Microsoft kutsuu tätä lähestymistapaa “tieto-optimaaliseksi järjestelmäksi”, joka poikkeaa perinteisestä “laskenta-optimaalisesta järjestelmästä” tai “ylikoulutusjärjestelmästä”, jota monet suuret kielimallit käyttävät. Tavoitteena on kalibroida koulutusaineisto mallin mittakaavaan, tarjoten oikean tason tietoa ja logiikkaa, samalla jättäen riittävästi kapasiteettia muiden kykyjen kehittämiseen.

- Uusien Phi-3-mallien laatu, mitattuna Massive Multitask Language Understanding (MMLU) -mittarilla
Tämä data-keskeinen lähestymistapa on osoittautunut menestyksekkääksi, sillä Phi-3 Mini saavuttaa merkittävän suorituskyvyn useilla akateemisilla mittareilla, usein kilpaillen tai ylittäen paljon suurempia malleja. Esimerkiksi se saavuttaa 69 % MMLU-mittarilla monitehtävän ymmärtämisessä ja 8,38 MT-bench-mittarilla matemaattisessa päättelyssä – tulokset, jotka ovat verrattavissa malleihin kuten Mixtral 8x7B ja GPT-3.5.
Turvallisuus ja luotettavuus
Phi-3 Minin vaikuttavan suorituskyvyn rinnalla Microsoft on asettanut vahvan painopisteen turvallisuuteen ja luotettavuuteen mallin kehityksessä. Malli on käynyt läpi tiukan jälkikoulutusprosessin, joka käsittää valvottua hienosäätöä (SFT) ja suoran preferenssi-optimoimisen (DPO).
SFT-vaihe hyödyntää erittäin kuratoitua aineistoa monilla alueilla, mukaan lukien matematiikka, koodaus, logiikka, keskustelu, mallin identiteetti ja turvallisuus. Tämä vahvistaa mallin kykyjä näillä alueilla ja istuttaa vahvan identiteetin ja eettisen käyttäytymisen.
DPO-vaihe puolestaan keskittyy ohjaamaan mallia pois ei-toivottavista käyttäytymisistä käyttämällä hylättyjä vastauksia negatiivisina esimerkkeinä. Tämä prosessi kattaa chat-aineistoa, logiikkaa ja vastuullista tekoälyä (RAI), varmistamalla, että Phi-3 Mini noudattaa Microsoftin periaatteita eettisestä ja luotettavasta tekoälystä.
Jotta turvallisuusprofiili voitiin edelleen parantaa, Phi-3 Mini on käynyt läpi laajan punainen tiimin ja automaattisen testauksen useilla kymmenillä RAI-haitta kategorioilla. Microsoftin itsenäinen punainen tiimi tutki iteratiivisesti mallia, tunnistamalla parantamisen kohteita, jotka korjattiin lisäkuratoidulla aineistolla ja uudelleenkoulutuksella.
Tämä monipuolinen lähestymistapa on merkittävästi vähentänyt haitallisten vastausten, faktatarkkuuden virheiden ja ennakkoluulojen määrää, kuten Microsoftin sisäiset RAI-mittarit osoittavat. Esimerkiksi malli osoittaa alhaisen virheluvun haitallisen sisällön jatkamisessa (0,75 %) ja yhteenvetossa (10 %), sekä alhaisen perusteettoman luonnehdinnan (0,603), osoittaen, että sen vastaukset ovat vahvasti juurrutettuina annettuun kontekstiin.
Sovellukset ja käyttötarkoitukset
Phi-3 Minin vaikuttavan suorituskyvyn ja turvallisuusmittauksien ansiosta se soveltuu moniin sovelluksiin, erityisesti resurssirajoitettuihin ympäristöihin ja viiveen määrittämiin tilanteisiin.
Yksi mielenkiintoisimmista näkymistä on älykkäiden virtuaaliavustajien ja keskustelurobottien käyttöönotto suoraan mobiililaitteissa. Toimimalla paikallisesti, nämä avustajat voivat tarjota välittömiä vastauksia ilman verkkoyhteyttä, samalla varmistamalla, että herkillä tiedoilla säilytetään laitteessa, mikä ratkaisee tietosuojauksen huolenaiheet.
Phi-3 Minin vahvat logiikkakyvyt tekevät siitä myös arvokkaan apuvälineen koodausavuksi ja matemaattisille ongelmanratkaisuille. Kehittäjät ja opiskelijat voivat hyödytyä laitteiston koodin täydentämisestä, virheenkorjaamisesta ja selityksistä, jolloin kehitys- ja oppimisprosessit nopeutuvat.
Näiden sovellusten lisäksi mallin monikäyttöisyys avaa mahdollisuuksia kielentunnistuksessa, tekstin yhteenvetossa ja kysymyksiin vastaamisessa. Sen pieni koko ja tehokkuus tekevät siitä houkuttelevan valinnan upottamiseen laitteisiin ja järjestelmiin, älykkäistä kodinkoneista teolliseen automaatioon.
Phi-3 Small ja Phi-3 Medium
Vaikka Phi-3 Mini on merkittävä saavutus, Microsoftilla on suurempia suunnitelmia Phi-3-perheelle. Yhtiö on jo esitellyt kaksi suurempaa mallia, Phi-3 Small (7 miljardia parametriä) ja Phi-3 Medium (14 miljardia parametriä), jotka odotetaan rikkovan suorituskyvyn rajoja kompaktissa kielimallissa.
Phi-3 Small hyödyntää edistyneempää tokenisaattoria (tiktoken) ja ryhmiteltyä kyselyhuomio-mekanismia, sekä uudenlaista blocksparse-huomiokerrosta, jotta optimoida muistijalanjälkiä säilyttäen samalla pitkän kontekstin hakutoiminnan. Se sisältää myös 10 % enemmän monikielista aineistoa, parantaen kielentunnistus- ja tuottamiskykyjä useilla kielillä.
Phi-3 Medium puolestaan edustaa merkittävää askelta mittakaavassa, 40 kerrosta, 40 huomioheadia ja 5 120 upotusulottuvuutta. Vaikka Microsoft toteaa, että jotkut mittarit saattavat vaatia koulutusaineiston seoksen hienosäätöä, alkutulokset ovat lupaavia, ja ne osoittavat merkittäviä parannuksia Phi-3 Smalliin nähden tehtävissä kuten MMLU, TriviaQA ja HumanEval.
Rajoitukset ja tulevaisuuden suunta
Vaikka Phi-3 Mini on vaikuttava, se ei ole vapaa rajoituksista. Yksi merkittävimmistä heikkouksista on sen suhteellisen rajoitettu kyky tallentaa faktatietoa, kuten sen alempi suorituskyky TriviaQA-mittarilla osoittaa.
Microsoft uskoo kuitenkin, että tämä rajoitus voidaan lieventää lisäämällä malliin hakukoneominaisuuksia, jolloin se voi hakea ja päättelyä relevanttia tietoa tarpeen mukaan. Tämä lähestymistapa on esitetty Hugging Face Chat-UI:ssa, jossa Phi-3 Mini voi hyödyntää hakua parantaakseen vastauksiaan.
Toinen parantamisen kohteena oleva alue on mallin monikieliset kyvyt. Vaikka Phi-3 Small on ottanut alkuvaiheet monikielisen aineiston sisällyttämisellä, tarvitaan edelleen työtä, jotta kompaktien mallien täysi potentiaali cross-linguaalisissa sovelluksissa voidaan vapauttaa.
Microsoft on sitoutunut jatkamaan Phi-mallien kehittämistä, korjaamaan heikkoudet ja laajentamaan kykyjä. Tämä saattaa vaatia edelleen koulutusaineiston ja -menetelmien hienosäätöä, sekä uusien arkkitehtuurien ja tekniikoiden tutkimista, jotka on suunniteltu nimenomaan kompaktiin, suorituskykyiseen kielimalliin.
Johtopäätös
Microsoftin Phi-3 Mini edustaa merkittävää askelta eteenpäin edistyneiden AI-kapasiteettien demokratisoimisessa. Tarjoamalla huipputason suorituskyvyn kompaktissa, resurssitehokkaassa paketissa, se avaa uusia mahdollisuuksia älykkäille laitteille monilla sovellusalueilla.
Mallin innovatiivinen koulutuslähestymistapa, joka korostaa korkealaatuista, logiikkaa tiheää aineistoa laskentavoiman sijaan, on osoittautunut pelinmuuttajaksi, mahdollistaen Phi-3 Minille lyödä yli painoonsa. Yhdistettynä sen turvallisuusmittauksiin ja jatkuvaan kehitykseen, Phi-3-malliperhe on valmis pelaamaan ratkaisevaa roolia älykkäiden järjestelmien tulevaisuuden muotoilussa, tekemällä AI:sta saatavampaa, tehokkaampaa ja luotettavampaa kuin koskaan aiemmin.
Teknologia-alan jatkuessa rajojen työntämiseen AI:n mahdollisuuksissa, Microsoftin sitoutuminen kevyisiin, suorituskykyisiin malleihin kuten Phi-3 Mini edustaa raikasta poikkeamaa perinteisestä “suurempi on parempi” -viisaudosta. Osoittamalla, että koko ei ole kaikki, Phi-3 Mini voi inspiroida uuden aallon innovaatioita, joka keskittyy AI:n arvon ja vaikuttavuuden maksimoimiseen älykkään aineiston kuratoinnin, tarkoituksenmukaisen mallin suunnittelun ja vastuullisen kehityksen kautta.












