Modele și platforme AI

În interiorul Phi-3 Mini de la Microsoft: Un model de inteligență artificială ușor care lovește peste greutatea sa

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Microsoft (MSFT ) a lansat recent modelul său de limbaj ușor, numit Phi-3 Mini, inițiind o serie de modele compacte de inteligență artificială proiectate pentru a oferi performanțe de ultimă generație, fiind suficient de mici pentru a rula eficient pe dispozitive cu resurse de calcul limitate. Cu doar 3,8 miliarde de parametri, Phi-3 Mini este o fracțiune din dimensiunea gigantilor AI, cum ar fi GPT-4, dar promite să egaleze capacitățile lor în multe domenii cheie.

Dezvoltarea Phi-3 Mini reprezintă o piatră de hotar importantă în căutarea de a democratiza capacitățile avansate de inteligență artificială, făcându-le accesibile pe o gamă mai largă de hardware. Dimensiunea sa mică îi permite să fie implementat local pe smartphone-uri, tablete și alte dispozitive de margine, depășind problemele de întârziere și confidențialitate asociate cu modelele bazate pe cloud. Acest lucru deschide noi posibilități pentru experiențe inteligente pe dispozitive, în diverse domenii, de la asistenți virtuali și inteligență conversațională la asistenți de codare și sarcini de înțelegere a limbajului.

4-bit cuantizat phi-3-mini rulează nativ pe un iPhone
4-bit cuantizat phi-3-mini rulează nativ pe un iPhone

Sub capotă: Arhitectură și Antrenament

La baza sa, Phi-3 Mini este un model decodificator de transformator construit pe o arhitectură similară cu cea a modelului Llama-2 open-source. Acesta dispune de 32 de straturi, 3072 de dimensiuni ascunse și 32 de capete de atenție, cu o lungime de context implicită de 4.000 de tokeni. Microsoft a introdus, de asemenea, o versiune cu context lung numită Phi-3 Mini-128K, care extinde lungimea contextului la 128.000 de tokeni, utilizând tehnici precum LongRope.

Ceea ce diferențiază Phi-3 Mini este, totuși, metodologia sa de antrenament. În loc să se bazeze doar pe forța brută a seturilor de date masive și a puterii de calcul, Microsoft s-a concentrat pe crearea unui set de date de antrenament de înaltă calitate, dens în raționament. Acest set de date este alcătuit din date web puternic filtrate, precum și din date sintetice generate de modele de limbaj mai mari.

Procesul de antrenament urmează o abordare în două faze. În prima fază, modelul este expus la o varietate de surse web menite să-i învețe cunoștințe generale și înțelegere a limbajului. A doua fază combină date web și mai puternic filtrate cu date sintetice proiectate pentru a-i impune abilități de raționament logic și expertiză în domenii de nișă.

Microsoft se referă la această abordare ca la “regimul de date optim”, o abatere de la “regimul de calcul optim” sau “regimul de suprantrenare” utilizat de multe modele de limbaj mari. Scopul este de a calibra datele de antrenament pentru a se potrivi cu scala modelului, oferind nivelul potrivit de cunoștințe și abilități de raționament, lăsând în același timp suficientă capacitate pentru alte capacități.

Calitatea noilor modele Phi-3, măsurată prin performanța pe benchmark-ul Massive Multitask Language Understanding (MMLU)
Calitatea noilor modele Phi-3, măsurată prin performanța pe benchmark-ul Massive Multitask Language Understanding (MMLU)

Această abordare axată pe date a dat roade, deoarece Phi-3 Mini obține performanțe remarcabile pe o gamă largă de benchmark-uri academice, adesea rivalizând sau depășind modele mult mai mari. De exemplu, obține 69% pe benchmark-ul MMLU pentru învățare multi-task și înțelegere, și 8,38 pe MT-bench pentru raționament matematic – rezultate care sunt la nivelul modelelor precum Mixtral 8x7B și GPT-3.5.

Siguranță și Robustitate

Alături de performanța sa impresionantă, Microsoft a pus un accent puternic pe siguranță și robustitate în dezvoltarea Phi-3 Mini. Modelul a suferit un proces riguros de post-antrenament, implicând ajustarea fină supravegheată (SFT) și optimizarea preferințelor directe (DPO).

Etapa SFT utilizează date puternic curate din diverse domenii, incluzând matematică, codare, raționament, conversație, identitatea modelului și siguranță. Acest lucru ajută la consolidarea capacităților modelului în aceste domenii, în timp ce îi insuflă o puternică identitate și comportament etic.

Etapa DPO, pe de altă parte, se concentrează pe direcționarea modelului departe de comportamente nedorite, utilizând răspunsuri respinse ca exemple negative. Acest proces acoperă date de format de conversație, sarcini de raționament și eforturi de inteligență artificială responsabilă (RAI), asigurând că Phi-3 Mini respectă principiile Microsoft de inteligență artificială etică și de încredere.

Pentru a-și îmbunătăți în continuare profilul de siguranță, Phi-3 Mini a fost supus unor teste extinse de “red teaming” și testare automată pe zeci de categorii de daune RAI. O echipă independentă de “red team” de la Microsoft a examinat iterativ modelul, identificând zone de îmbunătățire, care au fost apoi abordate prin seturi de date curate suplimentare și reantrenare.

Această abordare multi-pronged a redus semnificativ incidența răspunsurilor dăunătoare, inexactităților factuale și a prejudecăților, așa cum demonstrează benchmark-urile interne RAI ale Microsoft. De exemplu, modelul prezintă rate scăzute de defecte pentru conținut dăunător (0,75%) și rezumare (10%), precum și o rată scăzută de “ungroundedness” (0,603), indicând că răspunsurile sale sunt ferm înrădăcinate în contextul dat.

Aplicații și Studii de Caz

Cu performanța sa impresionantă și măsurile robuste de siguranță, Phi-3 Mini este bine adaptat pentru o gamă largă de aplicații, în special în medii cu resurse limitate și scenarii cu latență.

Una dintre perspectivele cele mai interesante este implementarea asistenților virtuali inteligenți și a inteligenței conversaționale direct pe dispozitive mobile. Rulând local, acești asistenți pot oferi răspunsuri instantanee fără a necesita o conexiune de rețea, asigurând în același timp că datele sensibile rămân pe dispozitiv, abordând astfel preocupările legate de confidențialitate.

Abilitățile puternice de raționament ale Phi-3 Mini îl fac, de asemenea, o resursă valoroasă pentru asistență de codare și rezolvare de probleme matematice. Dezvoltatorii și studenții pot beneficia de completarea codului pe dispozitiv, detectarea erorilor și explicații, simplificând procesele de dezvoltare și învățare.

Dincolo de aceste aplicații, versatilitatea modelului deschide oportunități în domenii precum înțelegerea limbajului, rezumarea textului și răspunsurile la întrebări. Dimensiunea sa mică și eficiența o fac o alegere atractivă pentru integrarea capacităților de inteligență artificială într-o gamă largă de dispozitive și sisteme, de la electrocasnice inteligente la sisteme de automatizare industrială.

Privind Înainte: Phi-3 Small și Phi-3 Medium

În timp ce Phi-3 Mini este o realizare remarcabilă în sine, Microsoft are planuri și mai ambițioase pentru familia Phi-3. Compania a prezentat deja două modele mai mari, Phi-3 Small (7 miliarde de parametri) și Phi-3 Medium (14 miliarde de parametri), ambele fiind așteptate să împingă limitele performanței pentru modelele compacte de limbaj.

Phi-3 Small, de exemplu, utilizează un tokenizator mai avansat (tiktoken) și un mecanism de atenție grupată, împreună cu un strat de atenție bloc-sparse, pentru a optimiza amprenta sa de memorie, menținând în același timp performanța de recuperare a contextului lung. De asemenea, incorporează un supliment de 10% din date multilingve, îmbunătățindu-și capacitățile de înțelegere și generare a limbajului în multiple limbi.

Phi-3 Medium, pe de altă parte, reprezintă o creștere semnificativă în scară, cu 40 de straturi, 40 de capete de atenție și o dimensiune de încorporare de 5.120. Deși Microsoft notează că unele benchmark-uri pot necesita o refacere suplimentară a amestecului de date de antrenament pentru a valorifica pe deplin această capacitate crescută, rezultatele inițiale sunt promițătoare, cu îmbunătățiri substanțiale față de Phi-3 Small la sarcini precum MMLU, TriviaQA și HumanEval.

Limitări și Direcții Viitoare

În ciuda capacităților sale impresionante, Phi-3 Mini, ca și toate modelele de limbaj, nu este lipsit de limitări. Una dintre cele mai notabile slăbiciuni este capacitatea sa relativ limitată de stocare a cunoștințelor factuale, așa cum se demonstrează prin performanța sa mai scăzută pe benchmark-uri precum TriviaQA.

În orice caz, Microsoft crede că această limitare poate fi mitigată prin completarea modelului cu capacități de căutare, permițându-i să recupereze și să raționeze informații relevante la cerere. Această abordare este demonstrată în Hugging Face Chat-UI, unde Phi-3 Mini poate utiliza căutarea pentru a-și îmbunătăți răspunsurile.

O altă zonă de îmbunătățire este capacitatea modelului de a funcționa în multiple limbi. Deși Phi-3 Small a făcut primii pași prin incorporarea de date multilingve suplimentare, este nevoie de mai multă muncă pentru a debloca pe deplin potențialul acestor modele compacte pentru aplicații cross-linguale.

Privind spre viitor, Microsoft este dedicat să continue să avanseze familia de modele Phi, abordând limitările lor și extinzându-le capacitățile. Acest lucru poate implica refineri suplimentare ale datelor de antrenament și metodologiei, precum și explorarea de noi arhitecturi și tehnici special concepute pentru modele de limbaj compacte și de înaltă performanță.

Concluzie

Phi-3 Mini de la Microsoft reprezintă un salt semnificativ în direcția democratizării capacităților avansate de inteligență artificială. Oferta sa de performanță de ultimă generație într-un pachet compact și eficient deschide noi posibilități pentru experiențe inteligente pe dispozitive, într-o gamă largă de aplicații.

Abordarea inovatoare de antrenament a modelului, care pune accentul pe date de înaltă calitate și dense în raționament, mai degrabă decât pe puterea de calcul brută, s-a dovedit a fi un jucător de schimbare, permițând Phi-3 Mini să lovească peste greutatea sa. În combinație cu măsurile sale robuste de siguranță și eforturile continue de dezvoltare, familia de modele Phi este poziționată pentru a juca un rol crucial în modelarea viitorului sistemelor inteligente, făcând inteligența artificială mai accesibilă, eficientă și de încredere ca niciodată.

Pe măsură ce industria tehnologică continuă să împingă limitele a ceea ce este posibil cu inteligența artificială, angajamentul Microsoft față de modele ușoare și de înaltă performanță, precum Phi-3 Mini, reprezintă o abordare proaspătă și binevenită, care demonstrează că dimensiunea nu este totul. Phi-3 Mini are potențialul de a inspira o nouă undă de inovație, concentrată pe maximizarea valorii și impactului inteligenței artificiale prin curarea inteligentă a datelor, proiectarea atentă a modelului și practicile de dezvoltare responsabile.

Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.