Modele și platforme AI

Zephyr-7B: Modelul de limbă hiper-optimizat HuggingFace, construit pe baza lui Mistral 7B

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Introducere

Evoluția modelelor de limbă deschise și de mari dimensiuni (LLM) a avut un impact semnificativ asupra comunității de cercetare în domeniul inteligenței artificiale, în special în dezvoltarea de chatbot-uri și aplicații similare. După lansarea de modele precum LLaMA, a existat o creștere a cercetărilor privind fine-tuning-ul eficient, manipularea extinsă a prompturilor, generarea augmentată de retrieval (RAG) și cuantificarea.

Modelul LLaMA, de exemplu, a marcat o nouă eră în fine-tuning și contextualizarea prompturilor, deschizând calea pentru modele ulterioare precum MPT de la MosaicML, RedPajama-INCITE de la Together AI, Falcon de la TII și Llama 2 de la Meta. Fiecare dintre aceste modele aduce capacități unice, îmbunătățind funcționalitatea și domeniul de aplicare al LLM-urilor.

Mistral AI, o companie fondată de foști angajați ai Google DeepMind și Meta, și-a făcut un nume cu prima sa ofertă: Mistral 7B.

Avantajul lui Mistral 7B constă în eficiența sa, oferind capacități similare sau îmbunătățite în comparație cu modelele similare, dar cu o cerință computațională mai mică.

În special, ajustat pentru sarcini instructive, Mistral 7B Instruct strălucește pe platforme precum Hugging Face, unde depășește alte modele de aceeași dimensiune și concurează strâns cu cele care au aproape dublul parametrilor săi.

Pe baza acestui fapt, Hugging Face a introdus Zephyr 7B Alpha, demonstrând că un model Mistral 7B fine-tuned poate depăși cu adevărat capacitățile unor modele de chat mai mari și, în unele sarcini, poate rivaliza chiar și cu GPT-4. “Alpha” a fost doar începutul, deoarece Zephyr 7B Beta a urmat curând.

Acest articol va explora modul în care Zephyr-7B folosește puterea modelelor mai mari pentru a-și rafina capacitatea de a răspunde și de a se alinia cu instrucțiunile umane, un proces posibil datorită tehnicii de distilare a cunoștințelor. Această metodă implică antrenarea unor modele mai mici pe baza patternurilor complexe învățate de modelele mai mari, reducând cerințele de antrenament fără a sacrifica capacitățile de modelare a limbajului. Vom analiza detaliile abordării de distilare a cunoștințelor de către Hugging Face.

Distilarea cunoștințelor

O inovație cheie în dezvoltarea unor modele precum Zephyr-7B este fine-tuning-ul supervizat distilat (dSFT). Această metodă implică utilizarea ieșirii unui model “învățător” mai mare și mai capabil pentru a antrena un model “elev” mai mic, îmbunătățindu-i precizia. Deși distilarea îmbunătățește modelele deschise pentru diverse sarcini, o diferență de performanță în comparație cu modelele “învățător” încă există.

Distilarea cunoștințelor este o metodă în învățarea mașinilor în care un model compact, numit “elev“, este învățat să reproducă performanța unui model mai mare și mai complex “învățător“. Această tehnică permite elevului să execute sarcini care anterior erau dincolo de capacitățile sale, prin transferul patternurilor complexe învățate de către învățător.

Distilarea cunoștințelor, Modelul Învățător-Elev

Distilarea cunoștințelor | Modelul Învățător-Elev

Modelul elev se antrenează pe baza probabilităților de ieșire sau a caracteristicilor generate de modelul învățător, concentrându-se pe a se potrivi cu aceste ieșiri, mai degrabă decât doar cu predicțiile finale. Acest lucru permite elevului să învețe procesele de luare a deciziilor nuanțate ale învățătorului, adesea rezultând într-o performanță îmbunătățită față de antrenamentul cu doar datele de bază.

În trecut, distilarea cunoștințelor a fost utilizată în modele precum rețelele de distilare originale ale lui Hinton și, mai recent, în NLP, cu modele precum DistilBERT, care a distilat modelul BERT într-o versiune mai mică și mai rapidă care păstrează majoritatea capacităților de înțelegere a limbajului originale. Un alt exemplu este TinyBERT, care optimizează și mai mult dimensiunea și viteza pentru dispozitive mobile sau de margine.

În cazul Zephyr-7B, distilarea cunoștințelor este utilizată pentru a îmbiba un model cu 7B de parametri cu capacitățile modelelor sale mai mari. Prin aceasta, Zephyr-7B realizează un echilibru între performanță și eficiență, făcându-l potrivit pentru medii în care resursele computaționale sunt limitate, fără a sacrifica calitatea interacțiunii și a înțelegerii.

La dezvoltarea Zephyr-7B, cercetătorii au abordat provocarea de a alinia un model LLM deschis și mic în întregime prin distilare. Ei au introdus o abordare numită optimizare directă a preferințelor distilate (dDPO), care utilizează feedback-ul AI dintr-un ansamblu de modele învățător ca date de preferință. Această metodă, care nu necesită annotarea umană, reduce semnificativ timpul și resursele necesare pentru antrenarea modelului.

Construirea ZEPHYR-7B

Pentru a valida dDPO, cercetătorii au construit ZEPHYR-7B, o versiune aliniată a modelului Mistral-7B. Procesul a implicat trei pași:

  1. dSFT utilizând setul de date UltraChat: Fine-tuning-ul supervizat distilat (dSFT) este o metodă avansată pentru antrenarea modelelor de limbă de mari dimensiuni (LLM) prin valorificarea ieșirii unui model “învățător” mai mare și mai capabil. Acesta începe cu un LLM brut care este antrenat pentru a răspunde la prompturi ale utilizatorului. În contrast cu fine-tuning-ul supervizat tradițional (SFT) care utilizează un set de date fix, dSFT folosește o abordare dinamică în care modelul însuși generează instrucțiuni și răspunsuri. Această metodă, cunoscută sub numele de auto-instruire, implică utilizarea modelului învățător atât pentru a răspunde, cât și pentru a refina instrucțiunile pe baza răspunsurilor.
  2. Incorporarea datelor de feedback AI din UltraFeedback: Aceste date au fost cruciale pentru a rafina răspunsurile modelului. În acest pas, modelul generează răspunsuri la diverse prompturi (cum ar fi descrierea modului de preparare a prăjiturilor cu ciocolată) care sunt apoi evaluate de un model mai avansat, cum ar fi GPT-4. Răspunsul cu scorul cel mai ridicat (yw) și un răspuns cu scor mai mic, ales aleator (yl), formează un set de date de feedback D.
  3. Aplicarea dDPO: Ultima fază, optimizarea directă a preferințelor distilate (dDPO), implică rafinarea modelului dSFT prin maximizarea probabilității de a clasifica răspunsurile preferate mai sus. Acest lucru se realizează prin utilizarea unei funcții de recompensă rθ(x, y) în modelul de preferință, care se bazează pe politica LLM optimă π* și politica πdSFT originală. Obiectivul de optimizare este formulat ca πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), ceea ce simplifică procesul de antrenament prin începerea cu versiunea dSFT a modelului și iterarea prin fiecare triplet AIF.
Metoda utilizată în Zephyr-7B reflectă procesele utilizate în InstructGPT.

Metoda utilizată în Zephyr-7B reflectă procesele utilizate în InstructGPT.

În mod remarcabil, Zephyr-7B atinge o performanță comparabilă cu modelele de 70B de parametri, aliniate cu feedback-ul uman. Acesta excelează atât în benchmark-urile academice, cât și în capacitățile conversaționale, subliniind eficacitatea învățării preferințelor în dezvoltarea modelului. Pentru explorarea ulterioară, modelele, codul și instrucțiunile sunt disponibile pe Depozitul GitHub al Hugging Face.

Abordarea Provocării de Aliniere a Intenției

O preocupare notabilă cu LLM-urile a fost alinierea lor cu intenția umană. Modelele anterioare au eșuat adesea în a produce răspunsuri care să se potrivească cu preferințele utilizatorilor, conducând la răspunsuri inexacte sau irelevante. Cu toate acestea, benchmark-urile recente precum MT-Bench și AlpacaEval au oferit instrumente pentru a cuantifica și îmbunătăți acest aspect, subliniind performanța superioară a modelelor proprietare antrenate cu feedback uman față de cele antrenate doar prin distilare.

Metode de Evaluare

Evaluarea Zephyr 7B a implicat testarea riguroasă pe benchmark-uri care evaluează capacitățile conversaționale ale unui model în contexte atât single, cât și multi-turn:

  • MT-Bench: Acest benchmark multi-turn necesită ca un model să răspundă la 160 de întrebări care acoperă opt domenii. Fiecare răspuns este evaluat de GPT-4, iar scorul final al modelului reflectă media peste două runde de întrebări.
  • AlpacaEval: În acest benchmark single-turn, modelul este prezentat cu 805 întrebări din diverse subiecte. Accentul aici se pune pe utilitatea modelului, cu GPT-4 evaluând răspunsurile pentru a determina un ritm de câștig comparativ.

În plus, Zephyr 7B a fost testat pe Open LLM Leaderboard, care, deși nu este o evaluare directă a capacităților conversaționale, oferă perspective asupra raționamentului și adevărului modelului după fine-tuning.

Zephyr 7B a fost comparat cu o varietate de modele deschise și proprietare, incluzând modele de diferite dimensiuni și metode de aliniere. A stabilit noi benchmark-uri pentru modelele de 7B pe MT-Bench și AlpacaEval și a arătat o performanță competitivă față de modelele mai mari, validând eficacitatea optimizării directe a preferințelor (dDPO) în antrenare.

Fazele de antrenament SFT și DPO au fost configurate cu atenție, cuprinzând multiple epoci și rate de învățare fine-tune și dimensiuni de lot pentru o performanță optimă. Modelul Zephyr final a rezultat nu numai rezistent la supra-antrenare, ci și îmbunătățit în abordarea sarcinilor practice și a benchmark-urilor academice.

Date și Rezultate

Date Utilizate

În dezvoltarea Zephyr-7B, două seturi de date cheie au fost utilizate pentru antrenarea și rafinarea modelului, fiecare adresând aspecte diferite ale generării de dialog:

Setul de date UltraChat

  • Sursă: Dezvoltat din dialoguri generate de GPT-3.5-TURBO.
  • Conținut: Conține 1,47 milioane de dialoguri multi-turn pe 30 de subiecte și 20 de tipuri de material text.
  • Rafinare: Setul de date a suferit o corectură gramaticală și filtre pentru a crește utilitatea răspunsurilor și a elimina frazele de introducere inutile.

Setul de date UltraFeedback

  • Sursă: Cuprinde prompturi evaluate de GPT-4, care a evaluat răspunsurile pe baza urmăririi instrucțiunilor, onestității și utilității.
  • Conținut: Include 64.000 de prompturi cu câte patru răspunsuri fiecare, evaluate de GPT-4.
  • Preferințe binare: Generate prin alegerea răspunsului cu scorul mediu cel mai ridicat ca “ales” și unul aleator din restul ca “respins” pentru a îmbunătăți diversitatea și a provoca procesul de optimizare directă a preferințelor (DPO).

Ambele seturi de date sunt cruciale pentru antrenarea Zephyr-7B pentru a înțelege și genera dialoguri umane care sunt instructive, oneste și utile. Aceste seturi de date au fost puse la dispoziție pe Hugging Face Hub, care poate fi accesat aici.

Performanță și Rezultate

Graficul de mai jos ilustrează performanța Zephyr 7B în diverse categorii de sarcini față de alte modele, cum ar fi GPT-3.5-turbo, Claude 1, GPT-4 și Llama-2-70b-chat. Categoriile pot include Scriere, Științe Umane, Rol, Raționament, Științe, Extracție, Programare și Matematică.

Din grafic, putem deduce în care domenii Zephyr 7B excelează și în care domenii ar putea necesita îmbunătățiri. De exemplu, dacă linia Zephyr se extinde mai mult pe axa Scriere în comparație cu altele, sugerează că Zephyr este deosebit de puternic în generarea de conținut scris. În contrast, dacă linia este mai aproape de centru pe axa Matematică, poate indica o slăbiciune relativă în rezolvarea problemelor de matematică.

Graficul radar ajută la identificarea punctelor forte și a slăbiciunilor Zephyr 7B, oferind o reprezentare vizuală a modului în care se situează față de modele mai mari, cum ar fi GPT-4, și modele specializate, cum ar fi Llama-2-70b-chat.

 

Grafic de performanță al modelului

Grafic de performanță al modelului

Compararea diverselor modele de limbă pe două benchmark-uri: MT-Bench și AlpacaEval. Modelele sunt evaluate pe baza dimensiunii, metodei de aliniere (cum ar fi dSFT pentru fine-tuning-ul supervizat distilat sau dDPO pentru optimizarea directă a preferințelor distilate) și a scorurilor de performanță. Zephyr se remarcă prin scoruri ridicate în ambele benchmark-uri, indicând eficacitatea sa în generarea de răspunsuri aliniate.

Rezultatele benchmark-ului de chat

Rezultatele benchmark-ului de chat

Concluzii

În concluzie, dezvoltarea Zephyr-7B demonstrează că alinierea și distilarea capacităților conversaționale de la un model de limbă de mari dimensiuni (LLM) către un model mai mic poate fi realizată fără a se baza pe metode bazate pe eșantionare. Prin utilizarea optimizării directe a preferințelor (DPO) cu feedback AI, Zephyr-7B valorifică baza solidă a lui Mistral-7B pentru a stabili un nou benchmark pentru modelele de chat cu 7B de parametri, demonstrând capacitatea modelelor deschise și mai mici de a înțelege și de a răspunde la intenția utilizatorului în mod eficient.

Cu toate acestea, această cercetare nu este lipsită de limitări. Dependența de GPT-4 ca evaluator pentru benchmark-uri introduce o părtinire către modelele distilate de la acesta, favorizând potențial răspunsurile precise. În plus, scalabilitatea acestei metode la modele mai mari, cum ar fi LLAMA2-70B, și impactul asupra câștigurilor de performanță rămân domenii care necesită cercetări ulterioare. Aceste limitări subliniază nevoia de inovație continuă și dezvoltarea de metode de evaluare neînclinate în comunitatea AI.

Privind dincolo de studiu, este evident că potențialul modelelor mai mici de a performa la nivelul modelelor mai mari poate democratiza AI, permițând o utilizare mai accesibilă și eficientă în diverse aplicații. Succesul Zephyr-7B încurajează explorarea ulterioară a modelelor deschise, care poate accelera progresele în AI prin promovarea cercetării și dezvoltării colaborative.

Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.