Modele și platforme AI

Zephyr-7B: O introducere în distilarea directă a alinierii în modelele de limbaj

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Capacitatea și performanța modelelor de limbaj mari deschise au evoluat semnificativ în ultimii ani, și am asistat la progresul de la modelele GPT-2 inițiale la cadre LLM mai compacte, mai precise și mai eficiente, care utilizează o cantitate considerabil mai mare de tokeni decât numărul de tokeni considerat a fi computațional optim sub legile de scalare Chinchilla. Mai mult, dezvoltatorii au demonstrat că aceste cadre LLM mai mici pot fi antrenate în continuare utilizând o abordare de dSFT sau Distilled Supervised Fine-Tuning bazată pe modele proprietare, care utilizează ieșirea de la un model profesor eficient ca date supervizate pentru modelul elev în încercarea de a îmbunătăți precizia.

În acest articol, vom discuta despre cadru Zephyr-7B, un benchmark de chat de ultimă generație pentru modele cu 7 miliarde de parametri care nu necesită annotări umane. Scopul principal al cadru Zephyr-7B este de a permite dezvoltatorilor să producă modele de limbaj mari deschise care să se alinieze cu intenția utilizatorului mai mult ca oricând. Cadru Zephyr-7B nu numai că examinează aplicarea abordărilor actuale pentru cadre LLM mai mari, cum ar fi dSFT, dar explorează și posibilitatea utilizării altor abordări pentru a învăța un model de chat cu o aliniere mai bună cu intenția utilizatorului. Vom face o analiză mai profundă a cadru Zephyr, și vom explora arhitectura, funcționarea și rezultatele sale. Așadar, să începem.

Zephyr-7B: O introducere în distilarea directă a alinierii în modelele de limbaj

Așa cum am menționat anterior, modelele de limbaj au evoluat rapid în ultimii ani, de la cadrele GPT-2 inițiale la cadrele LLM actuale GPT-4 și MiniGPT-5, care, deși sunt foarte consumatoare de tokeni, sunt acum mai precise și mai eficiente. Un aspect important al acestor cadre LLM avansate este că încorporează o cantitate semnificativ mai mare de tokeni decât numărul de tokeni care au fost considerați anterior a fi computațional optim sub legile de scalare Chinchilla. Mai mult, dezvoltatorii și cercetătorii care lucrează la cadre LLM au învățat că aceste cadre LLM mai mici pot fi antrenate în continuare utilizând o abordare de dSFT sau Distilled Supervised Fine-Tuning bazată pe modele proprietare, care utilizează ieșirea de la un model profesor eficient ca date supervizate pentru modelul elev în încercarea de a îmbunătăți precizia. Strategia de distilare s-a dovedit a fi un instrument foarte eficient și util pentru a maximiza potențialul și capacitățile modelelor deschise pe o gamă largă de sarcini, deși încă nu poate replica performanța modelului profesor. În plus, utilizatorii au raportat adesea că aceste modele prezintă “aliniere de intenție”, adică modelele nu se comportă într-un mod care să se alinieze cu cerințele utilizatorilor finali, ceea ce duce la ieșiri incorecte care nu oferă răspunsuri corecte la intrările sau întrebările utilizatorilor.

Alinierea intenției a fost întotdeauna o provocare majoră pentru dezvoltatori, cu lucrări recente care se concentrează pe dezvoltarea de benchmark-uri precum AlpacaEval și MT-Bench, create pentru a aborda problema alinierii. Motivația pentru dezvoltarea cadru Zephyr poate fi atribuită problemei utilizării distilării pentru a alinia un model LLM deschis mic, unde primul pas este de a utiliza un feedback AI sau Artificial Intelligence Feedback pentru a obține date de preferință de la un ansamblu de modele profesor, și apoi de a aplica direct o optimizare a preferinței distilate ca obiectiv de învățare principal, o abordare cunoscută sub numele de dDPO sau Denoising Diffusion Policy Optimization. Aspectul principal al abordării dDPO este că, spre deosebire de predecesorii săi, cum ar fi PPO sau Proximal Preference Optimization, nu necesită mostre sau annotări umane și reduce, de asemenea, timpul necesar pentru a antrena un model de limbaj. Mai mult, permite dezvoltatorilor să maximizeze recompensele mostrelor finale prin atenție la secvența pașilor de denoising de la început până la sfârșit, adică pe tot parcursul.

Dezvoltatorii au creat cadru Zephyr-7B pentru a valida această abordare, și în unele moduri, este o versiune aliniată a cadru Mistral-7B de ultimă generație. Cadru utilizează mai întâi dSFT sau Distilled Supervised Fine-Tuning pe baza setului de date UltraChat, și aplică apoi abordarea dDPO sau Denoising Diffusion Policy Optimization pe datele de feedback. Experimentele indică faptul că cadru Zephyr-7B cu 7 miliarde de parametri oferă rezultate comparabile cu cele oferite de modelele de chat aliniate cu feedback uman cu peste 70 de miliarde de parametri. Mai mult, experimentele indică, de asemenea, faptul că rezultatele pot fi îmbunătățite atât în ceea ce privește benchmark-urile care iau în considerare capacitățile conversaționale, cât și benchmark-urile academice standard, și utilizarea învățării preferințelor este esențială pentru a obține rezultatele dorite.

Figura de mai sus demonstrează performanța diferitelor modele de limbaj pe benchmark-ul MT-bench. Cadru Zephyr-7B, care este antrenat utilizând abordarea dDPO, este comparat cu modele de limbaj proprietare și deschise, mai mari, cum ar fi GPT-3.5 turbo, Llama-2-70B și altele, care au fost antrenate utilizând învățare de întărire suplimentară și au inclus, de asemenea, o cantitate mare de feedback uman. Așa cum se poate vedea clar, în ciuda diferenței uriașe în ceea ce privește numărul de parametri pe care aceste cadre îi utilizează, cadru Zephyr-7B oferă rezultate comparabile cu majoritatea acestora și depășește mai multe cadre în diferite domenii.

Zephyr-7B: Metodă, funcționare și arhitectură

Scopul principal al cadru Zephyr-7B este de a ajuta un model de limbaj mare deschis să se alinieze cât mai mult posibil cu intenția utilizatorului, și pe tot parcursul, cadru Zephyr-7B presupune acces la un model profesor mare care este interogat utilizând generarea de prompturi. Zephyr-7B urmează o abordare similară cu cea utilizată în cadru InstructGPT, și are ca scop generarea unui model elev eficient și precis.

Următoarea figură demonstrează pe scurt cele trei pași principali implicați în funcționarea cadru Zephyr-7B.

  1. dSFT pentru construcția de seturi de date la scară largă utilizând un stil de auto-instruire.
  2. Colectarea feedback-ului AI utilizând un ansamblu de modele de chat complete, urmată de binarizarea preferințelor și notarea de către GPT-4.
  3. dPO a modelului dSFT prin utilizarea datelor de feedback.

dSFT sau Distilled Supervised Fine-Tuning

Cadru începe cu un model de limbaj mare brut care trebuie mai întâi antrenat pentru a răspunde la prompturile utilizatorilor. În mod tradițional, antrenarea acestor cadre LLM pentru a răspunde la prompturile utilizatorilor se face utilizând SFT sau Supervised Fine Tuning pe un set de date care conține instrucțiuni de înaltă calitate și răspunsuri corespunzătoare. Deoarece cadru Zephyr-7B are acces la un model profesor, cadru poate genera instrucțiuni și răspunsuri, și antrena modelul direct pe aceste instrucțiuni și răspunsuri, și această abordare este cunoscută sub numele de dSFT sau Distilled SFT. Următoarea figură demonstrează distilarea realizată de SFT, unde x reprezintă un set de prompturi de start construite cu scopul principal de a reprezenta un set divers de domenii topice, y reprezintă răspunsul de testat, care este rafinat utilizând o nouă instrucțiune de testare reprezentată de x1 și C reprezintă punctul final în setul de date final.

Feedback AI prin preferințe

Feedback-ul uman este utilizat pentru a atribui modelelor de limbaj mari, deoarece acestea pot furniza semnalele suplimentare necesare, și aceste feedback-uri umane sunt furnizate în mod tradițional prin preferințe asupra calității răspunsurilor generate de cadrele LLM. Cu toate acestea, cadru Zephyr utilizează feedback-ul AI de la modelul profesor asupra ieșirilor generate de alte modele în loc de feedback uman pentru scopuri de distilare. Abordarea urmată de cadru Zephyr este influențată de cea utilizată de cadru UltraFeedback, care utilizează modelul profesor pentru a furniza preferințe asupra ieșirilor modelului.

Similar cu abordarea SFT sau Supervised Fine Tuning, începe cu un set de prompturi, unde x reprezintă fiecare prompt individual care este apoi alimentat cu un set de patru modele, cum ar fi Llama, Falcon, Claude și altele, fiecare generând un răspuns propriu. Aceste răspunsuri sunt apoi alimentate ca intrare pentru modelul profesor, cum ar fi GPT-3 sau GPT-4, și modelul produce un scor pentru răspunsul de intrare. După colectarea scorurilor de ieșire, modelul salvează răspunsul cu scorul cel mai mare.

dDPO sau Distilled Direct Preference Optimization

dDPO este ultimul pas al cadru Zephyr-7B, și scopul său principal este de a rafina modelul dSFT prin maximizarea probabilității de a clasifica răspunsul preferat într-un model de preferință determinat de o funcție de recompensă prin utilizarea modelului de limbaj elev. Pasul anterior care a implicat utilizarea feedback-ului AI s-a concentrat în primul rând pe utilizarea metodelor de învățare prin întărire, cum ar fi PPO sau Proximal Policy Optimization, pentru maximizarea optimizării cu privire la recompensa generată. În acest pas, recompensa este mai întâi antrenată și apoi eșantionată din politica curentă pentru a calcula actualizările, și astfel maximizarea optimizării. DPO sau Direct Preference Optimization urmează o abordare similară pentru a optimiza direct modelul de preferință utilizând datele statice. Obiectivul după conectarea funcției de recompensă la modelul de preferință poate fi scris ca

Zephyr-7B: Experimente, benchmark-uri și rezultate

Cadru Zephyr efectuează experimentele de fine-tuning pe cadru Mistral-7B de ultimă generație, care oferă performanțe comparabile cu cele ale modelelor de limbaj mai mari pe o gamă largă de sarcini de procesare a limbajului natural sau NLP.

Seturi de date

Cadru Zephyr utilizează două seturi de date de dialog, care au fost distilate dintr-un amestec de modele proprietare și deschise, care s-au dovedit a fi eficiente în producerea de modele de chat eficiente.

UltraChat

UltraChat este un set de date de auto-îmbunătățire care conține aproximativ 1,5 milioane de dialoguri multi-turn, răspândite pe 30 de subiecte și 20 de materiale text generate de cadru GPT-3.5-Turbo. Pentru a aborda problema de capitalizare incorectă a setului de date UltraChat, cadru aplică o abordare de heuristici de truecasing pentru a elimina erorile gramaticale.

UltraFeedback

UltraFeedback este un set de date de prompturi cu peste 64.000 de prompturi, fiecare având patru răspunsuri individuale LLM. Cadru Zephyr utilizează scorul mediu cel mai mare obținut din setul de date UltraFeedback pentru a construi preferințe binare, și una dintre celelalte trei răspunsuri LLM este respinsă aleatoriu.

Evaluare

Pentru a evalua performanța cadru Zephyr, dezvoltatorii au ales două benchmark-uri de chat, unul single-turn și unul multi-turn, în încercarea de a evalua capacitatea modelului de a urma instrucțiunile utilizatorului și de a răspunde corespunzător.

MT-Bench

Benchmark-ul de evaluare MT-Bench constă în 160 de întrebări, răspândite pe opt domenii de cunoaștere unice, și sub benchmark-ul MT-Bench, modelul trebuie să răspundă la o întrebare inițială și să furnizeze un răspuns la întrebarea de follow-up.

AlpacaEval

AlpacaEval este un benchmark single-turn sub care modelul sau cadru generează răspunsuri utilizatorilor la peste 800 de întrebări, răspândite pe diferite subiecte, cu accentul principal pe utilitate.

În plus față de aceste două benchmark-uri principale, cadru Zephyr-7B este evaluat și pe Open LLM Leaderboard pentru sarcini de clasificare multi-clasă, ARC, HellaSwag, MMLU și altele. Mai mult, indiferent de benchmark-ul pe care este evaluat cadru Zephyr-7B, este comparat cu o gamă de modele proprietare și deschise, cu procedurile de aliniere fiind singurul factor de diferențiere.

Rezultate

Să vedem acum cum se desfășoară cadru Zephyr-7B și cum se compară cu modelele de limbaj actuale.

Implementarea abordării dDPO îmbunătățește capacitățile de chat

Tabela de mai jos compară performanța cadru Zephyr-7B cu modelele de limbaj de ultimă generație pe benchmark-urile AlpacaEval și MT-Bench.

Așa cum se poate vedea clar, atunci când este comparat cu modelele deschise cu 7 miliarde de parametri, cadru Zephyr-7B nu numai că depășește semnificativ modelele dSFT pe ambele benchmark-uri, dar stabilește și noi standarde de ultimă generație. Mai mult, cadru Zephyr-7B reușește, de asemenea, să depășească modelul XWIN-LM-7B, care este unul dintre modelele rare antrenate pe abordarea dPPO sau distilled PPO. Performanța oferită de cadru Zephyr-7B este comparabilă cu rezultatele oferite de modele de limbaj mai mari, cum ar fi Llama2-Chat, cu peste 70 de miliarde de parametri.

dDPO îmbunătățește performanța sarcinilor academice

Figura de mai jos compară performanța cadru Zephyr-7B cu o gamă largă de cadre LLM deschise și proprietare.

Așa cum se poate vedea, cadru Zephyr-7B depășește semnificativ modelele LLM cu 7 miliarde de parametri, și diferența dintre performanța sa și cea a modelelor dSFT este, de asemenea, vizibilă. Pe măsură ce numărul de parametri crește, cadru Zephyr-7B nu reușește să țină pasul, deși se potrivește cu performanța oferită de cadrele cu 40 de miliarde de parametri.

Optimizarea preferințelor

În figura de mai jos, evaluăm modul în care diferiții pași din procesul de aliniere afectează performanța. Așa cum se poate observa, abordarea dDPO combinată cu dSFT îmbunătățește semnificativ performanța pe ambele seturi de date MT-Bench și AlpacaEval.

În final, în figura de mai jos, putem vedea acuratețea de testare și antrenare în timpul implementării DPO. Așa cum se poate vedea, abordarea DPO nu afectează performanța modelului pe sarcinile downstream.

Concluzii

În acest articol, am discutat despre cadru Zephyr-7B, bazat pe cadru Mistral-7B de ultimă generație, care are ca scop rezolvarea provocării actuale de distilare a alinierii dintr-un model de limbaj mare într-un cadru preantrenat mult mai mic. Scopul principal al cadru este de a permite dezvoltatorilor să producă modele de limbaj mari deschise care să se alinieze cu intenția utilizatorului mai mult ca oricând. Cadru Zephyr-7B nu numai că examinează aplicarea abordărilor actuale pentru cadre LLM mai mari, cum ar fi dSFT, dar explorează și posibilitatea utilizării altor abordări pentru a învăța un model de chat cu o aliniere mai bună cu intenția utilizatorului.

Cu toate acestea, în ciuda rezultatelor promițătoare, cadru Zephyr-7B nu este perfect, și încă există lucruri de făcut. Una dintre limitările evidente este utilizarea cadru GPT-4 pentru a evalua benchmark-urile MT-Bench și AlpacaEval, care a fost adesea împărtășită spre modelele pe care le distilează. Cu toate acestea, cadru Zephyr-7B speră să deschidă calea pentru explorarea capacităților modelelor deschise mai mici care sunt capabile să se alinieze cu intenția și interacțiunile utilizatorului.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.