Prompt engineering
Antrenarea îmbunătățită a încorporărilor de text cu modele de limbaj mari

Încorporările de text sunt reprezentări vectoriale ale cuvintelor, propozițiilor, paragrafelor sau documentelor care captează semnificația lor semantică. Ele servesc ca bloc de construcție de bază în multe aplicații de procesare a limbajului natural (NLP) de astăzi, inclusiv recuperarea informațiilor, răspunsurile la întrebări, căutarea semantică și multe altele.
Avansurile recente în modelele de limbaj mari (LLM) precum GPT-3 au demonstrat capacități impresionante în învățarea cu few-shot și generarea limbajului natural. Putem să utilizăm LLM-urile pentru a avansa și starea încorporărilor de text? În lucrarea lor “Îmbunătățirea încorporărilor de text cu modele de limbaj mari“, cercetătorii de la Microsoft (MSFT ) propun o metodă nouă care obține rezultate superioare prin generarea de date de antrenare sintetice cu LLM-uri și reglarea fină pe acestea.
Provocările metodelor existente
Tehnicile tradiționale de încorporare a textului, cum ar fi medii ponderate ale vectorilor de cuvinte sau TF-IDF, nu reușesc să capteze în mod corespunzător informația contextuală bogată din text. Metodele mai recente bazate pe modele de limbaj pre-antrenate, cum ar fi BERT, obțin încorporări mult mai bune care sunt conștiente de context.
Cu toate acestea, ele necesită lanțuri de antrenare complexe și multistadiale:
- Pre-antrenare pe miliarde de perechi de text slab etichetate sau artificiale
- Reglare fină pe seturi de date limitate și curate manual
Acest lucru cere resurse de calcul masive și efort uman pentru colectarea datelor. Datele de antrenare sunt, de asemenea, limitate în diversitate și acoperire lingvistică. De exemplu, benchmark-ul BEIR cuprinde seturi de date pentru doar 15 sarcini de recuperare în limba engleză.
Metodele existente utilizează în principal arhitecturi mai mici de tip BERT ca model de bază. Ele nu pot profita de LLM-uri mai avansate și de tehnici conexe.
Metodologie: Generarea de date sintetice cu LLM-uri
Pentru a depăși aceste limitări, cercetătorii propun o abordare de antrenare într-un singur stadiu care utilizează LLM-uri precum GPT-3 și GPT-4 pentru a genera date de antrenare sintetice diverse.
Pașii cheie sunt:
- Taxonomia sarcinilor: Definirea unei taxonomii care categorizează sarcinile de încorporare a textului în:
- Sarcini asimetrice (interogare și document nu sunt parafraze, de exemplu, căutare)
- Sarcini simetrice (interogare și document sunt parafraze, de exemplu, similaritate semantică)
- Proiectarea promptului: Crearea de șabloane de prompt personalizate pentru fiecare tip de sarcin care ghidează LLM-ul pentru a genera exemple de antrenare relevante.
- Generarea de date sintetice: Utilizarea LLM-ului cu prompturile proiectate pentru a genera sute de mii de perechi (interogare, document) care acoperă o varietate largă de sarcini semantice în 93 de limbi.
- Antrenarea modelului: Reglarea fină a unui model LLM puternic și open-source, cum ar fi Mistral, pe datele sintetice utilizând pierderea contrastivă.
Această metodologie permite crearea unor cantități ample de date de antrenare pentru sarcini diverse în multiple limbi fără niciun efort de etichetare umană. Prin utilizarea cunoștințelor deja încorporate în LLM-uri prin pre-antrenarea pe corpora de scară web, putem sintetiza date de calitate ridicată, precis adaptate pentru încorporări de text.
Cercetătorii demonstrează acest lucru cu o strategie de promptare în două etape:
- Promptarea GPT-4 pentru a sugera sarcini de recuperare potențiale
- Promptarea din nou pentru a genera perechi (interogare, document) pe baza sarcinilor sugerate
Unele aspecte cheie ale proiectării promptului:
- Prompturi de limbaj natural pentru instrucțiuni intuitive, asemănătoare celor umane
- Locuri rezervate pentru a încuraja diversitatea (de exemplu, lungimea interogării, claritatea, lungimea documentului)
- Combinarea datelor din multiple șabloane pentru același tip de sarcină
- Ponderarea limbilor în funcție de disponibilitatea resurselor
În total, au reușit să genereze 500.000 de exemple de încorporare de text la un cost de calcul de 180 de milioane de tokeni. Limba dominantă a fost engleza (43%), urmată de poloneză, japoneză, italiană și altele.
Pentru antrenarea modelului, au ales să regleze fin modelul open-source Mistral cu 7 miliarde de parametri, în loc de arhitecturi mai mici de tip BERT. Deoarece Mistral a fost deja pre-antrenat pe corpora de scară web, nu a fost necesară o pre-antrenare contrastivă suplimentară. Adăugarea acesteia a oferit îmbunătățiri neglijabile.
Întregul proces de reglare fină a durat mai puțin de 1.000 de pași, utilizând o combinație de date sintetice și etichetate manual. Acest lucru demonstrează eficiența eșantionului aferent abordării propuse.
Rezultate
Cercetătorii au evaluat modelul lor pe benchmark-ul MTEB, care acoperă sarcini diverse din clasificare, clustering, similaritate semantică, rezumare și recuperare de informații.
Modelul lor a depășit precedentul rezultat de top cu 2,4 puncte în scor mediu, stabilind noi recorduri pentru aproape fiecare categorie:
| Model | Precedentul SOTA | Modelul propus |
|---|---|---|
| Clasificare | 76,0 | 78,5 |
| Clustering | 46,1 | 50,3 |
| Clasificare pereche | 87,1 | 88,3 |
| Reordonare | 60,0 | 60,2 |
| Recuperare | 54,3 | 56,9 |
| STS | 83,1 | 84,6 |
| Rezumare | 31,6 | 31,4 |
| Medie | 64,2 | 66,6 |
În mod remarcabil, chiar și fără a utiliza date etichetate și antrenându-se doar pe date sintetice, a obținut o acuratețe competitivă – doar 3,5 puncte în spatele modelului complet supravegheat. Acest lucru demonstrează viabilitatea generării de încorporări de text utilizând doar LLM-uri, fără efort de etichetare umană.
Cercetătorii au evaluat, de asemenea, pe benchmark-ul multilingv MIRACL, care acoperă 18 limbi. Modelul lor a depășit cel mai bun precedent pe limbi cu resurse bogate, dar a fost mai slab pe limbi cu resurse limitate. Ei ipotezează că acest lucru ar putea fi mitigat prin pre-antrenarea LLM-urilor mai extins pe limbi cu resurse limitate.
În rezumat, încorporările de text antrenate pe date sintetice generate de LLM-uri stabilesc noi rezultate de top, utilizând în același timp o antrenare mai simplă și mai eficientă în comparație cu abordările multistadiale anterioare. Cu cercetări suplimentare în ingineria promptului și calitatea datelor sintetice, această metodologie ar putea avansa semnificativ încorporările de text multilingve.
Analiză
Această lucrare oferă câteva concluzii valoroase:
- LLM-urile precum GPT-3 și GPT-4 au o capacitate impresionantă de a genera date de antrenare sintetice de calitate pentru sarcini NLP diverse atunci când sunt promptate în mod corespunzător. Acest lucru poate reduce dependența de date etichetate manual.
- Pentru încorporări de text, pre-antrenarea contrastivă oferă îmbunătățiri neglijabile față de simpla reglare fină a modelelor precum Mistral, care au deja o pre-antrenare de scară trilionară. Acesta este un insight important în ceea ce privește eficiența antrenării.
- Metodele de generare augmentate de recuperare permit LLM-urilor să acceseze dinamic cunoștințe externe. Prin urmare, îmbunătățirea încorporărilor de text este valoroasă pentru îmbunătățirea acestor LLM-uri.
- Există un spațiu semnificativ de îmbunătățire pentru limbi cu resurse limitate. LLM-urile multilingve pre-antrenate pe date mai reprezentative ar putea ajuta la închiderea acestei lacune.
- Conceptual, modelarea limbajului și încorporările de text sunt două fețe ale aceleiași monede – înțelegerea semanticii limbajului. Cu promptarea datelor sintetice, LLM-urile pot fi reglate fin în mod organic pentru a deveni încorporări fără pipeline-uri complexe.
Unele direcții promițătoare pentru lucrări viitoare includ:
- Utilizarea LLM-urilor open-source precum GPT-NeoX pentru a genera date sintetice
- Explorarea post-antrenării ușoare pentru a adapta încorporările la contexte mai lungi
- Dezvoltarea de tehnici de inginerie a promptului pentru a controla calitatea și acoperirea sarcinilor
- Metode pentru a îmbunătăți latența inferenței și costurile de stocare pentru utilizarea industrială
Dincolo de a bate benchmark-urile, utilizarea LLM-urilor pentru a îmbunătăți încorporările de text deschide posibilități interesante pentru viitor. Pe măsură ce LLM-urile continuă să avanseze în stăpânirea limbajului natural, este probabil ca și capacitatea lor de a genera date sintetice de înaltă fidelitate să se îmbunătățească.
Cu toate acestea, direcții critice de cercetare rămân pentru a traduce acest potențial în impact real în lumea reală.
Personalizare și control
Un beneficiu cheie al datelor sintetice este capacitatea de a genera exemple programatic adaptate nevoilor specifice. Așa cum a demonstrat lucrarea, ingineria promptului permite crearea de date de antrenare pentru sute de mii de sarcini de încorporare.
Cu toate acestea, practicile actuale de proiectare a promptului rămân mai mult o artă decât o știință. Dezvoltarea de metode sistematice și reproductibile pentru a controla precis proprietățile datelor generate ar extinde aplicabilitatea acestei tehnici.
De exemplu, tehnici pentru a modula factori precum complexitatea, ambiguitatea și noutatea exemplelor ar putea ajuta la abordarea problemelor de robustețe în sarcinile downstream. Generarea dinamică a prompturilor pentru a se potrivi cu distribuțiile în schimbare din lumea reală este o altă provocare deschisă.
Antrenarea la scară
În timp ce LLM-urile pre-antrenate deja încorporează cunoștințe lingvistice substanțiale, abilitățile lor de generare a datelor sunt probabil să se amelioreze și mai mult cu scala suplimentară. Modele precum GPT-4, antrenate pe trilioane de tokeni de text de internet, demonstrează o învățare puternică cu few-shot, dar nu au fost optimizate în mod special pentru sintetizarea datelor de antrenare.
Arhitecturi și obiective adaptate pentru a iniția generarea de date autodidactă la scară web ar putea avansa semnificativ calitatea și eficiența acestei metode. Integrarea eficientă a cunoștințelor recuperate pentru a completa cunoștințele învățate este o altă direcție promițătoare.
Multitask și multilingv
Așa cum a notat lucrarea, îmbunătățirea performanței pe limbi cu resurse limitate rămâne o problemă. În loc de a pre-antrena un singur LLM masiv, o alternativă este antrenarea unei flote de modele mai mici specializate în modalități de date sau domenii lingvistice specifice.
O astfel de abordare a ansamblului ar putea ajuta la îmbunătățirea acoperirii asupra sarcinilor și limbilor rare prin împărtășirea reprezentărilor învățate între experți. Învățarea continuă pentru a extinde expertiza lingvistică și a sarcinilor în timp este, de asemenea, o perspectivă interesantă.
În concluzie, această lucrare introduce un concept inovator de sintetizare a datelor de antrenare din LLM-uri pentru a crea încorporări de text performante. Rezultatele lor demonstrează eficacitatea acestei metode, depășind benchmark-urile anterioare. Pe măsură ce LLM-urile și tehnicile de date sintetice progresează, utilizarea cunoștințelor lor pentru a antrena încorporări ar putea deveni o direcție foarte promițătoare.















