Modele și platforme AI
Încărcarea modelelor de limbaj mare cu predicția multi-token

De
Aayush Mittal Mittal
Modelele de limbaj mare (LLM) precum GPT, LLaMA și altele au făcut senzație cu capacitatea lor remarcabilă de a înțelege și genera texte asemănătoare cu cele umane. Cu toate acestea, în ciuda capacităților lor impresionante, metoda standard de antrenare a acestor modele, cunoscută sub numele de “predicție de token următor”, are unele limitări inerente.
În predicția de token următor, modelul este antrenat să prevadă următorul cuvânt dintr-o secvență dată cuvintele precedente. Deși această abordare s-a dovedit a fi de succes, poate duce la modele care se luptă cu dependențele pe termen lung și sarcinile de raționament complex. Mai mult, discrepanța dintre regimul de antrenare cu forțarea profesorului și procesul de generare autoregresiv în timpul inferenței poate rezulta într-o performanță suboptimală.
Un articol recent de cercetare de Gloeckle et al. (2024) de la Meta AI introduce un nou paradigme de antrenare numit “predicție multi-token” care își propune să abordeze aceste limitări și să încarce modelele de limbaj mare. În acest articol, vom explora în profunzime conceptele de bază, detaliile tehnice și implicațiile potențiale ale acestei cercetări deosebite.
Predicția de token unic: Abordarea convențională
Înainte de a explora detaliile predicției multi-token, este esențial să înțelegem abordarea convențională care a fost calul de bătaie al antrenării modelelor de limbaj mare de-a lungul anilor – predicția de token unic, cunoscută și sub numele de predicție de token următor.
Paradigma de predicție de token următor
În paradigma de predicție de token următor, modelele de limbaj sunt antrenate să prevadă următorul cuvânt dintr-o secvență dată contextul precedent. Mai formal, modelul este însărcinat cu maximizarea probabilității tokenului următor xt+1, dată tokenelor precedente x1, x2, …, xt. Acest lucru se realizează de obicei prin minimizarea pierderii de entropie cruză:
L = -Σt log P(xt+1 | x1, x2, …, xt)
Acest obiectiv de antrenare simplu, dar puternic, a fost baza multor modele de limbaj mare de succes, cum ar fi GPT (Radford et al., 2018), BERT (Devlin et al., 2019) și variantele lor.
Forțarea profesorului și generarea autoregresivă
Predicția de token următor se bazează pe o tehnică de antrenare numită “forțarea profesorului” în care modelului i se furnizează adevărul pentru fiecare token viitor în timpul antrenării. Acest lucru permite modelului să învețe din contextul și secvențele țintă corecte, facilitând o antrenare mai stabilă și mai eficientă.
Cu toate acestea, în timpul inferenței sau generării, modelul funcționează în mod autoregresiv, prevăzând un token la un moment dat pe baza tokenelor generate anterior. Această discrepanță dintre regimul de antrenare (forțarea profesorului) și regimul de inferență (generarea autoregresivă) poate duce la discrepanțe potențiale și la o performanță suboptimală, în special pentru secvențe mai lungi sau sarcini de raționament complex.
Limitări ale predicției de token următor
Deși predicția de token următor a fost remarcabil de de succes, are și unele limitări inerente:
- Focalizare pe termen scurt: Prin prevăzuirea doar a tokenului următor, modelul poate lupta pentru a capta dependențele pe termen lung și structura generală și coerența textului, ceea ce poate duce la incoerențe sau generații incoerente.
- Prinderea modelelor locale: Modelele de predicție de token următor pot prinde modele locale în datele de antrenare, făcându-le dificil de generalizat la scenarii sau sarcini care necesită un raționament mai abstract.
- Capacități de raționament: Pentru sarcinile care implică raționament multi-pași, gândire algoritmică sau operații logice complexe, predicția de token următor poate să nu ofere suficiente îndemnuri inductive sau reprezentări pentru a susține astfel de capacități în mod eficient.
- Ineficiență a mostrelor: Din cauza naturii locale a predicției de token următor, modelele pot necesita seturi de date de antrenare mai mari pentru a dobândi cunoștințele și abilitățile de raționament necesare, ceea ce poate duce la ineficiențe potențiale ale mostrelor.
Aceste limitări au motivat cercetătorii să exploreze paradigme de antrenare alternative, cum ar fi predicția multi-token, care își propune să abordeze unele dintre aceste limitări și să deblocheze noi capacități pentru modelele de limbaj mare.
Prin contrastarea abordării convenționale de predicție de token următor cu tehnica nouă de predicție multi-token, cititorii pot aprecia mai bine motivația și beneficiile potențiale ale acesteia, pregătind terenul pentru o explorare mai profundă a acestei cercetări deosebite.
Ce este predicția multi-token?
Ideea principală din spatele predicției multi-token este de a antrena modelele de limbaj să prevadă multiple tokenuri viitoare simultan, în loc de doar tokenul următor. În mod specific, în timpul antrenării, modelul este însărcinat să prevadă următoarele n tokenuri la fiecare poziție din corpusul de antrenare, utilizând n capete de ieșire independente care funcționează pe baza unui trunchi comun al modelului.
De exemplu, cu o configurație de predicție a 4 tokenuri, modelul ar fi antrenat să prevadă următoarele 4 tokenuri deodată, dată contextul precedent. Această abordare încurajează modelul să capteze dependențele pe termen lung și să dezvolte o înțelegere mai bună a structurii generale și coerenței textului.
Un exemplu simplu
Pentru a înțelege mai bine conceptul de predicție multi-token, să considerăm un exemplu simplu. Să presupunem că avem următoarea propoziție:
“Vulpea rapidă maro sărea peste câinele leneș.”
În abordarea standard de predicție de token următor, modelul ar fi antrenat să prevadă următorul cuvânt dată contextul precedent. De exemplu, dată contextul “Vulpea rapidă maro sărea peste”, modelul ar fi însărcinat să prevadă următorul cuvânt, “câinele”.
Cu predicția multi-token, însă, modelul ar fi antrenat să prevadă multiple cuvinte viitoare deodată. De exemplu, dacă setăm n=4, modelul ar fi antrenat să prevadă următoarele 4 cuvinte simultan. Dată același context “Vulpea rapidă maro sărea peste”, modelul ar fi însărcinat să prevadă secvența “leneș spațiu” (notă spațiul după “leneș” pentru a indica sfârșitul propoziției).
Prin antrenarea modelului să prevadă multiple tokenuri viitoare deodată, se încurajează modelul să capteze dependențele pe termen lung și să dezvolte o înțelegere mai bună a structurii generale și coerenței textului.
Detalii tehnice
Autorii propun o arhitectură simplă, dar eficientă, pentru implementarea predicției multi-token. Modelul constă dintr-un trunchi comun de transformator care produce o reprezentare latentă a contextului de intrare, urmată de n straturi de transformator independente (capete de ieșire) care prevăd tokenurile viitoare respective.
În timpul antrenării, trecerile forward și backward sunt orhestrate cu atenție pentru a minimiza amprenta de memorie GPU. Trunchiul comun calculează reprezentarea latentă, iar apoi fiecare cap de ieșire efectuează în mod secvențial trecerea forward și backward, acumulând gradientelor la nivelul trunchiului. Această abordare evită materializarea tuturor vectorilor de logit și a gradientelor lor simultan, reducând utilizarea maximă de memorie GPU de la O(nV + d) la O(V + d), unde V este mărimea vocabularului și d este dimensiunea reprezentării latente.
Implementarea eficientă din punct de vedere al memoriei
Una dintre provocările în antrenarea predictorilor multi-token este reducerea utilizării de memorie GPU. Deoarece mărimea vocabularului (V) este de obicei mult mai mare decât dimensiunea reprezentării latente (d), vectorii de logit devin un bottleneck pentru utilizarea de memorie GPU.
Pentru a aborda această provocare, autorii propun o implementare eficientă din punct de vedere al memoriei care adaptează cu atenție secvența de operații forward și backward. În loc de a materializa toți vectorii de logit și gradientelor lor simultan, implementarea calculează în mod secvențial trecerea forward și backward pentru fiecare cap de ieșire independent, acumulând gradientelor la nivelul trunchiului.
Această abordare evită stocarea tuturor vectorilor de logit și a gradientelor lor în memorie simultan, reducând utilizarea maximă de memorie GPU de la O(nV + d) la O(V + d), unde n este numărul de tokenuri viitoare prevăzute.
Avantajele predicției multi-token
Articolul de cercetare prezintă mai multe avantaje convingătoare ale utilizării predicției multi-token pentru antrenarea modelelor de limbaj mare:
- Îmbunătățirea eficienței mostrelor: Prin încurajarea modelului să prevadă multiple tokenuri viitoare deodată, predicția multi-token conduce la o mai bună eficiență a mostrelor. Autorii demonstrează îmbunătățiri semnificative ale performanței la sarcinile de înțelegere și generare de cod, cu modele de până la 13B de parametri care rezolvă aproximativ 15% mai multe probleme în medie.
- Inferență mai rapidă: Capetele de ieșire suplimentare antrenate cu predicția multi-token pot fi utilizate pentru decodarea speculativă auto, o variantă a decodării speculative care permite prevăzuirea paralelă a tokenurilor. Acest lucru conduce la timpuri de inferență de până la 3 ori mai rapide pentru o gamă largă de dimensiuni de batch, chiar și pentru modele mari.
- Promovarea dependențelor pe termen lung: Predicția multi-token încurajează modelul să capteze dependențele pe termen lung și modelele din date, ceea ce este deosebit de benefic pentru sarcinile care necesită înțelegere și raționament pe baza unor contexte mai largi.
- Raționament algoritmic: Autorii prezintă experimente pe sarcini sintetice care demonstrează superioritatea predicției multi-token în dezvoltarea capetelor de inducție și a capacităților de raționament algoritmic, în special pentru dimensiuni mai mici ale modelului.
- Coerență și consistență: Prin antrenarea modelului să prevadă multiple tokenuri viitoare simultan, predicția multi-token încurajează dezvoltarea unor reprezentări coerente și consistente. Acest lucru este deosebit de benefic pentru sarcinile care necesită generarea unor texte mai lungi și mai coerente, cum ar fi povestiri, articole sau manuale de instruire.
- Îmbunătățirea generalizării: Experimentele autorilor pe sarcini sintetice sugerează că modelele de predicție multi-token prezintă o mai bună generalizare, în special în scenarii în afara distribuției. Acest lucru poate fi datorat capacității modelului de a capta modele pe termen lung și dependențe, ceea ce îi permite să extrapoleze mai eficient la scenarii neîntâlnite.

Exemple și intuiții
Pentru a oferi o mai bună înțelegere a motivului pentru care predicția multi-token funcționează atât de bine, să considerăm câteva exemple:
- Generarea de cod: În contextul generării de cod, prevăzuirea multiplelor tokenuri simultan poate ajuta modelul să înțeleagă și să genereze structuri de cod mai complexe. De exemplu, atunci când se generează o definiție de funcție, prevăzuirea doar a tokenului următor poate să nu ofere suficient context pentru model pentru a genera corect semnătura funcției. Cu toate acestea, prin prevăzuirea multiplelor tokenuri deodată, modelul poate capta mai bine dependențele dintre numele funcției, parametri și tipul de returnare, conducând la o generare de cod mai precisă și coerentă.
- Raționamentul limbajului natural: Să considerăm un scenariu în care un model de limbaj este solicitat să răspundă la o întrebare care necesită raționament pe baza mai multor pași sau piese de informație. Prin prevăzuirea multiplelor tokenuri simultan, modelul poate capta mai bine dependențele dintre diferitele componente ale procesului de raționament, conducând la răspunsuri mai coerente și precise.
- Generarea de text pe termen lung: Atunci când se generează text pe termen lung, cum ar fi povești, articole sau rapoarte, menținerea coerenței și consistenței pe o perioadă mai lungă de timp poate fi o provocare pentru modelele de limbaj antrenate cu predicția de token următor. Predicția multi-token încurajează modelul să dezvolte reprezentări care captează structura generală și fluxul textului, ceea ce poate conduce la generații de text pe termen lung mai coerente și consistente.
Limitări și direcții viitoare
Deși rezultatele prezentate în articol sunt impresionante, există câteva limitări și întrebări deschise care necesită o investigație ulterioară:
- Numărul optim de tokenuri: Articolul explorează diferite valori pentru n (numărul de tokenuri viitoare de prevăzut) și găsește că n=4 funcționează bine pentru multe sarcini. Cu toate acestea, valoarea optimă a lui n poate depinde de sarcina specifică, de setul de date și de dimensiunea modelului. Dezvoltarea unor metode principiale pentru determinarea valorii optime a lui n ar putea conduce la îmbunătățiri suplimentare ale performanței.
- Mărimea vocabularului și tokenizarea: Autorii notează că mărimea vocabularului și strategia de tokenizare optime pentru modelele de predicție multi-token pot diferi de cele utilizate pentru modelele de predicție de token următor. Explorarea acestui aspect ar putea conduce la o mai bună îmbunătățire a lungimii secvenței comprimate și a eficienței computaționale.
- Pierderi de predicție auxiliare: Autorii sugerează că lucrarea lor ar putea stimula interesul pentru dezvoltarea unor pierderi de predicție auxiliare noi pentru modelele de limbaj mare, dincolo de predicția standard de token următor. Investigarea unor pierderi auxiliare alternative și a combinațiilor lor cu predicția multi-token este o direcție de cercetare interesantă.
- Înțelegere teoretică: Deși articolul oferă câteva intuiții și dovezi empirice pentru eficacitatea predicției multi-token, o înțelegere teoretică mai profundă a motivului pentru care și cum funcționează această abordare ar fi valoroasă.
Concluzii
Articolul de cercetare “Modele de limbaj mare mai bune și mai rapide prin predicția multi-token” de Gloeckle et al. introduce un nou paradigme de antrenare care are potențialul de a îmbunătăți semnificativ performanța și capacitățile modelelor de limbaj mare. Prin antrenarea modelelor să prevadă multiple tokenuri viitoare simultan, predicția multi-token încurajează dezvoltarea dependențelor pe termen lung, a capacităților de raționament algoritmic și a unei mai bune eficiențe a mostrelor.
Implementarea tehnică propusă de autorii este elegantă și eficientă din punct de vedere computațional, făcând-o fezabilă pentru aplicarea acestei abordări la antrenarea modelelor de limbaj mare la scară largă. Mai mult, capacitatea de a utiliza decodarea speculativă auto pentru inferențe mai rapide este un avantaj practic semnificativ.
Deși există încă întrebări deschise și direcții de explorat, această cercetare reprezintă un pas interesant înainte în domeniul modelelor de limbaj mare. Pe măsură ce cererea pentru modele de limbaj mai capabile și mai eficiente continuă să crească, predicția multi-token ar putea deveni o componentă cheie în următoarea generație de sisteme AI puternice.
Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.
Descoperă mai multe


Laboratoarele au dovedit că Cutia de nisip a agentului dvs. este doar o sugestie


Meta Transformă Asistentul său de Chatbot într-un Asistent de Execuție a Task-urilor


Graficele spectaculoase pot face ca și cercetarea “rea” să pară de încredere


Cel mai bun model OpenAI a fost lansat în spatele unei porți guvernamentale


Utilizarea AI poate face ca sarcinile să dureze mai mult, arată cercetările


Dacă un robot poate flirta cu copiii, ce altceva îi este permis să facă cu datele dvs.?


