Modele și platforme AI

De ce modelele de limbaj mari (LLM) sar peste instructiuni si cum sa adresati aceasta problema

mm
Adaugă Unite.AI la sursele tale preferate pe Google
LLM instruction skipping fix

Modelele de limbaj mare (LLM) au devenit rapid instrumente indispensabile de inteligenta artificiala (IA), alimentand aplicatii de la chatboti si crearea de continut la asistenta pentru programare. In ciuda capacitatile lor impresionante, o provocare comuna cu care se confrunta utilizatorii este ca aceste modele sar peste parti ale instructiunilor pe care le primesc, mai ales atunci cand aceste instructiuni sunt lungi sau implică multiple pasi. Acest sarire duce la iesiri incomplete sau inexacte, ceea ce poate cauza confuzie si eroda increderea in sistemele de IA. Ințelegerea motivelor pentru care LLM-urile sar peste instructiuni si cum sa abordati aceasta problema este esentiala pentru utilizatorii care se baza pe aceste modele pentru rezultate precise si fiabile.

De ce LLM-urile sar peste instructiuni?

LLM-urile functioneaza prin citirea textului de intrare ca o secventa de tokeni. Tokenii sunt parti mici in care textul este impartit. Modelul proceseaza acesti tokeni unul dupa altul, de la inceput la sfarsit. Acest lucru inseamna ca instructiunile de la inceputul intrarii tind sa primeasca mai multa atentie. Instructiunile ulterioare pot primi mai putina atentie si pot fi ignorate.

Acest lucru se intampla pentru ca LLM-urile au o capacitate de atentie limitata. Atentia este mecanismul pe care il folosesc modelele pentru a decide care parti ale intrarii sunt esentiale atunci cand genereaza raspunsuri. Atunci cand intrarea este scurta, atentia functioneaza bine. Dar atentia devine mai slaba pe masura ce intrarea devine mai lunga sau instructiunile devin complexe. Acest lucru slabeste focalizarea pe parti ulterioare, cauzand sarirea peste instructiuni.

În plus, multe instructiuni deodată cresc complexitatea. Atunci cand instructiunile se suprapun sau sunt in conflict, modelele pot deveni confuse. Ele pot incerca sa raspunda la tot, dar pot produce raspunsuri vagi sau contradictorii. Acest lucru duce adesea la omiterea unor instructiuni.

LLM-urile impart si unele limite umane. De exemplu, oamenii pot pierde focusul atunci cand citesc texte lungi sau repetitive. La fel, LLM-urile pot uita instructiunile ulterioare pe masura ce proceseaza mai multi tokeni. Aceasta pierdere a focusului face parte din proiectarea modelului si limitele sale.

Un alt motiv este modul in care LLM-urile sunt antrenate. Ele văd multe exemple de instructiuni simple, dar mai putine instructiuni complexe, cu multi pasi. Din cauza acestui fapt, modelele tind sa prefere urmarea instructiunilor mai simple, care sunt mai comune in datele de antrenare. Acest bias le face sa sară peste instructiunile complexe. De asemenea, limitele de tokeni restricționează cantitatea de intrare pe care modelul o poate procesa. Atunci cand intrarile depășesc aceste limite, instructiunile dincolo de limita sunt ignorate.

Exemplu: Presupunem ca oferiti unui LLM cinci instructiuni intr-un singur prompt. Modelul se poate concentra în principal pe primele doua instructiuni și poate ignora parțial sau complet ultimele trei. Acest lucru afectează direct modul în care modelul procesează tokenii secvențial și limitele sale de atenție.

Cum LLM-urile gestionează instructiunile secvențiale pe baza descoperirilor SIFo 2024

Studiile recente au examinat cu atenție modul în care LLM-urile urmează mai multe instructiuni oferite una dupa alta. Una dintre studiile importante este Benchmark-ul de urmărire a instructiunilor secvențiale (SIFo) 2024. Acest benchmark testează modelele pe sarcini care necesită finalizarea secvențială a instructiunilor, cum ar fi modificarea textului, răspunsurile la întrebări, matematica și respectarea regulilor de securitate. Fiecare instructiune din secvență depinde de finalizarea corectă a instructiunii anterioare. Acest abordaj ajută la verificarea dacă modelul a urmat întreaga secvență corespunzător.

Rezultatele din SIFo arată că chiar și cele mai bune LLM-uri, cum ar fi GPT-4 și Claude-3, adesea găsesc dificil să finalizeze toate instructiunile corect. Acest lucru este mai ales valabil atunci când instructiunile sunt lungi sau complicate. Cercetarea subliniază trei probleme principale cu care se confruntă LLM-urile în urmărirea instructiunilor:

Înțelegerea: Înțelegerea completă a fiecărei instructiuni.

Raționamentul: Conectarea logică a mai multor instructiuni pentru a menține răspunsul clar.

Ieșirea fiabilă: Producerea de răspunsuri complete și precise, care acoperă toate instructiunile oferite.

Tehnici precum ingineria promptului și ajustarea fină ajută la îmbunătățirea modului în care modelele urmează instructiunile. Cu toate acestea, aceste metode nu rezolvă complet problema saririi peste instructiuni. Utilizarea învățării prin întărire cu feedback uman (RLHF) îmbunătățește și mai mult capacitatea modelului de a răspunde corespunzător. Încă, modelele au dificultăți atunci când instructiunile necesită multe pași sau sunt foarte complexe.

Studiul arată și că LLM-urile funcționează cel mai bine atunci când instructiunile sunt simple, clar separate și bine organizate. Atunci când sarcinile necesită lanțuri lungi de raționament sau multe pași, acuratețea modelului scade. Aceste constatări ajută la sugestii pentru utilizarea mai bună a LLM-urilor și subliniază nevoia de a construi modele mai puternice care pot urma cu adevărat instructiunile una după alta.

De ce LLM-urile sar peste instructiuni: Provocări tehnice și considerații practice

LLM-urile pot sări peste instructiuni din cauza mai multor factori tehnici și practici, înrădăcinați în modul în care procesează și codifică textul de intrare.

Atenție limitată și diluare a informației

LLM-urile se bazează pe mecanisme de atenție pentru a atribui importanță diferitelor părți ale intrării. Atunci când prompturile sunt concise, atenția modelului este focalizată și eficientă. Cu toate acestea, pe măsură ce promptul crește în lungime sau devine mai repetitiv, atenția devine mai diluată, iar tokenii sau instructiunile ulterioare primesc mai puțină atenție, ceea ce crește probabilitatea ca acestea să fie ignorate. Acest fenomen, cunoscut sub numele de diluare a informației, este deosebit de problematic pentru instructiunile care apar târziu într-un prompt. În plus, modelele au limite fixe de tokeni (de exemplu, 2048 de tokeni); orice text dincolo de această limită este truncat și ignorat, ceea ce face ca instructiunile de la sfârșit să fie sărite complet.

Complexitatea și ambiguitatea ieșirii

LLM-urile pot lupta cu generarea de răspunsuri clare și complete atunci când se confruntă cu instructiuni multiple sau contradictorii. Modelul poate produce răspunsuri parțiale sau vagi pentru a evita contradicții sau confuzii, efectiv omitând unele instructiuni. Ambiguitatea în ceea ce privește modul în care sunt formulate instructiunile ridică, de asemenea, provocări: prompturi neclare sau imprecise fac dificilă pentru modelul să determine acțiunile intenționate, ceea ce crește riscul de a sări sau de a interpreta greșit părți ale intrării.

Sensibilitatea la designul și formatul promptului

Structura și formularea prompturilor joacă, de asemenea, un rol critic în urmărirea instructiunilor. Cercetările arată că chiar și modificări mici în ceea ce privește modul în care sunt scrise sau formate instructiunile pot avea un impact semnificativ asupra capacității modelului de a urma aceste instructiuni.

Prompturile prost structurate, lipsite de separare clară, puncte sau numerotare, fac dificilă pentru model să distingă între pași, ceea ce crește șansa de a omite sau de a combina instructiuni. Reprezentarea internă a promptului de către model este foarte sensibilă la aceste variații, ceea ce explică de ce ingineria promptului (reformularea sau restructurarea prompturilor) poate îmbunătăți substanțial urmărirea instructiunilor, chiar dacă conținutul subiacent rămâne același.

Cum să remediați sarirea peste instructiuni în LLM-uri

Îmbunătățirea capacității LLM-urilor de a urma instructiunile în mod precis este esențială pentru producerea de rezultate fiabile și precise. Următoarele practici recomandate ar trebui luate în considerare pentru a minimiza sarirea peste instructiuni și a îmbunătăți calitatea răspunsurilor generate de IA:

Împărțirea sarcinilor în părți mai mici

Prompturile lungi sau cu mai mulți pași ar trebui împărțite în segmente mai mici și mai focalizate. Oferirea unei sau a două instructiuni deodată permite modelului să mențină o atenție mai bună și reduce probabilitatea de a omite pași.

Exemplu

În loc de a combina toate instructiunile într-un singur prompt, cum ar fi “Rezuma textul, enumera punctele principale, sugerează îmbunătățiri și tradu în franceză”, fiecare instructiune ar trebui prezentată separat sau în grupuri mici.

Formatarea instructiunilor cu liste numerotate sau puncte

Organizarea instructiunilor cu formatări explicite, cum ar fi liste numerotate sau puncte, ajută la indicarea faptului că fiecare element este o sarcină individuală. Această claritate crește șansa ca răspunsul să abordeze toate instructiunile.

Exemplu

  • Rezuma următorul text.
  • Enumera punctele principale.
  • Sugerează îmbunătățiri.

O astfel de formatare oferă indicii vizuale care ajută modelul să recunoască și să separe sarcinile distincte dintr-un prompt.

Instructiunile ar trebui să fie explicite și neambigue

Este esențial ca instructiunile să specifice clar necesitatea de a finaliza fiecare pas. Limbajul ambiguu sau vag ar trebui evitat. Promptul ar trebui să indice în mod explicit că niciun pas nu poate fi sărit.

Exemplu

“Vă rugăm să finalizați toate cele trei sarcini de mai jos. Sarirea peste pași nu este acceptabilă.”

Astfel de declarații directe reduc confuzia și încurajează modelul să ofere răspunsuri complete.

Utilizarea prompturilor separate pentru sarcini critice

Fiecare instructiune ar trebui trimisă ca un prompt individual pentru sarcini unde acuratețea și completețea sunt critice. Deși această abordare poate crește timpul de interacțiune, îmbunătățește semnificativ probabilitatea de a obține ieșiri complete și precise. Această metodă asigură că modelul se concentrează în întregime pe o sarcină deodată, reducând riscul de a omite instructiuni.

Strategii avansate pentru a echilibra completețea și eficiența

Așteptarea unui răspuns după fiecare instructiune poate fi consumatoare de timp pentru utilizatori. Pentru a îmbunătăți eficiența, menținând în același timp claritatea și reducând instructiunile sărite, pot fi utilizate următoarele tehnici avansate de promptare:

Gruparea instructiunilor cu formatări clare și etichete explicite

Mai multe instructiuni legate pot fi combinate într-un singur prompt, dar fiecare ar trebui separată folosind numerotare sau titluri. Promptul ar trebui să instruiască modelul să răspundă la toate instructiunile în întregime și în ordine.

Exemplu de prompt

Vă rugăm să finalizați toate sarcinile de mai jos cu atenție, fără a sări peste niciuna:

  1. Rezumați textul de mai jos.
  2. Enumerați punctele principale din rezumat.
  3. Sugerați îmbunătățiri pe baza punctelor principale.
  4. Traduți textul îmbunătățit în franceză.

Prompturi în stilul lanțului de gândire

Prompturile în stilul lanțului de gândire îl îndrumă pe model să raționeze prin fiecare sarcină înainte de a oferi un răspuns. Încurajarea modelului să proceseze instructiunile secvențial în cadrul unui singur răspuns ajută la asigurarea faptului că niciun pas nu este omis, reducând astfel șansa de a sări peste instructiuni și îmbunătățind completețea.

Exemplu de prompt

Citiți textul de mai jos și faceți următoarele sarcini în ordine. Arătați-vă munca în mod clar:

  • Rezumați textul.
  • Identificați punctele principale din rezumat.
  • Sugerați îmbunătățiri pentru text.
  • Traduți textul îmbunătățit în franceză.

Vă rugăm să răspundeți la toate sarcinile în întregime și separat, într-un singur răspuns.

Adăugarea de instructiuni de finalizare și reminder-uri

În mod explicit, amintiți modelului să:

  • “Răspundeți la fiecare sarcină în întregime.”
  • “Nu săriți peste nicio instructiune.”
  • “Separați-vă răspunsurile în mod clar.”

Astfel de reminder-uri ajută modelul să se concentreze pe completețea sarcinilor atunci când instructiunile multiple sunt combinate.

Testarea diferitelor modele și setări de parametri

Nu toate LLM-urile performează la fel în urmărirea mai multor instructiuni. Este recomandat să se evalueze diverse modele pentru a identifica cele care excelează în sarcini cu mai mulți pași. În plus, ajustarea parametrilor, cum ar fi temperatura, tokenii maximi și prompturile sistemului, poate îmbunătăți și mai mult focalizarea și completețea răspunsurilor. Testarea acestor setări ajută la personalizarea comportamentului modelului în funcție de cerințele specifice sarcinii.

Ajustarea fină a modelelor și utilizarea unor instrumente externe

Modelele ar trebui ajustate fin pe seturi de date care includ instructiuni secvențiale sau cu mai mulți pași, pentru a îmbunătăți urmărirea instructiunilor. Tehnici precum RLHF pot îmbunătăți și mai mult urmărirea instructiunilor.

Pentru cazuri de utilizare avansate, integrarea unor instrumente externe, cum ar fi API-uri, plugin-uri specifice sarcinilor sau sisteme de generare augmentată cu recuperare (RAG), poate oferi context și control suplimentar, îmbunătățind astfel fiabilitatea și acuratețea ieșirilor.

Concluzia

LLM-urile sunt instrumente puternice, dar pot sări peste instructiuni atunci când prompturile sunt lungi sau complexe. Acest lucru se întâmplă din cauza modului în care ele citesc intrările și focalizează atenția. Instructiunile ar trebui să fie clare, simple și bine organizate pentru a obține rezultate mai bune și mai fiabile.

Prompturile separate pot îmbunătăți acuratețea pentru sarcini critice, deși ele consumă mai mult timp. În plus, metodele avansate de promptare, cum ar fi lanțul de gândire și formatarea clară, ajută la echilibrarea vitezei și preciziei. De asemenea, testarea diferitelor modele și ajustarea fină pot îmbunătăți rezultatele. Aceste idei vor ajuta utilizatorii să obțină răspunsuri consistente și complete, făcând instrumentele de IA mai utile în munca reală.

Dr. Assad Abbas, un profesor asociat titular la Universitatea COMSATS Islamabad, Pakistan, a obținut doctoratul de la Universitatea de Stat din Dakota de Nord, USA. Cercetările sale se axează pe tehnologii avansate, inclusiv calculul în cloud, fog și edge, analiza datelor mari și inteligența artificială. Dr. Abbas a făcut contribuții substanțiale prin publicații în reviste științifice și conferințe reputabile. El este, de asemenea, fondatorul MyFastingBuddy.