Prompt engineering

Abordarea halucinațiilor în modelele lingvistice mari: O analiză a tehnicilor de ultimă generație

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Modelele lingvistice mari (LLM) precum GPT-4, PaLM și Llama au deblocat avansuri remarcabile în capacitățile de generare a limbajului natural. Cu toate acestea, o provocare persistentă care limitează fiabilitatea și implementarea lor sigură este tendința de a halucina – generarea de conținut care pare coerent, dar este incorect din punct de vedere factual sau nu are legătură cu contextul de intrare.

Pe măsură ce LLM-urile continuă să crească în putere și să devină mai ubiquite în aplicații din lumea reală, abordarea halucinațiilor devine imperativă. Acest articol oferă o analiză cuprinzătoare a tehnicilor de ultimă generație introduse de cercetători pentru a detecta, cuantifica și atenua halucinațiile în LLM-urile.

Înțelegerea halucinațiilor în LLM

Halucinația se referă la inexactități factuale sau fabulații generate de LLM-uri care nu sunt bazate pe realitate sau pe contextul furnizat. Exemple includ:

  • Inventarea de detalii biografice sau evenimente care nu sunt dovedite în materialul sursă atunci când se generează text despre o persoană.
  • Furnizarea de sfaturi medicale defectuoase prin confabularea efectelor secundare ale medicamentelor sau procedurilor de tratament.
  • Fabricarea de date, studii sau surse inexistente pentru a susține o afirmație.

Acest fenomen apare deoarece LLM-urile sunt antrenate pe cantități mari de date textuale online. În timp ce acest lucru le permite să obțină capacități lingvistice puternice, înseamnă și că ele învață să extrapoleze informații, să facă salturi logice și să umple goluri într-un mod care pare convingător, dar poate fi înșelător sau eronat.

Factorii cheie responsabili pentru halucinații includ:

  • Generalizarea pattern-urilor – LLM-urile identifică și extind pattern-uri în datele de antrenare, care nu se generalizează întotdeauna bine.
  • Cunoașterea învechită – Antrenamentul static împiedică integrarea noilor informații.
  • Ambiguitatea – Prompt-urile vagi permit încadrarea în ipoteze incorecte.
  • Prejudecățile – Modelele perpetuează și amplifică perspective înclinate.
  • Lipsa de fundamentare – Lipsa de înțelegere și raționament înseamnă că modelele generează conținut pe care nu îl înțeleg pe deplin.

Abordarea halucinațiilor este critică pentru implementarea sigură și de încredere în domenii sensibile precum medicina, dreptul, finanele și educația, unde generarea de informații incorecte poate duce la prejudicii.

Taxonomia tehnicilor de atenuare a halucinațiilor

Cercetătorii au introdus diverse tehnici pentru a combate halucinațiile în LLM-uri, care pot fi categorizate în:

1. Ingineria prompt-urilor

Acest lucru implică crearea atentă a prompt-urilor pentru a oferi context și a ghida LLM-ul către răspunsuri factuale și bazate pe realitate.

  • Augmentarea recuperării – Recuperarea dovezilor externe pentru a fundamenta conținutul.
  • Bucle de feedback – Furnizarea iterativă a feedback-ului pentru a rafina răspunsurile.
  • Reglarea prompt-urilor – Ajustarea prompt-urilor în timpul finisării pentru comportamente dorite.

2. Dezvoltarea modelului

Crearea de modele inerent mai puțin predispuse la halucinații prin schimbări arhitecturale.

  • Strategii de decodare – Generarea textului în moduri care cresc fidelitatea.
  • Fundamentarea cunoașterii – Integrarea bazelor de cunoaștere externe.
  • Funcții de pierdere noi – Optimizarea pentru fidelitate în timpul antrenamentului.
  • Finisarea supravegheată – Utilizarea datelor etichetate de om pentru a îmbunătăți factualitatea.

Următorul, vom face o analiză a tehnicilor remarcabile din fiecare abordare.

Tehnici remarcabile de atenuare a halucinațiilor

Generarea augmentată cu recuperare

Generarea augmentată cu recuperare îmbunătățește LLM-urile prin recuperarea și condiționarea generării de text pe documente de dovadă externe, mai degrabă decât să se bazeze numai pe cunoașterea implicită a modelului. Acest lucru fundamentează conținutul în informații verificabile și actualizate, reducând halucinațiile.

Tehnici remarcabile includ:

  • RAG – Utilizează un modul de recuperare care oferă pasaje relevante pentru un model seq2seq pentru a genera din ele. Ambele componente sunt antrenate de la capăt.
  • RARR – Utilizează LLM-uri pentru a cerceta afirmații neatribuite în textul generat și a le revizui pentru a se alinia cu dovezile recuperate.
  • Recuperarea cunoașterii – Validează generările nesigure utilizând cunoașterea recuperată înainte de a produce text.
  • LLM-Augmenter – Caută iterativ cunoașterea pentru a construi lanțuri de dovezi pentru prompt-urile LLM.

Feedback și raționament

Utilizarea feedback-ului iterativ natural sau a raționamentului auto-permit LLM-urilor să rafineze și să îmbunătățească ieșirile inițiale, reducând halucinațiile.

CoVe utilizează o tehnică de verificare în lanț. LLM-ul proiectează inițial un răspuns la întrebarea utilizatorului. Apoi, generează posibile întrebări de verificare pentru a verifica răspunsul său, pe baza încrederii sale în diverse afirmații făcute. De exemplu, pentru un răspuns care descrie un nou tratament medical, CoVe poate genera întrebări precum “Care este rata de eficacitate a tratamentului?”, “A primit aprobarea regulamentară?”, “Care sunt efectele secundare posibile?”. În mod crucial, LLM-ul încearcă apoi să răspundă independent la aceste întrebări de verificare, fără a fi influențat de răspunsul său inițial. Dacă răspunsurile la întrebările de verificare contrazic sau nu pot susține afirmații făcute în răspunsul original, sistemul identifică acestea ca halucinații probabile și rafinează răspunsul înainte de a-l prezenta utilizatorului.

DRESS se concentrează pe ajustarea LLM-urilor pentru a se alinia mai bine cu preferințele umane prin feedback lingvistic natural. Abordarea permite utilizatorilor non-experți să furnizeze critici libere pe generările modelului, precum “Efectele secundare menționate par exagerate” sau instrucțiuni de rafinare precum “Vă rog să discutați și despre eficiența costurilor”. DRESS utilizează învățarea prin întărire pentru a antrena modelele să genereze răspunsuri condiționate de astfel de feedback care se aliniază mai bine cu preferințele umane. Acest lucru îmbunătățește interacțiunea, reducând în același timp afirmațiile nerealiste sau nesuportate.

MixAlign se ocupă de situațiile în care utilizatorii pun întrebări care nu corespund direct cu trecerile de dovezi recuperate de sistem. De exemplu, un utilizator poate întreba “Se va înrăutăți poluarea în China?” în timp ce trecerile recuperate discută tendințele globale de poluare. Pentru a evita halucinațiile cu context insuficient, MixAlign clarifică în mod explicit cu utilizatorul atunci când este nesigur cum să relateze întrebarea sa la informațiile recuperate. Acest mecanism “omul în buclă” permite obținerea feedback-ului pentru a obține și a contextualiza corect dovezi, prevenind răspunsurile nefundamentate.

Tehnica Auto-reflectare antrenează LLM-urile să evalueze, să ofere feedback și să rafineze iterativ propriile răspunsuri utilizând o abordare multi-task. De exemplu, dat fiind un răspuns generat pentru o întrebare medicală, modelul învață să evalueze acuratețea factuală, să identifice orice afirmații contradictorii sau nesuportate și să le editeze prin recuperarea cunoașterii relevante. Prin predarea LLM-urilor acestei bucle de feedback de auto-verificare și rafinare, abordarea reduce halucinația oarbă.

Reglarea prompt-urilor

Reglarea prompt-urilor permite ajustarea prompt-urilor instructive furnizate LLM-urilor în timpul finisării pentru comportamente dorite.

Metoda SynTra utilizează o sarcină de rezumat sintetic pentru a minimiza halucinația înainte de a transfera modelul la seturi de date reale de rezumat. Sarcina sintetică oferă pasaje de intrare și solicită modelului să le rezume prin recuperare, fără abstracție. Acest lucru antrenează modelele să se bazeze complet pe conținutul sursă, mai degrabă decât să halucineze informații noi în timpul rezumatului. SynTra se dovedește a reduce problemele de halucinație atunci când modelele finisate sunt implementate pe sarcini țintă.

UPRISE antrenează un recuperator universal de prompt care oferă prompt-ul moale optimal pentru învățarea cu puține exemple pe sarcini nevizionate. Prin recuperarea prompt-urilor eficiente ajustate pe o serie diversă de sarcini, modelul învață să generalizeze și să se adapteze la noi sarcini pentru care nu are exemple de antrenament. Acest lucru îmbunătățește performanța fără a necesita ajustări specifice sarcinii.

Arhitecturi de modele noi

FLEEK este un sistem axat pe asistarea verificatorilor și validatorilor umani. Acesta identifică în mod automat afirmații factuale verificabile făcute într-un text dat. FLEEK transformă aceste afirmații în întrebări, recuperează dovezi legate din baze de cunoaștere și oferă aceste informații contextuale validatorilor umani pentru a verifica eficient acuratețea documentului și a identifica nevoile de revizuire.

Abordarea CAD de decodare reduce halucinația în generarea limbajului prin decodarea conștientă de context. În mod specific, CAD amplifică diferențele dintre distribuția de ieșire a LLM-ului atunci când este condiționat de un context versus generat în mod necondiționat. Acest lucru descurajează contradicția dovezilor contextuale, îndreptând modelul către generări fundamentate.

DoLA atenuează halucinațiile factuale prin contrastarea logitelor din straturi diferite ale rețelelor neuronale transformator. Deoarece cunoașterea factuală tinde să fie localizată în anumite straturi medii, amplificarea semnalelor din acele straturi factuale prin contrastarea logitelor DoLA reduce generările factuale incorecte.

Cadrul THAM introduce un termen de regularizare în timpul antrenamentului pentru a minimiza informația mutuală dintre intrări și ieșiri halucinate. Acest lucru ajută la creșterea dependenței modelului de contextul de intrare dat, mai degrabă decât de imaginația neîncătușată, reducând halucinațiile oarbe.

Fundamentarea cunoașterii

Fundamentarea generărilor LLM în cunoașterea structurată previne speculațiile și fabulațiile neîngrădite.

Modelul RHO identifică entități într-un context conversațional și le leagă de o bază de cunoaștere (KG). Fapte și relații legate de aceste entități sunt recuperate din KG și integrate în reprezentarea contextului oferit LLM-ului. Acest context îmbogățit cu cunoaștere direcționează răspunsurile, reducând halucinațiile în dialog prin menținerea răspunsurilor legate de fapte fundamentate despre entitățile sau evenimentele menționate.

HAR creează seturi de antrenament contrafactuale care conțin halucinații generate de model pentru a învăța mai bine fundamentarea. Dat fiind un pasaj factual, modelele sunt promptate să introducă halucinații sau distorsionări, generând o versiune contrafactuală alterată. Finisarea pe aceste date forțează modelele să se bazeze mai bine pe sursele factuale originale, reducând improvizația.

Finisarea supravegheată

  • Coach – Un cadru interactiv care răspunde la întrebările utilizatorului, dar și solicită corecții pentru a se îmbunătăți.
  • R-Tuning – Ajustarea refuzului conștient identifică întrebări nesuportate prin goluri de cunoaștere în datele de antrenament.
  • TWEAK – O metodă de decodare care clasifică generările pe baza cât de bine ipotezele susțin faptele de intrare.

Provocări și limitări

În ciuda progresului promițător, există încă câteva provocări cheie în atenuarea halucinațiilor:

  • Tehnicile adesea fac compromisuri între calitate, coerență și creativitate pentru veracitate.
  • Dificultatea în evaluarea riguroasă dincolo de domenii limitate. Metricele nu capturează toate nuanțele.
  • Multe metode sunt computațional costisitoare, necesitând recuperări extinse sau auto-raționament.
  • Depind puternic de calitatea datelor de antrenament și de sursele de cunoaștere externe.
  • Greu de garantat generalizabilitatea pe domenii și modalități.
  • Rădăcinile fundamentale ale halucinației, cum ar fi extrapolarea excesivă, rămân nesoluționate.

Abordarea acestor provocări necesită probabil o abordare multi-stratificată care combină îmbunătățirile datelor de antrenament, îmbunătățirile arhitecturale ale modelului, pierderile care cresc fidelitatea și tehnicile din timpul inferenței.

Drumul înainte

Atenuarea halucinațiilor pentru LLM-uri rămâne o problemă deschisă de cercetare cu progres activ. Câteva direcții promițătoare pentru viitor includ:

  • Tehnici hibride: Combinarea abordărilor complementare precum recuperarea, fundamentarea cunoașterii și feedback-ul.
  • Modelarea cauzalității: Îmbunătățirea înțelegerii și raționamentului.
  • Integrarea cunoașterii online: Menținerea cunoașterii despre lume actualizată.
  • Verificarea formală: Furnizarea garanțiilor matematice cu privire la comportamentul modelului.
  • Interpretabilitatea: Construirea transparenței în tehnici de atenuare.

Pe măsură ce LLM-urile continuă să prolifereze în domenii cu miză ridicată, dezvoltarea unor soluții robuste pentru a reduce halucinațiile va fi cheia pentru a asigura implementarea lor sigură, etică și de încredere. Tehnicile prezentate în acest articol oferă o imagine de ansamblu a tehnicilor propuse până acum, unde mai multe provocări deschise de cercetare rămân. În general, există o tendință pozitivă către îmbunătățirea factualității modelului, dar progresul continuă necesită abordarea limitărilor și explorarea unor noi direcții, cum ar fi cauzalitatea, verificarea și metodele hibride. Cu eforturi diligente din partea cercetătorilor din diverse discipline, visul modelelor lingvistice puternice și de încredere poate deveni realitate.

Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.