Unghiul lui Anderson

O metodă “Zen” pentru a preveni halucinațiile modelelor de limbaj

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image: A robot sits in front of a laptop and a 'Eureka!' light-bulb lights up over its head. Z-Image, Qwen Edit (509), and Firefly V3

Spunând ChatGPT să verifice o răspuns aleatoriu înainte de a rezolva o problemă reală îl face să gândească mai mult și să obțină răspunsul corect mai des – chiar dacă răspunsul anterior “aleator” nu are nimic de-a face cu întrebarea dvs.

 

Un articol interesant nou din China a dezvoltat o metodă foarte ieftină pentru a preveni modelele de limbaj, cum ar fi ChatGPT, să halucineze, și pentru a îmbunătăți calitatea răspunsurilor: faceți modelul să verifice răspunsul la o întrebare complet nepertinentă mai întâi:

Un exemplu de întrebare nepertinentă care poate “elibera mintea” unui LLM și să-l ajute să se concentreze asupra unei întrebări reale ulterioare. Sursă

Acest palmă Zen este o modalitate incredibil de ieftină de a îmbunătăți performanța, comparativ cu alte metode mai complexe, cum ar fi reglarea fină, crearea de prompturi și eșantionarea paralelă, și funcționează atât pentru modele deschise, cât și pentru cele cu sursă închisă, ceea ce indică descoperirea unei trăsături fundamentale comune mai multor arhitecturi LLM (și nu o particularitate fragilă specifică unor materiale de antrenament sau metode specifice).

Autorii descriu economiile de scară posibile prin îmbunătățirea ieșirii în acest mod spartan*:

‘Pentru a implementa cu cunoștințe minime anterioare, VF doar necesită un răspuns aleatoriu sau trivial în prompt. Procesul de verificare se dovedește a avea mult mai puține tokeni de ieșire decât o cale CoT obișnuită, [uneori] chiar și fără un proces de verificare explicit, astfel [necesitând] foarte [puțin] calcul suplimentar la momentul testării.’

În testele efectuate, această abordare – denumită Verificare-Întâi (VF) – a reușit să îmbunătățească răspunsurile într-o varietate de sarcini, inclusiv raționament matematic, pe platforme deschise și comerciale.

O parte a motivului pentru care această tehnică funcționează poate fi legată de modul în care modelele de limbaj absorb și își apropriază tendințele din psihologia umană, astfel încât o întrebare directă poate face modelul “defensiv” și “nervos”, în timp ce o solicitare de a verifica munca altcuiva nu angajează aceste “instincte de supraviețuire”.

Idea de bază este că verificarea unui răspuns necesită mai puțin efort decât generarea unuia de la zero și poate declanșa o cale de raționament diferită care completează lanțul standard de gândire.

Solicitarea modelului de a critica un răspuns dat (adică, un răspuns pe care modelul nu l-a creat) poate activa, de asemenea, o formă de gândire critică care ajută la evitarea încrederii excesive în primele impresii ale modelului.

Lucrarea caracterizează procesul în termeni de cale de raționament inversă:

Începând de la un răspuns propus și raționând înapoi către întrebare poate expune scurtături sau insight-uri care sunt mai greu de găsit atunci când se raționează înainte de la problema în sine. Această 'cale inversă' poate urma o traiectorie mai simplă și oferă informații complementare raționamentului standard lanț de gândire.

Începând de la un răspuns propus și raționând înapoi către întrebare poate expune scurtături sau insight-uri care sunt mai greu de găsit atunci când se raționează înainte de la problema în sine. Această ‘cale inversă’ poate urma o traiectorie mai simplă și oferă informații complementare raționamentului standard lanț de gândire.

Cercetătorii au concretizat, de asemenea, conceptul central în Iter-VF, o metodă de scalare a timpului de testare secvențială care rafinează răspunsurile în mod iterativ, evitând problema de acumulare a erorilor comună strategiilor de auto-corectare găsite în arhitecturile LLM.

Noua lucrare este intitulată Cererea LLM-urilor de a verifica mai întâi este aproape un prânz gratuit și provine de la doi cercetători de la Departamentul de Inginerie Electronică de la Universitatea Tsinghua din Beijing.

Metodă

Ideea centrală din noua lucrare este de a inversa fluxul obișnuit de raționament în modelele de limbaj. În loc de a cere modelului să rezolve o problemă de la zero, i se oferă mai întâi un răspuns candidat (adesea incorect sau arbitrar) și i se cere să verifice dacă acel răspuns are sens.

Acest lucru îl determină pe model să raționeze în sens invers, lucrând înapoi de la răspunsul propus către întrebare. Odată ce verificarea este completă, modelul procedează apoi la rezolvarea problemei originale, ca de obicei.

Această inversare, afirmă lucrarea, reduce greșelile neglijente și încurajează un mod de raționament mai reflexiv, ajutând LLM-ul să descopere structuri ascunse și să evite ipoteze înșelătoare.

În exemplele de mai jos, chiar și solicitarea modelului de a verifica o presupunere evident greșită, cum ar fi ’10’ , poate ajuta la recuperarea de la logica defectuoasă și la depășirea promptării standard lanț de gândire:

Solicitarea modelului de a verifica un răspuns presupus mai întâi îl ajută să detecteze incoerențe și să se angajeze mai atent cu problema. În acest exemplu, abordarea standard conduce la o soluție fluentă, dar incorectă, în timp ce promptarea Verificare-Întâi declanșează o structură logică mai clară și rezultatul corect.

Solicitarea modelului de a verifica un răspuns presupus mai întâi îl ajută să detecteze incoerențe și să se angajeze mai atent cu problema. În acest exemplu, abordarea standard conduce la o soluție fluentă, dar incorectă, în timp ce promptarea Verificare-Întâi declanșează o structură logică mai clară și rezultatul corect.

În ceea ce privește multe probleme reale, nu este ușor să se ofere o presupunere pentru model, mai ales atunci când sarcina este deschisă, cum ar fi scrierea de cod sau apelarea unei API. Prin urmare, pentru a se adapta mai bine, metoda oferă mai întâi cel mai bun răspuns, ca de obicei, și apoi îl hrănește înapoi în formatul Verificare-Întâi. În acest fel, modelul verifică și îmbunătățește propriul său output:

Atunci când modelul este solicitat să verifice propriul său output anterior, el detectează defectul din logica sa și rescrie soluția corect. Promptarea Verificare-Întâi îl ajută să se concentreze asupra erorii specifice, mai degrabă decât să repete aceeași greșeală.

Atunci când modelul este solicitat să verifice propriul său output anterior, el detectează defectul din logica sa și rescrie soluția corect. Promptarea Verificare-Întâi îl ajută să se concentreze asupra erorii specifice, mai degrabă decât să repete aceeași greșeală.

Această abordare constituie metoda Iter-VF menționată anterior. Modelul repetă acest ciclu, rafinând răspunsul de fiecare dată, fără a necesita reantrenare sau unelte personalizate. În contrast cu alte strategii de auto-corectare, care pot acumula context pe parcursul iterațiilor, Iter-VF ia în considerare doar răspunsul cel mai recent la fiecare pas. Acestă abordare Markoviană evită confuzia care se acumulează din lanțurile prelungite de raționament – o slăbiciune, în special, dăunătoare pentru auto-corectare.

Date și teste

Autorii evaluează metoda în patru domenii: sarcini de raționament general, unde VF este inițializat cu o presupunere trivială; sarcini cu termen limită, unde Iter-VF este comparat cu strategii rivale de scalare; probleme deschise, cum ar fi codificarea și apelarea API-urilor, unde VF utilizează răspunsul anterior al modelului; și modele comerciale cu sursă închisă, unde pașii interni de raționament sunt inaccesibili.

Pentru a testa metoda, cercetătorii au utilizat trei benchmark-uri de raționament: GSM8K și MATH500 pentru probleme matematice; și GPQA-Diamond pentru întrebări științifice de nivel universitar.

În fiecare caz, modelul a primit fie o presupunere trivială, cum ar fi ‘1’ pentru răspunsuri numerice; fie o opțiune de alegere multiplă aleatorie, ca punct de plecare pentru verificare. Nu s-a adăugat nicio reglare specială sau cunoștințe anterioare, iar punctul de referință pentru comparație a fost promptarea standard lanț de gândire:

Testele au fost efectuate pe o gamă completă de modele Qwen2.5 și Llama3 reglate pentru instrucțiuni, de la 1B la 72B (parametri) în dimensiune. Modelele Qwen utilizate au fost Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct și Qwen2.5-72B-Instruct. Variantele Llama3 au fost Llama3.2-1B-Instruct, Llama3.2-3B-Instruct, Llama3.1-8B-Instruct și Llama3.3-70B-Instruct.

Îmbunătățirea de la promptarea Verificare-Întâi a rămas constantă pe parcursul tuturor dimensiunilor de model, cu câștiguri clare vizibile chiar și la 1B de parametri și continuând până la 72B:

Pe toate dimensiunile de model din familiile Qwen2.5 și Llama3, promptarea Verificare-Întâi a depășit constant promptarea standard lanț de gândire pe GSM8K, MATH500 și GPQA-Diamond.

Pe toate dimensiunile de model din familiile Qwen2.5 și Llama3, promptarea Verificare-Întâi a depășit constant promptarea standard lanț de gândire pe GSM8K, MATH500 și GPQA-Diamond.

Efectul s-a dovedit a fi mai puternic pe benchmark-urile matematice grele, cum ar fi GSM8K și MATH500, unde verificarea unui răspuns greșit a declanșat un raționament mai bun decât încercarea de a rezolva de la zero. Pe GPQA-Diamond, care se bazează mai mult pe cunoștințe stocate decât pe structură deductivă, avantajul a fost mai mic, dar constant.

Costul computațional al Verificării-Întâi a fost modest: în tabelul de mai jos, se poate vedea că generarea unei etape de verificare a adăugat aproximativ 20-50% mai multe tokeni de ieșire în comparație cu promptarea standard lanț de gândire:

Numărul mediu de tokeni de ieșire generați sub fiecare metodă de promptare, pe benchmark-urile GSM8K, MATH500 și GPQA.

Numărul mediu de tokeni de ieșire generați sub fiecare metodă de promptare, pe benchmark-urile GSM8K, MATH500 și GPQA.

În ciuda acestui fapt, costul suplimentar a rămas mult sub cel al strategiilor care necesită multiple completări eșantionate sau planificare recursivă.

În graficul de mai jos, se poate vedea cât de sensibilă este metoda la calitatea răspunsului presupus. Surprinzător, chiar și atunci când presupunerea este trivială (‘1’), neverosimilă (‘2025’) sau o opțiune de alegere multiplă aleatorie, Verificarea-Întâi depășește promptarea standard:

Câștiguri de acuratețe de la promptarea Verificare-Întâi, atunci când modelul primește răspunsuri triviale, neverosimile sau corecte pentru a le verifica pe GSM8K, MATH500 și GPQA.

Câștiguri de acuratețe de la promptarea Verificare-Întâi, atunci când modelul primește răspunsuri triviale, neverosimile sau corecte pentru a le verifica pe GSM8K, MATH500 și GPQA.

Îmbunătățirea a fost mai mare atunci când presupunerea a fost corectă; dar metoda a funcționat bine în orice caz, sugerând că beneficiile nu au fost determinate de informațiile din răspunsul presupus în sine, ci pur și simplu de actul de verificare.

Iter-VF a fost comparat, de asemenea, cu patru strategii de scalare la momentul testării care funcționează fără reantrenare sau adaptare specifică sarcinii. În Auto-Corectare, modelul a fost solicitat să-și revizuiască răspunsurile prin reflectarea asupra pașilor de raționament anteriori; în PHP, răspunsurile anterioare au fost anexate la intrare ca indicii contextuale, deși nu s-au oferit instrucțiuni despre cum să le utilizeze.

În plus, în Coerență Internă, au fost eșantionate multiple căi de raționament și răspunsul final a fost ales prin vot majoritar; și, în final, în Cel Mai Bun din N, au fost generate mai multe ieșiri independent și clasificate utilizând un prompt de verificare, cu răspunsul cu cel mai înalt scor selectat.

Au fost implementate două variante ale Iter-VF: una inițializată cu o presupunere trivială (‘1’) și alta inițializată cu un output standard CoT:

Acuratețe și eficiență a tokenilor pe MATH500 sub bugete de ieșire crescânde, arătând că ambele variante ale Iter-VF depășesc toate punctele de referință pe scară de model.

Acuratețe și eficiență a tokenilor pe MATH500 sub bugete de ieșire crescânde, arătând că ambele variante ale Iter-VF depășesc toate punctele de referință pe scară de model.

Iter-VF a oferit rezultate mai bune decât toate celelalte metode atunci când computația disponibilă a fost scăzută, ceea ce autorii au atribuit modului în care verifică răspunsurile, și nu calității răspunsurilor inițiale (deși ambele variante VF și CoT au atins rapid aceeași acuratețe).

PHP a performant mai slab, chiar și atunci când a reutilizat răspunsuri anterioare ca indicii, probabil pentru că LLM-urile nu au exploatat bine aceste indicii.

În contrast cu PHP și Auto-Corectare, care acumulează context pe parcursul iterațiilor, Iter-VF ia în considerare doar răspunsul cel mai recent la fiecare pas. Acestă abordare Markoviană evită confuzia care se acumulează din lanțurile prelungite de raționament – o slăbiciune, în special, dăunătoare pentru Auto-Corectare.

Metodele paralele, cum ar fi Coerență Internă și Cel Mai Bun din N, au evitat această problemă, deși îmbunătățirile lor au fost mai lente și mai modeste.

(n.b. Secțiunea de rezultate, deși cuprinzătoare, este o lectură nefavorabilă și prolixă, și la acest punct vom trebui să trunchiem cea mai mare parte a acoperirii rămase, trimițând cititorul la articolul sursă pentru mai multe detalii).

Când a fost testat pe GPT-5 Nano și GPT-5 Mini, modele comerciale închise care ascund urma completă de raționament și returnează doar răspunsul final, Iter-VF a îmbunătățit performanța fără a se baza pe ieșiri intermediare. În tabelul de mai jos, putem vedea câștiguri pe ambele MATH500 și GPQA, confirmând că abordarea verifică-și-generează rămâne viabilă chiar și atunci când doar intrarea și răspunsul final sunt accesibile:

Acuratețe pe MATH500 și GPQA atunci când Iter-VF este aplicat la modele GPT-5 cu urme de raționament ascunse.

Acuratețe pe MATH500 și GPQA atunci când Iter-VF este aplicat la modele GPT-5 cu urme de raționament ascunse.

Concluzie

Deși noua lucrare se îndreaptă spre opacitate din secțiunea de rezultate înainte, descoperirea aparentă a unei trăsături fundamentale comune unei clase de modele AI este, în orice caz, o evoluție fascinantă. Oricine utilizează în mod regulat un LLM a dezvoltat, probabil, instinctiv, o serie de trucuri pentru a lucra în jurul slăbiciunilor modelului, pe măsură ce acestea devin evidente cu timpul, și un model emerge; și toți speră să găsească un “truc” la fel de aplicabil și generalizat ca acesta.

Una dintre cele mai mari probleme în implementarea și actualizarea unei ferestre de context într-un LLM pare a fi găsirea unui echilibru între reținerea progresului sesiunii și capacitatea de a ieși în direcții noi atunci când este necesar, fără a cădea în halucinații spurii sau ieșiri off-topic. În cazul prezentat de noua lucrare, vedem un exemplu de “apel de trezire” blând, dar insistent, care pare să re-focalizeze și să re-seteze LLM-ul fără pierderea contextului. Va fi interesant de văzut dacă proiectele ulterioare adaptează și evoluează metoda.

Cercetătorii subliniază mult economia noii metode – o considerație care ar fi avut un impact mult mai mic chiar și cu 12 luni în urmă. În zilele noastre, implicațiile AI-ului la scară hiperscală fac clar că economiile de resurse, odată considerate pedante, în era “cercetării pure”, devin acum cardinale și esențiale.

 

* Vă rugăm să observați că sunt constrâns să nu includ numărul obișnuit de citate din articol, deoarece standardul de engleză găsit în unele părți ale acestuia ar putea confunda cititorul. Prin urmare, am luat libertatea de a rezuma insight-uri cheie în schimb și mă refer la cititor spre articolul sursă pentru verificare.

Publicat pentru prima dată joi, 4 decembrie 2025

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai