Unghiul lui Anderson
Acordarea modelelor de limbaj a unui “buton de adevăr”

Adevărat sau vorbăreț: alege unul. O nouă metodă de antrenare permite utilizatorilor să spună chatbot-urilor exact cât de “faptice” să fie, transformând acuratețea într-un buton pe care poți să-l reglezi în sus sau în jos.
O nouă colaborare de cercetare între Statele Unite și China oferă ceva ce aproape toți utilizatorii de chatbot-uri ar aprecia: un “buton” virtual care spune botului dacă ar trebui să fie “vorbăreț” sau “adevărat”.
Sistemul a fost creat prin reglarea fină a unui model Mistral-7B pe date sintetice, astfel încât schema pentru o scară de “adevăr” să poată fi imprimată pe model. După această revizuire, modelul Mistral este capabil să controleze numărul de fapte dintr-un răspuns; cu cât valoarea “adevăr” dată de utilizator este mai mare, cu atât mai puține, dar mai sigure, vor fi răspunsurile.
La setări mai mici, răspunsul chatbot-ului devine ceea ce autorii articolului numesc “informativ”, adică va oferi un răspuns mai lung și va conține mai multe fapte; dar unele dintre aceste fapte pot fi halucinate.
Datele sintetice pe care sistemul a fost antrenat au folosit Wikipedia ca referință pentru un domeniu de test: fapte biografice reale despre oameni. Indiferent dacă se consideră că Wikipedia ar trebui să fie o sursă autorizată sau nu, valoarea lucrării constă în proiectarea oricărui sistem care poate limita tendința LLM-urilor de a oferi răspunsuri, chiar și atunci când nu au niciun răspuns de oferit.

Un exemplu din proiectul FactScore care a alimentat curarea setului de date pentru articolul pe care îl analizăm aici, folosind Wikipedia ca autoritate de referință pentru detalii biografice. Sursă
Autorii notează că contextele cu înaltă asigurare, cum ar fi domeniile medicale și juridice, necesită ieșiri conservatoare și fiabile din punct de vedere factual, în timp ce mulți alți utilizatori necesită un tip de ieșire mai ductil și creativ, interpretativ (de exemplu, scrierea discursivă și analiza academică, printre altele).
Ei observă*:
‘[Modelele LLM actuale] nu oferă nicio mecansim încorporat pentru controlul acestui compromis.
‘Deși utilizatorii pot încerca să ghideze comportamentul modelului cu prompturi precum “fi mai factual”, constatăm că modelele de frontieră nu se ajustează în mod fiabil ieșirile în răspuns la astfel de prompturi pentru această sarcină.
‘Pe FactScore, constatăm că modelele off-the-shelf adesea nu îndeplinesc nici măcar țintele moderate până la stricte. Această lacună motivează o alternativă controlabilă care permite utilizatorilor să solicite un anumit nivel de fapticitate și să facă modelul să ajusteze răspunsurile în consecință.’
Doar faptele
Pentru a înțelege articolul și soluțiile pe care le oferă, este necesar să revizuiești propria definiție a “informativității”. Autorii afirmă că cuantificarea unui răspuns “informativ” este egală cu “cantitatea de conținut susținut în ieșire, măsurată ca număr de declarații atomice validate, normalizate prin lungimea ieșirii”.
În altă parte, articolul afirmă mai simplu că informativitatea este “numărul total de fapte atomice din ieșire, indiferent dacă sunt corecte sau nu”.
Mai departe, cercetătorii notează că tendința LLM-urilor de a varia între acuratețe factuală și presupuneri subiective este o trăsătură foarte umană, și una documentată de diverse studii științifice*:
‘[Cunoștințele LLM-urilor] sunt inegal de fiabile: unele declarații sunt puternic susținute, în timp ce altele sunt speculative, învechite sau incerte. Generarea necesită decizia cu privire la cât de mult să spui și cu câtă prudență să spui, creând o tensiune între precizia factuală și informativitate.
‘Oamenii fac alegeri analoge: începând cu fapte de înaltă fiabilitate și adaugă detalii mai puțin sigure numai atunci când sunt solicitați.’
Deși experimentele au fost efectuate doar pe modelul de dimensiuni medii Mistral, principiile aplicate ar trebui să funcționeze la diverse scări și platforme, deoarece implică o cuantificare nouă a datelor, ca o adăugare la schema internă a LLM-ului; și o modificare de acest tip nu este specifică arhitecturii.
Articolul nou este intitulat Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation, și provine de la șapte cercetători de la Columbia University, New York University și NYU Shanghai.
Metodă și date
Abordarea nouă prezentată în articol este numită Generare controlată de fapticitate (FCG), și introduce un buton virtual care permite utilizatorilor să specifice cât de precis ar trebui să fie răspunsul unui chatbot. ‘În esență,’ articolul afirmă, ‘FCG îmbunătățește modelul cu un “buton” controlabil pentru fapticitate’.
Modelul ia atât o întrebare a utilizatorului, cât și un nivel de fapticitate dorit, apoi generează un răspuns care include doar informații pe care le consideră suficient de fiabile, în timp ce încearcă să fie cât mai detaliat posibil în cadrul acestei constrângeri de încredere.
Utilizând sistemul FactScore, ieșirea segmentată din întrebări de exemplu este evaluată pentru acuratețe, o calitate definită ca aderență la fapticitate:

Pipeline de date de antrenare pentru FCG: un model de limbaj generează inițial un răspuns, îl descompune în fapte atomice, le ordonează după încredere și le elimină pe cele mai puțin fiabile până când nivelul dorit de adevăr este atins. Sursă
Deoarece nu exista niciun set de date care să corespundă cerințelor FCG, autorii au creat unul sintetic, având modelul de limbaj GPT-4† care generează inițial un răspuns neconstrâns, apoi elimină “faptele cu cea mai mică încredere” până când răspunsul a atins un anumit nivel de acuratețe.
Lucrările anterioare au sugerat că antrenarea doar pe date de realitate ar putea face modelele mai puțin faptice, prin descurajarea lor de a oferi orice detalii suplimentare. Prin urmare, exemplele de antrenare FCG au fost editate minim, păstrând frazarea și ritmul modelului, în timp ce se reducea doar atât cât era necesar pentru a atinge ținta de încredere cerută.
Prin aplicarea acestui proces de editare la diverse niveluri de încredere țintă, de la 10% la un prag strict de 100%, a fost creat un set de date sintetice în care fiecare întrebare a fost asociată cu multiple răspunsuri filtrate.
În fiecare versiune, doar faptele considerate de model ca fiind suficient de fiabile pentru a atinge nivelul dorit de fapticitate au fost păstrate; aceste exemple au fost apoi utilizate ca date de antrenare pentru reglarea fină supravegheată.
Setul final de date a constat din 3.302 de triple (întrebare, control, răspuns) pentru antrenare și 396 pentru validare, construite din 500 de entități împărțite în 450 pentru antrenare și 50 pentru dezvoltare. Au fost utilizate în plus 183 de entități distincte pentru testare.
Antrenare și teste
Autorii au reglat fin modelul Mistral-7B-Instruct-v0.2 LLM la diverse rata de învățare (3e-6, 1e-5, 3e-5) pentru a ajunge la rata optimă (neanunțată) LR, timp de 30 de epoci, la o dimensiune a lotului de 256 (n.b. hardware-ul de antrenare nu este specificat).
FCG a fost testat împotriva a două linii de bază. Prima a fost Fără control al fapticității (NFC), unde modelul a fost pur și simplu solicitat cu o cerere precum Spune-mi o biografie a lui X, fără a menționa acuratețea sau încrederea. Această versiune reflectă comportamentul implicit al unui LLM, fără niciun mecanism de filtrare sau constrângere.
Metoda a doua, numită Inferență controlată de fapticitate (FCI), a utilizat aceleași prompturi de nivel de încredere fără reglare fină. De exemplu, modelul a putut fi solicitat cu ‘Generează informații pe care le consideri 90% sigure’. În acest caz, instrucțiunea semăna cu cele utilizate în antrenare, dar modelul nu a avut nicio expunere anterioară la astfel de constrângeri:

Comparație între cele trei abordări testate: linia de bază fără control; o versiune care utilizează prompturi de fapticitate fără antrenare; și modelul reglat fin care a învățat să urmeze setările de acuratețe prin expunerea la date filtrate.
Inițial, a fost efectuat un test pentru aderență la fapticitate:

Performanță la trei niveluri de încredere țintă. Doar modelul reglat fin a putut produce ieșiri complet faptice, și a depășit ambele linii de bază în general, în special la praguri mai mari.
Când a fost testat împotriva pragurilor de fapticitate de 80%, 90% și 100%, doar modelul reglat fin a putut să atingă în mod constant țintele. Surprinzător, simpla adăugare a instrucțiunilor de încredere, fără antrenarea modelului pentru a urma aceste instrucțiuni, nu a ajutat. În unele cazuri, a făcut lucrurile și mai rele; de exemplu, doar 3,8% din ieșirile modelului cu prompturi au atins pragul de 90%, comparativ cu 5,5% din versiunea fără instrucțiuni:
Aceasta sugerează, afirmă autorii, că modelul de bază Mistral-7B nu a putut interpreta prompturi precum ‘fi 90% sigur’ într-un mod util, și că instrucțiunea suplimentară a putut chiar să perturbe ieșirea sa obișnuită.
În schimb, modelul antrenat a răspuns în mod fiabil la semnalele de control, producând 18,7% de ieșiri conforme la 80%, 12,6% la 90% și 23,6% la 100%; și a fost singurul care a putut genera ieșiri complet faptice:
‘Aceste îmbunătățiri indică faptul că capacitatea de a controla fapticitatea poate fi într-adevăr instilată prin antrenare supravegheată. Modelul FCG a învățat să ajusteze conținutul și să includă doar fapte în care are suficientă încredere, în timp ce modelul off-the-shelf nu a putut utiliza eficient semnalul de control de unul singur.’
Într-un test separat conceput pentru a confirma că modelul a învățat într-adevăr să interpreteze semnalul de control, cercetătorii au verificat dacă fapticitatea medie a răspunsurilor a crescut pe măsură ce au fost solicitate setări de adevăr mai mari.
Nu a apărut nicio astfel de tendință înainte de antrenare, dar după aceea, rezultatele au arătat o tendință ascendentă constantă, cu setări de încredere mai mari producând răspunsuri mai precise:

Pe măsură ce setarea de adevăr țintă a crescut, modelul reglat fin a produs ieșiri din ce în ce mai faptice în răspuns, în timp ce liniile de bază au demonstrat o schimbare consistentă pe parcursul aceluiași interval.
Compromisul între adevăr și “bogăție” a fost examinat și el. Ieșirile au fost evaluate nu numai pentru acuratețe, ci și pentru cantitatea de informații verificate care au rămas sub cerințe de fapticitate din ce în ce mai stricte. Așa cum se arată în graficul de mai jos, modelul FCG a fost găsit a fi superior ambelor linii de bază la majoritatea nivelurilor:

Un grafic care reprezintă compromisul între fapticitate și informativitate în cele trei metode. Modelul reglat fin a oferit un echilibru mai bun între adevăr și detaliu decât oricare dintre liniile de bază. La niveluri de acuratețe comparabile, a păstrat mai mult conținut factual, și la setarea cea mai înaltă a rămas singura metodă capabilă să producă răspunsuri complet verificate care nu erau goale.
La un nivel de acuratețe țintă de aproximativ 90%, au fost păstrate mai multe fapte de către FCG decât de orice altă metodă, și pe parcursul întregului interval de încredere, nicio linie de bază nu a produs rezultate consistent mai bune.
Diferența a fost cea mai izbitoare la setarea cea mai strictă, unde FCG a continuat să producă informativitate nenulă, în timp ce linia de bază cu prompturi a fost forțată să elimine totul. În aceste cazuri, chiar și o singură declarație cu încredere scăzută a cauzat eliminarea întregului răspuns.
În schimb, modelul antrenat a fost capabil să-și restructureze ieșirea pentru a păstra doar fapte pe care le considera complet fiabile, evitând colapsul în tăcere care a afectat celelalte.
Fapticitatea a fost direct constrânsă de setarea de control, în timp ce informativitatea a fost optimizată prin permiterea modelului să includă cât mai mult conținut fiabil. La setări mai mari, doar declarații verificabile din punct de vedere factual au fost păstrate; la setări mai mici, au fost permise detalii mai speculative, crescând lungimea, dar reducând acuratețea.
Autorii concluzionează:
‘[Când] o constrângere de fapticitate ridicată este în vigoare, modelul prioritizează declarații verificabile din punct de vedere factual, în timp ce include și cât mai multe informații relevante posibile. În mod invers, modelul are libertatea de a include o gamă mai largă de detalii, inclusiv unele care sunt mai puțin verificabile sau mai speculative, ceea ce duce la o informativitate mai mare (mai multe fapte menționate) la costul unor acuratețe.
‘Acest comportament se aliniază cu proiectarea noastră a datelor de antrenare: deoarece am eliminat întotdeauna faptele minime necesare, modelul a învățat “dacă trebuie să fii x% factual, elimină detaliile mai puțin sigure, dar păstrează tot restul.” ‘
Articolul se încheie cu speranța că noua metodologie va fi încercată cu modele mai mari și aplicată la sarcini mai complexe, printre alte posibile extensii ale lucrării.
Concluzie
Soluția oferită aici abordează una dintre cele mai severe și frecvent menționate probleme ale generațiilor actuale de Modele de Limbaj Mare – tendința lor de a favoriza vorbăria în detrimentul acurateței, aparent doar pentru a “menține conversația”, și pentru a prezenta cu încredere informații învechite sau complet halucinate ca fapte.
Pentru utilizatorii ChatGPT, orice răspuns confident care nu este precedat de apariția unei ferestre “căutare web” va proveni fie din limitele datei de cunoaștere a modelului, fie ar putea fi la fel de bine o halucinație ca o faptă.
Cu toate acestea, căutările pe web cresc latența și costurile de rulare ale LLM-ului, și, așa cum știe orice utilizator, sunt efectuate selectiv; sau la cererea utilizatorului; sau ca o “setare specială” care poate implica taxe de token suplimentare.
În ciuda acestor tipuri de economii interne, acestea pot avea un efect critic asupra întrebărilor LLM în anumite domenii, sau pentru anumite tipuri de întrebare. Orice metodă care poate impune o schemă legată de acuratețea ieșirii este o cercetare binevenită.
* Conversia mea a citării inline a autorilor în legături hipertext.
† Numărul complet de versiune nu este furnizat.
Publicat pentru prima dată vineri, 6 februarie 2026. Revizuit în următoarele cinci minute pentru o repetiție de cuvinte












