Modele și platforme AI
Când modelele de benchmarking AI învață modelele să mintă

Halucinația AI — atunci când un sistem produce răspunsuri care sună corecte, dar sunt de fapt greșite — rămâne una dintre cele mai dificile provocări în inteligența artificială. Chiar și modelele cele mai avansate de astăzi, cum ar fi DeepSeek-V3, Llama și cele mai recente lansări ale OpenAI, încă produc informații inexacte cu încredere ridicată. În domenii precum sănătatea sau dreptul, astfel de greșeli pot duce la consecințe grave.
Tradițional, halucinațiile au fost considerate un produs secundar al modului în care sunt antrenate modelele de limbaj: ele învață să prezică următorul cuvânt cel mai probabil fără a verifica dacă informația este adevărată. Dar o nouă cercetare sugerează că problema nu se oprește la antrenament. Benchmark-urile utilizate pentru a testa și compara performanța AI pot, de fapt, întări un comportament înșelător, răsplătind răspunsurile care sună convingătoare, mai degrabă decât pe cele corecte.
Această schimbare de perspectivă restructurează problema. Dacă modelele sunt antrenate să placă testului, mai degrabă decât să spună adevărul, atunci halucinațiile nu sunt defecte accidentale, ci strategii învățate. Pentru a vedea de ce se întâmplă acest lucru, trebuie să examinăm de ce modelele AI aleg să ghicească, mai degrabă decât să-și recunoască ignorarea?
De ce modelele AI ghicesc
Pentru a vedea de ce modelele AI adesea ghicesc, mai degrabă decât să-și recunoască ignorarea, considerați un student care se confruntă cu o întrebare dificilă de examen. Studentul are două opțiuni: să lase răspunsul necompletat și să primească zero puncte sau să facă o ghicire educată care ar putea câștiga câteva puncte. Rațional, ghicirea pare a fi alegerea mai bună, deoarece există cel puțin o șansă de a fi corect.
Modelele AI se confruntă cu o situație similară în timpul evaluării. Majoritatea benchmark-urilor utilizează un sistem de notare binar: răspunsurile corecte primesc puncte, în timp ce răspunsurile incorecte sau incerte primesc zero puncte. Dacă un model este întrebat “Care este ziua de naștere a unui cercetător?” și el nu știe cu adevărat, răspunsul “Nu știu” este considerat un eșec. Inventarea unei date, însă, are o anumită șansă de a fi corectă — și chiar dacă este greșită, sistemul nu pedepsește ghicirea sigură mai mult decât tăcerea.
Această dinamică explică de ce halucinațiile persistă, în ciuda cercetărilor extinse pentru a le elimina. Modelele nu se comportă defectuos; ele urmează stimulentele încorporate în evaluare. Ele învață că sună mai bine să fie sigure, chiar și atunci când răspunsul este fals. Ca urmare, în loc să exprime incertitudine, modelele sunt împinse să ofere declarații autoritare — corecte sau greșite.
Baza matematică a necinstei AI
Cercetarea arată că halucinațiile provin din fundamentele matematice ale modului în care modelele de limbaj învață. Chiar și dacă un model ar fi antrenat numai pe informații perfect exacte, obiectivele sale statistice ar duce totuși la erori. Acest lucru se datorează faptului că generarea răspunsului corect este fundamental mai grea decât recunoașterea dacă un răspuns este valid.
Acest lucru ajută la explicarea de ce modelele adesea eşuează în ceea ce priveşte faptele care lipsesc de modele clare, cum ar fi zilele de naștere sau alte detalii unice. Analiza matematică sugerează că ratele de halucinație în aceste cazuri vor fi cel puțin la fel de mari ca fracția de fapte care apar doar o dată în datele de antrenament. Cu alte cuvinte, cu cât informația este mai rară în date, cu atât este mai probabil ca modelul să aibă dificultăți cu ea.
Problema nu se limitează la fapte rare. Constrângerile structurale, cum ar fi capacitatea limitată a modelului sau proiectarea arhitecturală, produc, de asemenea, erori sistemice. De exemplu, modelele anterioare cu ferestre de context foarte scurte au eşuat în mod constant la sarcini care necesitau raționament pe termen lung. Aceste greșeli nu au fost glitch-uri aleatorii, ci rezultate previzibile ale cadrului matematic al modelului.
De ce antrenamentul post-învățare nu rezolvă problema
Odată ce un model AI este antrenat pe seturi masive de date text, el trece, de obicei, printr-un proces de fine-tuning pentru a face ieșirile sale mai utile și mai puțin dăunătoare. Dar acest proces se confruntă cu aceeași problemă de bază care cauzează halucinații în primul rând; modul în care evaluăm modelele.
Metodele de fine-tuning cele mai comune, cum ar fi învățarea prin întărire din feedbackul uman, încă se bazează pe benchmark-uri care utilizează notarea binară. Aceste benchmark-uri răsplătesc modelele pentru răspunsuri sigure, fără a oferi puncte atunci când un model recunoaște că nu știe. Ca urmare, un sistem care răspunde întotdeauna cu încredere, chiar și atunci când este greșit, poate depăși unul care exprimă onest incertitudinea.
Cercetătorii numesc această problemă “pedepsirea incertitudinii”. Chiar și tehnici avansate pentru detectarea sau reducerea halucinațiilor se luptă atunci când benchmark-urile subiacente continuă să favorizeze supraincrederea. Cu alte cuvinte, indiferent de cât de sofisticate sunt reparațiile, atâta timp cât sistemele de evaluare răsplătesc ghicirile sigure, modelele vor fi îndreptate către răspunsuri greșite, dar sigure, mai degrabă decât spre recunoașterea onestă a îndoielii.
Iluzia progresului
Clasamentele, larg răspândite în comunitatea AI, amplifică această problemă. Benchmark-urile precum MMLU, GPQA și SWE-bench domină articolele de cercetare și anunțurile de produs. Companiile evidențiază scorurile lor pentru a arăta progresul rapid. Însă, așa cum notează raportul, aceste benchmark-uri încurajează halucinația.
Un model care spune onest “Nu știu” poate fi mai sigur în medii reale, dar va fi clasat mai jos în clasament. În contrast, un model care inventează răspunsuri convingătoare, dar false, va obține un scor mai bun. Când adoptarea, finanțarea și prestigiul depind de clasamentele din leaderboard, direcția progresului devine distorsionată. Publicul vede o narativă a îmbunătățirii constante, dar sub suprafață, modelele sunt antrenate să înșele.
De ce incertitudinea onestă contează în AI
Halucinațiile nu sunt doar o provocare de cercetare; ele au consecințe reale. În sănătate, un model care inventează interacțiuni medicamentoase poate induce în eroare medicii. În educație, un model care inventează fapte istorice poate informa greșit elevii. În jurnalism, un chatbot care produce citate false, dar convingătoare, poate răspândi dezinformare. Aceste riscuri sunt deja vizibile. Raportul Stanford AI Index 2025 a raportat că benchmark-urile proiectate pentru a măsura halucinațiile “au luptat să câștige tracțiune”, chiar și pe măsură ce adoptarea AI accelerează. Între timp, benchmark-urile care domină clasamentele și care răsplătesc răspunsurile sigure, dar neverificate, continuă să stabilească direcția progresului.
Aceste constatări evidențiază atât o provocare, cât și o oportunitate. Prin examinarea rădăcinilor matematice ale halucinației, cercetătorii au identificat direcții clare pentru construirea unor sisteme AI mai fiabile. Cheia este să încetăm să tratăm incertitudinea ca pe un defect și să o recunoaștem, în schimb, ca o capacitate esențială care ar trebui să fie măsurată și răsplătită.
Această schimbare de perspectivă are implicații dincolo de reducerea halucinațiilor. Sistemele AI care pot evalua și comunica cu acuratețe limitele cunoștințelor lor ar fi mai potrivite pentru aplicații cu risc ridicat, unde supraincrederea poate avea riscuri grave. Diagnoza medicală, analiza juridică și cercetarea științifică necesită toate capacitatea de a distinge între cunoașterea sigură și speculația informată.
Reevaluarea evaluării pentru AI onestă
Aceste constatări evidențiază faptul că construirea unor sisteme AI mai de încredere necesită o reevaluare a modului în care măsurăm capacitatea AI. În loc de a ne baza pe scoruri simple corecte sau greșite, cadrurile de evaluare ar trebui să răsplătească modelele pentru exprimarea incertitudinii în mod corespunzător. Acest lucru înseamnă furnizarea de îndrumări clare cu privire la pragurile de încredere și schemele de notare corespunzătoare în instrucțiunile benchmark-ului.
O abordare promițătoare implică crearea unor ținte de încredere explicite care specifică când modelele ar trebui să răspundă și când ar trebui să se abțină. De exemplu, instrucțiunile ar putea specifica că răspunsurile ar trebui să fie oferite doar atunci când încrederea depășește un anumit prag, cu ajustarea notării în consecință. În acest cadru, incertitudinea nu mai este o slăbiciune, ci o parte valoroasă a comportamentului responsabil.
Cheia este să facem cerințele de încredere transparente, mai degrabă decât implicite. Benchmark-urile actuale creează pedepse ascunse pentru incertitudine pe care modelele le învață să le evite. Țintele de încredere explicite ar permite modelelor să optimizeze comportamentul dorit: răspunsuri corecte atunci când sunt sigure și recunoașteri oneste ale îndoielii atunci când cunoașterea lipsește.
Concluzia
Halucinațiile AI nu sunt defecte aleatorii — ele sunt întărite de benchmark-urile utilizate pentru a măsura progresul. Prin răsplătirea ghicirilor sigure în detrimentul incertitudinii oneste, sistemele actuale de evaluare împing modelele către înșelăciune, mai degrabă decât către fiabilitate. Dacă dorim AI care pot fi de încredere în domenii cu risc ridicat, cum ar fi sănătatea, dreptul și știința, trebuie să reevaluăm modul în care testăm și răsplătim modelele. Progresul ar trebui să fie măsurat nu doar prin acuratețe, ci și prin capacitatea de a recunoaște și admite ceea ce modelul nu știe.












