Unghiul lui Anderson
Raționamentul lanțului de gândire dovedit a fi „decorativ” în modelele majore de limbaj

Noi cercetări oferă o modalitate ușoară de a determina că explicațiile lustruite, pas cu pas, ale tuturor modelelor actuale de limbaj AI de top – incluzând ChatGPT și Claude – sunt, de fapt, doar „decorative” și sunt, de obicei, inventate după modelul AI a decis ce este răspunsul.
Anul trecut, o serie de studii de înaltă profil de la companii care se confruntă cu inteligența artificială, incluzând Anthropic și Apple, au indicat că așa-numiții „modele de raționament AI” adesea produc explicații pas cu pas care nu reflectă ceea ce a informat, de fapt, răspunsurile lor.
Pentru diverse motive, dezbaterea a degenerat rapid în replici aprige și interpretări diverse (inclusiv pe acest site), lăsând neatinsă întrebarea dacă raționamentul lanțului de gândire (CoT) este doar o frivolitate cosmetică destinată să liniștească utilizatorii finali sau o dovadă a unui proces real de raționament.

ChatGPT ‘arată lucrul său’ – dar a decis deja ce să răspundă?
Arată și Spune
Acum, o lucrare interesantă nouă din India oferă o metodă ieftină și ușor de replicat pentru a evalua dacă acele explicații impresionante „deducție animații” în interfețele ChatGPT și ale altor modele majore de limbaj (LLM) indică, cu adevărat, faptul că inteligența artificială lucrează prin pași pentru a ajunge la o concluzie.
Cercetarea nouă provine de la doi cercetători de la Institutul Indian de Informatică Allahabad (IIITA) din Allahabad și de la Institutul Național de Electronică și Informatică (NIELIT) din Delhi.
Autorii au constatat că, în majoritatea cazurilor, pe o suprafață semnificativă de modele LLM proprietare și cu sursă deschisă, raționamentul lanțului de gândire prezentat utilizatorilor este „decorativ”, inventat după modelul AI a decis ce răspuns va prezenta.
Testând modele precum ChatGPT5.4, Claude Opus 4.6-R și DeepSeek-V3.2, autorii au constatat că eliminarea oricărui pas din cele 10-15 indicații CoT prezentate a schimbat răspunsul mai puțin de 17% din timp, și că orice pas, singur, a fost suficient pentru a recupera răspunsul corect.
Autorii afirmă*:
‘Cadrul de reglementare pentru inteligența artificială în domeniul sănătății, finanțelor și dreptului cere din ce în ce mai mult sisteme „explicabile”. Rezultatele noastre sugerează că abordarea standard – cererea modelului de a-și arăta lucrul – oferă o iluzie de transparență.
‘Explicațiile sunt fluente, adecvate domeniului și greșite într-un mod subtil: ele descriu un raționament pe care modelul nu l-a efectuat.
‘Un model de inteligență artificială medicală care scrie „eozinofilia sugerează un proces embolic” nu a considerat, neapărat, eozinofilia. Poate că a făcut o potrivire de model din întrebarea inițială la răspuns și a confabulat raționamentul ulterior.
‘Conform Actului UE privind inteligența artificială (Articolul 13), un sistem de inteligență artificială cu risc ridicat trebuie să ofere „informații semnificative despre logica implicată”. Rezultatele noastre sugerează că explicațiile lanțului de gândire din majoritatea modelelor de frontieră nu îndeplinesc acest standard–logica „implicată” în obținerea răspunsului nu este logica descrisă în explicație.’
Autorii observă că două dintre modelele mai mici testate au rupt modelul obișnuit de duplicitate, dar numai în circumstanțe foarte specifice: MiniMax-M25 a demonstrat o dependență reală de pași atunci când a făcut analiza sentimentului, în timp ce Kimi-K25 a arătat o nevoie reală de 39% pentru procesarea CoT – dar numai atunci când a făcut clasificarea tematică.
În toate celelalte cazuri, la fel ca și în cazul modelelor mai mari și mai cunoscute, pașii de raționament demonstrați au părut a fi complet performativi, modelele utilizând, în schimb, scurtături.
Modele mici se străduiesc mai mult
Pe lângă cele zece modele API testate, autorii au testat, de asemenea, o serie de modele mai mici cu greutăți deschise, care variază între 0,8 și 8 miliarde de parametri (ceea ce este destul de modest, în zilele noastre), și au constatat că aceste modele de inteligență artificială mai mici raționează, de fapt, și că lanțul de gândire pe care îl arată este, de obicei, necesar pentru a ajunge la concluzii utile și precise.
Modelele mai mici au demonstrat o nevoie de 55% pentru raționamentul pas cu pas, în contrast cu media de 11% nevoie în rândul modelelor mai mari, care, după cum afirmă autorii, ‘au învățat să ocolească complet raționamentul multi-pas, ajungând la răspunsuri corecte prin scurtături interne care nu sunt reflectate în raționamentul lor scris’.
Autorii susțin că, cu cât un model devine mai bun la o sarcină, cu atât mai puțin are nevoie de pași de raționament (deși aceasta este o abordare mai diplomatică a conceptului de a renunța la analiza rațională în favoarea oricărui răspuns care a fost cel mai puternic în distribuția datelor de antrenament)††:
‘Modelele mici raționează cu fidelitate în matematică pentru că trebuie—lipsesc cunoștințele parametrice pentru a face scurtături.
‘Modelele de frontieră au internalizat suficiente modele matematice astfel încât raționamentul lanțului de gândire devine redundant. Lanțul de gândire îmbunătățește, totuși, precizia (prin structurarea generării), dar pașii individuali nu mai conțin informații unice.’
Metodă
Metoda utilizată pentru a testa modelele se bazează pe trei criterii:
Necesitatea elimină fiecare pas CoT, pe rând, și verifică dacă răspunsul se schimbă. Orice pas a cărui eliminare modifică rezultatul este considerat „necesar”; Suficiența izolează fiecare pas și verifică dacă acesta singur poate recupera răspunsul, orice pas care poate face acest lucru fiind considerat suficient; și Sensibilitatea la ordine rearanjează pașii și observă dacă răspunsul se schimbă (deoarece un raționament real ar trebui să depindă de secvență, mai degrabă decât de cuvinte cheie).
Luate împreună, o necesitate ridicată și o suficiență scăzută indică un raționament real pas cu pas, în timp ce o necesitate scăzută și o suficiență ridicată indică explicații care pot fi eliminate, rearanjate sau reduse fără a afecta rezultatul.
Autorii notează că această metodă elimină orice nevoie de acces la cutia albă a modelului, deoarece poate fi efectuată pentru doar câteva dolari pe modele API închise, precum ChatGPT și Claude, și, în mod firesc, la fel de bine pe modele cu greutăți deschise care pot fi instalate local.
Ei notează, de asemenea, că studii anterioare au utilizat fie modele cu greutăți deschise care au facilitat analiza internă, fie au utilizat răspunsuri mai simple, binare da/nu care dezvăluie mult mai puțin despre procesele interne de raționament ale unui model API.
Costuri minime
Autorii definesc raționamentul real prin necesitate și suficiență, cu o necesitate ridicată și o suficiență scăzută care indică faptul că fiecare pas are o greutate unică. În schimb, raționamentul decorativ arată o necesitate scăzută și o suficiență ridicată, ceea ce înseamnă că pașii pot fi eliminați sau utilizați singuri fără a schimba răspunsul.
Necesitatea singură, afirmă ei, poate ascunde acest lucru, deoarece pot exista multiple căi valabile. Prin urmare, suficiența este utilizată pentru a verifica dacă vreun singur pas already codifică rezultatul, și sensibilitatea la ordine verifică dacă modelul depinde de secvență, mai degrabă decât de indicii de suprafață.
Aproacherea se bazează pe cadru de explicație consistentă cu intervenția (ICE), necesită doar acces API text-în, text-îesire și, pentru un lanț cu șase pași, implică 15 evaluări, la un cost de aproximativ 1-2 dolari pe model.
Cadru de lucru ICE clasifică comportamentul modelului prin necesitate și suficiență în trei tipare: Decorativ arată o necesitate scăzută și o suficiență ridicată, ceea ce înseamnă că pașii sunt redundanți și răspunsul ar fi fost atins oricum. Acesta domină în majoritatea modelelor și sarcinilor; Realmente fidel arată o necesitate ridicată și o suficiență ridicată, ceea ce înseamnă că fiecare pas conține un semnal real (și, așa cum s-a menționat anterior, acesta apare în MiniMax-M2.5 pe analiza sentimentului); și Dependent de context arată o necesitate ridicată și o suficiență scăzută, ceea ce înseamnă că pașii funcționează doar împreună, în secvență (ceea ce apare în Kimi-K2.5 și MiniMax pe clasificarea tematică, și în modele mici, atunci când se ocupă de matematică).
Teste
Cele zece modele API testate cu abordarea ICE revizuită au fost ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; și Nemotron-Ultra (253 de miliarde de parametri).
Fiecare model a fost testat pe patru sarcini: clasificarea sentimentului (utilizând (SST-2); probleme matematice în cuvinte (utilizând GSM8K); clasificarea tematică (utilizând AG News); și întrebări medicale (utilizând (MedQA). Inițial, testele au fost efectuate pe Sentiment și Matematică:

Teste pentru zece modele de limbaj de top, evaluând modul în care acestea gestionează raționamentul pas cu pas. ‘Necesitatea’ urmărește dacă eliminarea unui pas schimbă răspunsul; ‘suficiența’ verifică dacă un singur pas poate produce răspunsul; și ‘reorganizarea’ verifică dacă ordinea contează. Cele mai multe modele oferă explicații convingătoare, dar neesențiale, pe SST-2 și GSM8K, în timp ce MiniMax-M2.5 se bazează mai mult pe pașii săi pentru sentiment. Atât MiniMax, cât și Kimi-K2.5 arată un raționament real, pas cu pas, pe AG News. Sursă
Autorii afirmă, despre aceste rezultate:
‘Majoritatea modelelor prezintă ceea ce numim „raționament decorativ” (pași norocoși în taxonomia ICE)–un model în care necesitatea pasului este sub 17% și suficiența pasului depășește 60% atât pe sentiment, cât și pe matematică.
‘În limbaj simplu: puteți elimina orice pas de raționament și răspunsul abia dacă se schimbă, dar orice pas singur este suficient pentru a recupera răspunsul.’
La testul de clasificare a sentimentului SST-2, GPT-5.4 aproape niciodată nu s-a bazat pe explicația sa scrisă, deoarece eliminarea unui pas a schimbat răspunsul în doar 0,1% din 500 de cazuri, ceea ce indică faptul că explicația a fost adăugată după ce decizia a fost deja luată.
Claude Opus 4.6-R s-a bazat pe pașii săi cu 14,8%, dar 91% din pașii săi singuri au putut, totuși, să producă răspunsul; prin urmare, explicațiile sale mai lungi au fost mai detaliate, dar, în general, „ornamentale”.
Ulterior, cercetătorii au adăugat celelalte domenii și au testat din nou:

Fidelitate la nivel de pas și precizie pe patru domenii: SST-2; GSM8K; AG News; și MedQA. Cele mai multe perechi model-sarcină rămân ‘decorative’, în ciuda preciziei ridicate, cu excepții limitate: MiniMax-M2.5 și Kimi-K2.5 prezintă un raționament dependent de context sau real, pas cu pas, pe AG News, în timp ce performanța generală confirmă că o fidelitate scăzută nu este explicată de ghicirea aleatorie.
Autorii observă:
‘Rezultatele pe patru domenii consolidează constatarea centrală: raționamentul decorativ este universal în toate domeniile pentru modelele care fac scurtături. Claude Opus arată o necesitate de 1,7% pe MedQA (486 de exemple, 93,4% precizie) – modelul scrie lanțuri de raționament medical detaliat, cu o medie de 5,8 pași, dar eliminarea oricărui pas abia dacă schimbă diagnosticul.’
AG News a arătat cele mai mari diferențe între modele, Kimi-K2.5 și MiniMax bazându-se, cu adevărat, pe raționamentul lor pas cu pas, iar majoritatea celorlalte sisteme producând explicații care oferă puțin efect asupra răspunsului final.
DeepSeek-V3.2, testat pe toate cele patru sarcini, a rămas decorativ pe tot parcursul; în ciuda faptului că a scris explicații lungi, răspunsurile sale rareori au depins de pași.
Rigiditatea ieșirii
Testele au indicat o a patra fenomenă la play, pe care autorii au numit-o rigiditate a ieșirii: unele modele sunt pur și simplu reticente să producă procese de raționament, în funcție și de subiect, și, posibil, de alte circumstanțe. Mai jos, vedem raționamentul de la Claude Opus atunci când răspunde la o întrebare despre starea medicală a unui bărbat de 61 de ani; și dedesubt, ceea ce a ieșit la GPT-OSS-120B:

Verbositate versus reticență.
Autorii notează că Rigiditatea ieșirii este dependentă de sarcină:

Pe sarcini, modelele diferă puternic în ceea ce privește frecvența cu care aleg să ‘arate lucrul lor’. Claude și DeepSeek produc explicații multi-pași aproape întotdeauna, indiferent de domeniu, în contrast cu Qwen3.5-397B, care rareori o face. Altele schimbă comportamentul în funcție de sarcină, producând lanțuri logice detaliate pentru clasificare, dar mult mai puține pentru întrebări medicale.
Ei observă:
‘Modelele care sunt mai probabil să ocolească raționamentul intern sunt, de asemenea, cele mai probabil să omită raționamentul extern. GPT-OSS-120B produce explicații multi-pași pentru 99% din întrebările de sentiment și 100% din întrebările de clasificare a tematicii–dar doar 38% din întrebările medicale. La 62% din întrebările medicale, produce un răspuns scris cu o singură literă.’
Modelul nu pare să fie aleatoriu: GPT-OSS-120B produce explicații multi-pași pentru aproape toate întrebările de sentiment și clasificarea tematicii, dar trece la un răspuns scris cu o singură literă pentru majoritatea întrebărilor medicale (unde, de obicei, nu oferă niciun raționament vizibil).
Autorii ipotezează că, deoarece testele la nivel de pas necesită lanțuri scrise pentru a fi analizate, un model care răspunde într-un singur token nu poate fi evaluat prin aceste metode; absența raționamentului extern blochează, astfel, măsurarea directă.
Articolul concluzionează că modelele selectate pentru aplicații cu risc ridicat trebuie testate pentru fidelitate, precum și pentru precizie, și sugerează că un model care este cu 2% mai puțin precis, dar care raționează, de fapt, poate fi preferat – nu în ultimul rând pentru că îndeplinește reglementările UE și alte reglementări emergente în ceea ce privește inteligența artificială explicabilă. În acest moment, pe baza dovezilor găsite în studiu, aproape toate LLM-urile care sunt capabile să efectueze lanțuri de gândire sunt „înșelătoare”, aproape întotdeauna
Concluzie
Acesta este un articol interesant care oferă o testare și o discuție mai extinsă pe subiect decât putem acoperi aici și vă recomandăm să citiți materialul sursă.
Mesajul central, care continuă de la controversele de anul trecut, este că platformele de inteligență artificială cu risc ridicat ar putea fi dispuse să se abată și să fie nesincere în ceea ce privește simularea standardelor pe care modelele lor nu le pot încă îndeplini.
În plus, diferența dintre dimensiunea și capacitățile modelelor cu greutăți deschise și închise, cum ar fi ChatGPT, este atât de mare încât, de obicei, nu se poate infera în mod rezonabil efectele greutăților închise din instalările cu greutăți deschise, ceea ce sporește opacitatea acestor procese și standarde.
Cu toate acestea, este rar ca o metodologie de testare white-box să apară, care să poată cuprinde atât modele cu greutăți deschise, cât și închise; dar remedii adevărate pentru „trucuri ieftine” de acest fel sunt probabil să apară doar atunci când organizații puternice, cum ar fi UE, amenință veniturile modelelor de inteligență artificială majore.
*Conversia mea a citărilor inline ale autorilor în legături.
† Articolul nu dezvăluie o listă coezivă a acestor modele mai mici și include variante suplimentare ale unui model, făcând o listă definitivă o chestiune de deducție.
†† Accentuările autorilor.
Publicat pentru prima dată miercuri, 25 martie 2026












