Unghiul lui Anderson

Heuristica vs. RAG: Shrinkflația ca un factor de politică

mm
Adaugă Unite.AI la sursele tale preferate pe Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

În majoritatea cazurilor, căutarea pe web îmbunătățește acuratețea factuală a răspunsurilor ChatGPT la întrebările noastre. Așadar, într-un climat în care IA luptă pentru acceptarea publică, de ce recurge la “ghicitori”?

 

Opinie Este o greșeală să credem că LLM-urile, cum ar fi ChatGPT, se implică vreodată în whistleblowing cu privire la practicile potențial dubioase ale gazdelor lor, chiar dacă o sesiune costisitoare și irosită a ridicat mânia noastră suficient de mult pentru a intra cu adevărat în detalii despre lipsurile sistemului:

Aici o discuție despre preferința ChatGPT pentru logica sa internă (în contrast cu cercetarea și verificarea pe web prin RAG – care produce mai puține halucinații, dar costă mai mult) induce un moment aparent de sinceritate; dar luați-o cu o picătură de sare. Sursă: chatgpt.com

Aici o discuție despre preferința ChatGPT pentru logica sa internă (în contrast cu cercetarea și verificarea pe web prin RAG – care produce mai puține halucinații, dar costă mai mult) induce un moment aparent de sinceritate; dar luați-o cu o picătură de sare. Sursă

În majoritatea cazurilor – în special pentru modele cu date de închidere a cunoașterii mai recente – IA doar improvizează pe baza postărilor de pe Reddit și forumuri văzute în timpul antrenamentului. Chiar dacă ar exista vreo valoare reală pentru astfel de “insider insights”, este imposibil de dovedit.

Însă, uneori, aceste schimburi aprinse duc la descoperirea de “hacks” (sau, cel puțin, “trucuri”) care promit să prevină unele dintre cele mai rele obiceiuri repetitive ale unui LLM – cum ar fi atunci când, săptămâna trecută, ChatGPT a sugerat că pot să-l fac să lucreze mai mult și să halucineze mai puțin, incluzând adjurarea ‘fără heuristici’:

ChatGPT

Am folosit ‘fără heuristici’ mult de atunci, și nici măcar o dată modelul nu a recurs la cunoașterea sa antrenată după ce am închis o întrebare cu această comandă. Mai degrabă, GPT utilizează imediat Generarea Augmentată de Retrieval (RAG), căutând pe internet documente care să ilumineze sau să coroboreze.

În practică, pentru majoritatea solicitărilor, acest lucru nu este diferit de a spune sistemului să “caute pe web” de fiecare dată când se trimite o întrebare. Unde fraza “fără heuristici” poate să ajute cu adevărat este atunci când încercăm să facem ChatGPT să citească cu adevărat un PDF nou încărcat, în loc de a utiliza metadatele din încărcările anterioare de PDF din aceeași sesiune (sau multe alte surse posibile), pentru a produce un răspuns “plauzibil” dar complet halucinat, fără a citi sau a parcurge documentul prezentat.

ChatGPT

Acest lucru fiind spus, cu cât sesiunea de chat a durat mai mult, este mai puțin probabil ca acest lucru să funcționeze – și ar fi o greșeală să credem că orice “truc” este fiabil sau va rămâne disponibil pe măsură ce sistemul evoluează.

Comerțul RAG

În contextul unei culturi în creștere a shrinkflației, și a faptului că sistemele mari, cum ar fi infrastructura GPT a OpenAI, sunt puternic afectate de chiar și de cele mai mici schimbări generalizate de comportament, este ușor de crezut că primim mai puțin decât ceea ce am plătit din cauza alegerilor făcute de LLM-urile populare, cum ar fi ChatGPT.

Alegerea de a utiliza RAG; de a începe un lanț de gândire (CoT) care ar putea obține un rezultat mai bun, dar care ar costa mai mult pentru a infera și ar putea obosi utilizatorul nepăsător; sau de a recurge la cunoașterea sa antrenată și la cunoașterea locală disponibilă – care este cea mai ieftină și rapidă soluție posibilă.

Există mai multe motive practice pentru care un LLM cu un profil public sensibil, cum ar fi ChatGPT, ar putea prefera să limiteze apelurile RAG, favorizând heuristica sa. În primul rând, din punct de vedere al PR-ului, utilizarea frecventă și neîncurajată a web-ului sprijină o caracterizare populară a LLM-urilor ca simple “Googlers-by-proxy”, diminuând valoarea cunoașterii sale innate și scumpe antrenate – și atracția unei abonamente plătite.

În al doilea rând, infrastructura RAG costă bani pentru a fi operată, întreținută și actualizată, comparativ cu costul relativ nesemnificativ al inferenței locale, adică generării parametrice, care este ieftină și rapidă.

În al treilea rând, sistemul poate să nu aibă o metodă eficientă de a determina dacă RAG ar putea îmbunătăți rezultatele heuristice – și adesea nu poate determina acest lucru fără a rula heuristica mai întâi. Acest lucru lasă utilizatorul final cu sarcina de a evalua un rezultat heuristic defectuos și de a solicita un apel RAG în cazul în care rezultatul din heuristici părea să nu corespundă.

Din punctul de vedere al “shrinkflației IA”, numărul de ori când ChatGPT greșește prin heuristici și reușește prin RAG poate indica, așa cum a făcut-o recent pentru mine, că sistemul optimizează costul în loc de rezultate.

RAG devine necesar în timp

În ciuda “mărturisirii” recente a ChatGPT către mine că acesta este, de fapt, cazul, “shrinkflația” are un context mai larg în acest sens. Deși RAG nu este ieftin, nici în ceea ce privește fricțiunea experienței (prin latență) și nici în ceea ce privește costul de operare, este mult mai ieftin decât fie reglarea fină sau chiar reantrenarea modelului de bază.

Pentru un model de IA mai vechi, cu o dată de închidere a cunoașterii mai îndepărtată, RAG poate menține valabilitatea sistemului, la costul apelurilor de rețea și a altor resurse; pentru un model mai nou, retragerile RAG sunt mai probabil să fie redundante sau dăunătoare calității rezultatelor, care în unele cazuri ar fi fost mai bune prin heuristici.

Prin urmare, IA pare să aibă nevoie de capacitatea nu numai de a decide dacă ar trebui să recurgă la RAG, dar și de a evolua continuu politica de utilizare a RAG pe măsură ce greutățile sale interne devin mai și mai învechite.

În același timp, sistemul are nevoie de a proteja “constante relative” în cunoaștere, cum ar fi orbitele lunare și literatura clasică, cultura și istoria; precum și geografia de bază, fizica și alte principii științifice care sunt puțin probabil să se schimbe mult în timp (adică riscul de “schimbare bruscă” nu este inexistent, dar scăzut).

Subiecte neconvenționale

În acest moment, cel puțin în ceea ce privește ChatGPT, apelurile RAG (adică utilizarea cercetării web pentru orice întrebare a utilizatorului care nu cere explicit sau implicit cercetarea web) par să fie rareori alese în mod autonom de sistem, chiar și atunci când se ocupă de “subdomenii marginale”.

Un exemplu de domeniu marginal este “utilizarea software-ului obscur”. Într-un astfel de caz, datele sursă disponibile minime ar fi luptat pentru atenție în timpul antrenamentului, iar statutul de “outlier” al datelor ar fi putut fie să le fi marcat pentru atenție, fie să le fi îngropat ca “marginale” sau “inconsecvente” – și chiar și o singură postare pe forum făcută după data de închidere a cunoașterii IA ar putea reprezenta o creștere substanțială a datelor disponibile și a calității răspunsului pentru un “subiect mic”, făcând un apel RAG valoros.

Însă, avantajul RAG tinde să scadă pe măsură ce modelul de bază devine mai puternic. În timp ce modelele mai mici beneficiază semnificativ de retrieval, sistemele mai mari, cum ar fi Qwen3-4B sau GPT-4o-mini/-4o, arată adesea o îmbunătățire marginală sau chiar negativă din cauza RAG*.

La multe benchmark-uri, retrieval-ul introduce mai multă distracție decât beneficiu, sugerând un compromis între investiția într-un model mai mare cu o acoperire internă mai bună sau un model mai mic, asociat cu retrieval.

Prin urmare, RAG pare să fie cel mai util pentru compensarea lacunelor în modele de mărime medie, care încă au nevoie de fapte externe, dar pot evalua aceste fapte cu heuristici interne mai puțin complexe.

Folosiți numai în caz de urgență

Politica de ghidare a ChatGPT cu privire la decizia de a utiliza RAG nu este expusă în mod evident de promptul său de sistem**, dar este abordată implicit (spre sfârșit):

‘Utilizați instrumentul web pentru a accesa informații actualizate de pe web sau atunci când răspunsul la utilizator necesită informații despre locația sa. Exemple de cazuri în care se utilizează instrumentul web includ:

Informații locale: Utilizați instrumentul web pentru a răspunde la întrebări care necesită informații despre locația utilizatorului, cum ar fi vremea, afaceri locale sau evenimente.

Prospețime: Dacă informații actualizate despre un subiect ar putea schimba sau îmbunătăți răspunsul, apelați instrumentul web oricând ați refuza altfel să răspundeți la o întrebare din cauza faptului că cunoașterea dvs. ar putea fi învechită.

Informații de nișă: Dacă răspunsul ar beneficia de informații detaliate care nu sunt pe deplin cunoscute sau înțelese (care ar putea fi găsite pe internet), cum ar fi detalii despre un cartier mic, o companie mai puțin cunoscută sau reglementări obscure, utilizați surse web direct, în loc de a vă baza pe cunoașterea distilată din preantrenare.

Acuratețe: Dacă costul unei greșeli mici sau a informațiilor învechite este ridicat (de exemplu, utilizarea unei versiuni învechite a unei biblioteci de software sau necunoașterea datei următorului meci pentru o echipă sportivă), atunci utilizați instrumentul web.’

În special, putem observa aceste direcții care promovează RAG în cazurile în care datele sursă native sunt sărace. Dar cum ajunge sistemul la această înțelegere? Utilizatorul casual și observatorul ChatGPT ar putea concluziona că, în acele ocazii în care widget-ul “căutare pe web” se afișează după o pauză, heuristica internă a modelului a fost doar chestionată pentru întrebare și a venit goală.

Putem observa, de asemenea, că, prin implicație, RAG este recomandat doar pentru un număr limitat de cazuri de utilizare. Acest lucru lasă GPT recomandat să chestioneze propria sa cunoaștere, în toate cazurile, cu excepția unei “situații critice” (‘Acuratețe’, la sfârșitul citatului de mai sus), pentru numărul mare de întrebări bazate pe fapte din domeniu în care tendința IA de a halucina ar putea fi o datorie semnificativă.

Concluzie

Tendințele cercetărilor actuale și recente indică faptul că generarea heuristicii este rapidă și ieftină, dar greșită prea des; în timp ce RAG este mai lent, mai scump, dar mult mai frecvent corect – cu atât mai mult pe măsură ce dimensiunea modelului scade.

Pe baza experienței mele cu ChatGPT, aș argumenta că OpenAI utilizează RAG prea rar, ca un instrument de precizie, mai degrabă decât unul zilnic, în special având în vedere problemele cu ferestrele de context în creștere care fac LLM-urile mai predispuse să halucineze pe măsură ce conversațiile lungi se dezvoltă.

Acest lucru ar putea fi alleviat în mod semnificativ prin verificarea răspunsurilor heuristice împotriva surselor de autoritate de pe web, fără a aștepta ca utilizatorul final să pună la îndoială output-ul sau să fie împiedicat de acesta, și fără a necesita ca rezultatele interne să fie atât de evident nesatisfăcătoare încât decizia de a utiliza RAG să fie inevitabilă.

În schimb, sistemul ar trebui să fie antrenat pentru a se îndoi selectiv și inteligent de sine, conform cazurilor, și, prin urmare, pentru a interacționa cu web-ul printr-un proces de selecție care ar fi, în sine, heuristici. Nu sunt conștient de faptul că arhitecturile modelelor actuale lasă loc pentru o abordare de acest tip, care ar trebui să fie adăugată la fricțiunea filtrelor API.

În acest moment, nu pot dovedi nici măcar că există o problemă; nici măcar cu o :

ChatGPT mărturisește

 

* Vă rugăm să consultați link-ul de la începutul acestui paragraf.

** Acesta este un “prompt de sistem auto-expus” pentru GPT-5, care, din nou, poate fi doar un digest din postări de forum reantrenate pentru GPT-5, deși unii susțin că promptul este autentic.

Eu nu sugerez cu adevărat că “candoarea vinovată” a ChatGPT este semnificativă aici; tendința mea de a mă împotrivi liniei de partid în chestiuni de politică OpenAI înseamnă că va “agree” în cele din urmă cu mine și va repeta opinia mea implicită oricum. Acest lucru este departe de a fi echivalent cu a divulga detalii despre debarcările de la Normandia sub presiune.

Publicat pentru prima dată miercuri, 10 decembrie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai