Angolo di Anderson
Euristiche contro RAG: la shrinkflation come driver di politica

Nella maggior parte dei casi, la ricerca sul web migliora l’accuratezza fattuale delle risposte di ChatGPT alle nostre domande. Quindi, in un clima in cui l’IA sta lottando per l’accettazione pubblica, perché sta ricorrendo a “ipotesi”?
Opinione È un errore credere che i modelli di linguaggio come ChatGPT si impegnino mai in whistleblowing sulle pratiche potenzialmente discutibili dei loro host, anche se una sessione costosa e sprecata ha sollevato la tua ira abbastanza da entrare nei dettagli sui difetti del sistema:

Qui una discussione sulla preferenza di ChatGPT per la sua logica interna (vs ricerca web e verifica attraverso RAG – che produce meno allucinazioni, ma costa di più) induce un apparente momento di candore; ma prendetelo con un pizzico di sale. Fonte
Per lo più – specialmente per modelli con date di taglio delle conoscenze più recenti – l’IA sta semplicemente improvvisando su post di Reddit e forum visti durante l’addestramento. Anche se ci fosse qualche valore reale in queste “intuizioni interne”, è impossibile provarlo.
Tuttavia, a volte questi scambi accesi portano alla scoperta di “trucchi” (o almeno, “tecniche”) che promettono di prevenire alcune delle peggiori abitudini ripetitive di un modello di linguaggio – come quando, la scorsa settimana, ChatGPT ha suggerito che potevo farlo lavorare più duramente e allucinare meno includendo l’invocazione ‘no euristiche’:

Ho usato ‘no euristiche’ molto da allora, e non una volta il modello è ricorso alle sue conoscenze addestrate dopo che ho chiuso una query con questo comando. Invece, GPT utilizza immediatamente la Generazione aumentata di recupero (RAG), cercando internet per documenti illuminanti o corroboranti.
Nella pratica, per la maggior parte delle richieste, ciò è poco diverso dal dire al sistema di “cercare il web” ogni volta che si invia una query. Dove la frase “no euristiche” può realmente aiutare è quando si tenta di far sì che ChatGPT legga effettivamente un nuovo PDF caricato invece di utilizzare i metadati da precedenti caricamenti di PDF in quella sessione (o molti altri possibili fonti), per produrre una risposta “plausibile” ma interamente allucinata, non avendo letto o anche scorso il documento che si è appena presentato.

Detto ciò, più lunga è la sessione di chat, meno probabile è che ciò funzioni – e sarebbe un errore pensare che un tale “trucco” sia affidabile o rimarrà disponibile mentre il sistema evolve.
Il commercio RAG
Nel contesto di una cultura in crescita di shrinkflation, e del fatto che grandi sistemi come l’infrastruttura GPT di OpenAI sono enormemente influenzati anche dai più piccoli cambiamenti diffusi nel comportamento, è anche facile credere che si stia ottenendo poco peso dalle scelte fatte da modelli di linguaggio popolari come ChatGPT.
Scelte come se raggiungerà il web con RAG; inizierà un processo di catena di pensiero (CoT) che potrebbe ottenere un risultato migliore, ma che costerà di più per inferire e potrebbe stancare l’utente impaziente; o ricorrerà alle sue conoscenze addestrate e disponibili localmente – che è la soluzione più economica e veloce possibile.
Ci sono diverse ragioni pratiche per cui un modello di linguaggio con un profilo pubblico sensibile, come ChatGPT, possa preferire limitare le sue chiamate RAG, favorendo invece le sue euristiche. In primo luogo, da un punto di vista delle PR, l’uso frequente e non sollecitato del web sostiene una caratterizzazione popolare dei modelli di linguaggio come semplici Googlers-by-proxy, diminuendo il valore delle loro conoscenze innate e costosamente addestrate – e l’appeal di un abbonamento a pagamento.
In secondo luogo, l’infrastruttura RAG costa denaro per essere eseguita, mantenuta e aggiornata, rispetto al costo relativamente trascurabile dell’inferenza locale, cioè la generazione parametrica, che è economica e veloce.
In terzo luogo, il sistema potrebbe non avere un metodo efficace per determinare se RAG potrebbe migliorare i risultati euristici – e spesso non può determinarlo senza eseguire prima le euristiche. Ciò lascia all’utente finale il compito di valutare un risultato euristico difettoso e richiedere una chiamata RAG nel caso in cui il risultato dalle euristiche sembri essere insufficiente.
Dal punto di vista della “shrinkflation dell’IA”, il numero di volte in cui ChatGPT si sbaglia attraverso euristiche e ha successo attraverso RAG può indicare, come ha recentemente fatto con me, che il sistema sta ottimizzando per il costo piuttosto che per i risultati.
RAG cresce necessario nel tempo
Nonostante la recente “confessione” di ChatGPT a me che questo è effettivamente il caso, la “shrinkflation” ha un contesto più ampio in questo senso. Sebbene RAG non sia economico, né in termini di frizione dell’esperienza (attraverso la latenza) né in termini di costo di esecuzione, è molto più economico di un addestramento regolare o anche di un ritraining del modello di base.
Per un modello di IA più vecchio con una data di taglio delle conoscenze più lontana, RAG può mantenere l’attualità del sistema, al costo di chiamate di rete e altre risorse; per un modello più recente, le proprie recupero di RAG sono più probabili di essere ridondanti o dannosi per la qualità dei risultati, che in alcuni casi sarebbero stati migliori attraverso euristiche.
Pertanto, l’IA sembra aver bisogno della capacità non solo di giudicare se deve ricorrere a RAG, ma di continuamente evolvere la sua politica sull’uso di RAG mentre i suoi pesi interni diventano più e più datati.
Allo stesso tempo, il sistema deve circondare “costanti relative” nella conoscenza, come orbite lunari e letteratura classica, cultura e storia; nonché geografia di base, fisica e altri principi scientifici che sono improbabili di evolversi molto nel tempo (cioè, il rischio di “cambiamento improvviso” non è inesistente, ma basso).
Argomenti outlier
Al momento, almeno per quanto riguarda ChatGPT, le chiamate RAG (cioè l’uso della ricerca web per qualsiasi query dell’utente che non richieda esplicitamente o implicitamente la ricerca web) sembrano raramente essere scelte autonomamente dal sistema, anche quando si tratta di “sottodomini marginali”.
Un esempio di dominio marginale è l’uso di software “oscuro”. In tale caso, i dati di origine minimi disponibili avranno lottato per l’attenzione durante l’addestramento, e lo stato di “outlier” dei dati potrebbe averli segnalati per l’attenzione o seppelliti come “marginali” o “inconsequenziali” – e anche un solo post di forum aggiuntivo fatto dopo la data di taglio delle conoscenze dell’IA potrebbe rappresentare un aumento sostanziale dei dati totali disponibili e della qualità della risposta per un “piccolo” argomento, rendendo una chiamata RAG utile.
Tuttavia, il vantaggio di RAG tende a diminuire man mano che il modello di base diventa più potente. Mentre i modelli più piccoli traggono vantaggio significativamente dalla recupero, i sistemi più grandi come Qwen3-4B o GPT-4o-mini/-4o mostrano spesso un miglioramento marginale o addirittura negativo da RAG*.
Su molti benchmark, la recupero introduce più distrazione che beneficio, suggerendo un compromesso tra investire in un modello più grande con una copertura interna più ampia o un modello più piccolo abbinato alla recupero.
Pertanto, RAG sembra più utile per compensare le lacune in modelli di medie dimensioni, che hanno ancora bisogno di fatti esterni, ma possono valutarli con euristiche interne meno complesse.
Utilizzare solo in caso di emergenza
Le politiche guida di ChatGPT sulla decisione di utilizzare RAG non sono esposte apertamente dal suo presunto prompt di sistema**, ma sono implicitamente affrontate (verso la fine):
‘Utilizzare lo strumento web per accedere a informazioni aggiornate dal web o quando la risposta all’utente richiede informazioni sulla sua posizione. Esempi di quando utilizzare lo strumento web includono:
Informazioni locali: Utilizzare lo strumento web per rispondere a domande che richiedono informazioni sulla posizione dell’utente, come il meteo, aziende locali o eventi.
Freschezza: Se le informazioni aggiornate su un argomento potrebbero potenzialmente cambiare o migliorare la risposta, chiamare lo strumento web ogni volta che altrimenti si rifiuterebbe di rispondere a una domanda perché la propria conoscenza potrebbe essere superata.
Informazioni di nicchia: Se la risposta trarrebbe beneficio da informazioni dettagliate non ampiamente note o comprese (che potrebbero essere trovate su internet), come dettagli su un piccolo quartiere, un’azienda meno conosciuta o regolamenti arcani, utilizzare fonti web direttamente piuttosto che affidarsi alla conoscenza distillata dall’addestramento.
Accuratezza: Se il costo di un piccolo errore o di informazioni superate è alto (ad esempio, utilizzare una versione superata di una libreria di software o non conoscere la data del prossimo gioco per una squadra sportiva), allora utilizzare lo strumento web.’
In particolare, possiamo notare queste direzioni che promuovono RAG in casi in cui i dati nativamente addestrati sono scarsi. Ma come arriva il sistema a questa comprensione? L’utente casuale e osservatore di ChatGPT potrebbe concludere che in quelle occasioni in cui il widget “ricerca web” si visualizza dopo una pausa, le euristiche interne del modello sono state appena sondaggiate per la query e sono risultate vuote.
Possiamo anche notare che, per implicazione, RAG è raccomandato solo per un numero molto limitato di casi d’uso. Ciò lascia GPT raccomandato di sondare le proprie pesi in tutti i casi, tranne che in una “contingenza critica” (‘Accuratezza’, in fondo alla citazione sopra), per la vasta gamma di domande di fatto in cui la tendenza dell’IA a hallucinare potrebbe essere una nota passività.
Conclusione
Le tendenze della ricerca attuale e recente indicano che la generazione euristica è veloce e economica, ma sbagliata troppo spesso; mentre RAG è più lento, più costoso, ma molto più frequente giusto – tanto più quanto la dimensione del modello diminuisce.
Basandomi sul mio uso di ChatGPT, arguirei che OpenAI sta utilizzando RAG troppo di rado, come uno strumento di precisione piuttosto che come un guidatore quotidiano, specialmente dal momento che le questioni con le finestre di contesto in crescita rendono i modelli di linguaggio più probabili di allucinare man mano che le conversazioni lunghe si sviluppano.
Questa circostanza potrebbe essere notevolmente alleviata verificando le risposte euristiche contro fonti di autorità basate sul web, senza aspettare che l’utente finale dubiti dell’output o sia intrappolato da esso, e senza che i risultati interni debbano essere così manifestamente insoddisfacenti che la decisione di utilizzare RAG sia inevitabile.
Piuttosto, il sistema potrebbe essere addestrato a selezionare e intelligentemente dubitare di se stesso secondo i casi, e quindi a impegnarsi con il web attraverso un processo di screening che sarebbe, di per sé, euristico. Non sono a conoscenza del fatto che le architetture dei modelli attuali lascino spazio a un approccio di questo tipo, che dovrebbe invece essere aggiunto alla frizione dei filtri API.
Come si trova, non posso nemmeno dimostrare che esista un problema; nemmeno con una confessione†:

* Si prega di fare riferimento al link in alto in questo paragrafo.
** Questo è un prompt di sistema “self-exposed” GPT-5 che, di nuovo, potrebbe semplicemente essere un digest da post di forum di prompt riaddestrati per GPT-5, sebbene alcuni sostengano che il prompt sia genuino.
† Non sto realmente suggerendo che la “candore colpevole” di ChatGPT sia significativa qui; la mia tendenza a spingere contro la sua linea di parte in materia di politica OpenAI significa che alla fine “accetterà” con me, e ripeterà le mie stesse opinioni implicite comunque. Ciò è ben lontano dall’equivalente di blaterare i dettagli dello sbarco in Normandia sotto pressione.
Pubblicato per la prima volta mercoledì, 10 dicembre 2025












