Leader di pensiero

Il Problema di Memoria dell’Intelligenza Artificiale: Perché il Contesto Lungo Efficientemente Cambia Tutto e Cosa Serve per Farlo Funzionare

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Un collega che dimentica ogni conversazione precedente non appena si conclude non durerebbe a lungo nella maggior parte dei lavori. Eppure, molti sistemi di intelligenza artificiale aziendale funzionano proprio in questo modo. La sessione si chiude e il contesto scompare con essa. Un consumatore che lancia domande una tantum potrebbe non notare quasi nulla, ma un’azienda che esegue un processo che dura più di una sola seduta raggiunge il limite quasi immediatamente.

Il lavoro reale si propaga da una sessione all’altra, e una decisione presa il giovedì si basa solitamente su una presa il lunedì, con il pensiero alla base che deve sopravvivere nel frattempo. Un’intelligenza artificiale che si pulisce quando una sessione termina può funzionare bene all’interno di quella sessione e contribuire ancora nulla a un compito che dura una settimana.

L’intelligenza artificiale aziendale ha cambiato silenziosamente cosa richiede da un modello. Per anni, i modelli sono stati giudicati in gran parte sulla quantità di conoscenza che avevano assorbito. Le aziende ora hanno bisogno che conservino le informazioni giuste in vista mentre il lavoro si svolge, una capacità che richiede un tipo diverso di ingegneria efficiente. Finora, la capacità di mantenere questo livello di conoscenza persistente non è stata raggiunta a causa della grande quantità di memoria (GPU), calcolo e costo richiesti per scalare tale capacità. Mantenere una latenza accettabile e un livello di allucinazione del modello diventa una sfida con l’uso contemporaneo quando si utilizza un contesto lungo. C’è una crescente domanda di tali capacità di conoscenza e non abbastanza memoria e calcolo a disposizione. Quindi, questo solleva la domanda: come si ottiene un’intelligenza più precisa su larga scala con meno infrastrutture e impronta?

La Scrivania e il Cassettone

Due cose vengono raggruppate sotto la voce di memoria, e si comportano abbastanza diversamente da rendere necessario tenerle separate.

Cominciamo con la finestra di contesto, che è quanto un modello può prendere in considerazione e ragionare in un’unica passata. Funziona come la superficie di una scrivania. Una piccola scrivania prende poche pagine alla volta, quindi tutto il resto aspetta in un cassetto e viene recuperato e cancellato mentre si procede, mentre una grande scrivania lascia aperto l’intero fascicolo mentre si lavora su di esso. Quello che la scrivania contiene viene spazzato via alla fine della giornata, ogni giorno.

La memoria persistente è il cassetto accanto alla scrivania. Il sistema sceglie cosa memorizzare e lo richiama quando diventa rilevante, quindi qualcosa che è successo questa settimana può influenzare cosa fa la prossima settimana. Quel deposito si estende tra le sessioni e richiede le proprie decisioni su cosa salvare, come organizzarlo e quando richiamarlo.

Molto dell’ingegneria visibile è stata diretta verso la scrivania. Le finestre che un tempo contenevano poche migliaia di token ora arrivano a centinaia di migliaia, e i modelli più grandi di OpenAI e Anthropic raggiungono circa un milione.

Il termine per questo lavoro, ‘ingegneria del contesto’, proviene da Tobi Lutke di Shopify (SHOP ) ed è stato popolarizzato da Andrej Karpathy a metà del 2025. La competenza principale in qualsiasi applicazione di intelligenza artificiale seria, scrisse Karpathy, è riempire la finestra con le informazioni giuste per il prossimo passo. La sua analogia era l’hardware – il modello come processore, la finestra come memoria di lavoro. I pratici adottarono il termine rapidamente, perché avevano girato intorno all’idea senza un’etichetta per essa.

Avere una Scrivania Più Grande Non Risolve il Problema della Memoria

Ecco dove la mossa ovvia – continuare ad allargare la scrivania – incontra difficoltà.

I ricercatori di Stanford hanno mostrato nel 2024 che quando le informazioni di cui un modello ha bisogno si trovano nel mezzo di un lungo input, la sua accuratezza cala bruscamente rispetto allo stesso fatto collocato all’inizio o alla fine. Lo chiamarono ‘perso nel mezzo’, e valeva anche per modelli progettati specificamente per il contesto lungo. Mettere più informazioni davanti a un modello, si scopre, non è lo stesso che il modello faccia un uso affidabile di esse.

L’effetto si è mantenuto mentre altri team sono andati a cercarlo, e uno studio del 2025 che ha eseguito 18 modelli di frontiera contro input sempre più lunghi ha trovato le prestazioni che si deterioravano molto prima che la finestra fosse anche piena, un modello che i suoi autori hanno chiamato ‘marciume del contesto’. Allargare la scrivania e far sì che un modello ragioni in modo pulito su tutto ciò che si trova su di essa sono due problemi separati, e il primo non fa nulla per risolvere il secondo.

La Cura Guadagna Più della Capacità

L’ingegneria del contesto è cresciuta come disciplina sulla base di questo, con un sondaggio del 2025 che attinge da oltre 1.400 saggi che stabilisce i suoi metodi e Gartner che consiglia ai clienti di dare priorità al contesto rispetto ai prompt nel luglio 2025. L’arte si è spostata dal formulare un’istruzione più acuta all’assemblaggio di un insieme di input più acuti per il modello da cui lavorare.

Una scrivania più grande aumenta le poste in gioco su cosa metterci sopra. Versare un intero archivio di documenti sulla superficie e le poche pagine che contano finiscono perse tra il rumore, le contraddizioni e le versioni superate, dove una selezione più stretta di ciò che effettivamente influenza il compito lascia lo stesso modello eseguire in modo nettamente migliore. Il giudizio sta in ciò che appartiene davanti al modello, come viene inquadrato, quando appare e cosa rimane nel cassetto.

Questo è ciò per cui RAG (retrieval-Augmented Generation) è stato costruito: tagliare i documenti in frammenti e recuperare quelli che sembrano rilevanti, per aggirare una finestra troppo piccola per contenere l’intero oggetto. Supponiamo che una disputa contrattuale si basi su una clausola a pagina 200. L’approccio usuale taglia il contratto in frammenti e lascia che un sistema di recupero recuperi quelli che sembrano rilevanti. Valutare la pagina 200 come irrilevante e il modello non vede mai la clausola.

Una finestra dimensionata per l’intero contratto salta completamente il passaggio di recupero e fornisce al modello la clausola insieme a tutto ciò che la circonda. Se il modello legge poi un input lungo in modo affidabile è il problema di affidabilità della sezione precedente, ed è un problema migliore da affrontare rispetto a un sistema di recupero che decide silenziosamente che la clausola non valeva la pena di passarla.

Dentro una Sessione e Dopo di Essa

Il contesto lungo è ciò che consente a un agente di intelligenza artificiale di lavorare su un lavoro lungo piuttosto che su uno scambio singolo. Un agente che gestisce una revisione di conformità su più giorni o un fornitore in fase di onboarding mantiene l’intero compito nella finestra mentre lo esegue, quindi ogni passo attinge allo stato completo del lavoro. Una finestra abbastanza lunga può sostituire la memoria all’interno di una sessione.

È anche lì che la somiglianza si ferma. Qualunque cosa il sistema debba ricordare la prossima settimana, una volta chiusa la sessione, deve vivere da qualche parte dove la finestra non è.

Costruire questo tipo di memoria porta un insieme diverso di problemi, molti dei quali l’industria ha appena iniziato ad affrontare. La mia formazione in psicologia e neuroscienze rende difficile non notare la somiglianza con la memoria umana. Non recuperiamo una registrazione perfetta di un evento. Ogni volta che lo ricordiamo, lo ricostruiamo, e piccoli errori possono gradualmente diventare parte della versione accettata. Una memoria macchina può sviluppare un problema simile quando le informazioni archiviate vengono riassunte, fuse o riscritte ripetutamente. Nel tempo, il record può allontanarsi dall’evento originale a meno che qualcuno non lo controlli, corregga gli errori e rimuova le informazioni che sono diventate inaffidabili.

Molte aziende che distribuiscono questi sistemi non hanno ancora raggiunto questi problemi, e poche sono vicine a una soluzione. Ciò che guarderei in un fornitore non è la dimensione della finestra che pubblicizza. Un modello che tiene 10 milioni di token vale poco se la maggior parte di ciò che conserva è obsoleto, irrilevante o sbagliato. Le sue risposte possono sembrare ben documentate mentre si basano su materiale che l’azienda non avrebbe mai dovuto fidarsi. Ciò che guadagna denaro è il giudizio su cosa conservare e la capacità di ragionare in modo accurato su tutte le informazioni, con una frazione del costo e dell’impronta dell’infrastruttura. Questo è fare di più con meno, e non tutte le finestre più grandi vengono con questa vera capacità.

Mathew Haswell è Co-Fondatore di Refiant, un'azienda di intelligenza artificiale che si concentra sull'efficienza dell'IA, sulla compressione e sul rendere i modelli più efficienti e pratici da distribuire, compreso il contesto lungo. Master in Scienze Mediche e neuroscienziato per formazione, ha ricoperto ruoli esecutivi strategici, commerciali, operativi e di prodotto in tecnologia, fintech, gaming, retail e servizi finanziari.