Leader di pensiero
La memoria della tua azienda dovrebbe durare più a lungo dei suoi modelli di IA

Spesso ci si chiede quale modello alimenta la mia azienda. La risposta è importante: determina qualità, costi e limiti, e sono felice di dedicare un’ora a questo. Voglio anche sapere un’altra cosa: cosa avrà ancora l’organizzazione quando quel modello cambierà.
Immaginalo come una data. Se il tuo provider raddoppiasse il prezzo di martedì, o ritirasse l’endpoint su cui hai costruito, cosa possederesti ancora mercoledì mattina?
Per molte aziende, la risposta onesta è: una chiave API, una fattura e una cronologia di conversazione molto lunga che risiede sui server di qualcun altro, sotto il loro programma di conservazione.
Il mio background è la chimica. Ho trascorso anni a costruire modelli grey-box per impianti chimici, collegati a SCADA, risultati di laboratorio e alle note dell’operatore. Quel lavoro insegna rapidamente una regola: un numero senza le sue condizioni non è un risultato. Se qualcuno ha sostituito un sensore la scorsa settimana e nessuno l’ha annotato, la lettura sullo schermo non spiega nulla.
Questo è un problema di taccuino di laboratorio. Ora si presenta come un problema di approvvigionamento, e raramente compare nella tabella dove viene deciso il budget per l’IA.
Tre domande a cui si risponde in una sola
Una finestra di contesto più ampia consente a un modello di utilizzare più informazioni all’interno di una singola richiesta. L’archiviazione durevole determina cosa sopravvive tra le richieste. La portabilità stabilisce se tali informazioni rimangono utilizzabili quando il provider cambia. Queste sono domande architetturali separate, e la finestra da un milione di token ha spinto tutti a trattarle come un’unica questione.
La documentazione di Google offre l’analogia direttamente: “Un’analogia per la finestra di contesto è la memoria a breve termine.” Prendila alla lettera. La memoria a breve termine è ciò che perdi.
Quindi ogni fornitore che vende una finestra enorme vende anche qualcosa di separato per mantenere lo stato. Leggi questi livelli in modo preciso, con le loro parole, e annota cosa copre effettivamente ciascuno.
OpenAI conserva gli oggetti Response per 30 giorni per impostazione predefinita; Gli oggetti Conversation e i loro elementi sono esenti da quel TTL. L’eliminazione di 30 giorni di Amazon si applica all’API Bedrock Session Management, e riguarda solo quell’API. Lo strumento di memoria client-side di Anthropic illustra un confine utile: il modello richiede operazioni di memoria, l’applicazione controlla l’archiviazione, mentre la stessa azienda fornisce anche archivi di memoria gestiti per i suoi agenti ospitati.
Tutte queste sono decisioni ingegneristiche ordinarie, pubblicate apertamente. Significa anche che le regole di conservazione per il contesto operativo della tua azienda vivono nelle note di rilascio di qualcun altro, e dovresti essere in grado di indicare quale regola si applica a ciascuno dei tuoi dati.
Dove risiede realmente il costo di migrazione
Sostituire una chiamata di generazione di testo con un’altra richiede un fine settimana. Ecco perché dire “siamo multi-modello” è così facile. Gli strati costosi sono quelli che nessuno dimostra.
Incorporamenti. Cambiare il incorporamento modello tipicamente richiede il re-incorporamento del corpus e la migrazione o la ricostruzione dell’indice. Un cambiamento di generazione modello non richiede tale requisito, e i due vengono costantemente confusi — di solito da chi promette che la migrazione sarà rapida. La letteratura del 2025 descrive il percorso standard come “ri-codificare l’intero corpus e ricostruire l’indice Approximate Nearest Neighbor (ANN), provocando una significativa interruzione operativa e un costo computazionale”; il contributo di quel documento, Drift-Adapter, è un metodo per posticipare la ricostruzione apprendendo una trasformazione tra spazi di incorporamento. In ogni caso, il costo della migrazione copre la validazione del recupero e il lavoro operativo così come le chiamate di incorporamento stesse.
Comportamento ottimizzato. Una frase del avviso di deprecazione di settembre 2025 appartiene a tutti i dipartimenti di approvvigionamento: “I modelli precedentemente ottimizzati non saranno più accessibili.” Un comportamento per cui hai pagato la creazione, ritirato insieme all’endpoint che lo ospitava. Tutti hanno seguito il processo pubblicato. Il tuo modello è comunque scomparso.
Comportamento di prompt e strumenti. Le stesse istruzioni producono un’applicazione diversa su un modello differente. In un’applicazione aziendale, i ricercatori hanno segnalato il calo del tasso di superamento della regressione dal 100% sul modello originale al 97,3% su uno più recente con prompt identici, recuperato solo dopo una riprogettazione deliberata del prompt. Gli scenari di test compaiono in produzione con le proprie frequenze, così quel dato non supporta alcuna stima di quanto spesso i flussi di lavoro live falliscano. La regola operativa che sostiene è più semplice: valida ogni aggiornamento del modello a livello di applicazione, personalmente, prima che raggiunga un cliente.
Tutto ciò arriva alla fattura alla fine, molto tempo dopo che le pagine dei prezzi sono state confrontate.
Qualcun altro sta gestendo il tuo calendario
La deprecazione avviene secondo un calendario pubblicato, e i calendari non sono i tuoi. OpenAI ha dato un preavviso di un anno prima di chiudere l’Assistants API nell’agosto 2026 – generoso secondo gli standard della stessa pagina, dove GPT-4.5 Preview ha ottenuto circa tre mesi. La politica di Mistral è di sei mesi per i modelli GA e di un mese per quelli preview e di terze parti, con un avviso che un alias rotante “potrebbe esporvi a aggiornamenti silenziosi nel comportamento e nei prezzi del modello.”
AWS dice la parte silenziosa ad alta voce nella sua politica di ciclo di vita: “Migrare a un modello Active prima della data di fine vita; la migrazione non avverrà automaticamente.”
La tua roadmap ha un coautore. Non partecipa mai alle tue riunioni di pianificazione e non gli importa in quale trimestre ti trovi.
Il prezzo è anch’esso una parte mobile
Alle tariffe Standard elencate di Gemini 3.7 Flash, cinque miliardi di token di input non memorizzati nella cache e un miliardo di token di output fatturati costano $7,500 al mese. Le tariffe attualmente programmate per il 1 gennaio 2027 porterebbero quella fattura di token a $15,000, prima di altre spese o sconti, mentre il tuo prodotto fa esattamente quello che faceva prima.
Un listino prezzi congelato può anche generare una fattura più alta. La documentazione sui prezzi di Anthropic osserva che il tokenizzatore usato dalle sue generazioni di modelli più recenti “produce circa il 30% di token in più per lo stesso testo” – dipendente dal contenuto e specifico per quelle generazioni – il che rende l’effetto su una fattura qualsiasi qualcosa da misurare. Quindi misura i token per i quali vieni fatturato. Un listino prezzi da solo non ti dirà nulla.
Per un prodotto che esegue flussi di lavoro, la misura economica utile è il costo di un’attività completata con successo, includendo i tentativi di nuovo e la revisione umana. Tale valore varia quando un modello cambia anche se il listino prezzi rimane invariato.
E nulla di tutto ciò è negoziabile da una posizione in cui l’abbandono richiede un anno. Capgemini ha intervistato 1,300 dirigenti di organizzazioni da miliardi di dollari nella primavera del 2026 riguardo ai fornitori di tecnologia critici in generale: il 36% ha detto che passare a un altro richiederebbe più di dodici mesi, e uno su dieci non aveva alcuna alternativa valida. Questa è una descrizione di una relazione con il fornitore priva di una seconda fonte.
Portala al reparto acquisti
Gestisco un’azienda francese, registrata a Marsiglia, ospitata in Europa, e continuerò a trascurare il discorso sulla sovranità in astratto. L’indipendenza da ogni fornitore di tecnologia è fuori portata per un’azienda normale. Lo stesso studio di Capgemini ha rilevato che il 59% dei dirigenti considera la piena sovranità digitale irrealistica, e sono d’accordo con loro.
Comprendere e controllare le proprie dipendenze critiche è un compito più piccolo, e possibile. Tre domande, tutte rispondibili in una riunione: dove sono archiviati e processati i nostri dati, chi vi può accedere, e cosa servirebbe per continuare a operare con un altro fornitore?
Tutte le aziende sanno come porre questa domanda per la logistica, i pagamenti e l’archiviazione cloud. Se si chiede del contesto lavorativo, la dipendenza europea arriva nella riunione come una discussione su una seconda fonte con un numero allegato, che è una forma su cui gli acquisti possono intervenire.
Una cautela sui numeri citati qui. Il fatto che un’impresa utilizzi diversi modelli ci dice poco sulla sua capacità di spostare il contesto lavorativo tra fornitori. Ciò richiede un test separato: i record, le autorizzazioni e il lavoro incompleto possono essere trasferiti e continuare a essere utilizzati?
Cosa rende davvero un modello intercambiabile
Un’interfaccia condivisa tra i modelli è utile, e ne costruirei una. Dovrebbe rendere visibili le capacità e le dipendenze specifiche di ciascun modello. La portabilità non richiede pretese che tutti i modelli si comportino allo stesso modo, e un’astrazione che appiattisce le differenze elimina silenziosamente il motivo per cui si è pagato per un buon modello.
Il lavoro più gravoso è possedere lo stato che nessun provider dovrebbe custodire da solo. Quattro cose, nell’ordine in cui si rompono.
Un record autorevole sotto il tuo controllo.Messaggi, fonti recuperate, approvazioni, punti di controllo di esecuzione. Registra ciò che è stato completato nei sistemi esterni e ciò che può essere ripetuto in sicurezza: l’email potrebbe essere stata inviata mentre la conferma non è stata salvata, e una procedura di recupero che non lo sa la invierà due volte. Qualsiasi stato del provider che non puoi ricostruire è una dipendenza. Annotalo come tale, esplicitamente, prima che un incidente lo faccia per te.
La fonte accanto a ogni vettore.Un vettore è un artefatto compilato; il chunk è il codice sorgente. Conserva il documento di origine e la sua versione, l’ID del documento, i confini del chunk, la versione del chunker, il modello di embedding con versione e dimensioni, la versione dell’indice e quale elaborazione ha prodotto il testo. Un frammento di testo memorizzato da solo non ricostruirà una tabella, un’immagine o un risultato OCR. Conservare tutto ciò trasforma una re-indicizzazione in una migrazione pianificata, che è tanto conforto quanto prometto.
Record che distinguono fonte, inferenza e decisione. La memoria deve separare ciò che una fonte ha detto, ciò che un modello ha inferito e ciò che una persona ha approvato. Un cliente che promette di pagare giovedì, l’ipotesi del modello che il pagamento si ritardi e un’estensione concordata a venerdì sono tre record diversi con tre stati diversi, e il sistema deve sapere su quale può agire. Ognuno richiede la sua origine, ambito, regole di accesso e stato attuale, inclusa l’indicazione se è stato corretto o sostituito. Una trascrizione può contenere le prove; rigiocarla non identifica in modo affidabile quali conclusioni sono ancora attuali e quali decisioni rimangono valide.
Portabilità che hai effettivamente testato. Rendila verificabile in due modi: un esercizio di esportazione e ripristino, e una suite di valutazione che definisce ciò che l’applicazione deve realizzare. Poi “potremmo passare” diventa una misura che qualcuno può eseguire: il sostituto può continuare i flussi di lavoro rappresentativi all’interno dei tuoi requisiti di qualità, permessi, latenza e costo? E conserva i dati di addestramento che sei autorizzato a riutilizzare, insieme alle loro versioni, configurazione di tuning e test di accettazione. Questi rendono possibile il riaddestramento, senza garanzia di comportamento identico, e l’ID del modello fine‑tuned scade in una data stabilita da qualcuno che non hai mai incontrato.
Quindi usa sessioni ospitate, cache dei prompt e il recupero del provider ovunque siano utili. Spesso sono eccellenti, e rifiutarli per principio è di per sé costoso. Il requisito è che i record che detengono possano essere recuperati e utilizzati altrove mantenendo intatte le loro regole di accesso e conservazione. Noleggia la potenza di calcolo; mantieni il controllo del record.
Non sovrastimerei nemmeno l’architettura. Prima dell’adattamento prodotto‑mercato, lanciare sei settimane prima spesso supera qualsiasi livello di astrazione, e una startup che costruisce tre backend di recupero prima di avere clienti ha creato un museo. Se quel compromesso è giusto dipende dal prodotto e dal costo della ricostruzione eventuale. Mantieni la materia prima recuperabile e una scorciatoia rimane una scorciatoia.
La parte che è cambiata
Mentre l’IA si limitava a rispondere alle domande, perdere il contesto era solo un inconveniente. Ridigiti il prompt e andavi avanti. Ora prenota la riunione, apre il ticket e interagisce con il CRM, e la mancanza di contesto porta a lavori duplicati o incompleti nei sistemi dei tuoi clienti.
I fornitori di modelli creano cose straordinarie e le utilizzo quotidianamente. La responsabilità di cui parlo spetta a noi che costruiamo le piattaforme intermedie: rendere visibili le dipendenze e conservare un registro affidabile di ciò che è stato autorizzato e di ciò che è stato completato.
Ogni flusso di lavoro completato dovrebbe lasciare all’organizzazione qualcosa che possa riutilizzare — un risultato verificato, una decisione con una cronologia tracciabile, un punto di partenza più chiaro per il compito successivo. Quel valore accumulato dovrebbe superare la durata del modello che ha contribuito a crearlo.
Chiediti cosa possederesti ancora mercoledì mattina.












