Leader di pensiero
Perché i costi dei token stanno facendo esplodere i budget dei CFO nel 2026

In meno di un anno, i costi dei token di IA sono passati dall’essere un dettaglio tecnologico marginale a diventare un problema di bilancio per i consigli di amministrazione. Dodici mesi fa, il «costo dei token» non figurava tra le voci tenute sotto controllo dalla maggior parte dei direttori finanziari. Oggi compare in tutti i posti sbagliati: nelle notizie, nelle comunicazioni interne, nei blocchi dei budget e nelle presentazioni dei risultati.
Alla fine del 2025 Uber ha dato ai propri ingegneri accesso a Claude Code. Entro aprile 2026, l’azienda aveva consumato in quattro mesi l’intero budget annuale per la programmazione con l’IA. La risposta è stata fissare un tetto di spesa di 1.500 dollari per dipendente, al mese e per strumento, come riportato per primo da Bloomberg. Se si consente di utilizzare insieme due strumenti di programmazione agentica, per esempio Claude e Cursor, tale limite raddoppia a 3.000 dollari al mese per ingegnere, cioè 36.000 dollari l’anno per l’utilizzo dell’IA da parte di una sola persona. Si stima che Uber abbia circa 4.000 ingegneri, il che equivarrebbe a una spesa di 144 milioni di dollari per l’IA.
La spesa di Meta potrebbe essere ancora maggiore. Una comunicazione interna avvertiva che i costi dei token di IA erano destinati a raggiungere miliardi di dollari nel 2026. La ragione sta nel meccanismo con cui gli agenti operano su larga scala. Quando un agente IA si collega a una base di codice per correggere un errore o scrivere software, elabora migliaia di token di contesto per ogni singola richiesta. Se questo avviene in un’organizzazione delle dimensioni di Meta e si aggiunge una direttiva aziendale affinché gli ingegneri utilizzino Claude, il consumo di token non si limita a crescere: esplode.
Secondo l’AI Index di Ramp, che monitora i pagamenti reali ai fornitori in più di 70.000 aziende, l’1% delle imprese che adottano maggiormente l’IA spende ormai circa 7.500 dollari per dipendente al mese, e tale spesa cresce del 14,1% ogni mese. Alcuni dirigenti di Mercor, startup di recruiting basato sull’IA, hanno dichiarato pubblicamente che in determinate organizzazioni i costi dei token di IA stanno iniziando ad avvicinarsi o addirittura a superare il costo della retribuzione dei dipendenti.
Da tutto ciò si può trarre una lezione. Se questa spesa può sorprendere le più grandi aziende tecnologiche al mondo, può sorprendere chiunque. Il consumo di token è diventato una categoria di spesa realmente nuova, che due anni fa non esisteva in alcun conto economico. Non si comporta come i costi del software che i team finanziari hanno imparato per decenni a modellare e includere nei tradizionali calcoli del ritorno sull’investimento. Capire perché i costi dei token di IA si comportano in modo tanto diverso dalla tradizionale spesa per il software è il primo passo per tenerli sotto controllo.
Perché i costi dei token di IA sono così difficili da prevedere
La tradizionale pianificazione del budget software si basa su un presupposto semplice: i costi crescono con il numero di dipendenti. Dieci dipendenti in più significano dieci licenze in più, a un prezzo noto. È facile fare previsioni e pianificare quando le aziende crescono o acquistano nuove piattaforme software.
I token di IA fanno venir meno tale presupposto. Il costo cresce con l’utilizzo, non con il numero dei dipendenti, e l’utilizzo è estremamente disomogeneo, difficile da prevedere e, nel caso degli agenti autonomi, non è nemmeno legato a una persona seduta davanti a una tastiera. Un singolo ingegnere che esegue una sessione di programmazione agentica può consumare migliaia di dollari in un mese senza alcun preavviso, perché il contatore continua a girare indipendentemente dall’utilità del risultato. Molti modelli generano inoltre migliaia di token nascosti e invisibili solo per «ragionare» passo dopo passo prima di rispondere, moltiplicando il costo di ogni richiesta.
È questo l’elemento che la maggior parte delle organizzazioni non ha ancora incluso nelle proprie previsioni: ogni nuovo dollaro destinato all’IA agentica deve provenire da qualche altra voce. Per la maggior parte dei direttori finanziari non si tratta di un errore di arrotondamento assorbito da un fondo per l’innovazione. Parliamo di milioni di dollari di nuove spese che due anni fa non esistevano. Ciò crea una vera scelta tra queste spese e il numero di dipendenti, altri investimenti tecnologici o i budget discrezionali in altre aree aziendali.
I tre livelli di rischio della spesa aziendale per l’IA
Osservando come le organizzazioni spendono effettivamente per l’IA, emerge uno schema più chiaro. Il rischio dei costi non è distribuito in modo uniforme. Si concentra in punti specifici e, in una tipica organizzazione, probabilmente solo uno dei tre livelli è oggi sotto controllo.
Gli utenti aziendali nelle vendite, nel marketing e nelle operazioni utilizzano in gran parte strumenti con prezzi per licenza: una tariffa fissa di 20-30 dollari per utente al mese. È il livello che il settore finanziario sa già come pianificare, perché si comporta esattamente come qualsiasi altra voce SaaS acquistata negli ultimi vent’anni.
Gli sviluppatori che utilizzano strumenti di programmazione agentica sono all’origine delle storie come quella di Uber, e l’intera categoria è appena passata dalle tariffe fisse ai prezzi a consumo. GitHub Copilot è passato alla fatturazione basata sui token nel giugno 2026 e gli sviluppatori hanno previsto bollette in aumento da 29 a 750 dollari al mese e da 50 a 3.000 dollari mensili durante sessioni agentiche intensive. Uber non è un’eccezione, ma un primo sguardo alla direzione verso cui si sta muovendo l’intera categoria.
Gli agenti autonomi sono il livello che quasi nessuno ha ancora modellato. Per un agente non esiste il concetto di «licenza utente». Opera senza supervisione, avvia sotto-agenti, riprova quando fallisce e consuma token per tutto il tempo, indipendentemente dal fatto che produca qualcosa di valore. È il livello con meno dati sui costi e meno precedenti nella pianificazione del budget.
In termini semplici, il livello con cui i direttori finanziari hanno maggiore familiarità è anche quello che presenta il rischio economico minore. I due livelli che stanno realmente facendo esplodere i budget sono quelli che abbandonano prezzi prevedibili proprio nel momento in cui l’utilizzo cresce più rapidamente.
Colmare il divario nella gestione dei costi dell’IA
Il tema comune tra Uber, Meta e il più ampio insieme di dati di Ramp è la mancanza di visibilità. La maggior parte delle organizzazioni non dispone di uno strato di controllo tra il dipendente o l’agente e lo strumento che viene aperto. I tetti di spesa come quello di Uber sono una soluzione grossolana applicata a posteriori a un problema che richiederebbe in realtà un intervento a monte.
Questa è la lacuna che una nuova categoria di strumenti, spesso denominata orchestrazione degli agenti o gateway per agenti, intende colmare: indirizzare ogni attività al modello meno costoso in grado di gestirla, applicare limiti di spesa prima che vengano superati e fornire alla funzione finanziaria un contatore in tempo reale anziché una sorpresa mensile.
Questa categoria si evolve rapidamente e si sta già dividendo in alcuni livelli distinti. Un livello è costituito dai gateway con controllo dei costi, che si collocano tra le applicazioni di un’organizzazione e i fornitori di modelli, aggiungendo limiti di spesa per team, l’instradamento automatico delle attività semplici verso modelli meno costosi e la memorizzazione delle risposte nella cache: gli stessi strumenti a cui Uber è ricorsa manualmente quando ha imposto il proprio tetto. Un secondo livello è l’orchestrazione degli agenti, che si concentra sul coordinamento di più agenti che lavorano insieme e integra sempre più la visibilità dei costi sin dall’inizio, invece di aggiungerla in seguito. Un livello più recente, rivolto alla funzione finanziaria, sta iniziando a trattare la spesa per l’IA come i team FinOps trattano da tempo la spesa per il cloud: attribuita per team e funzionalità, pianificata e riesaminata ogni mese, anziché scoperta a posteriori.
Esiste inoltre un approccio architetturale che punta a limitare la spesa riducendo la dipendenza dai grandi modelli linguistici. Alcune aziende hanno iniziato a creare architetture ibride SLM/LLM, nelle quali piccoli modelli linguistici vengono addestrati su un insieme ristretto di attività aziendali, per esempio politiche interne, servizio clienti, elaborazione di documenti di prestito o analisi dei manifesti di carico. I vantaggi economici possono essere notevoli.
Secondo un confronto del 2026 tra LLM aziendali, con un milione di conversazioni al mese i costi dei principali LLM ospitati vanno da 15.000 a 75.000 dollari mensili, mentre un piccolo modello linguistico perfezionato e distribuito internamente costa da 150 a 800 dollari al mese per lo stesso volume. Goldman Sachs, per esempio, gestisce la spesa per l’IA su larga scala attraverso un gateway centralizzato che classifica ogni richiesta in base al tipo di attività e la indirizza verso il modello più conveniente per quel lavoro, dai modelli open source leggeri ai principali LLM, il tutto entro il proprio perimetro di sicurezza.
Il filo conduttore è che la maggior parte degli strumenti attuali è stata costruita da e per gli ingegneri, allo scopo di potenziarne la produttività attraverso gli agenti. Lo strato che ancora manca alla maggior parte delle organizzazioni è quello progettato per rispondere direttamente alle domande del direttore finanziario: quale team, quale budget, come prevediamo le spese e quale caso d’uso aziendale è sostenuto da questa spesa? È probabilmente questa la lacuna che conterà di più man mano che la spesa per l’IA agentica continuerà ad accumularsi.
Due anni fa, nulla di tutto questo esisteva come voce di bilancio. Oggi i costi dei token di IA sono una delle voci del bilancio in più rapida crescita e meno comprese, e la gestione dei costi dell’IA sta rapidamente diventando una disciplina finanziaria fondamentale invece di un progetto secondario. Abbiamo assistito a una storia simile quando il cloud è stato adottato per la prima volta e i costi sono esplosi durante quella fase iniziale. Le organizzazioni che pianificano l’introduzione dell’IA agentica farebbero bene ad avviare ora questa discussione tra ingegneria e finanza e a definire un approccio di gestione. Uber e Meta hanno già mostrato cosa accade quando la conversazione avviene dopo, invece che prima.












