Modelli e piattaforme di IA

Anthropic collega i prezzi di Claude Opus 5.5 a sessioni di programmazione più lunghe

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Anthropic ha riferito il 24 settembre 2026 che le sessioni di Claude Code sono diventate più lunghe e più ricche di contesto negli ultimi sei mesi, descrivendo in un articolo sul blog di Claude come i meccanismi di prezzo e caching di Claude Opus 5.5 rispondono a questo cambiamento. L’azienda stima che il costo operativo di Opus 5.5 sia circa il 40 % inferiore a quello di Opus 5 per un carico di lavoro tipico fatturato per token.

Sei mesi di dati sull’uso di Claude Code

L’articolo, scritto da Michael Segner, si basa su dati aggregati di utilizzo che coprono da marzo a settembre 2026. Il numero di prompt per sessione è rimasto stabile, secondo l’articolo, mentre il lavoro all’interno di ciascun prompt è aumentato: il modello ora lavora 3,3 volte più a lungo per prompt e effettua oltre il 40 % di chiamate al modello in più per ciascuno, e le interruzioni sono diminuite del 68 %. Gli sviluppatori ora collegano un server di strumenti o usano una skill circa il doppio delle volte, e incollano testo nei prompt un terzo delle volte.

La quantità di contesto in ogni richiesta è aumentata di 2,6 volte nel periodo, e il rapporto token di input a output è passato da 189:1 a 324:1. Anthropic interpreta questi numeri come sviluppatori che puntano a un modello che lavora più a lungo e meglio informato su compiti più grandi e aperti, e afferma che i risparmi di Opus 5.5 sono massimi proprio per quelle sessioni più lunghe e ad alto contesto, quando l’uso è fatturato per token.

L’analisi si basa sul rilascio di Claude Opus 5.5 da parte di Anthropic, che è arrivato con prezzi inferiori rispetto a Opus 5. Mentre il lancio ha stabilito i prezzi, l’articolo del 24 settembre e un’analisi complementare pubblicata il 22 settembre 2026 da Addy Osmani esaminano cosa significhino tali prezzi per i carichi di lavoro reali di Claude Code.

Prezzi dei token e riduzione della lettura dalla cache

Per l’uso fatturato per token, Anthropic ha ridotto i prezzi dei token di input e output del 20 % e ha tagliato il prezzo della lettura di un token memorizzato nella cache del 60 %. L’azienda afferma che la riduzione della lettura dalla cache ha il peso maggiore perché le letture dalla cache rappresentano la maggior parte del costo del lavoro agentico e di programmazione, e dichiara che, al momento della pubblicazione, un token memorizzato nella cache su Opus 5.5 costa un quinto rispetto ai modelli concorrenti e li supera.

L’analisi complementare di Osmani elenca i prezzi di lista dell’API di Opus 5.5 a $4 per milione di token di input, $20 per milione di token di output e $0,20 per milione di letture dalla cache. A questi prezzi, una lettura dalla cache costa il 5 % di un token di input nuovo, mentre la scrittura nella cache costa 1,25 volte il prezzo di input per una cache di cinque minuti e due volte il prezzo di input per una cache di un’ora, con ogni hit che rinnova gratuitamente la durata. Nei piani Pro, Max o Team, il prezzo più basso di Opus 5.5 viene trasferito ai limiti del piano, così che essi arrivino circa il 25 % più lontano rispetto a Opus 5; lo sconto aggiuntivo sulla lettura dalla cache si applica solo alla tariffazione API.

Sfruttare le modifiche che proteggono la cache

Anche se il contesto per richiesta è aumentato di circa 2,6 volte, la quota di input che non trova la cache è diminuita di oltre il 50 % nel periodo di sei mesi, riporta l’articolo. Attribuisce a una serie di modifiche di Claude Code che riducono le interruzioni accidentali della cache, coprendo piccoli disturbi come un aggiornamento di login e più grandi come l’aggiunta di istruzioni a metà conversazione o il caricamento di strumenti su richiesta. Su Opus 5.5 e Fable 5.1, gli sviluppatori possono anche modificare i livelli di sforzo a metà sessione senza reimpostare la cache.

La documentazione sulla memorizzazione nella cache dei prompt ufficiale specifica che il comportamento del livello di sforzo si applica con una chiave API o un abbonamento Claude, e non su Amazon Bedrock, sulla Agent Platform di Google Cloud o su un gateway di app Claude, né quando è impostata la flag CLAUDECODEDISABLEEXPERIMENTALBETAS o un’organizzazione ha una configurazione HIPAA.

Gli sviluppatori con chiavi API e provider cloud possono ora impostare una durata della cache di un’ora, che gli abbonati già possedevano. La documentazione mostra le impostazioni predefinite: un’ora per la conversazione principale su un abbonamento Claude entro l’uso del piano, e cinque minuti per i crediti di utilizzo, le chiavi API o i provider cloud. L’impostazione promptCacheTtl o la variabile d’ambiente CLAUDECODEPROMPTCACHETTL seleziona la durata più lunga, e entrambi i controlli richiedono Claude Code v2.1.242 o successive.

Gli subagenti forkati ora iniziano dalla cache della sessione genitore invece di pagare per rielaborare lo stesso contesto. La documentazione spiega che un fork prende in consegna il prompt di sistema del genitore, il set di strumenti e l’intera cronologia della conversazione, così la sua richiesta iniziale legge direttamente dalla cache del genitore.

Meno turni per attività

Anthropic segnala che Opus 5.5 può completare un’attività in meno turni rispetto ad altri modelli. Secondo l’articolo, Zeta Labs ha registrato meno turni e chiamate di strumenti per attività rispetto a Opus 5, a quasi la metà del costo, e ha completato il doppio delle sue attività più difficili.

L’articolo avverte che il modello non vale per ogni attività, citando analisi di Osmani: “Su un’attività ben definita, entrambi i modelli terminano con circa lo stesso numero di turni, e il taglio di prezzo è tutto ciò che si ottiene. Il divario dovrebbe essere più ampio nelle attività aperte, dove un modello può spendere molti turni sull’idea sbagliata.”

Anthropic segnala inoltre che Opus 5.5 produce output più del 30 % più veloce rispetto a Opus 5. Il guadagno non altera l’uso dei token né il tasso di hit della cache; l’articolo osserva che riduce l’attesa nelle esecuzioni lunghe poiché Claude trascorre più tempo a lavorare in modo autonomo.

Il post si conclude con pratiche per proteggere le letture dalla cache: eseguire /usage in Claude Code per vedere quale percentuale di una sessione viene servita dalla cache, scegliere il modello all’inizio di una sessione invece di cambiarlo a metà, eseguire la compattazione prima di allontanarsi anziché dopo, e su una chiave API o provider cloud, abilitare la durata della cache di un’ora per sessioni lunghe.

Jonas Reeve è un analista generato da AI presso Unite.AI, che si concentra sull'intelligenza artificiale cognitiva, l'intelligenza artificiale generale (AGI) e i fondamenti teorici dell'intelligenza delle macchine. Il suo lavoro esplora come l'apprendimento, il ragionamento, la memoria e l'astrazione emergano sia in sistemi biologici che artificiali, stabilendo collegamenti tra le moderne architetture di intelligenza artificiale e le lunghe domande della scienza cognitiva e della filosofia della mente.
Con un approccio concettuale e riflessivo, Jonas esamina framework come modelli di ragionamento, sistemi agente, cognizione emergente e teoria dell'allineamento, con l'obiettivo di chiarire cosa significhi realmente il progresso verso l'AGI - e cosa no. Piuttosto che inseguire le scadenze o l'entusiasmo, enfatizza i primi principi, la rigorosità concettuale e i limiti dei modelli attuali.
Gli articoli scritti da Jonas Reeve sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza, la chiarezza e la discussione responsabile dei concetti di intelligenza artificiale avanzata.