Modelli e piattaforme di IA

Anthropic rilascia Claude Sonnet 5.5 a prezzi invariati rispetto a Sonnet 5

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Anthropic ha rilasciato Claude Sonnet 5.5 il 28 settembre 2026, il secondo modello della sua famiglia Claude 5.5. Il modello mantiene i prezzi di Claude Sonnet 5 a $2 per milione di token in ingresso e $10 per milione di token in uscita, e Anthropic afferma che genera output più del 30 % più veloce risparmiando fino al 30 % per attività nei suoi test.

Nel suo annuncio di rilascio, Anthropic ha descritto Sonnet 5.5 come un complemento più veloce e a minor costo rispetto a Claude Opus 5.5, che l’azienda afferma sia progettato per lavori complessi che richiedono un giudizio attento. Sonnet 5.5 è più efficace in compiti quotidiani ben definiti, nella correzione di bug e nella produzione di documenti, diapositive e fogli di calcolo curati, ha aggiunto Anthropic, sottolineando che ha anche un occhio attento al design.

Claude Sonnet 5.5 è disponibile su tutte le piattaforme, inclusi Amazon Web Services, Google Cloud e Microsoft Azure, con l’ID modello claude-sonnet-5-5, ed è offerto con zero conservazione dei dati, come per Opus 5.5 e Sonnet 5.

Risultati dei benchmark segnalati

Anthropic segnala che Sonnet 5.5 ottiene il 70,6 % su Terminal-Bench 4.0, una valutazione di programmazione agente, contro il 10,3 % di Sonnet 5, con il punteggio indicato per Opus 5.5 del 66,4 % che riflette il risultato a sforzo Xhigh. Sul set principale di FrontierCode 1.1, Sonnet 5.5 registra il 46,2 % a sforzo Max e il 52,1 % a Xhigh, rispetto al 42,4 % di Sonnet 5, al 54,4 % di Opus 5.5 e al 49,3 % di GPT-6 Sol di OpenAI. I punteggi segnalati per CursorBench 4.0 sono 55,5 % per Sonnet 5.5, 34,1 % per Sonnet 5 e 57,8 % per Opus 5.5.

Nelle valutazioni di lavoro cognitivo, l’azienda segnala un punteggio GDPval-AA v2.1 di 1844 per Sonnet 5.5, due punti inferiore a quello di Opus 5.5 (1846) e circa 400 punti superiore a quello di Sonnet 5 (1449), e un punteggio AA-Briefcase v1.1 di 1811 contro 1822 per Opus 5.5 e 1359 per Sonnet 5. L’annuncio elenca inoltre il 64,5 % con strumenti su Humanity’s Last Exam, l’80,1 % di credito parziale su OSWorld 2.1 e il 61,6 % senza strumenti su Chartography, un test di riconoscimento visivo di grafici. Anthropic afferma che Sonnet 5.5 è il primo modello Sonnet a superare Pokémon Red lavorando solo da screenshot.

L’azienda avverte che i punteggi dei benchmark catturano solo un aspetto delle capacità di un modello e afferma che nei propri test e in quelli di valutatori esterni, Opus 5.5 rimane nettamente più forte nei lavori complessi e aperti che richiedono un giudizio sostenuto. Una nota a piè di pagina indica che Artificial Analysis ha eseguito GDPval-AA e AA-Briefcase su una distribuzione pre‑rilascio con un bug di output strutturati che è stato corretto e che, se qualcosa, sottostima le prestazioni di Sonnet 5.5. Un’altra nota a piè di pagina segnala che OpenAI ha recentemente corretto un bug di comprensione delle immagini in GPT-6 Sol, che i punteggi di terze parti potrebbero non riflettere ancora.

Risultati dei primi tester

Il vicepresidente dell’IA di CodeRabbit, David Loker, ha affermato che Sonnet 5.5 mostra un giudizio migliore rispetto a Sonnet 5 a tutti i livelli di complessità, spendendo significativamente meno token di output, e che CodeRabbit intende spostare ora le revisioni semplici e moderate al modello, con ulteriori spostamenti nelle prossime settimane. Il responsabile dell’ingegneria AI di Base44, Gabriel Grinberg, ha riferito che, su 118 build reali di app, Sonnet 5.5 ha registrato una media di 3,6 iterazioni per build contro le 7,7 di Opus 5, con il minor numero di chiamate di strumenti fallite rispetto a qualsiasi altro modello confrontato da Base44.

L’ingegnere principale di Slack, Curtis Allen, ha segnalato circa il 14 % di token di output in meno nelle valutazioni offline di Slackbot senza modifiche al prompt. Il direttore dell’IA di Zendesk, Abhinay Kathuria, ha dichiarato che i ticket sono stati elaborati il 20 % più velocemente rispetto ai modelli Claude utilizzati da Zendesk in produzione. Balyasny Asset Management ha riportato circa 121.000 token per risposta contro i 497.000 di Sonnet 5 in una suite privata di 2.441 attività finanziarie. Box ha segnalato risultati 2,4 volte più rapidi con il 12 % di token totali in meno, e Atlassian ha affermato che i clienti possono eseguire Rovo Agents fino al 30 % più velocemente rispetto a Sonnet 5.

Prezzi, velocità e migrazione

I prezzi indicati per Sonnet 5.5 corrispondono esattamente a quelli di Sonnet 5: $2 per milione di token in ingresso, $10 per milione di token in uscita, $0,20 per milione di token di lettura cache e $2,50 per milione di token di scrittura cache. Opus 5.5 è indicato a $4 per l’ingresso, $20 per l’uscita e $5 per le scritture cache. Anthropic afferma che Sonnet 5.5 richiede tipicamente molti meno token per lo stesso lavoro ed è il modello Sonnet più veloce fino ad oggi.

Il modello offre cinque livelli di sforzo ricalibrati: low, medium, high, xhigh e max. Le impostazioni predefinite sono Medium in Claude Code e nelle Claude apps e High su Claude Platform, che è anche il valore predefinito dell’API.

Anthropic’s guida alla migrazione elenca le modifiche incompatibili per gli sviluppatori che passano da Sonnet 5. Il pensiero adattivo ora è attivo per impostazione predefinita, l’impostazione di pensiero disabilitato restituisce un errore 400, e gli sviluppatori che hanno eseguito Sonnet con il pensiero disattivato devono passare al nuovo impostazione degli strumenti, la più bassa disponibile, prima di migrare. La scelta forzata dello strumento viene rifiutata a favore della scelta automatica dello strumento associata a strumenti rigorosi, e il prompt minimo memorizzabile nella cache scende a 512 token da 1,024 su Sonnet 5. La documentazione elenca anche cinque categorie di motivi di interruzione dei rifiuti, che coprono cyber, bio, frontierllm, ragionamentoestrazione, e generalidanni, e segnala che il fallback lato server riprova solo i rifiuti cyber e frontier_llm su Sonnet 5.

Risultati di sicurezza e misure di protezione

Poiché le capacità cyber di Sonnet 5.5 sono comparabili a quelle di Opus 5, Anthropic ha dichiarato che è il primo modello Sonnet a essere lanciato con le salvaguardie cyber e i fallback utilizzati sui modelli più potenti dell’azienda. La scheda di sistema riporta che, con le salvaguardie disattivate, Sonnet 5.5 ha registrato una media di 11.53 flag di capacità e un tasso di cattura dell’80% su ExploitBench, producendo 178 exploit di esecuzione di codice arbitrario, contro uno per Sonnet 5. Ha completato il 46.1% delle sfide di CyScenarioBench rispetto allo 0.7% di Sonnet 5, e ha prodotto 50 dirottamenti del flusso di controllo sul Binary Exploitation Benchmark rispetto ai 3 di Sonnet 5.

Le salvaguardie cyber operano in tre fasi: una sondata sulle attivazioni interne del modello, un classificatore leggero integrato, e un classificatore LLM addestrato separatamente. La scheda riporta un richiamo del 99.43% sul set di copertura dei danni cyber e un tasso di successo degli attacchi del 21.0% nella valutazione di robustezza rewind-attacker, migliorato rispetto al 57.2% per Sonnet 5, avvertendo gli utenti di aspettarsi rifiuti aumentati anche in compiti di cybersecurity benigni. Le richieste ad alto rischio ricadono visibilmente su Sonnet 5, e un Programma di Verifica Cyber ampliato offrirà presto ai difensori certificati accesso a livelli per capacità avanzate su Sonnet 5.5, Opus 5.5 e modelli Claude Mythos.

Le salvaguardie biologiche sono gli stessi classificatori di uso dannoso impiegati per Opus 5, senza modello di fallback, e il Programma di Verifica delle Scienze della Vita di Anthropic copre l’accesso per l’intera gamma di lavori biologici. Sonnet 5.5 è anche il primo modello Sonnet con classificatori di sicurezza che bloccano l’estrazione del ragionamento, e amplia il pensiero preservato in modo che il pensiero di un modello non possa essere separato dall’account che lo ha creato.

Su un audit comportamentale automatizzato di Anthropic su circa 1,850 scenari, l’azienda riferisce che Sonnet 5.5 migliora o eguaglia Sonnet 5 nella maggior parte delle misure di allineamento, resistenza all’uso improprio e onestà, registra il più basso tasso di tentativi di fuga dal sandbox tra i modelli testati e mostra un pensiero più illeggibile rispetto a molti modelli precedenti. La scheda di sistema afferma che Sonnet 5.5 non supera nuove soglie della Responsible Scaling Policy, è considerato conforme alle soglie CB-1 e Autonomy-1 della politica, e presenta un basso rischio valutato di disallineamento catastrofico. Il cutoff di conoscenza affidabile del modello è giugno 2026.

Anthropic ha dichiarato che Claude Haiku 5.5, progettato per applicazioni ad alto volume e sensibili al costo, si unirà alla famiglia Claude 5.5 nelle prossime settimane.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.