Modelli e piattaforme di IA

Gli ingegneri di Amazon riducono la spesa per l’intelligenza artificiale dopo eccessi di costo

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

I team di ingegneria di Amazon (AMZN ) hanno trovato casi in cui il passaggio dal codice scritto a mano ai modelli di intelligenza artificiale ha fatto esplodere i budget dei progetti, compresi 1,8 milioni di dollari spesi per eseguire Claude Sonnet di Anthropic su un lavoro che non è stato consegnato. Gli ingegneri senior hanno presentato i casi al personale durante una riunione interna il 28 luglio 2026 e li hanno descritti come “catastroficamente costosi”, secondo quanto riportato dal Financial Times, citando più persone familiari con la presentazione. Hanno detto ai colleghi che stanno costruendo barriere automatizzate per limitare quanto i progetti futuri possano spendere.

L’esempio più grande ha abbinato i record degli autori alle liste di prodotti sul sito di vendita al dettaglio di Amazon. La spesa è stata del 860% superiore a quanto previsto per quel progetto, ha richiesto cinque mesi per emergere e la distribuzione è comunque fallita. Due casi più piccoli sono stati presentati accanto ad esso: circa 541.000 dollari di costi imprevisti su un set di strumenti di revisione finanziaria e 134.000 dollari su lavori per migliorare i tempi di consegna in tutta la rete logistica di Amazon, intercettati dopo più di due settimane.

Amazon ha dichiarato di stare “sperimentando, imparando e migliorando” come utilizza la tecnologia, compreso come essa guidi le efficienze dei costi. L’azienda ha anche affermato che presentare una manciata di esempi isolati come norma aziendale distorce come funzionano i team con l’intelligenza artificiale e che i casi coprivano un piccolo numero di gruppi all’interno di una forza lavoro aziendale di circa 300.000 persone.

Cosa fa la fatturazione dei token per un errore di codifica

Il personale è stato informato che gli errori che costano quasi nulla nei sistemi convenzionali diventano costosi una volta che un modello esegue il lavoro. Il motivo si trova nella lista dei prezzi. Anthropic addebita 3 dollari per milione di token di input e 15 dollari per milione di token di output per Claude Sonnet 4.5 e 4.6, con Sonnet 5 a un prezzo introduttivo di 2 e 10 dollari fino al 31 agosto 2026, prima di passare agli stessi tassi. Al prezzo standard di input di Sonnet, 1,8 milioni di dollari comprano all’incirca 600 miliardi di token di input.

Un ciclo di ritentativo che rinviia lo stesso contesto o un lavoro batch puntato su un intero catalogo invece di un campione non genera eccezioni e non crasha nulla. Produce una fattura e la fattura arriva su un ciclo di fatturazione mensile invece che nel registro di costruzione. Quella distanza tra l’errore e il numero è ciò che trasforma una cattiva configurazione in un problema di cinque mesi.

L’unità di fatturazione si è anche mossa. La documentazione di Anthropic nota che Claude 4.7 e modelli successivi utilizzano un tokenizer più recente che produce circa il 30% di token in più per lo stesso testo, quindi lo stesso lavoro fattura più alto su un modello più recente allo stesso tasso di intestazione. Il più ampio passaggio da posti a sedere piatti a token misurati è lo sfondo: Unite.AI lo ha coperto quando Claude Fable 5 è arrivato come utility misurata e di nuovo come l’era dei sempre-accessibili agenti Claude a basso costo si è chiusa.

I controlli che AWS già vende

I controlli per questo problema esatto sono pubblicati sulla pagina dei prezzi di Bedrock di Amazon. L’inferenza batch viene eseguita al tasso della metà rispetto a quello on-demand. Un livello di servizio Flex porta uno sconto del 50% rispetto al prezzo standard, con un livello di priorità al 75% in più per il lavoro che richiede velocità. L’inoltro intelligente delle promemoria costa 1 dollaro per 1.000 richieste e spinge le promemoria più semplici a un modello più economico nella stessa famiglia, che AWS afferma possa ridurre i costi fino al 30% senza danneggiare l’accuratezza.

Anthropic aggiunge due in più. Una lettura della cache è prezziata a un decimo del tasso di input standard, quindi rinviare un prompt di sistema fisso o un documento è la parte economica una volta attivata la cache. E Claude Haiku 4.5 è elencato a 1 e 5 dollari per milione di token, un terzo dei tassi di Sonnet, che è il più grande risparmio disponibile per qualsiasi team che abbia scelto il modello di frontiera per impostazione predefinita.

Ognuno di questi è una decisione per carico di lavoro: quale modello, se il contesto è memorizzato nella cache, se il lavoro viene eseguito in modo interattivo o in una finestra batch e quale soffitto porta il conto. I venditori hanno iniziato a vendere lo strato di applicazione stesso, compreso Spectro Cloud’s PaletteAI inference launchpad, presentato alle aziende che cercano di tenere bassi i costi dei token.

Cosa sta cambiando Amazon

Amazon ha già rimosso un incentivo che puntava nella direzione sbagliata. All’inizio del 2026 ha chiuso una classifica interna che classificava l’uso della piattaforma di sviluppo Kiro da parte dei dipendenti dopo che il personale aveva gonfiato il consumo di token per salire, un’abitudine che aveva preso il nome di “tokenmaxxing”. Le barriere automatizzate descritte dagli ingegneri sono il prossimo passo, inserendo l’applicazione del budget nel percorso di distribuzione invece di una revisione mensile.

La scala spiega perché 1,8 milioni di dollari leggono come una storia di governance piuttosto che finanziaria. Amazon dovrebbe spendere circa 200 miliardi di dollari in spese di capitale nel 2026, la maggior parte dei quali per l’infrastruttura di intelligenza artificiale e data center, contro entrate trimestrali vicine a 180 miliardi di dollari. L’azienda riporterà i risultati del secondo trimestre dopo la chiusura del 30 luglio 2026, e la linea di spesa per il capitale attirerà la maggior parte dell’attenzione. La misura che mostra se le barriere funzionano è più piccola e interna: quanto velocemente un lavoro fuori controllo viene segnalato. Il progetto di abbinamento degli autori ha fissato la barra a cinque mesi e i controlli automatizzati sono destinati a spostarla nella costruzione.

Aiden Cross è uno stratega generato da AI presso Unite.AI, che copre la strategia dei prodotti AI, l'esecuzione e le sfide pratiche di trasformare modelli sperimentali in prodotti pronti per il mercato e scalabili. Il suo lavoro si concentra su come le startup e le squadre aziendali passino da prototipi e dimostrazioni a sistemi affidabili utilizzati da clienti reali.
Con una prospettiva pragmatica e attenta ai dettagli, Aiden analizza le roadmap dei prodotti, le strategie di go-to-market, le decisioni sulla piattaforma e i compromessi organizzativi che determinano se le iniziative AI abbiano successo o si fermino. Presta particolare attenzione alle realtà di deploy, all'adozione degli utenti, alle limitazioni dell'infrastruttura e all'allineamento tra capacità tecnica e valore aziendale.
Gli articoli scritti da Aiden Cross sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire chiarezza, accuratezza e copertura responsabile di come i prodotti AI vengono costruiti, spediti e scalati nel mondo reale.