Modele și platforme AI

Inginerii Amazon se străduiesc să limiteze cheltuielile cu inteligența artificială după depășiri de cost

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Echipele de ingineri ale Amazon (AMZN ) au descoperit cazuri în care mutarea lucrului de la codul scris de mână la modelele de inteligență artificială a depășit bugetele proiectelor, inclusiv 1,8 milioane de dolari cheltuiți pentru rularea modelului Anthropic Claude Sonnet pe un proiect care nu a fost lansat. Inginerii seniori au prezentat aceste cazuri personalului la o întâlnire internă pe 28 iulie 2026 și au descris rezultatele ca “catastroficamente scumpe”, conform raportului Financial Times, care citează mai multe persoane familiarizate cu prezentarea. Ei le-au spus colegilor că acum construiesc garduri automate pentru a limita cheltuielile viitoarelor proiecte.

Exemplul cel mai mare a fost potrivirea înregistrărilor autorilor cu listările de produse pe site-ul de retail al Amazon. Cheltuielile au fost cu 860% peste ceea ce proiectul avea bugetat, au durat cinci luni pentru a fi descoperite și implementarea a eșuat oricum. Două cazuri mai mici au fost prezentate alături de acesta: aproximativ 541.000 de dolari în costuri neplanificate pentru un set de instrumente de audit financiar și 134.000 de dolari pentru lucrul de îmbunătățire a vitezei de livrare în rețeaua logistică a Amazon, descoperite după mai mult de două săptămâni.

Amazon a declarat că “experimentează, învață și îmbunătățește” modul în care utilizează tehnologia, inclusiv modul în care aceasta conduce la eficiență în ceea ce privește costurile. Compania a mai spus că prezentarea unor exemple izolate ca fiind afaceri obișnuite denaturează modul în care echipele sale lucrează cu inteligența artificială și că aceste cazuri au acoperit un număr mic de grupuri dintr-o forță de muncă corporativă de aproximativ 300.000 de persoane.

Ce facturarea pe token la o greșeală de codare

Personalul a fost informat că greșelile care costă aproape nimic în sistemele convenționale devin scumpe odată ce un model face lucrul. Motivul se află pe lista de prețuri. Anthropic taxează 3 dolari pentru un milion de tokeni de intrare și 15 dolari pentru un milion de tokeni de ieșire pentru Claude Sonnet 4.5 și 4.6, cu Sonnet 5 la un preț introductiv de 2 și 10 dolari până la 31 august 2026, înainte de a trece la aceleași tarife. La prețul standard de intrare al lui Sonnet, 1,8 milioane de dolari cumpără aproximativ 600 de miliarde de tokeni de intrare.

O buclă de retry care retrimite același context sau un job de batch care vizează întregul catalog în loc de un eșantion nu aruncă nicio excepție și nu prăbușește nimic. Acesta produce o factură, iar factura sosește pe un ciclu de facturare lunară, și nu într-un jurnal de compilare. Acea distanță între greșeală și număr este ceea ce transformă o configurație proastă într-o problemă de cinci luni.

Unitatea de facturare s-a mutat și ea. Documentația Anthropic notează că Claude 4.7 și modelele ulterioare folosesc un tokenizer mai nou care produce aproximativ 30% mai multe tokeni pentru același text, astfel încât același lucru este facturat mai scump pe un model mai nou la același tarif de bază. Schimbarea mai largă de la locuri fixe la tokeni măsurați este fundalul: Unite.AI a acoperit-o atunci când Claude Fable 5 a apărut ca o utilitate măsurată și din nou când era ieftină a agenților Claude care rulează mereu s-a încheiat.

Controalele pe care AWS le vinde deja

Levele pentru această problemă exactă sunt publicate pe pagina de prețuri Bedrock a Amazon. Rularea inferenței în batch are loc la jumătate din tariful la cerere. Un nivel de serviciu Flex are o reducere de 50% față de prețurile standard, cu un nivel Priority la un premium de 75% pentru lucrul care necesită viteză. Rutele inteligente de prompturi costă 1 dolar pentru 1.000 de solicitări și împing prompturile mai simple către un model mai ieftin din aceeași familie, ceea ce spune AWS că poate reduce costurile cu până la 30% fără a afecta acuratețea.

Partea Anthropic adaugă două. O citire din cache este tarifată la a zecea parte din tariful standard de intrare, astfel încât retrimiterea unui prompt de sistem fix sau a unui document este partea ieftină odată ce cache-ul este activat. Și Claude Haiku 4.5 este listat la 1 și 5 dolari pentru un milion de tokeni, o treime din tarifele Sonnet, ceea ce este cea mai mare economie disponibilă oricărui grup care a ales modelul de frontieră în mod implicit.

Fiecare dintre acestea este o decizie pe lucrare: care model, dacă contextul este în cache, dacă lucrul rulează în mod interactiv sau într-o fereastră de batch și care este plafonul contului. Vânzătorii au început să vândă stratul de aplicare în sine, inclusiv lansarea PaletteAI Inference Launchpad de către Spectro Cloud, care se adresează întreprinderilor care încearcă să țină sub control costurile tokenilor.

Ce schimbă Amazon

Amazon a eliminat deja o stimulare care arăta în direcția greșită. La începutul anului 2026 a închis un clasament intern care îi clasa pe angajații săi după utilizarea platformei de dezvoltator Kiro, după ce personalul și-a mărit consumul de tokeni pentru a urca în clasament, un obicei care a primit numele de “tokenmaxxing”. Gardurile automate despre care inginerii au vorbit sunt următoarea mișcare, introducând aplicarea bugetară în calea de implementare în loc de o revizuire lunară.

Scara explică de ce 1,8 milioane de dolari par o poveste de guvernanță mai degrabă decât una financiară. Se așteaptă ca Amazon să cheltuiască aproximativ 200 de miliarde de dolari în cheltuieli de capital pe parcursul anului 2026, cea mai mare parte pentru infrastructura de inteligență artificială și centre de date, față de venituri trimestriale de aproximativ 180 de miliarde de dolari. Compania raportează rezultatele pentru al doilea trimestru după închiderea pe 30 iulie 2026, iar linia de cheltuieli de capital va primi cea mai mare atenție. Măsura care arată dacă gardurile funcționează este mai mică și internă: cât de repede este semnalat un job care a scăpat de sub control. Proiectul de potrivire a autorilor a stabilit acea bară la cinci luni, iar verificările automate sunt menite să o mute în faza de implementare.

Aiden Cross este un strategist generat de AI la Unite.AI, care acoperă strategia de produs AI, execuția și provocările practice de transformare a modelelor experimentale în produse scalabile și gata de piață. Lucrările sale se concentrează pe modul în care startup-urile și echipele enterprise trec de la prototipuri și demo-uri la sisteme fiabile utilizate de clienți reali.
Cu o perspectivă pragmatică și atentă la detalii, Aiden analizează planurile de drum ale produselor, strategiile de lansare pe piață, deciziile de platformă și compromisurile organizaționale care determină dacă inițiativele AI reușesc sau stagnează. El acordă o atenție deosebită realităților de implementare, adoptării utilizatorilor, constrângerilor de infrastructură și alinierii dintre capacitatea tehnică și valoarea business.
Articolele scrise de Aiden Cross sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura claritatea, acuratețea și acoperirea responsabilă a modului în care produsele AI sunt create, expediate și scalate în lumea reală.