Modely a platformy AI
Inženýři Amazonu omezují výdaje za AI po překročení nákladů

Týmy inženýrů Amazonu (AMZN ) objevily případy, kdy přesunutí práce z ručně psaného kódu na modely AI vedlo k překročení projektových rozpočtů, včetně 1,8 milionu dolarů vynaložených na běh Anthropic’s Claude Sonnet na projektu, který nebyl nikdy vydán. Senioři inženýři představili tyto případy zaměstnancům na interní schůzi 28. července 2026 a popsali výsledky jako “katastroficky drahé”, podle Financial Times, citující několik lidí熟悉ých s prezentací. Řekli svým kolegům, že nyní budují automatické zábrany, aby omezily, co budou moci budoucí projekty utratit.
Největší příklad odpovídal záznamům autorů proti produktovým nabídkám na maloobchodním webu Amazonu. Výdaje byly o 860 % vyšší než rozpočet projektu, trvalo pět měsíců, než byly odhaleny, a nasazení selhalo. Dvě menší případy byly ukázány vedle něj: asi 541 000 dolarů v neplánovaných nákladech na sadu finančních auditních nástrojů a 134 000 dolarů na práci ke zlepšení dodacích rychlostí napříč logistickou sítí Amazonu, odhalených po více než dvou týdnech.
Amazon uvedl, že “experimentuje, učí se a zlepšuje” způsob, jakým používá technologii, včetně toho, jak řídí náklady. Společnost také uvedla, že prezentace několika izolovaných příkladů jako běžné podnikání zkresluje, jak jeho týmy pracují s AI, a že případy pokrývaly pouze malý počet skupin uvnitř korporátní pracovní síly o přibližně 300 000 lidech.
Co tokenové fakturace dělá s chybou v kódu
Personál byl informován, že chyby, které stojí téměř nic v konvenčních systémech, se stanou drahými, jakmile model provede práci. Důvod spočívá v ceníku. Anthropic účtuje $3 za milion vstupních tokenů a $15 za milion výstupních tokenů pro Claude Sonnet 4.5 a 4.6, s Sonnet 5 za úvodní $2 a $10 do 31. srpna 2026, než se přesune na stejné sazby. Při standardní vstupní ceně Sonnetu 1,8 milionu dolarů koupí přibližně 600 miliard vstupních tokenů.
Opakující se smyčka, která znovu odesílá stejný kontext, nebo dávková úloha zaměřená na celý katalog místo vzorku, nevyvolá žádnou výjimku a nic nezkrachuje. Vytvoří fakturu a faktura přichází v měsíčním fakturačním cyklu místo v sestavě. Ta vzdálenost mezi chybou a číslem je to, co promění špatnou konfiguraci na pět měsíců problému.
Jednotka fakturace se také mění. Dokumentace Anthropic uvádí, že Claude 4.7 a pozdější modely používají novější tokenizer, který produkuje přibližně o 30 % více tokenů pro stejný text, takže identická práce je fakturována vyšší na novějším modelu při stejné základní sazbě. Širší posun z plochých míst na měřené tokeny je pozadím: Unite.AI to pokryl, když Claude Fable 5 přišel s cenou jako měřená utilita a znovu, když levná éra vždy zapnutých agentů Claude skončila.
Ovládací prvky, které AWS již prodává
Ovládací prvky pro tento přesně problém jsou publikovány na Bedrock cenové stránce Amazonu. Dávková inferencia běží na polovinu sazby na vyžádání. Flex služba má 50% slevu na standardní ceny, s Priority úrovní za 75% prémií za práci, která potřebuje rychlost. Inteligentní směrování promptů stojí 1 dolar za 1 000 požadavků a posouvá jednodušší prompty na levnější model ve stejné rodině, což podle AWS může snížit náklady až o 30 % bez poškození přesnosti.
Anthropic přidává další dvě. Čtení z mezipaměti je ceněno jako desetina standardní vstupní sazby, takže opětovné odeslání pevného systémového promptu nebo dokumentu je levnou částí, jakmile je mezipaměť zapnuta. A Claude Haiku 4.5 je uveden za 1 a 5 dolarů za milion tokenů, což je třetina sazeb Sonnetu, což je největší úspora dostupná pro jakýkoli tým, který vybral model frontier jako výchozí.
Každý z nich je rozhodnutím pro každou zátěž: jaký model, zda je kontext uložen v mezipaměti, zda úloha běží interaktivně nebo v dávkovém okně a jaký strop má účet. Dodavatelé začali prodávat vrstvu vynucování sama o sobě, včetně Spectro Cloud’s PaletteAI inference launchpad, zaměřeného na podniky, které se snaží držet náklady na tokeny AI pod kontrolou.
Co Amazon mění
Amazon již odstranil jednu pobídku, která ukazovala špatným směrem. Na začátku roku 2026 ukončil interní žebříček, který řadil zaměstnance podle jejich použití platformy Kiro developer, po kterém zaměstnanci zvyšovali spotřebu tokenů, aby vylepšili své postavení, zvyk, který získal název “tokenmaxxing”. Automatické zábrany, které inženýři popsali, jsou dalším krokem, který bude vynucovat rozpočet do cesty nasazení místo měsíční revize.
Stupeň vysvětluje, proč 1,8 milionu dolarů zní jako příběh o správě spíše než o financích. Amazon se očekává, že vynaloží asi 200 miliard dolarů na kapitálové výdaje napříč rokem 2026, většinu z nich na AI a infrastrukturu datových center, proti čtvrtletnímu výnosu blízko 180 miliard dolarů. Společnost bude hlásit výsledky druhého čtvrtletí po uzavření 30. července 2026, a kapitálová linka výdajů bude mít většinu pozornosti. Měřítko, které ukazuje, zda zábrany fungují, je menší a vnitřní: jak rychle je identifikována úniková práce. Projekt pro shodu autorů nastavil tuto laťku na pět měsíců a automatizované kontroly jsou určeny k posunu do fáze sestavení.












