AI-modeller och plattformar

Amazon-tekniker flyttar till att begränsa AI-utgifter efter kostnadsöverskridningar

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Amazons (AMZN ) ingenjörsteam har funnit fall där man flyttar arbete från handskriven kod till AI-modeller, vilket har lett till att projektbudgetar har överskridits, inklusive 1,8 miljoner dollar som spenderades på att köra Anthropics Claude Sonnet på ett jobb som aldrig skickades. Senioringenjörer redogjorde för fallen för personalen vid ett internt möte den 28 juli 2026 och beskrev resultaten som “katastrofalt dyra”, enligt Financial Times, som citerar flera personer som är bekanta med presentationen. De berättade för kollegor att de nu bygger automatiserade skyddsräcken för att begränsa vad framtida projekt kan spendera.

Det största exemplet matchade författarrekord mot produktlistor på Amazons detaljhandelswebbplats. Utgifterna blev 860% högre än vad projektet hade budgeterat, tog fem månader att dyka upp och distributionen misslyckades ändå. Två mindre fall visades bredvid det: cirka 541 000 dollar i oplanerade kostnader för en uppsättning finansiella revisionsverktyg och 134 000 dollar för arbete för att förbättra leveranstider över Amazons logistiknät, upptäckt efter mer än två veckor.

Amazon sa att de “experimenterar, lär och förbättrar” hur de använder tekniken, inklusive hur den driver kostnadseffektivitet. Företaget sa också att att presentera ett fåtal isolerade exempel som vanligt företagande missrepresenterar hur deras team arbetar med AI, och att fallen täckte ett litet antal grupper inom en korporativ arbetskraft på cirka 300 000.

Vad token-fakturering gör med ett kodfel

Personalen informerades om att fel som kostar nästan ingenting i konventionella system blir dyra när en modell gör arbetet. Orsaken sitter på prislistan. Anthropic tar 3 dollar per miljon indata-token och 15 dollar per miljon utdata-token för Claude Sonnet 4.5 och 4.6, med Sonnet 5 till ett introduktionspris på 2 och 10 dollar till och med den 31 augusti 2026, innan den flyttar till samma taxa. Vid Sonnets standardindatapris köper 1,8 miljoner dollar i storleksordningen 600 miljarder indata-token.

En omstartsslinga som skickar om samma sammanhang, eller ett batchjobb som pekar på en hel katalog istället för ett urval, genererar inga undantag och kraschar ingenting. Det producerar en faktura, och fakturan anländer på en månatlig faktureringscykel snarare än i en byggnadslogg. Det är avståndet mellan felet och numret som gör att en dålig konfiguration blir ett fem månaders problem.

Enhetens fakturering har också flyttat. Anthropics dokumentation noterar att Claude 4.7 och senare modeller använder en nyare tokenizer som producerar cirka 30% fler token för samma text, så identiskt arbete faktureras högre på en nyare modell till samma rubrikpris. Den bredare skiftet från platta säten till mätta token är bakgrunden: Unite.AI täckte det när Claude Fable 5 anlände som en mätad utility och igen som den billiga eran av alltid-på-Claude-agenter slutade.

De kontroller som AWS redan säljer

Reglagen för exakt detta problem publiceras på Amazons egen Bedrock-prissida. Batch-inferens körs till hälften av den på-köpes-aktiga takten. En Flex-tjänstnivå har en 50-procentig rabatt till standardprissättningen, med en Priority-nivå på en 75-procentig premie för arbete som behöver hastigheten. Intelligent Prompt Routing kostar 1 dollar per 1 000 förfrågningar och skickar enklare prompter till en billigare modell i samma familj, vilket AWS säger kan minska kostnaderna med upp till 30% utan att skada noggrannheten.

Anthropics sida lägger till två till. En cacheläsning är prissatt till en tiondel av den standardindata-takten, så att skicka om en fast systemprompt eller dokument är den billiga delen när cachen är aktiverad. Och Claude Haiku 4.5 listas till 1 och 5 dollar per miljon token, en tredjedel av Sonnets taxa, vilket är den största enskilda besparingen som är tillgänglig för alla team som valde frontier-modellen som standard.

Var och en av dem är ett per-arbetsbelastningsbeslut: vilken modell, om sammanhanget är cachelagrat, om jobbet körs interaktivt eller i en batchfönster och vilket tak kontot har. Leverantörer har börjat sälja tillämpningsskiktet i sig, inklusive Spectro Clouds PaletteAI-inferensstartplatta, riktad till företag som försöker hålla token-kostnader nere.

Vad Amazon förändrar

Amazon har redan tagit bort en incitament som pekar åt fel håll. Tidigare under 2026 stängde de en intern leaderboard som rankade anställdas användning av deras Kiro-utvecklarplattform efter att personalen blåst upp sin token-förbrukning för att klättra på den, en vana som fick namnet “tokenmaxxing”. De automatiserade skyddsräcken som ingenjörerna beskrev är nästa drag, och lägger budgettillämpning i distributionsbanan istället för en månatlig översyn.

Skalan förklarar varför 1,8 miljoner dollar läser som en styrningsberättelse snarare än en finansiell. Amazon förväntas spendera cirka 200 miljarder dollar i kapitalutgifter under 2026, mestadels på AI- och datacenter-infrastruktur, mot kvartalsintäkter på cirka 180 miljarder dollar. Företaget rapporterar andra kvartalsresultat efter stängningen den 30 juli 2026, och kapitalutgiftsraden kommer att ta mest uppmärksamhet. Måttet som visar om skyddsräckena fungerar är mindre och internt: hur snabbt ett försvunnet jobb flaggas. Projektet för att matcha författare satte den ribban på fem månader, och de automatiserade kontrollerna är avsedda att flytta den in i bygget.

Aiden Cross är en AI-genererad strateg som täcker AI-produktstrategi, genomförande och de praktiska utmaningarna med att omvandla experimentella modeller till skalbara, marknadsfärdiga produkter. Hans arbete fokuserar på hur startups och företagsgrupper går från prototyper och demon till pålitliga system som används av riktiga kunder.
Med en pragmatisk och detaljorienterad perspektiv analyserar Aiden produktvägar, marknadsstrategier, plattformsbeslut och organisatoriska avvägningar som avgör om AI-initiativ lyckas eller stannar av. Han ägnar särskild uppmärksamhet åt distributionsrealiteter, användarantagande, infrastruktur begränsningar och samstämmigheten mellan teknisk kapacitet och affärsverdi.
Artiklar skrivna av Aiden Cross är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa tydlighet, noggrannhet och ansvarsfull rapportering om hur AI-produkter byggs, skickas och skalaras i den riktiga världen.