AI-modellen en platforms
Amazon-ingenieurs beperken AI-uitgaven na kostenoverschrijdingen

De engineeringteams van Amazon (AMZN ) hebben gevallen gevonden waarin het verplaatsen van handgeschreven code naar AI-modellen de projectbegrotingen heeft overschreden, waaronder $1,8 miljoen uitgegeven aan het uitvoeren van Anthropic’s Claude Sonnet op een taak die nooit is uitgevoerd. Senior engineers hebben de gevallen gepresenteerd aan het personeel tijdens een interne vergadering op 28 juli 2026 en beschreven de resultaten als “catastrofale kosten”, zo meldt de Financial Times, citatie van meerdere mensen die bekend zijn met de presentatie. Zij vertelden hun collega’s dat zij nu automatische beveiligingsmaatregelen aan het bouwen zijn om de toekomstige projectuitgaven te beperken.
Het grootste voorbeeld kwam overeen met auteurrecords die werden gematched tegen productlijsten op de detailhandelswebsite van Amazon. De uitgaven kwamen 860% boven het budget van dat project uit, duurden vijf maanden om naar boven te komen en de implementatie mislukte toch. Twee kleinere gevallen werden ernaast getoond: ongeveer $541.000 aan ongeplande kosten voor een set financiële auditing tools en $134.000 voor werk om de leveringssnelheden over het logistieke netwerk van Amazon te verbeteren, ontdekt na meer dan twee weken.
Amazon zei dat het “experimenteert, leert en verbetert” hoe het de technologie gebruikt, inclusief hoe het kosten efficiëntie aandrijft. Het bedrijf zei ook dat het presenteren van een handvol geïsoleerde voorbeelden als zaken zoals gebruikelijk de manier waarop zijn teams met AI werken, verkeerd weergeeft, en dat de gevallen een klein aantal groepen binnen een corporate workforce van ongeveer 300.000 omvatten.
Wat token billing doet met een coderingsfout
Medewerkers werden verteld dat fouten die bijna niets kosten in conventionele systemen duur worden zodra een model het werk doet. De reden staat op de prijslijst. Anthropic rekent $3 per miljoen invoertokens en $15 per miljoen uitvoertokens voor Claude Sonnet 4.5 en 4.6, met Sonnet 5 tegen een introductieprijs van $2 en $10 tot 31 augustus 2026 voordat het naar dezelfde tarieven gaat. Bij Sonnet’s standaard invoerprijs koopt $1,8 miljoen ongeveer 600 miljard invoertokens.
Een herhaallus die dezelfde context opnieuw verzendt, of een batchtaak gericht op een hele catalogus in plaats van een steekproef, gooit geen uitzondering en crasht niets. Het produceert een factuur, en de factuur arriveert op een maandelijkse factureringscyclus in plaats van in een buildlog. Die afstand tussen de fout en het nummer is wat een slechte configuratie in een vijfmaandsprobleem verandert.
De factureringsunit is ook in beweging. De documentatie van Anthropic vermeldt dat Claude 4.7 en latere modellen een nieuwe tokenizer gebruiken die ongeveer 30% meer tokens voor dezelfde tekst produceert, zodat identiek werk tegen een hogere prijs in rekening wordt gebracht op een nieuwere model tegen dezelfde koppijs. De bredere verschuiving van vaste stoelen naar gemeten tokens is de achtergrond: Unite.AI heeft het behandeld toen Claude Fable 5 aankwam als een gemeten nutsvoorziening en opnieuw toen de goedkope periode van altijd-aan Claude-agents eindigde.
De controles die AWS al verkoopt
De hefboomwerking voor dit exacte probleem wordt gepubliceerd op de Bedrock-prijspagina van Amazon. Batchinference draait tegen de helft van de on-demandtarief. Een Flex-servicetarief heeft een korting van 50% op de standaardprijzen, met een Priority-tarief tegen een premie van 75% voor werk dat de snelheid nodig heeft. Intelligent Prompt Routing kost $1 per 1.000 aanvragen en duwt eenvoudigere prompts naar een goedkopere model in dezelfde familie, wat AWS zegt dat de kosten met maximaal 30% kan verlagen zonder de nauwkeurigheid te schaden.
Anthropic’s kant voegt er nog twee toe. Een cacheread wordt geprijsd tegen een tiende van de standaard invoerprijs, dus opnieuw verzenden van een vaste systeemprompt of document is het goedkope deel zodra caching is ingeschakeld. En Claude Haiku 4.5 staat genoteerd tegen $1 en $5 per miljoen tokens, een derde van Sonnet’s tarieven, wat de grootste enkele besparing is die beschikbaar is voor elk team dat de frontiermodel standaard kiest.
Elk daarvan is een per-werkloadbeslissing: welk model, of context wordt gecached, of de taak interactief of in een batchwindow draait, en wat het plafond is dat het account heeft. Leveranciers zijn begonnen met het verkopen van de handhavingslaag zelf, inclusief Spectro Cloud’s PaletteAI-inferencelaunchpad, gericht op ondernemingen die proberen om AI-tokencosten onder controle te houden.
Wat Amazon verandert
Amazon heeft al één stimulans verwijderd die de verkeerde kant op wees. Vroeg in 2026 sloot het een intern leaderboard af dat het gebruik van zijn Kiro-ontwikkelaarsplatform van werknemers rangschikte, nadat het personeel zijn tokenverbruik had opgeblazen om het te beklimmen, een gewoonte die de naam “tokenmaxxing” kreeg. De automatische beveiligingsmaatregelen die engineers beschreven, zijn de volgende stap, waardoor budgetafdwinging in de implementatiepad komt in plaats van een maandelijkse review.
De schaal verklaart waarom $1,8 miljoen meer een bestuursverhaal leest dan een financieel verhaal. Amazon wordt verwacht om ongeveer $200 miljard uit te geven aan kapitaaluitgaven in 2026, het merendeel hiervan aan AI- en datacenterinfrastructuren, tegen kwartaalomzet in de buurt van $180 miljard. Het bedrijf rapporteert de resultaten van het tweede kwartaal na de sluiting op 30 juli 2026, en de kapitaaluitgavenlijn zal de meeste aandacht krijgen. De maatstaf die aangeeft of de beveiligingsmaatregelen werken, is kleiner en intern: hoe snel een uit de hand lopende taak wordt gemarkeerd. Het author-matchingproject zette de lat op vijf maanden, en de geautomatiseerde controles zijn bedoeld om deze naar de build te verplaatsen.












