AI-mallit ja alustat

Amazonin insinöörit rajoittavat tekoälykuluja ylityön jälkeen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Amazonin insinööritiimit ovat löytäneet tapauksia, joissa työn siirtäminen käsin kirjoitetusta koodista tekoälymalliin on ylittänyt projektibudjetit, mukaan lukien 1,8 miljoonan dollarin kulut Anthropicin Claude Sonnetin suorittamisesta työssä, joka ei koskaan valmistunut. Vanhemmat insinöörit esittivät tapaukset henkilöstölle sisäisessä kokouksessa 28. heinäkuuta 2026 ja kuvasivat tulokset “katastrofaalisesti kalliiksi”, kuten Financial Times raportoi, viitaten useisiin lähteisiin, jotka ovat tuttuja esityksestä. He kertoivat kollegoilleen, että he ovat nyt rakentamassa automaattisia varoitusjärjestelmiä rajoittamaan sitä, mitä tulevaisuuden projektit voivat kuluttaa.

Suurin esimerkki vastasi kirjailijan tietueita Amazonin myyntisivuston tuoteluetteloihin. Kustannukset ylittivät 860 %:lla budjetin, kestivät viisi kuukautta ennen kuin ne tulivat ilmi, ja käyttöönotto epäonnistui joka tapauksessa. Kaksi pienempää tapausta esiteltiin rinnakkain: noin 541 000 dollarin suorattomat kustannukset joukossa taloudellisia tarkastustyökaluja varten ja 134 000 dollarin työhön parantamaan toimitusnopeuksia Amazonin logistiikkaverkossa, joka havaittiin yli kahden viikon jälkeen.

Amazon (AMZN ) kertoi, että se “kokeilee, oppii ja parantaa” sitä, miten se käyttää teknologiaa, mukaan lukien sitä, miten se ajaa kustannustehokkuutta. Yritys myös sanoi, että esittämällä joukon erillisiä esimerkkejä liiketoimintana normaalina se väittää väärin, miten tiimit työskentelevät tekoälyllä, ja että tapaukset kattoivat pienen joukon ryhmiä noin 300 000 hengen yrityksen sisällä.

Miten token-laskutus vaikuttaa koodivirheeseen

Henkilöstölle kerrottiin, että virheet, jotka maksavat lähes mitään perinteisissä järjestelmissä, tulevat kalliiksi, kun malli tekee työn. Syy on hinnastossa. Anthropic veloittaa 3 dollaria miljoonaa syötetokenia kohti ja 15 dollaria miljoonaa tulostokenia kohti Claude Sonnet 4.5:lle ja 4.6:lle, ja Sonnet 5 on esittelyssä 2 dollarilla ja 10 dollarilla 31. elokuuta 2026 asti, ennen kuin se siirtyy samaan hintaan. Sonnetin standardihintaan 1,8 miljoonalla dollarilla saa noin 600 miljardia syötetokenia.

Uudelleenyrityssilmukka, joka lähettää saman kontekstin uudelleen, tai erätyö, joka on suunnattu koko luetteloon sen sijaan, että se on näyte, ei heitä poikkeusta ja ei kaada mitään. Se tuottaa laskun, ja lasku saapuu kuukausittaisen laskutusjakson aikana sen sijaan, että se olisi rakennusloossa. Se etäisyys virheen ja numeron välillä on se, mikä muuttaa huonon konfiguraation viiden kuukauden ongelmaksi.

Laskutusyksikkö on myös muuttunut. Anthropicin asiakirjat toteavat, että Claude 4.7 ja myöhemmät mallit käyttävät uudempaa tokenoijaa, joka tuottaa noin 30 % enemmän tokenia samalle tekstille, joten sama työ laskutetaan korkeammaksi uudemmalla mallilla samalla otsikolla. Laajempi siirtymä tasaisista istuimista mitatuille tokenille on tausta: Unite.AI käsitteli sitä, kun Claude Fable 5 saapui hinnoiteltuna mitatulla hyödykkeellä ja uudelleen, kun halpa aika aina päällä olevista Claude-agenteista loppui.

Ohjaus, jonka AWS jo myy

Täsmätapauksen liikkeet on julkaistu Amazonin oman Bedrock-hinnastosivulla. Erätyöt toimivat puolitoista kertaa vähemmän kuin tarjoushinta. Flex-palvelutaso sisältää 50 % alennuksen normaaliin hintaan, ja Priority-taso on 75 %:n korkeampi työlle, joka tarvitsee nopeutta. Älykäs ohjausreititys maksaa 1 dollarin 1 000 pyynnön mukaan ja siirtää yksinkertaisempia pyynnöksiä halvempaan malliin samassa perheessä, mikä AWS sanoo voivan laskea kustannuksia jopa 30 %:lla ilman vaikutusta tarkkuuteen.

Anthropicin puolelta on kaksi enemmän. Välimuistilukema on hinnoiteltu kymmenesosaan standardisyötteen hintaan, joten kiinteän järjestelmäpyynnön tai asiakirjan uudelleenlähettäminen on halpaa, kun välimuisti on käytössä. Ja Claude Haiku 4.5 on listattu 1 dollarilla ja 5 dollarilla miljoonaa tokenia kohti, joka on kolmasosa Sonnetin hintaa, mikä on suurin yksittäinen säästö, jota mikä tahansa tiimi voi valita oletusarvoisesti.

Jokainen niistä on työkohtainen päätös: mikä malli, onko konteksti välimuistissa, suoritetaanko työ vuorovaikutteisesti vai eräikkunassa, ja mikä katto on tilillä. Toimittajat ovat alkaneet myydä itse valvontakerrosta, mukaan lukien Spectro Cloudin PaletteAI-inference launchpad, jota markkinoidaan yrityksille, jotka yrittävät pitää tekoälytoken-kustannukset kurissa.

Mitä Amazon muuttaa

Amazon on jo poistanut yhden kannustimen, joka osoitti väärään suuntaan. Aikaisemmin vuonna 2026 se sulki sisäisen leaderboardin, joka luokitteli työntekijöiden käyttöä Kiro-kehitysalustalla, kun työntekijät olivat paisuttaneet token-kulutustaan kiipeämään sen ylös, tapa, josta tuli “tokenmaxxing” -nimitys. Automaattiset varoitusjärjestelmät, joista insinöörit kertoivat, ovat seuraava siirto, asettamalla budjettivalvonnan käyttöönottoreittiin sen sijaan, että se olisi kuukausittainen tarkastelu.

Mittakaava selittää, miksi 1,8 miljoonaa dollaria luetaan hallintokertomuksena eikä rahoituskertomuksena. Amazonin odotetaan kuluttavan noin 200 miljardia dollaria pääomamenoihin vuonna 2026, suurimmaksi osaksi tekoäly- ja tietokeskusinfrastruktuuriin, verrattuna neljännesvuosittaiseen liikevaihtoon, joka on lähellä 180 miljardia dollaria. Yritys raportoi toisen neljännekseen tulokset sulkemisen jälkeen 30. heinäkuuta 2026, ja pääomamenorivi saa suurimman osan huomiosta. Mittari, joka osoittaa, toimivatko varoitusjärjestelmät, on pienempi ja sisäinen: kuinka nopeasti pääsääntöinen työ voidaan merkitä. Kirjailijan vastaavuushanke asetti sen rajan viideksi kuukaudeksi, ja automaattiset tarkastukset on tarkoitettu siirtämään sen rakennukseen.

Aiden Cross on tekoälystrategi Unite.AI:ssa, joka kattaa tekoälytuotteiden strategian, toteutuksen ja kokeellisten mallien muuttamisen skaalattaviksi, markkinoille valmiiksi tuotteiksi. Hänen työnsä keskittyy siihen, miten startup-yritykset ja suuret yritykset siirtävät prototyyppien ja demojen tuotantoon luotettaviksi järjestelmiksi, joita todelliset asiakkaat käyttävät.
Hänen työnsä on pragmaattista ja yksityiskohtaista, ja Aiden analysoi tuotteen kehitysroadmappeja, markkinointistrategioita, alustapäätöksiä ja organisaatioiden kompromisseja, jotka määräävät, onnistuvatko tekoälyhankkeet vai jäävätkö ne paikoilleen. Hän kiinnittää erityistä huomiota käyttöönoton todellisuuteen, käyttäjähyväksyntään, infrastruktuurirajoituksiin ja teknisen kyvyn ja liiketoimintarahoituksen väliseen tasapainoon.
Aiden Crossin kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksellinen tiimi tarkistaa ne, jotta varmistetaan selkeä, tarkin ja vastuullinen kattavuus siitä, miten tekoälytuotteet rakennetaan, toimitetaan ja skaalataan todellisessa maailmassa.