Modele i platformy AI

Inżynierowie Amazona ograniczają wydatki na AI po przekroczeniach budżetowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Zespoły inżynierskie Amazona (AMZN ) znalazły przypadki, w których przeniesienie pracy z ręcznie pisanych kodów na modele AI przekroczyło budżety projektów, w tym 1,8 miliona dolarów wydanych na uruchomienie Anthropic’s Claude Sonnet w projekcie, który nigdy nie został wydany. Starsi inżynierowie przedstawili te przypadki pracownikom na spotkaniu wewnętrznym 28 lipca 2026 r. i opisali wyniki jako “katastrofalnie drogie”, jak podał Financial Times, cytując wiele osób znających prezentację. Powiedzieli kolegom, że teraz budują automatyczne bariery, aby ograniczyć wydatki przyszłych projektów.

Największy przykład pasował do rekordów autorów wobec listy produktów na stronie handlowej Amazon. Wydatki przekroczyły o 860% to, co ten projekt miał w budżecie, zajęło to pięć miesięcy, aby się pojawić, a wdrożenie nie powiodło się. Dwa mniejsze przypadki zostały przedstawione obok: około 541 000 dolarów nieplanowanych kosztów na zestaw narzędzi do audytu finansowego i 134 000 dolarów na pracę nad poprawą szybkości dostaw w sieci logistycznej Amazon, co zostało wykryte po ponad dwóch tygodniach.

Amazon powiedział, że “eksperymentuje, uczy się i poprawia”, jak używa tej technologii, w tym jak napędza efektywność kosztów. Firma również powiedziała, że przedstawienie garści izolowanych przykładów jako normalny biznes nieprawidłowo przedstawia, jak jej zespoły pracują z AI, i że przypadki obejmowały niewielką liczbę grup wewnątrz siły roboczej o wielkości około 300 000.

Co token billing robi z błędem kodowania

Personel został poinformowany, że błędy, które kosztują prawie nic w konwencjonalnych systemach, stają się drogie, gdy model wykonuje pracę. Powodem jest cena na liście. Anthropic pobiera 3 dolary za milion tokenów wejściowych i 15 dolarów za milion tokenów wyjściowych dla Claude Sonnet 4.5 i 4.6, z Sonnet 5 w cenie wprowadzającej 2 i 10 dolarów do 31 sierpnia 2026 r., zanim przejdzie do tych samych stawek. Przy standardowej cenie wejściowej Sonnet 1,8 miliona dolarów kupi około 600 miliardów tokenów wejściowych.

Pętla ponownego wykonywania, która ponownie wysyła ten sam kontekst, lub zadanie wsadowe skierowane do całego katalogu zamiast próbki, nie generuje wyjątku i nie powoduje awarii. Wytwarza fakturę, a faktura przychodzi w comiesięcznym cyklu rozliczeniowym, a nie w dzienniku kompilacji. To oddalenie między błędem a liczbą jest tym, co zmienia złą konfigurację w pięciomiesięczny problem.

Jednostka rozliczania również się zmieniła. Dokumentacja Anthropic podaje, że Claude 4.7 i nowsze modele używają nowszego tokenizera, który wytwarza około 30% więcej tokenów dla tego samego tekstu, więc identyczna praca jest rozliczana wyżej w nowszym modelu przy tej samej stawce. Szeroka zmiana z płaskich miejsc na pomierzone tokeny jest tłem: Unite.AI opisywał to, gdy Claude Fable 5 pojawił się jako pomierzona usługa i ponownie, gdy tani okres zawsze włączonych agentów Claude dobiegł końca.

Kontrolki, które AWS już sprzedaje

Dźwignie do tego dokładnego problemu są opublikowane na stronie cennika Bedrock Amazon. Wsadowe wnioski są rozliczane po połowie stawki na żądanie. Warstwa usług Flex ma 50% zniżki od standardowej ceny, a warstwa Priority ma 75% premii za pracę, która wymaga szybkości. Inteligentna trasa promptów kosztuje 1 dolar za 1000 wniosków i przekazuje proste prompty do tańszego modelu w tej samej rodzinie, co AWS twierdzi, że może zmniejszyć koszty o 30% bez uszczerbku dla dokładności.

Strona Anthropic dodaje dwa więcej. Odczyt pamięci podręcznej jest wyceniony na jedną dziesiątą standardowej stawki wejściowej, więc ponowne wysłanie stałego systemu promptu lub dokumentu jest tanim elementem, gdy pamięć podręczna jest włączona. I Claude Haiku 4.5 jest wyceniony na 1 i 5 dolarów za milion tokenów, jedną trzecią stawek Sonnet, co jest największym oszczędnościom dostępnym dla każdego zespołu, który wybrał model frontier jako domyślny.

Każdy z nich jest decyzją na poziomie obciążenia: który model, czy kontekst jest buforowany, czy zadanie jest uruchamiane interaktywnie, czy w oknie wsadowym, i jaki limit ma konto. Dostawcy zaczęli sprzedawać warstwę egzekwowania, w tym Spectro Cloud’s PaletteAI inference launchpad, skierowany do przedsiębiorstw próbujących utrzymać koszty tokenów AI.

Co Amazon zmienia

Amazon już usunął jeden bodziec wskazujący w złym kierunku. Na początku 2026 r. zamknął wewnętrzną listę rankingową, która klasyfikowała pracowników według ich korzystania z platformy deweloperskiej Kiro, po tym, jak pracownicy nadmiernie zwiększali swoje zużycie tokenów, aby awansować, co nazwano “tokenmaxxingiem”. Automatyczne bariery, które opisali inżynierowie, są następnym krokiem, wprowadzając egzekwowanie budżetu do ścieżki wdrożenia, zamiast comiesięcznej recenzji.

Skala wyjaśnia, dlaczego 1,8 miliona dolarów brzmi jak historia zarządzania, a nie finansowa. Oczekuje się, że Amazon wyda około 200 miliardów dolarów na wydatki kapitałowe w 2026 r., z czego większość to AI i infrastruktura centrów danych, wobec kwartalnych przychodów w wysokości około 180 miliardów dolarów. Firma przedstawi wyniki za II kwartał po zamknięciu 30 lipca 2026 r., a linia wydatków kapitałowych zajmie najwięcej uwagi. Miara, która pokazuje, czy bariery działają, jest mniejsza i wewnętrzna: jak szybko uciekinierka praca zostaje oznaczona. Projekt dopasowania autorów ustalił tę poprzeczkę na pięć miesięcy, a automatyczne kontrole mają ją przenieść do budowy.

Aiden Cross jest strategiem wygenerowanym przez sztuczną inteligencję w Unite.AI, zajmującym się strategią produktów AI, wykonaniem oraz praktycznymi wyzwaniami związanymi z przekształcaniem modeli eksperymentalnych w produkty skalowalne i gotowe do wejścia na rynek. Jego praca koncentruje się na tym, jak startupy i zespoły przedsiębiorstw przechodzą od prototypów i demonstracji do niezawodnych systemów używanych przez prawdziwych klientów.
Z pragmatycznym i szczegółowym podejściem Aiden analizuje mapy produktów, strategie wejścia na rynek, decyzje dotyczące platformy oraz kompromisy organizacyjne, które determinują, czy inicjatywy AI są udane, czy zawodzą. Zwraca szczególną uwagę na realia wdrożenia, przyjęcie przez użytkowników, ograniczenia infrastruktury oraz zgodność między możliwościami technicznymi a wartością biznesową.
Artykuły autorstwa Aiden Cross są wygenerowane przez sztuczną inteligencję i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić klarowność, dokładność i odpowiedzialne relacjonowanie, w jaki sposób produkty AI są tworzone, wysyłane i skalowane w świecie rzeczywistym.