Моделі та платформи ШІ
Інженери Amazon обмежують витрати на штучний інтелект після перевитрат

Інженерні команди Amazon (AMZN ) виявили випадки, коли перенесення роботи з ручного коду на моделі штучного інтелекту призвело до перевитрат проекту, включаючи 1,8 мільйона доларів, витрачених на виконання Anthropic’s Claude Sonnet на роботі, яка так і не була випущена. Старші інженери представили ці випадки співробітникам на внутрішній зустрічі 28 липня 2026 року та описали результати як “катастрофічно дорогі”, як повідомляє Financial Times, цитуючи декілька людей, знайомих з презентацією. Вони повідомили колег, що зараз будують автоматичні обмежувачі витрат для майбутніх проектів.
Найбільший приклад збігався з авторськими записами проти списків товарів на роздрібному сайті Amazon. Витрати склали 860% вище запланованих, зайняли п’ять місяців, щоб з’явитися на поверхні, а розгортання в будь-якому разі завершилося невдачею. Два менших випадки були показані поряд з ним: близько 541 000 доларів непланових витрат на набір фінансових аудиторських інструментів та 134 000 доларів на роботу з покращення швидкості доставки по логістичній мережі Amazon, виявленої після більш ніж двох тижнів.
Amazon заявила, що вона “експериментує, вчиться та покращує” використання цієї технології, включаючи те, як вона забезпечує ефективність витрат. Компанія також заявила, що представлення декількох ізольованих прикладів як звичайного бізнесу неправильно представляє роботу її команд зі штучним інтелектом, і що ці випадки охоплювали лише невелику кількість груп всередині корпоративної робочої сили з приблизно 300 000 осіб.
Що таке токен-оплата для помилки у кодуванні
Співробітникам було сказано, що помилки, які майже нічого не коштують у традиційних системах, стають дорогими, коли модель виконує роботу. Причина криється у ціновому списку. Anthropic стягує 3 долари за мільйон вхідних токенів та 15 доларів за мільйон вихідних токенів для Claude Sonnet 4.5 та 4.6, а для Sonnet 5 – вступну ціну 2 та 10 доларів до 31 серпня 2026 року, перш ніж перейти на ті самі ставки. За стандартної ціни на вхідні дані 1,8 мільйона доларів можна придбати близько 600 мільярдів вхідних токенів.
Петля повторного виконання, яка повторно надсилає той самий контекст, або пакетна робота, спрямована на весь каталог замість зразка, не викидає жодної виняткової ситуації та нічого не розбиває. Вона генерує рахунок, а рахунок надходить щомісячно, а не у будівельному журналі. Відстань між помилкою та номером – це те, що перетворює погану конфігурацію на п’ятимісячну проблему.
Одиниця оплати також змінилася. Документація Anthropic зазначає, що Claude 4.7 та пізніші моделі використовують новий токенізаційний інструмент, який генерує приблизно на 30% більше токенів для того самого тексту, тому ідентична робота коштує дорожче на новішій моделі за тієї ж самої заголовної ставки. Ширша зміна від плоских місць до виміряних токенів – це фон: Unite.AI висвітлював це, коли Claude Fable 5 з’явився з ціною як виміряна утиліта та знову, коли дешева епоха постійно діючих агентів Claude закінчилася.
Контролі, які вже продає AWS
Регулятори цієї самої проблеми опубліковані на власній сторінці цінової політики Bedrock Amazon. Пакетні висновки виконуються за половину ставки на вимогу. Тарифний план Flex пропонує 50% знижку до стандартної ціни, а тарифний план Priority – на 75% премію за роботу, яка потребує швидкості. Інтелектуальне маршрутизація запиту коштує 1 долар за 1000 запитів та перенаправляє простіші запити на дешевшу модель у тому самому сімействі, що, за словами AWS, може зменшити витрати до 30% без шкоди для точності.
Anthropic додає ще два. Читання з кешу коштує десяту частину стандартної ставки на вхід, тому повторне надсилання фіксованого системного запиту або документа – це дешева частина, коли кеш увімкнено. І Claude Haiku 4.5 списується за 1 та 5 доларів за мільйон токенів, тобто третину ставок Sonnet, що є найбільшим окремим заощадженням, доступним будь-якій команді, яка вибрала модель фронтиру за замовчуванням.
Кожен з них – це рішення про окрему роботу: яка модель, чи кешується контекст, чи робота виконується інтерактивно чи у вікні пакету, і який ліміти має рахунок. Постачальники почали продавати сам шар примусу, включно з Spectro Cloud’s PaletteAI inference launchpad, спрямованим на підприємства, які намагаються стримувати витрати на токени.
Що змінює Amazon
Amazon вже прибрала одну мотивацію, яка вказувала не туди. Раніше у 2026 році вона закрила внутрішній рейтинг, який оцінював використання співробітниками своєї платформи розробника Kiro, після того, як співробітники завищили свій споживання токенів, щоб піднятися по рейтингу, звичай, яка отримала назву “tokenmaxxing”. Автоматичні обмежувачі, про які розповіли інженери, – це наступний крок, який переносить примус бюджету у шлях розгортання замість щомісячної перевірки.
Масштаб пояснює, чому 1,8 мільйона доларів виглядає як історія управління, а не фінансової історії. Очікується, що Amazon витратить близько 200 мільярдів доларів капітальних витрат у 2026 році, більшість із яких буде витрачена на штучний інтелект та інфраструктуру центрів даних, проти квартального доходу близько 180 мільярдів доларів. Компанія представить результати другого кварталу після закриття 30 липня 2026 року, і лінія капітальних витрат буде займати більшість уваги. Міра того, чи працюють обмежувачі, – це менша та внутрішня: як швидко виявляється робота, яка вийшла з-під контролю. Проект зі збігу авторів встановив цю планку на рівні п’яти місяців, а автоматичні перевірки призначені для перенесення її у процес будівництва.












