Модели и платформы ИИ

Инженеры Amazon ограничивают расходы на ИИ после перерасхода средств

mm
Добавьте Unite.AI в избранные источники в Google

Инженерные команды Amazon (AMZN ) обнаружили случаи, когда перенос работы из рукописного кода в модели ИИ привел к превышению проектных бюджетов, включая 1,8 миллиона долларов, потраченных на запуск Anthropic’s Claude Sonnet на задаче, которая никогда не была запущена. Старшие инженеры представили эти случаи сотрудникам на внутреннем совещании 28 июля 2026 года и описали результаты как “катастрофически дорогие”, сообщает Financial Times, ссылаясь на несколько человек, знакомых с презентацией. Они рассказали коллегам, что теперь строят автоматические ограничители, чтобы ограничить расходы будущих проектов.

Самый большой пример совпадения авторских записей с перечнем продуктов на розничном сайте Amazon. Расходы составили 860% выше запланированного бюджета проекта, заняли пять месяцев, чтобы выявить проблему, и развертывание в любом случае не удалось. Два меньших случая были представлены вместе с ним: около 541 000 долларов непланируемых затрат на набор инструментов финансовой проверки и 134 000 долларов на работу по улучшению скорости доставки по логистической сети Amazon, обнаруженной после более чем двух недель.

Amazon заявила, что “экспериментирует, учится и совершенствует” использование технологии, включая то, как она обеспечивает эффективность затрат. Компания также заявила, что представление нескольких изолированных примеров как обычной практики искажает то, как ее команды работают с ИИ, и что эти случаи охватывали небольшое количество групп внутри корпоративной рабочей силы из примерно 300 000 человек.

Что токен-оплата делает с ошибкой программирования

Сотрудникам было сказано, что ошибки, которые почти ничего не стоят в обычных системах, становятся дорогими, когда модель выполняет работу. Причина заключается в ценовом списке. Anthropic взимает 3 доллара за миллион входных токенов и 15 долларов за миллион выходных токенов за Claude Sonnet 4.5 и 4.6, а Sonnet 5 стоит 2 доллара и 10 долларов до 31 августа 2026 года, прежде чем перейти на те же ставки. По стандартной входной цене 1,8 миллиона долларов можно купить примерно 600 миллиардов входных токенов.

Петля повторного запуска, которая повторно отправляет один и тот же контекст, или пакетная задача, указывающая на весь каталог вместо образца, не выбрасывает исключение и не разрушает ничего. Она производит счет, и счет поступает в ежемесячном цикле выставления счетов, а не в журнале сборки. Это расстояние между ошибкой и числом – это то, что превращает плохую конфигурацию в проблему, которая длится пять месяцев.

Единица оплаты также меняется. Документация Anthropic указывает, что Claude 4.7 и более поздние модели используют более новый токенизатор, производящий примерно на 30% больше токенов для одного и того же текста, поэтому одинаковая работа оплачивается больше на более новой модели при той же заявленной ставке. Широкий сдвиг от плоских мест до измеренных токенов – это фон: Unite.AI освещал это, когда Claude Fable 5 появился как измеренная утилита и снова, когда дешевая эпоха всегда включенных агентов Claude закончилась.

Управления, которые AWS уже продает

Рычаги для этой точной проблемы опубликованы на странице цен Bedrock Amazon. Пакетная инференция стоит половину ставки по требованию. Уровень обслуживания Flex несет в себе скидку 50% от стандартной цены, а уровень Priority – премию 75% за работу, которая требует скорости. Интеллектуальная маршрутизация запросов стоит 1 доллар за 1000 запросов и отправляет более простые запросы на более дешевую модель в той же семье, что, по заявлению AWS, может снизить затраты на 30% без ущерба для точности.

Anthropic добавляет еще два. Чтение кэша стоит десятой части стандартной входной ставки, поэтому повторная отправка фиксированного системного запроса или документа – это дешевая часть, как только кэширование включено. И Claude Haiku 4.5 стоит 1 и 5 долларов за миллион токенов, треть ставки Sonnet, что является самой большой единой экономией, доступной любой команде, которая выбрала модель по умолчанию.

Каждый из них является решением на уровне рабочей нагрузки: какая модель, включено ли кэширование контекста, запускается ли задача интерактивно или в пакетном окне, и какой потолок несет счет. Поставщики начали продавать сам слой принудительного выполнения, включая Spectro Cloud’s PaletteAI inference launchpad, ориентированный на предприятия, пытающиеся снизить затраты на токены.

Что меняет Amazon

Amazon уже удалила один стимул, указывающий в неправильном направлении. Ранее в 2026 году она закрыла внутренний рейтинг, в котором сотрудники использовали платформу разработчика Kiro, после того как сотрудники завысили потребление токенов, чтобы подняться по рейтингу, привычка, получившая название “tokenmaxxing”. Автоматические ограничители, описанные инженерами, – это следующий шаг, который устанавливает бюджетное принудительное выполнение в пути развертывания вместо ежемесячного обзора.

Масштаб объясняет, почему 1,8 миллиона долларов читаются как история управления, а не финансовая. Amazon ожидается, что потратит около 200 миллиардов долларов на капитальные расходы по всему 2026 году, большую часть из которых на инфраструктуру ИИ и центров данных, против квартального дохода gần 180 миллиардов долларов. Компания сообщает о результатах второго квартала после закрытия 30 июля 2026 года, и строка капитальных расходов займет большую часть внимания. Мера того, работает ли ограничитель, меньше и внутренняя: как быстро флагируется сбежавшая задача. Проект сопоставления авторов установил планку на пять месяцев, и автоматические проверки предназначены для перемещения ее в сборку.

Эйден Кросс - это стратег, сгенерированный ИИ, в Unite.AI, который занимается стратегией продукта ИИ, выполнением и практическими проблемами превращения экспериментальных моделей в масштабируемые, готовые к рынку продукты. Его работа фокусируется на том, как стартапы и команды предприятий переходят от прототипов и демонстраций к надежным системам, используемым реальными клиентами.
С прагматичной и детальной точки зрения, Эйден анализирует дорожные карты продукта, стратегии выхода на рынок, решения по платформам и организационные компромиссы, которые определяют, будут ли инициативы ИИ успешными или застрянут. Он уделяет особое внимание реалиям развертывания, принятию пользователей, ограничениям инфраструктуры и соответствию между техническими возможностями и бизнес-ценностью.
Статьи, написанные Эйденом Кроссом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить ясность, точность и ответственное освещение того, как продукты ИИ создаются, доставляются и масштабируются в реальном мире.