Modelos e plataformas de IA
Engenheiros da Amazon Movem para Limitar Gastos com IA Após Estouros de Custo

As equipes de engenharia da Amazon (AMZN ) descobriram casos em que a transferência de trabalho de código escrito à mão para modelos de IA ultrapassou os orçamentos dos projetos, incluindo US$ 1,8 milhão gastos com a execução do Claude Sonnet da Anthropic em um trabalho que nunca foi enviado. Engenheiros seniores apresentaram os casos para o pessoal em uma reunião interna em 28 de julho de 2026 e descreveram os resultados como “catastróficamente caros”, conforme reportado pelo Financial Times, citando várias pessoas familiarizadas com a apresentação. Eles disseram aos colegas que agora estão construindo guardrails automatizados para limitar o que os projetos futuros podem gastar.
O exemplo mais amplo correspondia a registros de autor contra listagens de produtos no site de varejo da Amazon. Os gastos ficaram 860% acima do que o projeto havia orçado, levou cinco meses para ser detectado e a implantação falhou de qualquer forma. Dois casos menores foram mostrados ao lado: cerca de US$ 541.000 em custos não planejados em um conjunto de ferramentas de auditoria financeira e US$ 134.000 em trabalhos para melhorar as velocidades de entrega na rede logística da Amazon, detectados após mais de duas semanas.
A Amazon disse que está “experimentando, aprendendo e melhorando” como usa a tecnologia, incluindo como impulsiona a eficiência de custos. A empresa também disse que apresentar um punhado de exemplos isolados como rotina de negócios distorce como as equipes trabalham com IA e que os casos abrangiam um pequeno número de grupos dentro de uma força de trabalho corporativa de cerca de 300.000.
O que a faturação por token faz com um erro de codificação
O pessoal foi informado de que erros que custam quase nada em sistemas convencionais se tornam caros quando um modelo faz o trabalho. O motivo está na lista de preços. A Anthropic cobra US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída para o Claude Sonnet 4.5 e 4.6, com o Sonnet 5 a um preço de introdução de US$ 2 e US$ 10 até 31 de agosto de 2026, antes de mudar para as mesmas taxas. No preço de entrada padrão do Sonnet, US$ 1,8 milhão compra cerca de 600 bilhões de tokens de entrada.
Um loop de retry que reenvia o mesmo contexto ou um trabalho em lote apontado para um catálogo inteiro em vez de uma amostra não dispara exceção e não trava nada. Ele produz uma fatura, e a fatura chega em um ciclo de faturamento mensal em vez de em um log de compilação. Essa distância entre o erro e o número é o que transforma uma configuração ruim em um problema de cinco meses.
A unidade de faturamento também está mudando. A documentação da Anthropic observa que o Claude 4.7 e modelos posteriores usam um tokenizer mais recente que produz cerca de 30% mais tokens para o mesmo texto, então o mesmo trabalho é faturado em um modelo mais novo com a mesma taxa de cabeçalho. A mudança mais ampla de assentos planos para tokens medidos é o pano de fundo: o Unite.AI cobriu quando o Claude Fable 5 chegou com preço de utilidade medido e novamente como a era barata de agentes Claude sempre ativados chegou ao fim.
Os controles que a AWS já vende
As alavancas para esse problema exato estão publicadas na página de preços do Bedrock da Amazon. A inferência em lote é cobrada pela metade da taxa de demanda. Um nível de serviço Flex oferece um desconto de 50% na tarifa padrão, com um nível Prioritário a um prêmio de 75% para trabalhos que precisam de velocidade. O Intelligent Prompt Routing custa US$ 1 por 1.000 solicitações e envia prompts mais simples para um modelo mais barato na mesma família, o que a AWS diz que pode reduzir os custos em até 30% sem prejudicar a precisão.
O lado da Anthropic acrescenta mais dois. Uma leitura de cache é cobrada em um décimo da taxa de entrada padrão, então reenviar um prompt de sistema fixo ou documento é a parte barata uma vez que o cache é ativado. E o Claude Haiku 4.5 é listado a US$ 1 e US$ 5 por milhão de tokens, um terço das taxas do Sonnet, o que é a maior economia disponível para qualquer equipe que escolheu o modelo de fronteira por padrão.
Cada um deles é uma decisão por carga de trabalho: qual modelo, se o contexto é armazenado em cache, se o trabalho é executado interativamente ou em uma janela de lote e qual teto a conta suporta. Os fornecedores começaram a vender a própria camada de aplicação, incluindo o PaletteAI inference launchpad da Spectro Cloud, direcionado a empresas que tentam manter os custos de tokens sob controle.
O que a Amazon está mudando
A Amazon já removeu um incentivo que apontava na direção errada. No início de 2026, fechou um leaderboard interno que classificava o uso da plataforma de desenvolvedor Kiro por funcionários após o pessoal inflar seu consumo de tokens para subir na classificação, um hábito que recebeu o nome de “tokenmaxxing”. Os guardrails automatizados que os engenheiros descreveram são a próxima medida, colocando a aplicação do orçamento no caminho de implantação em vez de uma revisão mensal.
A escala explica por que US$ 1,8 milhão lê como uma história de governança em vez de financeira. A Amazon deve gastar cerca de US$ 200 bilhões em despesas de capital ao longo de 2026, a maior parte disso em infraestrutura de IA e data centers, contra receita trimestral perto de US$ 180 bilhões. A empresa relata os resultados do segundo trimestre após o fechamento em 30 de julho de 2026, e a linha de despesas de capital vai receber a maior parte da atenção. A medida que mostra se os guardrails funcionam é menor e interna: quanto tempo um trabalho descontrolado leva para ser sinalizado. O projeto de correspondência de autor estabeleceu essa barra em cinco meses, e as verificações automatizadas visam movê-la para a compilação.












