Modelos y plataformas de IA
Ingenieros de Amazon limitan el gasto en inteligencia artificial después de desviaciones de costos

Los equipos de ingeniería de Amazon (AMZN ) han encontrado casos en los que trasladar el trabajo de código escrito a mano a modelos de inteligencia artificial han superado con creces los presupuestos de los proyectos, incluyendo 1,8 millones de dólares gastados en ejecutar Claude Sonnet de Anthropic en un trabajo que nunca se lanzó. Ingenieros seniors presentaron los casos a los empleados en una reunión interna el 28 de julio de 2026 y describieron los resultados como “catastróficamente costosos”, según informó el Financial Times, citando a varias personas familiarizadas con la presentación. Les dijeron a sus colegas que ahora están construyendo guardrails automatizados para limitar lo que los proyectos futuros pueden gastar.
El ejemplo más grande coincidió con los registros de autores contra listados de productos en el sitio de comercio electrónico de Amazon. El gasto superó en un 860% lo que había presupuestado ese proyecto, tardó cinco meses en surgir y la implementación falló de todos modos. Se mostraron dos casos más pequeños junto a él: alrededor de 541.000 dólares en costos no planificados en un conjunto de herramientas de auditoría financiera, y 134.000 dólares en trabajo para mejorar las velocidades de entrega en la red logística de Amazon, detectados después de más de dos semanas.
Amazon dijo que está “experimentando, aprendiendo y mejorando” cómo utiliza la tecnología, incluyendo cómo conduce la eficiencia de costos. La empresa también dijo que presentar un puñado de ejemplos aislados como negocio habitual tergiversa cómo sus equipos trabajan con la inteligencia artificial, y que los casos cubrieron un pequeño número de grupos dentro de una fuerza laboral corporativa de aproximadamente 300.000 personas.
Qué hace la facturación por tokens a un error de codificación
Se les dijo al personal que los errores que cuestan casi nada en sistemas convencionales se vuelven costosos una vez que un modelo realiza el trabajo. La razón se encuentra en la lista de precios. Anthropic cobra $3 por millón de tokens de entrada y $15 por millón de tokens de salida para Claude Sonnet 4.5 y 4.6, con Sonnet 5 a un precio introductorio de $2 y $10 hasta el 31 de agosto de 2026 antes de pasar a las mismas tarifas. A precio de entrada estándar de Sonnet, 1,8 millones de dólares compran aproximadamente 600 mil millones de tokens de entrada.
Un bucle de reintento que reenvía el mismo contexto, o un trabajo por lotes apuntando a todo un catálogo en lugar de una muestra, no lanza ninguna excepción y no estrella nada. Produce una factura, y la factura llega en un ciclo de facturación mensual en lugar de en un registro de compilación. Esa distancia entre el error y el número es lo que convierte una mala configuración en un problema de cinco meses.
La unidad de facturación también ha estado cambiando. La documentación de Anthropic señala que Claude 4.7 y modelos posteriores utilizan un tokenizador más nuevo que produce aproximadamente un 30% más de tokens por el mismo texto, por lo que el mismo trabajo se factura más en un modelo más nuevo al mismo precio de título. El cambio más amplio de asientos planos a tokens medidos es el telón de fondo: Unite.AI lo cubrió cuando Claude Fable 5 llegó con un precio de utilidad medido y de nuevo como la era barata de agentes Claude siempre activos terminó silenciosamente.
Los controles que AWS ya vende
Las palancas para este problema exacto se publican en la página de precios de Bedrock de Amazon. La inferencia por lotes se ejecuta a la mitad de la tarifa de pago por uso. Un nivel de servicio Flex lleva un descuento del 50% al precio estándar, con un nivel de prioridad a un 75% de prima para el trabajo que necesita la velocidad. La Ruta de Prompt Inteligente cuesta $1 por 1.000 solicitudes y empuja los prompts más simples a un modelo más barato en la misma familia, lo que AWS dice que puede reducir los costos hasta un 30% sin dañar la precisión.
Anthropic agrega dos más. Una lectura de caché se factura a una décima parte de la tarifa de entrada estándar, por lo que reenviar un prompt de sistema fijo o un documento es la parte barata una vez que se activa la caché. Y Claude Haiku 4.5 se lista a $1 y $5 por millón de tokens, un tercio de las tarifas de Sonnet, lo que es el ahorro individual más grande disponible para cualquier equipo que eligió el modelo de frontera por defecto.
Cada uno de ellos es una decisión por carga de trabajo: qué modelo, si el contexto se almacena en caché, si el trabajo se ejecuta de forma interactiva o en una ventana por lotes, y qué techo lleva la cuenta. Los vendedores han comenzado a vender la capa de cumplimiento en sí, incluyendo PaletteAI Inference Launchpad de Spectro Cloud, dirigido a empresas que intentan mantener los costos de tokens bajos.
Qué está cambiando Amazon
Amazon ya ha eliminado un incentivo que apuntaba en la dirección equivocada. Temprano en 2026, cerró una clasificación interna que clasificaba el uso de su plataforma de desarrollo Kiro por los empleados después de que el personal inflara su consumo de tokens para subir en la clasificación, un hábito que adoptó el nombre de “tokenmaxxing”. Los guardrails automatizados que describieron los ingenieros son el próximo movimiento, poniendo el cumplimiento del presupuesto en la ruta de implementación en lugar de una revisión mensual.
La escala explica por qué $1,8 millones se leen como una historia de gobernanza en lugar de una historia financiera. Se espera que Amazon gaste alrededor de $200 mil millones en gastos de capital a lo largo de 2026, la mayoría de ellos en infraestructura de inteligencia artificial y centros de datos, frente a ingresos trimestrales cercanos a $180 mil millones. La empresa informará los resultados del segundo trimestre después del cierre el 30 de julio de 2026, y la línea de gastos de capital tomará la mayor parte de la atención. La medida que muestra si los guardrails funcionan es más pequeña y interna: qué tan rápido se señaliza un trabajo desbocado. El proyecto de coincidencia de autores estableció esa barra en cinco meses, y las verificaciones automatizadas están destinadas a moverla a la compilación.












