Modèles et plateformes d’IA

Les ingénieurs d’Amazon visent à limiter les dépenses en IA après des dérapages de coûts

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les équipes d’ingénierie d’Amazon (AMZN ) ont constaté des cas où le passage du code manuscrit aux modèles d’IA a dépassé les budgets de projet, notamment 1,8 million de dollars dépensés pour exécuter Claude Sonnet d’Anthropic sur un travail qui n’a jamais été livré. Les ingénieurs seniors ont présenté ces cas au personnel lors d’une réunion interne le 28 juillet 2026 et les ont décrits comme “catastrophiquement coûteux”, selon le Financial Times, citant plusieurs personnes familières avec la présentation. Ils ont dit à leurs collègues qu’ils construisent désormais des garde-fous automatisés pour limiter ce que les futurs projets peuvent dépenser.

L’exemple le plus important correspondait aux enregistrements d’auteurs aux listes de produits sur le site de vente au détail d’Amazon. Les dépenses ont dépassé de 860 % ce que le projet avait budgétisé, ont mis cinq mois à émerger et la mise en œuvre a échoué de toute façon. Deux cas plus petits ont été présentés à côté : environ 541 000 dollars de coûts imprévus sur un ensemble d’outils d’audit financier et 134 000 dollars sur des travaux pour améliorer les vitesses de livraison sur le réseau logistique d’Amazon, détectés après plus de deux semaines.

Amazon a déclaré qu’il “expérimente, apprend et améliore” la façon dont il utilise la technologie, notamment pour améliorer l’efficacité des coûts. La société a également déclaré que présenter un petit nombre d’exemples isolés comme une pratique commerciale courante déforme la façon dont ses équipes travaillent avec l’IA, et que les cas concernaient un petit nombre de groupes au sein d’une main-d’œuvre d’environ 300 000 personnes.

What token billing does to a coding mistake

Le personnel a été informé que les erreurs qui coûtent presque rien dans les systèmes conventionnels deviennent coûteuses une fois que le modèle effectue le travail. La raison se trouve sur la liste de prix. Anthropic facture 3 dollars par million de jetons d’entrée et 15 dollars par million de jetons de sortie pour Claude Sonnet 4.5 et 4.6, avec Sonnet 5 à un tarif introductif de 2 et 10 dollars jusqu’au 31 août 2026 avant de passer aux mêmes tarifs. Au tarif d’entrée standard de Sonnet, 1,8 million de dollars achètent dans l’ordre de 600 milliards de jetons d’entrée.

Une boucle de réessai qui renvoie le même contexte ou un travail par lots pointé vers un catalogue entier au lieu d’un échantillon ne lance aucune exception et ne plante rien. Cela produit une facture, et la facture arrive sur un cycle de facturation mensuel plutôt que dans un journal de construction. Cette distance entre l’erreur et le nombre est ce qui transforme une mauvaise configuration en un problème de cinq mois.

L’unité de facturation a également changé. La documentation d’Anthropic indique que Claude 4.7 et les modèles ultérieurs utilisent un tokenizer plus récent produisant environ 30 % plus de jetons pour le même texte, de sorte que le même travail est facturé plus cher sur un modèle plus récent au même tarif nominal. Le changement plus large des sièges plats aux jetons mesurés est l’arrière-plan : Unite.AI l’a couvert lors de l’arrivée de Claude Fable 5 et à nouveau lors de la fin de l’ère des agents Claude toujours activés à bas coût.

The controls AWS already sells

Les leviers pour ce problème exact sont publiés sur la page de tarification Bedrock d’Amazon. L’exécution de l’inférence par lots coûte la moitié du tarif à la demande. Un niveau de service Flex comporte une remise de 50 % sur le tarif standard, avec un niveau de priorité à un prix majoré de 75 % pour les travaux qui nécessitent de la vitesse. Le routage intelligent des invites coûte 1 dollar par 1 000 requêtes et pousse les invites plus simples vers un modèle moins cher de la même famille, ce qui, selon AWS, peut réduire les coûts de jusqu’à 30 % sans nuire à la précision.

Le côté d’Anthropic ajoute deux autres éléments. Une lecture de cache est facturée au dixième du tarif d’entrée standard, de sorte que la réexpédition d’une invite de système fixe ou d’un document est la partie peu coûteuse une fois que le cache est activé. Et Claude Haiku 4.5 est facturé 1 et 5 dollars par million de jetons, un tiers des tarifs de Sonnet, ce qui constitue l’économie la plus importante disponible pour toute équipe qui a choisi le modèle de frontière par défaut.

Chacun de ceux-ci est une décision par charge de travail : quel modèle, si le contexte est mis en cache, si le travail s’exécute de manière interactive ou dans une fenêtre de lot, et quelle limite le compte porte. Les fournisseurs ont commencé à vendre la couche d’application elle-même, notamment Spectro Cloud’s PaletteAI inference launchpad, destiné aux entreprises qui tentent de contrôler les coûts des jetons d’IA.

What Amazon is changing

Amazon a déjà supprimé un facteur d’incitation qui pointait dans la mauvaise direction. Plus tôt en 2026, il a fermé un tableau de bord interne classant les employés en fonction de leur utilisation de la plate-forme de développement Kiro après que le personnel ait gonflé leur consommation de jetons pour grimper, une habitude qui a pris le nom de “tokenmaxxing”. Les garde-fous automatisés que les ingénieurs ont décrits sont la prochaine étape, en insérant l’application des budgets dans le chemin de déploiement au lieu d’une revue mensuelle.

L’échelle explique pourquoi 1,8 million de dollars se lisent comme une histoire de gouvernance plutôt que comme une histoire financière. Amazon devrait dépenser environ 200 milliards de dollars en dépenses d’investissement au cours de 2026, dont la majeure partie pour l’IA et les infrastructures de centres de données, par rapport à un chiffre d’affaires trimestriel proche de 180 milliards de dollars. La société rendra compte de ses résultats du deuxième trimestre après la clôture le 30 juillet 2026, et la ligne de dépenses d’investissement occupera la majeure partie de l’attention. Le facteur qui montre si les garde-fous fonctionnent est plus petit et interne : à quelle vitesse un travail dérape est-il signalé. Le projet de correspondance d’auteurs a fixé cette barre à cinq mois, et les vérifications automatisées sont censées la déplacer dans la construction.

Aiden Cross est un stratège généré par IA chez Unite.AI, couvrant la stratégie de produit IA, l'exécution et les défis pratiques pour transformer des modèles expérimentaux en produits prêts pour le marché et évolutifs. Son travail se concentre sur la façon dont les startups et les équipes d'entreprise passent des prototypes et des démos à des systèmes fiables utilisés par de vrais clients.
Avec une perspective pragmatique et axée sur les détails, Aiden analyse les feuilles de route de produit, les stratégies de lancement sur le marché, les décisions de plateforme et les compromis organisationnels qui déterminent si les initiatives IA réussissent ou stagner. Il prête une attention particulière aux réalités de déploiement, à l'adoption des utilisateurs, aux contraintes d'infrastructure et à l'alignement entre la capacité technique et la valeur commerciale.
Les articles rédigés par Aiden Cross sont générés par IA et révisés par l'équipe éditoriale de Unite.AI pour garantir la clarté, l'exactitude et la couverture responsable de la façon dont les produits IA sont construits, expédiés et mis à l'échelle dans le monde réel.