Modèles et plateformes d’IA
OpenAI réduit les prix de l’API pour ses deux modèles GPT-5.6 les moins chers

OpenAI a réduit les prix de l’API pour ses deux modèles GPT-5.6 les moins chers le 30 juillet 2026, réduisant le prix du modèle le moins cher de 80 % et celui du modèle intermédiaire de 20 %, tout en laissant son modèle phare inchangé. Le changement est consigné dans le journal des modifications de l’API de l’entreprise et est déjà en vigueur sur la tarification publiée.
Au million de jetons d’entrée et de sortie, les tarifs standard sont maintenant les suivants :
- GPT-5.6 Luna: 20 centimes et 1,20 $, contre 1 $ et 6 $ précédemment
- GPT-5.6 Terra: 2 $ et 12 $, contre 2,50 $ et 15 $ précédemment
- GPT-5.6 Sol: 5 $ et 30 $, inchangé, correspondant au tarif de son prédécesseur GPT-5.5
Les trois modèles sont disponibles depuis le 9 juillet 2026 aux prix plus élevés, ce qui signifie que la réduction des prix intervient trois semaines après leur mise sur le marché.
Les réductions s’appliquent à tous les niveaux de service, et non seulement au tarif de base. Le traitement par lots et le traitement Flex, qui coûtent la moitié du tarif standard, font maintenant passer Luna à 10 centimes pour les jetons d’entrée et à 60 centimes pour les jetons de sortie. Les lectures de jetons d’entrée en cache, qui bénéficient d’une réduction de 90 %, passent à 2 centimes par million de jetons pour Luna et à 20 centimes pour Terra. Les demandes à contexte long, qui sont facturées au double du tarif d’entrée et à 1,5 fois le tarif de sortie, s’élèvent à 40 centimes et à 1,80 $ pour Luna. Les acheteurs qui passent par Amazon Bedrock sont facturés par AWS, et OpenAI note que ces tarifs peuvent différer des siens.
Les modèles les moins chers sont ceux qui sont utilisés pour les trafics de production à haute volumétrie : classification, extraction, routage de demandes, rédaction de premier jet et les longues boucles d’agent où une instruction utilisateur peut déclencher des dizaines d’appels de modèle avant de renvoyer une réponse. Une réduction de cinq fois sur le modèle qui absorbe ce volume change les calculs pour déterminer quels travaux valent la peine d’être automatisés.
Where the cheaper tiers sit against Claude
À 20 centimes pour les jetons d’entrée et à 1,20 $ pour les jetons de sortie, Luna sous-estime le modèle le moins cher d’Anthropic, Haiku 4.5, d’un facteur de cinq pour les jetons d’entrée et d’environ quatre pour les jetons de sortie, selon la page de tarification d’Anthropic. Le nouveau tarif de Terra se situe en dessous des 3 $ et 15 $ que Claude Sonnet 5 devrait facturer une fois que son tarif d’introduction de 2 $ et 10 $ expirera le 31 août 2026. Au sommet des deux gammes, Sol coûte toujours plus pour les jetons de sortie que Opus 5, que Anthropic facture à 5 $ et 25 $.
Priority processing becomes Fast mode
La même entrée de journal des modifications retire le traitement prioritaire et le remplace par le mode Fast. Pour Sol, OpenAI indique que le mode Fast s’exécute jusqu’à 2,5 fois plus vite que le tarif standard, au double du prix, et que le changement est rétrocompatible : les demandes déjà étiquetées pour le traitement prioritaire sont acheminées vers le mode Fast sans modification de code. Les tarifs du mode Fast sont de 10 $ et 60 $ pour Sol, de 4 $ et 24 $ pour Terra, et de 40 centimes et 2,40 $ pour Luna.
Anthropic vend le même produit sous le même nom et les mêmes conditions — mode Fast pour Opus 5, jusqu’à 2,5 fois plus rapide au double du tarif standard. Les deux cartes de tarifs convergent maintenant sur l’inférence épinglée à la région. OpenAI facture une majoration de 10 % sur les modèles publiés à compter du 5 mars 2026 lorsque le client exige une résidence de données ; Anthropic facture une inférence US uniquement à 1,1 fois son tarif standard.
What made the cheaper tiers cheaper
OpenAI a publié sa comptabilité un jour avant la réduction des prix. Dans un article technique du 29 juillet 2026, cinq membres de son personnel technique ont décrit des optimisations dans l’inférence et le harnais d’agent derrière Codex et ChatGPT Work. Sol, qui s’exécute à l’intérieur de Codex, a réécrit les noyaux de production GPU de l’entreprise ; combiné avec un travail plus large sur les noyaux, OpenAI indique que cela a réduit les coûts de service de bout en bout de 20 %. Sol a également repensé son propre modèle de décoding spéculatif sur des centaines d’expériences, que l’entreprise crédite d’une augmentation de l’efficacité de génération de jetons de plus de 15 %.
Ces chiffres sont ceux d’OpenAI pour sa propre pile. L’article s’est terminé par un engagement à transmettre les « améliorations sous-jacentes à nos utilisateurs et clients sous forme d’intelligence plus largement disponible et plus rentable ». La carte de tarifs a suivi un jour plus tard.
Le travail sur le harnais pointe vers le même centre de coûts que la réduction des prix. OpenAI limite la sortie d’outil à 10 000 jetons par défaut et conserve l’historique du modèle en mode ajout uniquement, de sorte qu’une boucle d’agent renvoyant ses instructions et ses définitions d’outil à chaque étape frappe le cache d’entrée au lieu de payer les tarifs d’entrée complets. Pour une tâche qui nécessite 30 appels de modèle, cela représente 30 chances d’éviter de recalculer le même préfixe.
Les réductions des prix interviennent alors que les acheteurs vérifient les dépenses d’inférence et élargissent les équipes qui utilisent les modèles : les recherches d’OpenAI ont constaté que le personnel utilisait ChatGPT au-delà de leurs titres de poste. L’organisation d’ingénierie d’Amazon a décidé de plafonner les dépenses en IA le même jour, et OpenAI a mis à disposition des limites de dépenses rigides pour les organisations et les projets API le 22 juillet 2026, permettant aux administrateurs de définir un plafond mensuel qui commence à renvoyer des erreurs une fois que les dépenses suivies atteignent ce plafond.
Pour une équipe qui achemine déjà du travail en vrac vers Luna, les mêmes appels coûtent maintenant un cinquième de ce qu’ils coûtaient, avec un plafond qu’ils peuvent définir dans le tableau de bord. Avec le prix de Sol inchangé, la décision en temps réel reste là où OpenAI l’a placée depuis que la famille a été lancée : quel niveau de tarif chaque demande nécessite.












