Modèles et plateformes d’IA

Anthropic associe le prix de Claude Opus 5.5 à des sessions de codage plus longues

mm
Ajouter Unite.AI à vos sources préférées sur Google

Anthropic a indiqué le 24 septembre 2026 que les sessions Claude Code sont devenues plus longues et plus lourdes en contexte au cours des six derniers mois, détaillant dans un article sur le Claude blog comment la tarification et les mécanismes de mise en cache de Claude Opus 5.5 répondent à ce changement. L’entreprise estime que le coût d’exécution d’Opus 5.5 est d’environ 40 % inférieur à celui d’Opus 5 pour une charge de travail facturée à la token, selon ses propres estimations.

Six mois de données d’utilisation de Claude Code

L’article, rédigé par Michael Segner, s’appuie sur des données d’utilisation agrégées couvrant la période de mars à septembre 2026. Le nombre d’invites par session est resté stable, indique l’article, tandis que le travail à l’intérieur de chaque invite a augmenté : le modèle travaille désormais 3,3 fois plus longtemps par invite et effectue plus de 40 % d’appels de modèle supplémentaires pour chacune, et les interruptions ont diminué de 68 %. Les développeurs connectent désormais un serveur d’outils ou utilisent une compétence environ deux fois plus souvent, et collent du texte dans les invites un tiers moins souvent.

La quantité de contexte dans chaque requête a augmenté de 2,6 fois sur la période, et le ratio token d’entrée : token de sortie est passé de 189 : 1 à 324 : 1. Anthropic interprète ces chiffres comme indiquant que les développeurs visent un modèle qui travaille plus longtemps et mieux informé sur des tâches plus grandes et plus ouvertes, et affirme que les économies réalisées avec Opus 5.5 sont les plus importantes précisément pour ces sessions plus longues et à contexte élevé lorsque l’utilisation est facturée à la token.

L’analyse s’appuie sur le lancement par Anthropic de Claude Opus 5.5, qui est arrivé avec des prix inférieurs à ceux d’Opus 5. Alors que le lancement a fixé les prix, l’article du 24 septembre et une analyse compagnon publiée le 22 septembre 2026 par Addy Osmani examinent ce que ces prix signifient pour les charges de travail réelles de Claude Code.

Prix des tokens et réduction du coût de lecture du cache

Pour une utilisation facturée à la token, Anthropic a réduit les prix des tokens d’entrée et de sortie de 20 % et a baissé le prix de lecture d’un token mis en cache de 60 %. L’entreprise affirme que la réduction du coût de lecture du cache a le plus d’impact car les lectures du cache représentent la majeure partie du coût du travail agentique et de codage, et indique qu’à la date de publication, un token mis en cache sur Opus 5.5 coûte un cinquième de celui des modèles concurrents et les surpasse.

L’analyse compagnon d’Osmani indique les prix de liste API d’Opus 5.5 à 4 $ par million de tokens d’entrée, 20 $ par million de tokens de sortie et 0,20 $ par million de lectures de cache. À ces tarifs, une lecture mise en cache coûte 5 % d’un token d’entrée frais, tandis que l’écriture dans le cache coûte 1,25 fois le prix d’entrée pour un cache de cinq minutes et deux fois le prix d’entrée pour un cache d’une heure, chaque accès renouvelant la durée de vie gratuitement. Sur les plans Pro, Max ou Team, le prix inférieur d’Opus 5.5 est répercuté sur les limites du plan, ce qui les fait aller environ 25 % plus loin que sur Opus 5 ; la remise supplémentaire sur la lecture du cache ne s’applique qu’à la tarification API.

Exploiter les changements qui protègent le cache

Même si le contexte par requête a augmenté d’environ 2,6 fois, la part d’entrée qui ne trouve pas le cache a chuté de plus de 50 % sur la période de six mois, indique l’article. Il attribue cela à une série de changements de Claude Code qui réduisent les ruptures accidentelles du cache, couvrant de petites perturbations comme un rafraîchissement de connexion et de plus grandes comme l’ajout d’instructions au milieu d’une conversation ou le chargement d’outils à la demande. Sur Opus 5.5 et Fable 5.1, les développeurs peuvent également modifier les niveaux d’effort en cours de session sans réinitialiser le cache.

La documentation de la mise en cache des invites officielle précise que le comportement du niveau d’effort s’applique avec une clé API ou un abonnement Claude, et non sur Amazon Bedrock, la plateforme Agent de Google Cloud, ou une passerelle d’applications Claude, ni lorsque le drapeau CLAUDECODEDISABLEEXPERIMENTALBETAS est activé ou qu’une organisation possède une configuration HIPAA.

Les développeurs disposant de clés API et de fournisseurs cloud peuvent désormais définir une durée de vie du cache d’une heure, ce que les abonnés possédaient déjà. La documentation indique les valeurs par défaut : une heure pour la conversation principale sur un abonnement Claude dans le cadre de l’utilisation du plan, et cinq minutes pour les crédits d’utilisation, les clés API ou les fournisseurs cloud. Le paramètre promptCacheTtl ou la variable d’environnement CLAUDECODEPROMPTCACHETTL sélectionne la durée de vie plus longue, et les deux contrôles nécessitent Claude Code v2.1.242 ou ultérieur.

Les sous‑agents dérivés commencent désormais à partir du cache de la session parent plutôt que de payer pour retraiter le même contexte. La documentation explique qu’un fork reprend l’invite système du parent, l’ensemble d’outils et l’historique complet de la conversation, de sorte que sa requête d’ouverture lit directement depuis le cache du parent.

Moins de tours par tâche

Anthropic rapporte qu’Opus 5.5 peut accomplir une tâche en moins de tours que d’autres modèles. Selon l’article, Zeta Labs a enregistré moins de tours et d’appels d’outils par tâche que sur Opus 5, à près de la moitié du coût, et a terminé deux fois plus de ses tâches les plus difficiles.

L’article avertit que ce schéma ne s’appliquera pas à toutes les tâches, en citant l’analyse d’Osmani : « Sur une tâche bien définie, les deux modèles terminent avec à peu près le même nombre de tours, et la réduction de prix est tout ce que vous obtenez. L’écart devrait être le plus important sur les tâches ouvertes, où un modèle peut passer de nombreux tours sur une mauvaise idée. »

Anthropic indique également qu’Opus 5.5 génère des résultats plus de 30 % plus rapidement qu’Opus 5. Ce gain laisse l’utilisation des tokens et le taux de succès du cache inchangés ; l’article note que cela raccourcit l’attente lors de longues exécutions, Claude passant plus de temps à travailler de façon autonome.

L’article se termine par des pratiques visant à protéger les lectures en cache : exécutez /usage dans Claude Code pour voir quelle part d’une session est servie depuis le cache, choisissez le modèle dès le démarrage d’une session plutôt que de le changer en cours de route, lancez la compaction avant de vous éloigner plutôt qu’après, et, sur une clé API ou un fournisseur cloud, activez la durée de vie du cache d’une heure pour les longues sessions.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.