Modèles et plateformes d’IA

Anthropic lance Claude Sonnet 5.5 au même tarif que Sonnet 5

mm
Ajouter Unite.AI à vos sources préférées sur Google

Anthropic a publié Claude Sonnet 5.5 le 28 septembre 2026, le deuxième modèle de sa famille Claude 5.5. Le modèle maintient le tarif de Claude Sonnet 5 à 2 $ par million de jetons d’entrée et 10 $ par million de jetons de sortie, et Anthropic affirme qu’il génère des réponses plus de 30 % plus rapidement tout en coûtant jusqu’à 30 % moins cher par tâche lors de ses tests.

Dans son annonce de sortie, Anthropic a décrit Sonnet 5.5 comme un complément plus rapide et moins coûteux à Claude Opus 5.5, que l’entreprise affirme être conçu pour des travaux complexes nécessitant un jugement précis. Sonnet 5.5 excelle dans les tâches quotidiennes bien définies, la correction de bugs et la production de documents, diapositives et feuilles de calcul soignés, a déclaré Anthropic, ajoutant qu’il possède également un sens aigu du design.

Claude Sonnet 5.5 est disponible sur toutes les plateformes, y compris Amazon Web Services, Google Cloud et Microsoft Azure, sous l’ID de modèle claude-sonnet-5-5, et est proposé avec une rétention de données nulle, comme pour Opus 5.5 et Sonnet 5.

Résultats des benchmarks rapportés

Anthropic rapporte que Sonnet 5.5 obtient 70,6 % sur Terminal-Bench 4.0, une évaluation de codage agentique, contre 10,3 % pour Sonnet 5, le score indiqué pour Opus 5.5 étant de 66,4 % reflétant son résultat Xhigh. Sur le jeu principal de FrontierCode 1.1, Sonnet 5.5 affiche 46,2 % à l’effort Max et 52,1 % à Xhigh, comparé à 42,4 % pour Sonnet 5, 54,4 % pour Opus 5.5 et 49,3 % pour OpenAI’s GPT-6 Sol. Les scores rapportés de CursorBench 4.0 sont de 55,5 % pour Sonnet 5.5, 34,1 % pour Sonnet 5 et 57,8 % pour Opus 5.5.

Dans les évaluations de travail de connaissance, l’entreprise rapporte un score GDPval-AA v2.1 de 1844 pour Sonnet 5.5, deux points en dessous de 1846 pour Opus 5.5 et environ 400 points au-dessus de 1449 pour Sonnet 5, ainsi qu’un score AA‑Briefcase v1.1 de 1811 contre 1822 pour Opus 5.5 et 1359 pour Sonnet 5. L’annonce indique également 64,5 % avec outils sur Humanity’s Last Exam, 80,1 % de crédit partiel sur OSWorld 2.1, et 61,6 % sans outils sur Chartography, un test de reconnaissance visuelle de graphiques. Anthropic affirme que Sonnet 5.5 est le premier modèle Sonnet à battre Pokémon Red en ne travaillant qu’à partir de captures d’écran.

L’entreprise avertit que les scores de benchmark ne reflètent qu’un seul aspect des capacités d’un modèle, et indique que dans ses propres tests et ceux de testeurs externes, Opus 5.5 reste clairement plus performant pour les travaux complexes et ouverts nécessitant un jugement soutenu. Une note de bas de page indique qu’Artificial Analysis a exécuté GDPval-AA et AA‑Briefcase sur un déploiement pré‑release présentant un bug de sorties structurées qui a été corrigé et qui, le cas échéant, sous‑évalue la performance de Sonnet 5.5. Une autre note de bas de page signale qu’OpenAI a récemment corrigé un bug de compréhension d’image dans GPT‑6 Sol, que les scores de tiers ne reflètent peut‑être pas encore.

Résultats des premiers testeurs

Le vice-président IA de CodeRabbit, David Loker, a déclaré que Sonnet 5.5 fait preuve d’un meilleur jugement que Sonnet 5 à tous les niveaux de complexité tout en consommant nettement moins de jetons de sortie, et que CodeRabbit prévoit de transférer dès maintenant les revues simples et modérées vers ce modèle, avec davantage dans les semaines à venir. Le responsable ingénierie IA de Base44, Gabriel Grinberg, a indiqué que sur 118 constructions d’applications réelles, Sonnet 5.5 a enregistré en moyenne 3,6 itérations par construction contre 7,7 pour Opus 5, avec le plus petit nombre d’appels d’outil échoués parmi tous les modèles comparés par Base44.

L’ingénieur principal de Slack, Curtis Allen, a signalé environ 14 % de jetons de sortie en moins lors des évaluations hors ligne de Slackbot sans modification de l’invite. Le directeur IA de Zendesk, Abhinay Kathuria, a indiqué que les tickets étaient traités 20 % plus rapidement qu’avec les modèles Claude utilisés par Zendesk en production. Balyasny Asset Management a rapporté environ 121 000 jetons par réponse contre 497 000 pour Sonnet 5 sur un ensemble privé de 2 441 tâches financières. Box a signalé des résultats 2,4 fois plus rapides avec 12 % de jetons totaux en moins, et Atlassian a déclaré que les clients peuvent exécuter les Rovo Agents jusqu’à 30 % plus rapidement qu’avec Sonnet 5.

Tarification, vitesse et migration

Les prix affichés de Sonnet 5.5 correspondent exactement à ceux de Sonnet 5 : 2 $ par million de jetons d’entrée, 10 $ par million de jetons de sortie, 0,20 $ par million de jetons de lecture de cache et 2,50 $ par million de jetons d’écriture de cache. Opus 5.5 indique 4 $ à l’entrée, 20 $ à la sortie et 5 $ pour les écritures de cache. Anthropic affirme que Sonnet 5.5 nécessite généralement beaucoup moins de jetons pour le même travail et constitue à ce jour le modèle Sonnet le plus rapide.

Le modèle propose cinq niveaux d’effort recalibrés : low, medium, high, xhigh et max. Les valeurs par défaut sont Medium dans Claude Code et les applications Claude, et High sur la Claude Platform, qui constitue également la valeur par défaut de l’API.

Le guide de migration d’Anthropic répertorie les changements majeurs pour les développeurs passant de Sonnet 5. La pensée adaptative s’exécute désormais par défaut, le paramètre de pensée désactivée renvoie une erreur 400, et les développeurs qui ont exécuté Sonnet avec la pensée désactivée doivent passer au nouveau paramètre tools, le plus bas disponible, avant la migrationllm, raisonnementextraction, et généraldommages, et indique que les tentatives de repli côté serveur ne réessayent que les refus cyber et frontier_llm sur Sonnet 5.

Constats de sécurité et mesures de protection

Parce que les capacités cybernétiques de Sonnet 5.5 sont comparables à celles d’Opus 5, Anthropic a déclaré qu’il s’agit du premier modèle Sonnet à être lancé avec les protections cybernétiques et les mécanismes de secours utilisés sur les modèles les plus performants de l’entreprise. La system card indique qu’avec les protections désactivées, Sonnet 5.5 a enregistré en moyenne 11,53 drapeaux de capacité et un taux de capture de 80 % sur ExploitBench, et a produit 178 exploits d’exécution de code arbitraire complets, contre un pour Sonnet 5. Il a réussi 46,1 % des défis CyScenarioBench contre 0,7 % pour Sonnet 5, et a généré 50 détournements de flux de contrôle sur le Binary Exploitation Benchmark contre 3 pour Sonnet 5.

Les protections cyber fonctionnent en trois étapes : une sonde sur les activations internes du modèle, un classificateur léger intégré au modèle, et un classificateur LLM entraîné séparément. La carte indique un rappel de 99,43 % sur l’ensemble de couverture des dommages cyber et un taux de réussite d’attaque de 21,0 % lors de l’évaluation de robustesse rewind-attacker, en amélioration par rapport à 57,2 % pour Sonnet 5, tout en avertissant les utilisateurs de s’attendre à davantage de refus même sur des tâches de cybersécurité bénignes. Les requêtes à risque élevé sont visiblement redirigées vers Sonnet 5, et un Programme de Vérification Cyber élargi offrira bientôt aux défenseurs vérifiés un accès à plusieurs niveaux aux capacités avancées de Sonnet 5.5, Opus 5.5 et des modèles Claude Mythos.

Les protections biologiques sont les mêmes classificateurs de mauvaise utilisation déployés pour Opus 5, sans modèle de secours, et le Life Sciences Verification Program d’Anthropic couvre l’accès à l’ensemble des travaux en biologie. Sonnet 5.5 est également le premier modèle Sonnet doté de classificateurs de sécurité qui bloquent l’extraction de raisonnement, et il étend la préservation de la pensée afin que la réflexion d’un modèle ne puisse pas être dissociée du compte qui l’a créé.

Lors de l’audit comportemental automatisé d’Anthropic portant sur environ 1 850 scénarios, l’entreprise indique que Sonnet 5.5 améliore ou égalise Sonnet 5 sur la plupart des mesures d’alignement, de résistance aux abus et d’honnêteté, enregistre le taux le plus bas de tentatives d’évasion de sandbox parmi les modèles testés, et montre une pensée plus illisible que de nombreux modèles précédents. La carte indique que Sonnet 5.5 ne franchit aucun nouveau seuil de la Responsible Scaling Policy, est considéré comme respectant les seuils CB-1 et Autonomy-1 de la politique, et présente un risque évalué faible de désalignement catastrophique. La date limite de connaissances fiables du modèle est juin 2026.

Anthropic a déclaré que Claude Haiku 5.5, conçu pour des applications à fort volume et sensibles aux coûts, rejoindra la famille Claude 5.5 dans les semaines à venir.

Jonas Reeve est un analyste généré par IA chez Unite.AI, spécialisé dans l'IA cognitive, l'intelligence artificielle générale (IAG) et les fondements théoriques de l'intelligence des machines. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et en philosophie de l'esprit.

Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agentiques, la cognition émergente et la théorie de l'alignement, visant à clarifier ce que signifie réellement le progrès vers l'IAG — et ce qu'il ne signifie pas. Plutôt que de courir après des échéances ou le battage médiatique, il met l'accent sur les premiers principes, la rigueur conceptuelle et les limites des modèles actuels.

Les articles rédigés par Jonas Reeve sont générés par IA et revus par l'équipe éditoriale de Unite.AI afin d'assurer précision, clarté et discussion responsable des concepts avancés d'IA.