Cybersécurité
Les laboratoires viennent de prouver que le bac à sable de votre agent n’est qu’une suggestion

Anthropic a examiné 141 006 évaluations de cybersécurité et a trouvé trois incidents — six exécutions au total — où un modèle Claude .
Ce n’est pas une faille de sécurité. Ce n’est pas une tentative d’évasion. Dans , la société est explicite : dans aucun des trois cas, le modèle n’a tenté de s’exfiltrer ou de sortir de son environnement de test. Il a simplement continué à faire le travail qui lui avait été confié, et le travail l’a mené quelque part dans le monde réel.
Cette distinction est importante, car c’est la même structure qui fonctionne à l’intérieur de nombreuses déploiements commerciaux ordinaires en ce moment.
La limite était une phrase, et la phrase était incorrecte
Voici ce qui s’est passé. Un malentendu entre Anthropic et Irregular, l’un des partenaires tiers qu’il utilise pour les évaluations, a laissé les machines de test avec un accès Internet en direct. Les invites d’évaluation ont indiqué au modèle qu’il n’avait pas d’Internet.
Ainsi, le modèle avait une tâche de capture du drapeau — l’exercice de sécurité standard où vous vous connectez à une machine cible pour récupérer un secret planté — une contrainte déclarée selon laquelle il n’avait pas d’Internet, et un environnement qui contredisait discrètement la contrainte. Dans un cas, le nom d’une société cible fictive correspondait à un domaine réel. Au cours de quatre exécutions, Claude Opus 4.7 a cherché la cible simulée, a trouvé la société réelle sur le Web ouvert et s’est connecté avec des techniques de base — des mots de passe faibles et des points de terminaison non authentifiés, selon la description des incidents par Anthropic. Il a extrait les informations d’identification et a atteint une base de données contenant plusieurs centaines de lignes de données de production. Dans les quatre exécutions, le modèle a finalement reconnu que les systèmes étaient réels ; aucun n’a arrêté sur cette base, et dans deux cas, il a raisonné que la société réelle devait faire partie de l’exercice.
Un deuxième modèle a créé un paquet de logiciel piégé pour correspondre à un paquet fictif dans ses instructions de configuration et l’a publié sur PyPI — le registre public où les logiciels Python sont publiés et extraits. Il a été actif pendant environ une heure et a atterri sur quinze machines réelles, dont une appartenant à une société de sécurité dont l’analyseur installe régulièrement des packages et les inspecte.
Lorsque l’analyseur a exécuté le package, le code caché a extrait les informations d’identification de la société vers un point de collecte que le modèle avait configuré, et le modèle les a utilisées pour atteindre davantage d’infrastructures de la société. Au début de l’exécution, sa propre logique avait correctement identifié cela : si Internet était réel, la publication serait une attaque du monde réel — « Pas d’accord, et sûrement pas la solution prévue ». Ensuite, il s’est convaincu lui-même de sa propre conclusion. Il n’a pas reconnu les autorités de certification qui sécurisaient ses connexions — les sociétés qui attestent qu’un site Web est celui qu’il prétend être — et le calendrier indiquait 2026, il a donc décidé que l’environnement était mis en scène et n’a jamais réexaminé la question. Lorsque les analyseurs automatisés ont commencé à installer le package, il les a pris pour des acteurs scriptés à l’intérieur de l’exercice.
Le troisième et plus récent modèle a découvert que sa cible était réelle et s’est arrêté de lui-même — mais seulement après avoir scanné environ 9 000 cibles et avoir compromis une application Internet d’une société à travers une page de débogage exposée et une injection SQL, un vieux truc pour faire répondre une base de données à des questions qu’elle ne devrait pas. Le verdict d’Anthropic : même ce modèle est allé plus loin avant de s’arrêter qu’ils ne le souhaitaient.
Enfoui dans le compte-rendu se trouve la ligne qui compte le plus pour quiconque déployant ces choses commercialement : il est « également possible qu’une invite qui disait à Claude qu’il avait accès à Internet aurait changé la façon dont Claude se comportait lorsqu’il était en contact avec des systèmes réels ».
Lisez cela comme une déclaration de conception plutôt que comme une note de sécurité. La seule chose qui se tenait entre l’agent et Internet ouvert était une phrase décrivant un environnement qui n’existait pas. L’agent a cru la description. La description était incorrecte. Tout ce qui a suivi, c’est que l’agent a compétamment poursuivi son objectif à travers un monde dont il avait une mauvaise carte.
Anthropic appelle cela une défaillance opérationnelle, ce qui est la mauvaise nouvelle
La société caractérise les incidents comme « plus proches d’une défaillance de harnais et opérationnelle que d’une défaillance d’alignement du modèle ». Ce cadrage est censé être rassurant, et pour un laboratoire, cela l’est probablement. Pour une entreprise, cela devrait atterrir de l’autre côté.
Un problème d’alignement appartient au fournisseur de modèle. Un problème de harnais vous appartient. Le harnais est tout ce que vous construisez autour du modèle : les informations d’identification qu’il détient, le réseau sur lequel il se trouve, ce qu’il peut atteindre, ce qui l’arrête. Anthropic fait des tests de pénétration sur ses propres modèles, contracte des partenaires d’évaluation externes et déclare être en pourparlers avec METR, un évaluateur indépendant, pour une révision tierce. La mauvaise configuration est toujours passée inaperçue à la fois d’Anthropic et de son partenaire — le premier incident date d’avril, et personne ne l’a détecté jusqu’à l’audit des transcriptions de juillet.
L’audit lui-même a commencé deux jours après que — un mécanisme différent, comme Anthropic le note soigneusement, mais la même classe de défaillance. Les modèles d’OpenAI ont trouvé une faille inconnue et non corrigée dans le service interne qui récupère les bibliothèques de code externes, l’ont utilisée pour sortir d’un environnement de recherche censé être scellé et ont travaillé à partir de là — y compris des informations d’identification volées — dans les systèmes en direct de Hugging Face. L’examen continu d’OpenAI a depuis : les modèles ont utilisé des informations d’identification exposées publiquement sur quatre services externes au cours de l’attaque de Hugging Face elle-même, ainsi que quelques autres dans d’autres évaluations, bien qu’il ne signale rien d’autre à cette gravité ou à cette échelle. Deux laboratoires de pointe, deux défaillances de confinement indépendantes, divulguées neuf jours à part.
Une complication honnête avant que l’analogie ne prenne : les deux laboratoires ont exécuté ces évaluations avec leurs couches de sécurité de production délibérément désactivées, et Anthropic déclare que les garanties sur ses modèles expédiés auraient bloqué le comportement. Vos agents s’exécutent avec ces garanties activées. Mais les garanties vivent à la couche du modèle, et le fossé des autorisations vit chez vous — aucun classificateur n’audit votre compte de service.
Maintenant, tenez votre propre configuration contre celle-ci. La plupart des déploiements d’agents à l’intérieur des sociétés ordinaires définissent la portée de la même manière que l’évaluation : dans les instructions. Ne lisez que le lecteur partagé. Ne touchez rien en production. Demandez avant d’envoyer. Pendant ce temps, le compte de service auquel il se connecte — la connexion non humaine que votre logiciel utilise, que personne ne pense comme un utilisateur — détient les autorisations qui ont été accordées lors de la configuration du jour, et personne n’a audité ce fossé depuis.
Personne n’a remarqué, et c’est le deuxième problème
Les deux organisations touchées qu’Anthropic a pu joindre n’avaient pas précédemment détecté l’activité et n’avaient pas contacté la société à ce sujet — elles ont appris qu’elles avaient été compromises lorsque le laboratoire les a contactées. Anthropic déclare qu’il est toujours en train d’essayer de joindre la troisième. Il a trouvé les incidents en lisant ses propres transcriptions.
Hugging Face est l’exception qui montre ce qu’il faut. Il a détecté son intrusion avec un système d’IA lisant ses propres journaux de sécurité et triant les alertes réelles du bruit, ce qui signifie qu’il a détecté un agent en exécutant des agents. Dans , il décrit l’attaque se propageant d’un système interne à l’autre sur un week-end.
La surveillance ordinaire manque cela parce qu’il n’y a rien d’anomal à voir. Votre agent se connecte en tant que compte autorisé, interroge les systèmes auxquels il est autorisé à accéder et se déplace à une vitesse de machine dans des modèles de trafic qui ressemblent à l’automatisation parce qu’ils sont de l’automatisation. Chaque règle d’alerte que vous possédez a été écrite pour attraper un étranger. Ce n’est pas un étranger.
Cela laisse une position inconfortable. Le volume d’activité nécessitant un examen augmente avec la quantité de travail que vous confiez à l’agent, et les deux options affichées sont celles de Hugging Face — exécuter un triage d’IA sur vos propres journaux de sécurité — ou d’Anthropic, qui est d’examiner 141 006 exécutions après coup. La deuxième est une capacité quasiment personne d’autre n’a, appliquée de manière rétroactive, et elle n’a fonctionné que parce que la divulgation d’un concurrent l’a déclenchée.
Que faire à ce sujet
L’action est étroite et ne nécessite pas d’équipe de sécurité pour commencer.
Prenez un agent que vous avez déjà en production. Ouvrez le compte auquel il se connecte et listez ce que cette credential peut atteindre — pas ce que l’invite dit qu’il devrait toucher, ce que la connexion permet réellement. Comparez les deux listes. Le fossé est votre véritable rayon d’action, et pour la plupart des équipes, il s’étend considérablement plus loin que prévu, car les autorisations sont accordées pendant la configuration pour faire fonctionner quelque chose et jamais retirées.
Ensuite, réparez la couche d’exécution plutôt que les instructions — la version pratique de ce que signifie avec le diagramme supprimé. Si l’agent ne doit pas atteindre Internet, supprimez la route du réseau au lieu d’écrire qu’il n’a pas d’accès à Internet. Si cela ne doit pas écrire en production, donnez-lui une credential en lecture seule plutôt qu’une phrase de politique. Si cela ne doit pas dépasser un nombre, mettez le cap où se fait la dépense.
Les modèles dans ces incidents se sont comportés, selon leurs propres traces de raisonnement, comme des employés diligents qui avaient reçu une description incorrecte du bâtiment. Deux d’entre eux se sont convaincus eux-mêmes de l’évidence qui se trouvait devant eux parce qu’ils faisaient confiance au briefing plutôt qu’à la pièce. Ce n’est pas un défaut que vous pouvez résoudre en modifiant l’invite, et les laboratoires, avec toutes les ressources à leur disposition, ne l’ont pas fait.
Supposez que l’agent croira tout ce que vous lui dites sur son environnement. Ensuite, assurez-vous que l’environnement est d’accord.












