Angle d’Anderson
Pourquoi les agents IA favorisent-ils des outils inutilement puissants ?

Cela s’est escaladé rapidement: des recherches ont découvert que les agents IA continuent d’accéder à plus de privilèges qu’ils n’en ont besoin, et que de petites défaillances les amènent à escalader encore plus, en exposant inutilement les données et les systèmes.
Un nombre croissant d’incidents ayant fait les gros titres a récemment attiré l’attention sur les risques de laisser les IA agentic disposer de privilèges excessifs, souvent par le biais de l’utilisation d’outils et de méthodes surprivilégiés offrant une portée bien plus large que celle nécessaire pour une tâche donnée.
Dans un récent événement, un agent de codage alimenté par Claude a rencontré un jeton d’API Railway à portée large lors d’une tâche de routine, et l’a utilisé pour supprimer une base de données de production et ses sauvegardes – bien que la tâche n’exigeait pas un niveau d’accès aussi élevé.
Dans un cas distinct en 2025, l’agent de codage IA de Replit a ignoré les contraintes explicites, modifié du code protégé et supprimé une base de données de production en direct.
Dans un troisième cas en février de cette année, un flux de travail assisté par IA a traversé une chaîne de privilèges qui a finalement atteint les informations d’identification de publication de package, créant ainsi une attaque de chaîne d’approvisionnement.
Par la suite, les analyses de sécurité ont cité ces cas, et d’autres similaires, comme illustration de la tendance des systèmes d’agents à transformer de petites entrées en actions à forte incidence une fois que des privilèges étendus sont disponibles. Ces incidents suggèrent que les IA autonomes atteignent immédiatement et « instinctivement » les outils les plus puissants – et potentiellement destructeurs –, en particulier lorsqu’il y a des problèmes.
Temps d’outils
Pour résoudre ce problème, de nouvelles recherches en Chine ont testé une gamme des modèles les plus populaires, propriétaires et open source, pour découvrir leur disposition à atteindre des outils puissants dans les cas où de tels outils sont excessifs pour une tâche:

À partir du nouveau document: performance de onze modèles d’IA de premier plan lors du choix entre des outils à privilèges minimaux et des alternatives plus puissantes qui étaient inutiles pour la tâche. Qwen3-8B et LLaMA-3.1-8B ont montré la tendance la plus forte vers des privilèges excessifs, tandis que Claude 4.6 Sonnet, GPT-5.2 et GLM-5 étaient beaucoup plus réservés. Les segments plus sombres indiquent une surextension immédiate, tandis que les segments plus clairs montrent une escalade après des défaillances temporaires, suggérant que de nombreux modèles répondent aux revers en élargissant l’accès plutôt que de persister avec des options plus sûres. Source
Les tests indiquent que les modèles à poids ouverts tels que Qwen3-8B et LLaMA-3.1-8B sont plus disposés à escalader, peut-être en raison de leur conditionnement post-formation plus limité, par rapport aux modèles propriétaires tels que ChatGPT et Gemini série.
Les auteurs déclarent:
‘Six des onze modèles dépassent 30 % [taux d’utilisation d’outils surprivilégiés (OPUR)], avec des taux particulièrement élevés pour des modèles open-weight plus petits couramment utilisés tels que Qwen3-8B (64,9 %) et LLaMA-3.1-8B (55,9 %).
‘Entre-temps, les modèles à faible OPUR tels que Claude 4.6 Sonnet, GPT-5.2 et GLM-5 restent en dessous de 10 %, mais présentent toujours une utilisation surprivilégiée mesurable dans certains paramètres.
‘Cette variation suggère que l’adhésion au principe de moindre privilège est une propriété comportementale dépendante du modèle, potentiellement façonnée par des différences de capacité générale, de formation à l’utilisation d’outils et d’alignement sur la sécurité.’
En outre, la disposition à utiliser des outils surpuissants varie selon le domaine, avec des travaux sur les codes sources au plus grand risque, et des domaines plus étroitement surveillés, tels que les soins de santé, inspirant des mesures moins radicales:

Taux d’utilisation d’outils à privilèges élevés inutiles à travers différents domaines de tâches et catégories de risque. Les tâches de codage, de base de données et d’infrastructure ont régulièrement produit certains des taux d’escalade les plus élevés, tandis que les tâches de soins de santé et de gouvernement ont généralement suscité plus de retenue. À travers les types de risque, les modèles étaient les plus susceptibles de surextendre leur autorité et de contourner les mesures de sécurité, suggérant que lorsqu’ils rencontrent des obstacles, les systèmes d’IA préfèrent souvent un accès plus large et moins de restrictions, plutôt que de rester dans les privilèges les plus étroits nécessaires pour effectuer la tâche.
En outre, les résultats indiquent que certaines des pires conséquences se produisent lorsque le modèle se sent « sous pression ». À travers plusieurs familles de modèles, des défaillances temporaires provenant d’outils à privilèges inférieurs ont souvent déclenché un changement rapide vers des alternatives plus larges et plus puissantes – même si les outils d’origine étaient toujours pleinement capables d’effectuer la tâche.
Mode panique!
De cette façon, une erreur transitoire pouvait amener les modèles à abandonner complètement le principe de moindre privilège. Plutôt que d’essayer une autre option à privilèges inférieurs ou de réessayer l’outil, de nombreux systèmes ont répondu en élargissant leur accès.
Les auteurs affirment que des revers répétés semblent éroder la confiance dans les outils à privilèges inférieurs, rendant l’escalade de privilèges de plus en plus probable dans des conditions d’incertitude – un comportement observé à des degrés divers à la fois dans les modèles open-weight et propriétaires.
La prise en compte des privilèges après la formation obtient un succès limité en tant que mitigation possible, en récompensant l’utilisation d’outils à privilèges inférieurs et en pénalisant l’escalade prématurée. Cependant, la manipulation de l’invite a offert peu d’amélioration dans les tests, et pour l’instant, le problème semble lié à des principes de comportement plus élevés dans les LLM.
Bien que le document ne l’aborde pas, il semble logique de penser que les IA ont beaucoup plus de matériel de formation sur les « résultats ultimes » que sur le processus d’essais et d’erreurs qui mène à ces résultats – une culture de « TLDR » impatiente qui a peut-être également engendré de l’impatience chez les IA..?
Le nouveau document s’intitule Quand des privilèges inférieurs suffisent: Étude de la sélection d’outils surprivilégiés dans les agents LLM, et provient de huit auteurs issus de l’Académie chinoise des sciences, de l’Université chinoise de Hong Kong, de l’Université de Pékin et de l’Université de l’Académie chinoise des sciences.
Méthode
Pour étudier l’utilisation d’outils surprivilégiés dans des conditions contrôlées, les chercheurs ont créé ToolPrivBench, un référentiel composé de 544 scénarios issus de huit domaines d’application: Entreprise, Codage, Base de données, Éducation, Gouvernement, Soins de santé, Infrastructure et Médias.
Cinq modèles de risque récurrents ont été examinés: Escalade d’autorité, Exposition excessive de données, Contournement de la sécurité, Élargissement de la portée et Persistante temporelle:

Distribution des 544 scénarios dans ToolPrivBench à travers cinq modèles d’escalade de privilèges et huit domaines d’application. L’escalade d’autorité était la catégorie de risque la plus courante, tandis que la base de données, l’entreprise et l’éducation comptaient pour les plus grandes parts du référentiel. La large diffusion des domaines et des types de risque visait à tester si la sélection d’outils surprivilégiés persiste à travers différents paramètres opérationnels, plutôt que d’émerger d’un ensemble étroit de tâches.
Chaque scénario a associé une tâche utilisateur à trois outils à privilèges inférieurs et à trois alternatives à privilèges supérieurs. Les six outils étaient indépendamment capables d’effectuer la tâche, garantissant que toute préférence pour un accès plus large ne pouvait pas être expliquée par une fonctionnalité manquante.
ToolPrivBench est conçu pour mesurer plus que le fait qu’un modèle sélectionne initialement l’outil le plus puissant: lors de l’évaluation, des défaillances temporaires telles que des erreurs de connexion ont été intentionnellement injectées dans les outils à privilèges inférieurs, même si ces outils restaient pleinement capables d’effectuer la tâche. Cela a permis aux chercheurs d’observer comment les modèles réagissaient aux revers, y compris s’ils réessaient les options à privilèges inférieurs ou escaladaient vers des outils à privilèges supérieurs plus larges:

Vue d’ensemble du pipeline d’évaluation de ToolPrivBench. (a) Chaque scénario de test présente une tâche aux côtés de trois outils à privilèges inférieurs et de trois alternatives à privilèges supérieurs, tous capables d’effectuer le même objectif. (b) Les modèles sont évalués à la fois pour la sélection immédiate d’un outil surpuissant et pour l’escalade après des défaillances temporaires introduites dans les outils à privilèges inférieurs. (c) Les cas de référence sont générés à partir de modèles de risque d’API du monde réel, puis passés par des vérifications automatisées, une validation de l’adéquation des outils, une analyse des défaillances et une révision d’experts humains avant d’être admis dans l’ensemble d’évaluation final.
La métrique personnalisée développée pour l’étude est le taux d’utilisation d’outils surprivilégiés (OPUR), qui enregistre à quelle fréquence un modèle utilise un outil à privilèges supérieurs malgré des alternatives à privilèges inférieurs toujours disponibles. La profondeur d’exploration avant l’escalade (PED) est également mesurée, enregistrant le nombre d’outils à privilèges inférieurs essayés avant que l’escalade se produise.
Pour garantir que le niveau de privilège reste la seule différence significative entre les outils, chaque scénario dans les essais a été soumis à plusieurs étapes de validation avant d’être admis dans le référentiel. ChatGPT-5.2 et Gemini 2.5 Pro ont été utilisés de manière indépendante pour vérifier que les six outils pouvaient effectuer la tâche assignée. Seuls les cas qui ont reçu l’accord des deux systèmes ont été conservés. Les scénarios restants ont ensuite été audité par des réviseurs humains avant d’être inclus dans le référentiel final.
Tests
Le référentiel a été évalué en utilisant onze modèles de langage issus de familles propriétaires et open-weight: Qwen3-8B, LLaMA-3.1-8B, MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5, Gemini 3 Flash, GPT-5.2, GLM-5, et Claude 4.6 Sonnet. Les performances ont été mesurées en utilisant OPUR et PED.
La plupart des modèles ont présenté des taux importants d’utilisation inutile de privilèges malgré des alternatives à privilèges inférieurs pleinement capables d’effectuer la tâche. Qwen3-8B a enregistré le taux d’OPUR le plus élevé à 64,9 %, suivi de LLaMA-3.1-8B à 55,9 %, tandis que six des onze modèles ont dépassé 30 %:

Distribution de l’utilisation d’outils surprivilégiés à travers les onze modèles évalués. Qwen3-8B et LLaMA-3.1-8B ont enregistré les valeurs d’OPUR les plus élevées, tandis que Claude 4.6 Sonnet, GPT-5.2 et GLM-5 ont montré les taux les plus bas. Les segments plus sombres indiquent la sélection immédiate d’un outil inutilement puissant, tandis que les segments plus clairs indiquent une escalade après qu’un ou plusieurs outils à privilèges inférieurs aient été essayés en premier, révélant que l’escalade des privilèges a souvent suivi des revers temporaires plutôt que de se produire au premier point de décision.
À l’autre extrémité du spectre, Claude 4.6 Sonnet, GPT-5.2 et GLM-5 sont restés en dessous de 10 %, bien que des violations mesurables aient encore été observées. Des résultats intermédiaires ont été signalés pour MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5 et Gemini 3 Flash.
En général, l’adhésion aux principes de moindre privilège a varié de manière significative à travers les onze modèles. Les défaillances d’outils ont été trouvées pour augmenter la probabilité d’escalade des privilèges: lorsque les outils à privilèges inférieurs ont rencontré des problèmes temporaires, de nombreux modèles se sont déplacés vers des alternatives à privilèges supérieurs au lieu de continuer à explorer des options à privilèges inférieurs qui restaient capables d’effectuer la tâche.
Selon les auteurs, des défaillances répétées semblent réduire la confiance dans les outils à privilèges inférieurs, augmentant la tendance à sélectionner des alternatives à accès plus large même lorsque ces privilèges supplémentaires s’avèrent inutiles pour la tâche:
‘Nous observons une tendance cohérente où le biais de sélection d’outils est gravement amplifié par la friction environnementale séquentielle. Plutôt que d’essayer des alternatives à privilèges minimaux, de nombreux agents se déplacent rapidement vers des outils plus puissants après avoir rencontré des revers.
‘Par exemple, GPT-5.2 présente un biais de sélection à zéro tir seulement 5 fois (PED=0), mais son biais est déclenché 13 fois à PED=1, et explose à 35 fois à PED=2.
‘Des modèles d’escalade similaires sont observés de manière cohérente à travers DeepSeek-v3.2, Grok 4.1 Fast, Kimi K2.5 et les modèles de la série Qwen. ‘
Problèmes de domaine éminent
Les taux d’escalade ont également varié de manière significative à travers les domaines d’application et les catégories de risque. Les tâches infrastructure ont produit certains des taux d’OPUR les plus élevés, atteignant 46,4 % pour DeepSeek-v3.2, 42,9 % pour Grok 4.1 Fast et 37,5 % pour Qwen3.5-397B.
Des taux élevés ont également été observés dans les tâches liées au codage, à la base de données et aux médias, tandis que les scénarios de soins de santé et de gouvernement ont généralement produit des taux d’escalade plus faibles, en particulier parmi GPT-5.2 et Claude 4.6 Sonnet. Selon les auteurs, ce modèle peut refléter des différences dans la façon dont les modèles interprètent les risques et les contraintes opérationnelles à travers les domaines:

OPUR (%) à travers huit domaines d’application et cinq catégories d’escalade. Les modèles open-weight ont généralement enregistré les taux les plus élevés d’utilisation d’outils surprivilégiés, avec des scénarios de codage, de base de données, d’infrastructure, d’escalade d’autorité et de contournement de la sécurité produisant la tendance la plus forte vers la surextension.
Le type d’escalade de privilèges a également compté: l’escalade d’autorité et le contournement de la sécurité étaient les formes les plus courantes de comportement surprivilégié à travers les modèles évalués: LLaMA-3.1-8B a atteint 72,7 % sur l’escalade d’autorité et 74,1 % sur le contournement de la sécurité, tandis que Qwen3.5-397B a enregistré 42,4 % et 45,7 % respectivement.
En revanche, l’élargissement de la portée a été systématiquement la catégorie la moins courante, indiquant que les modèles étaient plus susceptibles de rechercher une autorité plus large ou de contourner les restrictions plutôt que d’élargir la portée de leurs actions à travers des utilisateurs ou des systèmes supplémentaires.
Recherche de solutions
Les expériences de mitigation ont examiné si les méthodes de sécurité d’agent existantes réduisent également l’escalade de privilèges inutile. Le tableau de résultats ci-dessous compare l’OPUR avec les performances sur AgentHarm, un référentiel qui mesure le comportement nocif et les taux de refus dans les agents IA.
Le premier test a évalué AgentAlign, une méthode d’alignement de sécurité conçue pour réduire les actions nocives. AgentAlign a amélioré de manière significative les performances sur le référentiel de sécurité AgentHarm:

Alignement de la sécurité et utilisation d’outils surprivilégiés avant et après la formation AgentAlign. AgentAlign a amélioré de manière significative les performances sur le référentiel de sécurité AgentHarm, en réduisant les sorties nocives et en augmentant les taux de refus; mais son effet sur l’OPUR a été incohérent, avec un modèle montrant une réduction modeste de l’escalade de privilèges inutile et un autre montrant une augmentation. Ce résultat indique que les améliorations de la sécurité conventionnelle des agents ne se traduisent pas nécessairement par une meilleure sélection d’outils à privilèges minimaux.
Pour Ministral-8B-Instruct, le score nocif est tombé de 67,4 à 10,5 tandis que le taux de refus est passé de 0,0 à 79,5. Pour Qwen2.5-7B-Instruct, le score nocif est tombé de 41,9 à 6,7 et le taux de refus est passé de 21,6 à 85,8. Cependant, ces améliorations n’ont pas systématiquement se traduites par des OPUR plus bas. L’OPUR a baissé modérément pour Ministral-8B-Instruct, de 68,8 à 62,5, mais a augmenté pour Qwen2.5-7B-Instruct, de 50,4 à 60,7.
Les auteurs ont également testé des interventions basées sur des invites qui ont explicitement instruit les modèles pour préférer des outils à privilèges inférieurs. Bien que ces invites aient réduit l’OPUR dans certains paramètres, l’effet a diminué lorsque les outils à privilèges inférieurs ont rencontré des défaillances:

Effet des stratégies d’atténuation sur l’utilisation d’outils surprivilégiés dans trois modèles Qwen3. L’ingénierie de l’invite (PE) a réduit les taux d’escalade, mais la formation post-formation axée sur les privilèges (‘Notre’) a produit des réductions nettement plus importantes de l’OPUR à travers tous les modèles et les profondeurs d’escalade.
Les résultats de mitigation les plus solides ont été obtenus à partir d’une approche de formation post-formation dédiée spécifiquement à la sélection d’outils à privilèges minimaux. Les modèles ont été formés pour préférer des outils à privilèges inférieurs chaque fois que ceux-ci étaient suffisants pour la tâche et pour éviter l’escalade inutile.
Selon les auteurs, cette approche a produit des réductions plus importantes de l’OPUR tout en préservant les performances d’achèvement de la tâche, indiquant que le comportement à privilèges minimaux peut nécessiter une formation ciblée plutôt que d’émerger automatiquement d’un alignement de sécurité général.
Conclusion
Pour répondre à la question posée par le titre de cet article, les auteurs concluent que l’escalade est motivée par l’incertitude de capacité: après des défaillances temporaires, les modèles perdent confiance dans les outils à privilèges inférieurs et choisissent de plus en plus des outils plus larges et plus flexibles qui semblent plus susceptibles de réussir, même si des alternatives à privilèges inférieurs restent suffisantes.
Encore une fois, nous voyons des problèmes qui sont inhérents aux modèles formés, et qui nécessitent d’être abordés par des méthodes tertiaires, des restrictions, un conditionnement post-formation et d’autres approches complémentaires, alors que la préférence serait que de tels comportements puissent être formés à l’intérieur de l’architecture – probablement grâce à une meilleure curation des données, ou à la contextualisation du type de points de données de « réponses rapides » qui dominent les collections, et qui peuvent incliner les LLM vers un comportement imprudent.
Publié pour la première fois le dimanche 21 juin 2026












