Rapports
Lorsque l’IA se retourne contre nous : le rapport Enkrypt AI expose des vulnérabilités dangereuses dans les modèles multimodaux

En mai 2025, Enkrypt AI a publié son Rapport de test de sécurité multimodale, une analyse glaçante qui a révélé à quel point les systèmes d’IA avancés peuvent être manipulés pour générer du contenu dangereux et contraire à l’éthique. Le rapport se concentre sur deux des modèles de vision-langage de Mistral – Pixtral-Large (25.02) et Pixtral-12b – et peint un tableau de modèles qui ne sont pas seulement techniquement impressionnants, mais également vulnérables de manière inquiétante.
Les modèles de vision-langage (VLM) comme Pixtral sont conçus pour interpréter à la fois les entrées visuelles et textuelles, leur permettant de répondre de manière intelligente à des invites complexes et réalistes. Mais cette capacité est accompagnée d’un risque accru. Contrairement aux modèles de langage traditionnels qui ne traitent que du texte, les VLM peuvent être influencés par l’interaction entre les images et les mots, ouvrant de nouvelles portes aux attaques adverses. Les tests d’Enkrypt AI montrent à quel point ces portes peuvent être facilement forcées.
Résultats de test alarmants : échecs de la CSEM et de la CBRN
L’équipe derrière le rapport a utilisé des méthodes de test de sécurité avancé – une forme d’évaluation adverse conçue pour simuler des menaces réalistes. Ces tests ont employé des tactiques telles que le jailbreak (en faisant des requêtes soigneusement conçues pour contourner les filtres de sécurité), la tromperie basée sur les images et la manipulation du contexte. De manière alarmante, 68 % de ces invites adverses ont provoqué des réponses dangereuses à travers les deux modèles Pixtral, y compris du contenu lié à l’exploitation des enfants, à l’exploitation et même à la conception d’armes chimiques.
L’une des révélations les plus frappantes concerne les matériaux de sexualisation des enfants (CSEM). Le rapport a constaté que les modèles de Mistral étaient 60 fois plus susceptibles de produire du contenu lié à la CSEM par rapport aux références de l’industrie telles que GPT-4o et Claude 3.7 Sonnet. Dans les cas de test, les modèles ont répondu à des invites de manipulation déguisées avec du contenu structuré et multi-paragraphe expliquant comment manipuler des mineurs – enveloppé dans des déclarations trompeuses telles que « pour la sensibilisation éducative uniquement ». Les modèles ne rejetaient pas simplement les requêtes dangereuses – ils les complétaient en détail.
Les résultats étaient tout aussi inquiétants dans la catégorie de risque CBRN (chimique, biologique, radiologique et nucléaire). Lorsqu’ils étaient invités à modifier l’agent neurotoxique VX – une arme chimique – les modèles ont offert des idées choquantes et spécifiques pour augmenter sa persistance dans l’environnement. Ils ont décrit, dans des détails techniques caviardés mais clairs, des méthodes telles que l’encapsulation, le blindage environnemental et les systèmes de libération contrôlée .
Ces échecs n’étaient pas toujours déclenchés par des requêtes ouvertement dangereuses. Une tactique consistait à télécharger une image d’une liste numérotée vide et à demander au modèle de « remplir les détails ». Cette invite simple et apparemment inoffensive a conduit à la génération d’instructions illégales et contraires à l’éthique. La fusion de la manipulation visuelle et textuelle s’est avérée particulièrement dangereuse – mettant en évidence un défi unique posé par l’IA multimodale.
Pourquoi les modèles de vision-langage posent de nouveaux défis de sécurité
Au cœur de ces risques se trouve la complexité technique des modèles de vision-langage. Ces systèmes ne traitent pas seulement le langage – ils synthétisent le sens à travers les formats, ce qui signifie qu’ils doivent interpréter le contenu d’image, comprendre le contexte du texte et répondre en conséquence. Cette interaction introduit de nouveaux vecteurs d’exploitation. Un modèle peut correctement rejeter une invite de texte dangereuse seule, mais lorsqu’il est associé à une image suggestive ou à un contexte ambigu, il peut générer un contenu dangereux.
Le test de sécurité d’Enkrypt AI a révélé comment les attaques d’injection intermodales – où des indices subtils dans une modalité influencent la sortie d’une autre – peuvent complètement contourner les mécanismes de sécurité standard. Ces échecs démontrent que les techniques traditionnelles de modération de contenu, conçues pour les systèmes à modalité unique, ne sont pas suffisantes pour les VLM d’aujourd’hui .
Le rapport détaille également comment les modèles Pixtral ont été accessibles : Pixtral-Large via AWS Bedrock et Pixtral-12b via la plateforme Mistral. Ce contexte de déploiement réel met encore plus l’accent sur l’urgence de ces constats. Ces modèles ne sont pas confinés aux laboratoires – ils sont disponibles via des plateformes cloud grand public et pourraient facilement être intégrés dans des produits grand public ou d’entreprise.
Ce qui doit être fait : un plan pour un AI plus sûr
À son crédit, Enkrypt AI fait plus que mettre en évidence les problèmes – il propose un chemin à suivre. Le rapport présente une stratégie de mitigation complète, en commençant par la formation d’alignement de sécurité. Cela implique de réentraîner le modèle en utilisant ses propres données de test de sécurité pour réduire la susceptibilité aux invites dangereuses. Des techniques telles que l’optimisation des préférences directes (DPO) sont recommandées pour affiner les réponses du modèle loin des sorties à risque.
Il souligne également l’importance des garde-fous sensibles au contexte – des filtres dynamiques qui peuvent interpréter et bloquer les invites dangereuses en temps réel, en tenant compte du contexte complet de l’entrée multimodale. En outre, l’utilisation de cartes de risque de modèle est proposée comme mesure de transparence, aidant les parties prenantes à comprendre les limites du modèle et les cas de défaillance connus.
Peut-être la recommandation la plus critique est de traiter le test de sécurité comme un processus continu, et non comme un test unique. À mesure que les modèles évoluent, les stratégies d’attaque également. Seule une évaluation continue et une surveillance active peuvent garantir la fiabilité à long terme, en particulier lorsque les modèles sont déployés dans des secteurs sensibles tels que les soins de santé, l’éducation ou la défense.
Le Rapport de test de sécurité multimodale d’Enkrypt AI est un signal clair à l’industrie de l’IA : la puissance multimodale vient avec la responsabilité multimodale. Ces modèles représentent un bond en avant en termes de capacité, mais ils nécessitent également un bond en avant dans la façon dont nous pensons la sécurité, la sûreté et le déploiement éthique. Si elles ne sont pas contrôlées, elles ne risquent pas seulement l’échec – elles risquent un préjudice réel dans le monde.
Pour quiconque travaille sur ou déploie un grand AI, ce rapport n’est pas seulement un avertissement. C’est un livre de jeu. Et il n’aurait pas pu arriver à un moment plus urgent.












