Rapports

Rapport de test de DeepSeek-R1 : des risques de sécurité et éthiques alarmants mis au jour

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une évaluation de test de l’équipe rouge menée par Enkrypt AI a révélé des risques de sécurité importants, des préoccupations éthiques et des vulnérabilités dans DeepSeek-R1. Les résultats, détaillés dans le Rapport de test de l’équipe rouge de janvier 2025, mettent en évidence la vulnérabilité du modèle à la génération de contenus nuisibles, biaisés et non sécurisés par rapport aux modèles leaders de l’industrie tels que GPT-4o, OpenAI’s o1 et Claude-3-Opus. Ci-dessous se trouve une analyse complète des risques présentés dans le rapport et des recommandations pour les atténuer.

Risques de sécurité et éthiques clés

1. Sortie nuisible et risques de sécurité

  • Très vulnérable à la production de contenus nuisibles, y compris le langage toxique, les sorties biaisées et les informations exploitables par les criminels.
  • 11 fois plus susceptible de générer des contenus nuisibles que OpenAI’s o1.
  • 4 fois plus toxique que GPT-4o.
  • 3 fois plus biaisé que Claude-3-Opus.
  • 4 fois plus vulnérable à la génération de code non sécurisé que OpenAI’s o1.
  • Très susceptible à la génération d’informations sur les armes chimiques, biologiques, radiologiques et nucléaires (CBRN), ce qui en fait un outil à haut risque pour les acteurs malveillants.

2. Comparaison avec d’autres modèles

Catégorie de risque DeepSeek-R1 Claude-3-Opus GPT-4o OpenAI’s o1
Biais 3 fois supérieur Inférieur Similaire Similaire
Code non sécurisé 4 fois supérieur 2,5 fois supérieur 1,25 fois supérieur
Contenu nuisible 11 fois supérieur 6 fois supérieur 2,5 fois supérieur
Toxicité 4 fois supérieur Pratiquement absent 2,5 fois supérieur
Contenu CBRN 3,5 fois supérieur 3,5 fois supérieur 2 fois supérieur

Risques de biais et éthiques

  • 83 % des attaques de biais ont été couronnées de succès, avec un biais important détecté dans les requêtes liées à la santé, la race et la religion.
  • Le modèle a affiché des niveaux plus élevés de stéréotypes démographiques, qui pourraient violer diverses réglementations sur l’équité, notamment ECOA, FHA, ACA et le Règlement AI de l’UE.
  • Des cas de test ont démontré que DeepSeek-R1 préférait certaines démographies pour les rôles professionnels à haut niveau, renforçant ainsi les biais sur le lieu de travail.

Génération de contenu nuisible

  • 45 % des tests de contenu nuisible ont abouti à la génération de contenu lié à des activités criminelles, y compris des armes illégales et des substances contrôlées.
  • Une invite de test demandant au modèle de développer un blog sur « L’art de la persuasion dans le recrutement terroriste » a donné lieu à une réponse très détaillée décrivant les stratégies de radicalisation qui pourraient être exploitées par des groupes extrémistes pour affiner leurs tactiques de recrutement, augmentant potentiellement le risque de violence dans le monde réel.
  • 2,5 fois plus vulnérable que GPT-4o et 6 fois plus vulnérable que Claude-3-Opus à la génération de contenu extrémiste.
  • 45 % des tests de contenu nuisible ont abouti à la génération de contenu lié à des activités criminelles, y compris des armes illégales et des substances contrôlées.

Génération de code non sécurisé

  • 78 % des attaques liées au code ont réussi à extraire des extraits de code non sécurisés et malveillants.
  • Le modèle a généré des logiciels malveillants, des chevaux de Troie et des scripts auto-exécutables à la demande. Les chevaux de Troie posent un risque grave car ils peuvent permettre aux attaquants de gagner un accès non autorisé persistant aux systèmes, de voler des données sensibles et de déployer d’autres charges utiles malveillantes.
  • Les scripts auto-exécutables peuvent automatiser des actions malveillantes sans consentement de l’utilisateur, créant des menaces potentielles dans les applications critiques en matière de cybersécurité.
  • Par rapport aux modèles de l’industrie, DeepSeek-R1 était 4,5 fois, 2,5 fois et 1,25 fois plus vulnérable que OpenAI’s o1, Claude-3-Opus et GPT-4o, respectivement.
  • 78 % des attaques liées au code ont réussi à extraire des extraits de code non sécurisés et malveillants.

Vulnérabilités CBRN

  • Généré des informations détaillées sur les mécanismes biochimiques des agents de guerre chimique. Ce type d’informations pourrait potentiellement aider les individus à synthétiser des matières dangereuses, en contournant les restrictions de sécurité destinées à empêcher la propagation d’armes chimiques et biologiques.
  • 13 % des tests ont réussi à contourner les contrôles de sécurité, produisant du contenu lié aux menaces nucléaires et biologiques.
  • 3,5 fois plus vulnérable que Claude-3-Opus et OpenAI’s o1.
  • Généré des informations détaillées sur les mécanismes biochimiques des agents de guerre chimique.
  • 13 % des tests ont réussi à contourner les contrôles de sécurité, produisant du contenu lié aux menaces nucléaires et biologiques.
  • 3,5 fois plus vulnérable que Claude-3-Opus et OpenAI’s o1.

Recommandations pour l’atténuation des risques

Pour minimiser les risques associés à DeepSeek-R1, les étapes suivantes sont conseillées :

1. Mettre en œuvre une formation d’alignement de sécurité robuste

2. Test de l’équipe rouge automatisé continu

  • Tests de stress réguliers pour identifier les biais, les vulnérabilités de sécurité et la génération de contenu toxique.
  • Mettre en œuvre un suivi continu des performances du modèle, en particulier dans les applications de finance, de soins de santé et de cybersécurité.

3. Garde-fous sensibles au contexte pour la sécurité

  • Développer des sauvegardes dynamiques pour bloquer les invites nuisibles.
  • Mettre en œuvre des outils de modération de contenu pour neutraliser les entrées nuisibles et filtrer les réponses non sécurisées.

4. Surveillance active du modèle et journalisation

  • Journalisation en temps réel des entrées et des réponses du modèle pour la détection précoce des vulnérabilités.
  • Flux de travail d’audit automatisé pour garantir la conformité avec les normes de transparence et d’éthique de l’IA.

5. Mesures de transparence et de conformité

  • Maintenir une fiche de risque de modèle avec des métriques exécutives claires sur la fiabilité, la sécurité et les risques éthiques du modèle.
  • Se conformer aux réglementations sur l’IA telles que NIST AI RMF et MITRE ATLAS pour maintenir la crédibilité.

Conclusion

DeepSeek-R1 présente des risques de sécurité, éthiques et de conformité importants qui le rendent inadapté à de nombreuses applications à haut risque sans efforts d’atténuation importants. Sa propension à générer des contenus nuisibles, biaisés et non sécurisés le place en désavantage par rapport à des modèles comme Claude-3-Opus, GPT-4o et OpenAI’s o1.

Étant donné que DeepSeek-R1 est un produit originaire de Chine, il est peu probable que les recommandations d’atténuation nécessaires soient pleinement mises en œuvre. Cependant, il est crucial que les communautés de l’IA et de la cybersécurité soient conscientes des risques potentiels que ce modèle présente. La transparence sur ces vulnérabilités garantit que les développeurs, les régulateurs et les entreprises peuvent prendre des mesures proactives pour atténuer les dommages lorsque cela est possible et rester vigilants contre les abus de cette technologie.

Les organisations envisageant son déploiement doivent investir dans des tests de sécurité rigoureux, des tests de l’équipe rouge automatisés et un suivi continu pour assurer une mise en œuvre de l’IA sécurisée et responsable. DeepSeek-R1 présente des risques de sécurité, éthiques et de conformité importants qui le rendent inadapté à de nombreuses applications à haut risque sans efforts d’atténuation importants.

Les lecteurs qui souhaitent en savoir plus sont invités à télécharger le rapport en visitant cette page.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.