Cybersécurité
Comment sécuriser les données de formation d’IA
L’intelligence artificielle (IA) a besoin de données et en grande quantité. La collecte des informations nécessaires n’est pas toujours un défi dans l’environnement actuel, avec de nombreux jeux de données publics disponibles et tant de données générées chaque jour. Cependant, les sécuriser est une autre affaire.
La grande taille des jeux de données de formation d’IA et l’impact des modèles d’IA attirent l’attention des cybercriminels. À mesure que la dépendance à l’égard de l’IA augmente, les équipes qui développent cette technologie doivent prendre des précautions pour s’assurer qu’elles maintiennent la sécurité de leurs données de formation.
Pourquoi les données de formation d’IA ont besoin d’une meilleure sécurité
Les données que vous utilisez pour former un modèle d’IA peuvent refléter des personnes, des entreprises ou des événements du monde réel. En tant que tel, vous pourriez gérer une quantité considérable d’informations personnelles identifiables (PII), ce qui causerait des violations de confidentialité importantes si elles étaient exposées. En 2023, Microsoft (MSFT ) a subi un tel incident, exposant accidentellement 38 téraoctets d’informations privées lors d’un projet de recherche sur l’IA.
Les jeux de données de formation d’IA peuvent également être vulnérables à des attaques plus nuisibles. Les cybercriminels peuvent altérer la fiabilité d’un modèle d’apprentissage automatique en manipulant ses données de formation s’ils peuvent y accéder. Il s’agit d’un type d’attaque appelé empoisonnement des données, et les développeurs d’IA peuvent ne pas remarquer les effets jusqu’à ce qu’il soit trop tard.
Les recherches montrent qu’il suffit de 0,001 % d’un jeu de données pour corrompre un modèle d’IA. Sans protections appropriées, une attaque de ce type pourrait avoir des implications graves une fois que le modèle est mis en œuvre dans le monde réel. Par exemple, un algorithme de conduite autonome corrompu peut ne pas remarquer les piétons. Alternativement, un outil d’analyse de CV peut produire des résultats biaisés.
Dans des circonstances moins graves, les attaquants pourraient voler des informations confidentielles à partir d’un jeu de données de formation dans un acte d’espionnage industriel. Ils peuvent également verrouiller les utilisateurs autorisés hors de la base de données et exiger une rançon.
À mesure que l’IA devient de plus en plus importante pour la vie et les entreprises, les cybercriminels ont plus à gagner en ciblant les bases de données de formation. Tous ces risques, à leur tour, deviennent de plus en plus inquiétants.
5 étapes pour sécuriser les données de formation d’IA
Compte tenu de ces menaces, prenez la sécurité au sérieux lors de la formation de modèles d’IA. Voici cinq étapes à suivre pour sécuriser vos données de formation d’IA.
1. Minimiser les informations sensibles dans les jeux de données de formation
L’une des mesures les plus importantes est de supprimer la quantité d’informations sensibles dans votre jeu de données de formation. Moins il y a d’informations personnelles identifiables (PII) ou d’autres informations précieuses dans votre base de données, moins elle est ciblée par les hackers. Une faille de sécurité aura également moins d’impact si elle se produit dans ces scénarios.
Les modèles d’IA n’ont souvent pas besoin d’utiliser des informations du monde réel pendant la phase de formation. Les données synthétiques sont une alternative précieuse. Les modèles formés sur des données synthétiques peuvent être tout aussi précis, voire plus précis que les autres, vous n’avez donc pas à vous inquiéter de problèmes de performance. Assurez-vous simplement que le jeu de données généré ressemble et se comporte comme des données du monde réel.
Alternativement, vous pouvez nettoyer les jeux de données existants d’informations sensibles telles que les noms de personnes, les adresses et les informations financières. Lorsque ces facteurs sont nécessaires pour votre modèle, envisagez de les remplacer par des données fictives ou de les échanger entre enregistrements.
2. Restreindre l’accès aux données de formation
Une fois que vous avez compilé votre jeu de données de formation, vous devez restreindre l’accès à celui-ci. Suivez le principe du privilège minimum, qui stipule que tout utilisateur ou programme ne doit avoir accès qu’à ce qui est nécessaire pour effectuer correctement son travail. Les personnes qui ne sont pas impliquées dans le processus de formation n’ont pas besoin de voir ou d’interagir avec la base de données.
Rappelez-vous que les restrictions de privilèges ne sont efficaces que si vous mettez également en œuvre un moyen fiable de vérifier les utilisateurs. Un nom d’utilisateur et un mot de passe ne suffisent pas. L’authentification multifacteur (AMF) est essentielle, car elle arrête 80 à 90 % de toutes les attaques contre les comptes, mais toutes les méthodes d’AMF ne sont pas égales. L’AMF basée sur le texte et l’application est généralement plus sûre que les alternatives basées sur le courrier électronique.
Assurez-vous de restreindre les logiciels et les appareils, et non seulement les utilisateurs. Les seuls outils ayant accès à la base de données de formation doivent être le modèle d’IA lui-même et tout programme que vous utilisez pour gérer ces informations pendant la formation.
3. Chiffrer et sauvegarder les données
Le chiffrement est une autre mesure de protection cruciale. Même si tous les algorithmes d’apprentissage automatique ne peuvent pas s’entraîner activement sur des données chiffrées, vous pouvez chiffrer et déchiffrer les données pendant l’analyse. Ensuite, vous pouvez les rechiffrer une fois que vous avez terminé. Alternativement, recherchez des structures de modèle qui peuvent analyser les informations tout en les chiffrant.
Il est important de conserver des sauvegardes de vos données de formation en cas de problème. Les sauvegardes doivent se trouver dans un emplacement différent de la copie principale. Selon l’importance de votre jeu de données, vous devrez peut-être conserver une sauvegarde hors ligne et une dans le cloud. N’oubliez pas de chiffrer toutes les sauvegardes également.
Lorsqu’il s’agit de chiffrement, choisissez votre méthode avec soin. Les normes plus élevées sont toujours préférables, mais vous pouvez également envisager des algorithmes de cryptographie résistants aux attaques quantiques à mesure que la menace d’attaques quantiques augmente.
4. Surveiller l’accès et l’utilisation
Même si vous suivez ces autres étapes, les cybercriminels peuvent percer vos défenses. Par conséquent, vous devez continuellement surveiller les modèles d’accès et d’utilisation de vos données de formation d’IA.
Une solution de surveillance automatisée est probablement nécessaire ici, car peu d’organisations ont des effectifs pour surveiller les activités suspectes 24 heures sur 24. L’automatisation est également beaucoup plus rapide pour agir lorsqu’il se produit quelque chose d’inhabituel, ce qui conduit à 2,22 $ de coûts de violation de données inférieurs en moyenne grâce à des réponses plus rapides et plus efficaces.
Enregistrez chaque fois que quelqu’un ou quelque chose accède au jeu de données, demande à y accéder, le modifie ou interagit autrement avec lui. Outre la surveillance des failles de sécurité potentielles dans cette activité, examinez régulièrement les tendances plus larges. Le comportement des utilisateurs autorisés peut changer avec le temps, ce qui peut nécessiter un ajustement de vos autorisations d’accès ou de vos biométries de comportement si vous utilisez un tel système.
5. Réévaluer régulièrement les risques
De même, les équipes de développement d’IA doivent réaliser que la cybersécurité est un processus continu, et non une solution ponctuelle. Les méthodes d’attaque évoluent rapidement — certaines vulnérabilités et menaces peuvent glisser entre les mailles avant que vous ne les remarquiez. Le seul moyen de rester en sécurité est de réévaluer régulièrement votre posture de sécurité.
Au moins une fois par an, examinez votre modèle d’IA, ses données de formation et tout incident de sécurité qui a affecté l’un ou l’autre. Auditez le jeu de données et l’algorithme pour vous assurer qu’ils fonctionnent correctement et qu’aucune donnée empoisonnée, trompeuse ou autrement nuisible n’est présente. Adaptez vos contrôles de sécurité en conséquence à tout ce que vous remarquez d’inhabituel.
Les tests de pénétration, où des experts en sécurité testent vos défenses en essayant de les percer, sont également bénéfiques. Tous sauf 17 % des professionnels de la cybersécurité effectuent des tests de pénétration au moins une fois par an, et 72 % de ceux qui le font estiment qu’ils ont empêché une faille de sécurité dans leur organisation.
La cybersécurité est la clé du développement sécurisé de l’IA
Le développement éthique et sécurisé de l’IA devient de plus en plus important à mesure que les problèmes potentiels liés à la dépendance à l’égard de l’apprentissage automatique deviennent plus importants. La sécurisation de votre base de données de formation est une étape cruciale pour répondre à cette demande.
Les données de formation d’IA sont trop précieuses et vulnérables pour ignorer les risques cybernétiques. Suivez ces cinq étapes aujourd’hui pour garder votre modèle et son jeu de données en sécurité.












