Leaders d’opinion

Existe-t-il une solution claire aux risques pour la vie privée posés par l’IA générative ?

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les risques pour la vie privée posés par l’IA générative sont très réels. De la surveillance accrue et de l’exposition à des campagnes de phishing et de vishing plus efficaces que jamais, l’IA générative érode la vie privée en masse, de manière indiscriminée, tout en fournissant aux acteurs malveillants, qu’ils soient criminels, parrainés par l’État ou gouvernementaux, les outils dont ils ont besoin pour cibler des individus et des groupes.

La solution la plus claire à ce problème implique que les consommateurs et les utilisateurs se détourneront collectivement de l’hype de l’IA, exigeront la transparence de la part de ceux qui développent ou mettent en œuvre des fonctionnalités dites « IA », et une régulation efficace de la part des organismes gouvernementaux qui supervisent leurs opérations. Bien que cela vaille la peine d’y aspirer, cela ne devrait pas se produire dans un avenir proche.

Ce qui reste, ce sont des approches raisonnables, même si nécessairement incomplètes, pour atténuer les risques pour la vie privée de l’IA générative. La prédiction à long terme, sûre et ennuyeuse, est que plus le public sera éduqué sur la vie privée des données en général, plus les risques pour la vie privée posés par l’adoption massive de l’IA générative seront faibles.

Comprendrons-nous tous le concept d’IA générative ?

L’hype autour de l’IA est si omniprésent qu’une enquête sur ce que les gens entendent par IA générative est à peine nécessaire. Bien sûr, aucune de ces « fonctionnalités IA », fonctionnalités et produits ne représente vraiment des exemples de véritable intelligence artificielle, quelle que soit sa définition. Plutôt, il s’agit principalement d’exemples de apprentissage automatique (ML), apprentissage profond (DL) et grands modèles de langage (LLM).

L’IA générative, comme son nom l’indique, peut générer du contenu nouveau – qu’il s’agisse de texte (y compris des langages de programmation), d’audio (y compris de la musique et de voix humaines) ou de vidéos (avec son, dialogue, coupures et changements de caméra). Tout cela est réalisé en formant des LLM pour identifier, correspondre et reproduire des modèles dans le contenu généré par l’homme.

Prenez ChatGPT comme exemple. Comme de nombreux LLM, il est formé en trois grandes étapes :

  • Pré-formation : Au cours de cette phase, le LLM est « nourri » de matériel textuel provenant d’Internet, de livres, de revues universitaires et de tout ce qui contient du texte potentiellement pertinent ou utile.
  • Affinage d’instruction supervisé : Les modèles sont formés pour répondre de manière plus cohérente aux instructions en utilisant des paires d’instruction-réponse de haute qualité, généralement provenant d’humains.
  • Apprentissage par renforcement à partir de la rétroaction humaine (RLHF) : Les LLM comme ChatGPT subissent souvent cette étape de formation supplémentaire, au cours de laquelle les interactions avec les utilisateurs humains sont utilisées pour affiner l’alignement du modèle avec les cas d’utilisation typiques.

Toutes les trois étapes du processus de formation impliquent des données, qu’il s’agisse de grandes quantités de données pré-formées (comme celles utilisées dans la pré-formation) ou de données collectées et traitées presque en temps réel (comme celles utilisées dans le RLHF). Ce sont ces données qui comportent la plus grande partie des risques pour la vie privée découlant de l’IA générative.

Quels sont les risques pour la vie privée posés par l’IA générative ?

La vie privée est compromise lorsque des informations personnelles concernant un individu (la personne concernée) sont mises à la disposition d’autres individus ou entités sans le consentement de la personne concernée. Les LLM sont pré-formés et affinés sur une gamme extrêmement large de données qui peuvent et contiennent souvent des données personnelles. Ces données sont généralement extraites de sources publiques, mais pas toujours.

Même lorsque ces données sont prises à partir de sources publiques, le fait de les agréger et de les traiter par un LLM, puis de les rendre essentiellement accessibles par l’intermédiaire de l’interface LLM, pourrait être considéré comme une violation supplémentaire de la vie privée.

L’étape d’apprentissage par renforcement à partir de la rétroaction humaine (RLHF) complique les choses. Au cours de cette étape de formation, les interactions réelles avec les utilisateurs humains sont utilisées pour corriger et affiner les réponses du LLM. Cela signifie qu’une interaction utilisateur avec un LLM peut être consultée, partagée et diffusée par quiconque a accès aux données de formation.

Dans la plupart des cas, ce n’est pas une violation de la vie privée, étant donné que la plupart des développeurs de LLM incluent des politiques de confidentialité et des conditions d’utilisation qui exigent que les utilisateurs consentent avant d’interagir avec le LLM. Le risque pour la vie privée réside plutôt dans le fait que de nombreux utilisateurs ne sont pas conscients qu’ils ont consenti à une telle collecte et utilisation de données. De tels utilisateurs sont susceptibles de révéler des informations privées et sensibles au cours de leurs interactions avec ces systèmes, sans se rendre compte que ces interactions ne sont ni confidentielles ni privées.

De cette façon, nous arrivons aux trois principales façons dont l’IA générative pose des risques pour la vie privée :

  • Les grandes quantités de données de pré-formation contenant potentiellement des informations personnelles sont vulnérables aux compromis et à l’exfiltration.
  • Les informations personnelles incluses dans les données de pré-formation peuvent fuiter vers d’autres utilisateurs du même LLM par le biais de ses réponses aux requêtes et aux instructions.
  • Les informations personnelles et confidentielles fournies au cours des interactions avec les LLM se retrouvent entre les mains des employés des LLM et éventuellement des sous-traitants tiers, d’où elles peuvent être consultées ou divulguées.

Ce sont tous des risques pour la vie privée des utilisateurs, mais les chances que des informations personnelles identifiables (PII) se retrouvent entre de mauvaises mains semblent encore relativement faibles. C’est-à-dire, du moins, jusqu’à ce que les courtiers de données entrent en scène. Ces entreprises se spécialisent dans la recherche d’informations personnelles identifiables et dans la collecte, l’agrégation et la diffusion, sinon la diffusion pure et simple, de ces informations.

Avec les informations personnelles identifiables et les autres données personnelles devenues une sorte de marchandise et l’industrie des courtiers de données surgissant pour en tirer profit, toute donnée personnelle qui se retrouve « là-bas » est très susceptible d’être récupérée par les courtiers de données et diffusée loin et large.

Les risques pour la vie privée de l’IA générative dans leur contexte

Avant d’examiner les risques que l’IA générative pose à la vie privée des utilisateurs dans le contexte de produits, de services et de partenariats d’entreprise spécifiques, faisons un pas en arrière et prenons un regard plus structuré sur la gamme complète des risques pour la vie privée de l’IA générative. Écrivant pour l’IAPP, Moraes et Previtali ont adopté une approche axée sur les données pour affiner la « taxonomie de la vie privée » de Solove en 2006, en réduisant les 16 risques pour la vie privée décrits à 12 risques pour la vie privée spécifiques à l’IA.

Voici les 12 risques pour la vie privée inclus dans la taxonomie révisée de Moraes et Previtali :

  • Surveillance : L’IA aggrave les risques de surveillance en augmentant l’échelle et l’ubiquité de la collecte de données personnelles.
  • Identification : Les technologies d’IA permettent le lien d’identité automatisé entre diverses sources de données, augmentant les risques liés à l’exposition de l’identité personnelle.
  • Agrégation : L’IA combine diverses pièces d’informations sur une personne pour faire des inférences, créant des risques d’invasion de la vie privée.
  • Phrénologie et physiognomonie : L’IA infère la personnalité ou les attributs sociaux à partir de caractéristiques physiques, une nouvelle catégorie de risque qui n’est pas dans la taxonomie de Solove.
  • Utilisation secondaire : L’IA aggrave l’utilisation de données personnelles à des fins autres que celles pour lesquelles elles ont été initialement prévues, grâce à la réutilisation des données.
  • Exclusion : L’IA rend pire le fait de ne pas informer ou de ne pas donner le contrôle aux utilisateurs sur la façon dont leurs données sont utilisées, grâce à des pratiques de données opaques.
  • Insécurité : Les exigences de données et les pratiques de stockage de l’IA risquent de fuite de données et d’accès impropre.
  • Exposition : L’IA peut révéler des informations sensibles, telles que par le biais de techniques d’IA générative.
  • Distorsion : La capacité de l’IA à générer du contenu réaliste mais faux augmente la diffusion de fausses ou trompeuses informations.
  • Divulgation : L’IA peut provoquer une partage inapproprié de données lorsqu’elle infère des informations sensibles supplémentaires à partir de données brutes.
  • Augmentation de l’accessibilité : L’IA rend les informations sensibles plus accessibles à un public plus large que prévu.
  • Intrusion : Les technologies d’IA envahissent l’espace personnel ou la solitude, souvent par le biais de mesures de surveillance.

Cela fait pour une lecture assez alarmante. Il est important de noter que cette taxonomie, à son crédit, prend en compte la tendance de l’IA générative à halluciner – à générer et à présenter avec confiance des informations factuellement inexactes. Ce phénomène, même s’il révèle rarement des informations réelles, est également un risque pour la vie privée. La diffusion d’informations fausses et trompeuses affecte la vie privée de la personne concernée de manière plus subtile que dans le cas d’informations exactes, mais elle l’affecte néanmoins.

Essayons de nous concentrer sur des exemples concrets de la manière dont ces risques pour la vie privée se concrétisent dans le contexte de produits d’IA réels.

Interactions directes avec des systèmes d’IA générative basés sur le texte

Le cas le plus simple est celui qui implique un utilisateur interagissant directement avec un système d’IA générative, comme ChatGPT, Midjourney ou Gemini. Les interactions de l’utilisateur avec de nombreux de ces produits sont enregistrées, stockées et utilisées pour l’apprentissage par renforcement à partir de la rétroaction humaine (RLHF), l’affinage d’instruction supervisé et même la pré-formation d’autres LLM.

Une analyse des politiques de confidentialité de nombreux services comme ceux-ci révèle également d’autres activités de partage de données sous-tendues par des objectifs très différents, comme le marketing et la courtage de données. C’est un tout autre type de risque pour la vie privée posé par l’IA générative : ces systèmes peuvent être caractérisés comme d’énormes entonnoirs de données, collectant des données fournies par les utilisateurs ainsi que celles générées par leurs interactions avec le LLM sous-jacent.

Interactions avec des systèmes d’IA générative intégrés

Certains utilisateurs peuvent interagir avec des interfaces d’IA générative intégrées dans le produit qu’ils utilisent ostensiblement. L’utilisateur peut savoir qu’il utilise une fonctionnalité « IA », mais il est moins susceptible de savoir ce que cela implique en termes de risques pour la vie privée. Ce qui ressort avec les systèmes intégrés, c’est le manque de compréhension du fait que les données personnelles partagées avec le LLM pourraient se retrouver entre les mains des développeurs et des courtiers de données.

Il y a deux degrés de manque de conscience ici : certains utilisateurs réalisent qu’ils interagissent avec un produit d’IA générative ; et certains pensent qu’ils utilisent simplement le produit dans lequel l’IA générative est intégrée ou accessible. Dans les deux cas, l’utilisateur a peut-être (et probablement a) techniquement consenti aux conditions et aux conditions d’utilisation associées à ses interactions avec le système intégré.

Autres partenariats qui exposent les utilisateurs à des systèmes d’IA générative

Certaines entreprises intègrent ou incluent des interfaces d’IA générative dans leurs logiciels de manière moins évidente, laissant les utilisateurs interagir – et partager des informations – avec des tiers sans le réaliser. Heureusement, « l’IA » est devenue un argument de vente si efficace qu’il est peu probable qu’une entreprise cache de telles implémentations.

Un autre phénomène dans ce contexte est le recul croissant que de telles entreprises ont connu après avoir tenté de partager des données d’utilisateurs ou de clients avec des entreprises d’IA générative comme OpenAI. La société de suppression de données Optery, par exemple, a récemment annulé une décision de partager des données d’utilisateurs avec OpenAI sur une base d’opt-out, ce qui signifie que les utilisateurs étaient inscrits au programme par défaut.

Non seulement les clients ont-ils rapidement exprimé leur mécontentement, mais le service de suppression de données de l’entreprise a été promptement supprimé de la liste des services de suppression de données recommandés par les Guides de confidentialité. Au crédit d’Optery, elle a rapidement et de manière transparente annulé sa décision, mais c’est le recul général qui est important ici : les gens commencent à apprécier les risques de partager des données avec des entreprises « IA ».

L’affaire Optery constitue un bon exemple ici car ses utilisateurs sont, d’une certaine manière, à la pointe de la méfiance croissante entourant les mises en œuvre d’IA. Les types de personnes qui optent pour un service de suppression de données sont également, typiquement, celles qui prêteront attention aux changements dans les conditions de service et les politiques de confidentialité.

Preuves d’un recul croissant contre l’utilisation des données de l’IA générative

Les consommateurs soucieux de la vie privée n’ont pas été les seuls à exprimer des inquiétudes concernant les systèmes d’IA générative et les risques pour la vie privée qui leur sont associés. Au niveau législatif, l’acte sur l’intelligence artificielle de l’UE categorise les risques en fonction de leur gravité, la vie privée des données étant le critère explicite ou implicite pour attribuer la gravité dans la plupart des cas. L’acte aborde également les questions de consentement éclairé que nous avons discutées plus tôt.

Les États-Unis, notoirement lents à adopter une législation complète et fédérale sur la vie privée des données, ont au moins quelques garde-fous grâce à l’ordonnance exécutive 14110. À nouveau, les préoccupations en matière de vie privée des données sont au premier plan des objectifs de l’ordonnance : « l’utilisation irresponsable [des technologies d’IA] pourrait aggraver les dommages sociaux tels que la fraude, la discrimination, les préjugés et la désinformation » – tous liés à la disponibilité et à la diffusion de données personnelles.

En revenant au niveau des consommateurs, ce ne sont pas seulement les consommateurs particulièrement soucieux de la vie privée qui ont été choqués par les mises en œuvre d’IA générative envahissantes. La fonctionnalité « alimentée par l’IA » Recall de Microsoft, destinée à son système d’exploitation Windows 11, est un exemple de premier plan. Une fois que l’étendue des risques pour la vie privée et la sécurité a été révélée, le recul a été suffisant pour amener le géant de la technologie à reculer. Malheureusement, Microsoft semble ne pas avoir abandonné l’idée, mais la réaction initiale du public est néanmoins encourageante.

En restant avec Microsoft, son programme Copilot a été largement critiqué pour à la fois les problèmes de vie privée et de sécurité des données. Comme Copilot a été formé sur des données GitHub (principalement du code source), une controverse a également éclaté autour des allégations de violations présumées par Microsoft des accords de licence de logiciel des programmeurs et des développeurs. Ce sont des cas comme celui-ci où les lignes entre la vie privée des données et les droits de propriété intellectuelle commencent à se brouiller, accordant à la première une valeur monétaire – ce qui n’est pas facile à faire.

Peut-être la plus grande indication que l’IA devient un drapeau rouge aux yeux des consommateurs est la réaction publique tiède, voire méfiante, à l’annonce initiale d’IA d’Apple, en particulier en ce qui concerne les accords de partage de données avec OpenAI.

Les solutions pièce par pièce

Il existe des mesures que les législateurs, les développeurs et les entreprises peuvent prendre pour atténuer certains des risques posés par l’IA générative. Ce sont des solutions spécialisées à des aspects spécifiques du problème global, aucune de ces solutions n’est censée être suffisante, mais toutes, travaillant ensemble, pourraient faire une réelle différence.

  • Minimisation des données. La minimisation de la quantité de données collectées et stockées est un objectif raisonnable, mais il est directement opposé au désir des développeurs d’IA générative de données de formation.
  • Transparence. Étant donné l’état actuel de l’art en apprentissage automatique, cela peut ne pas être techniquement réalisable dans de nombreux cas. L’aperçu de quelles données sont traitées et de la manière dont elles sont traitées lors de la génération d’une sortie donnée est un moyen de garantir la vie privée dans les interactions avec l’IA générative.
  • Anonymisation. Toute information personnelle identifiable (PII) qui ne peut pas être exclue des données de formation (grâce à la minimisation des données) doit être anonymisée. Le problème est que de nombreuses techniques d’anonymisation et de pseudonymisation populaires sont facilement vaincues.
  • Consentement de l’utilisateur. Exiger que les utilisateurs consentent à la collecte et au partage de leurs données est essentiel mais trop ouvert à l’abus et trop enclin à la complaisance des consommateurs pour être efficace. C’est le consentement éclairé qui est nécessaire ici et la plupart des consommateurs, convenablement informés, ne consentiraient pas à un tel partage de données, donc les incitations sont mal alignées.
  • Sécurisation des données en transit et au repos. Un autre fondement à la fois de la vie privée des données et de la sécurité des données, la protection des données par le biais de moyens cryptographiques et autres peut toujours être rendue plus efficace. Cependant, les systèmes d’IA générative ont tendance à fuir les données par le biais de leurs interfaces, ce qui ne fait que partie de la solution.
  • Application de la loi sur le droit d’auteur et la propriété intellectuelle dans le contexte de l’IA dite « IA ». L’apprentissage automatique peut fonctionner dans une « boîte noire », rendant difficile, voire impossible, de tracer quel matériel protégé par le droit d’auteur et quelle propriété intellectuelle se retrouve dans quelle sortie d’IA générative.
  • Audits. Une autre mesure de garde-fou cruciale entravée par la nature de « boîte noire » des LLM et des systèmes d’IA générative qu’ils soutiennent. Cette limitation inhérente est aggravée par la nature de code fermé de la plupart des produits d’IA générative, ce qui limite les audits à ceux effectués à la convenance du développeur.

Toutes ces approches du problème sont valables et nécessaires, mais aucune n’est suffisante. Elles nécessitent toutes un soutien législatif pour avoir un effet significatif, ce qui signifie qu’elles sont condamnées à être à la traîne alors que ce domaine dynamique continue d’évoluer.

La solution claire

La solution aux risques pour la vie privée posés par l’IA générative n’est ni révolutionnaire ni passionnante, mais poussée à sa conclusion logique, ses résultats pourraient être les deux. La solution claire implique que les consommateurs ordinaires deviennent conscients de la valeur de leurs données pour les entreprises et de l’inestimable valeur de la vie privée pour eux-mêmes.

Les consommateurs sont les sources et les moteurs derrière les informations personnelles qui alimentent ce que l’on appelle l’économie de la surveillance moderne. Une fois qu’un nombre critique de consommateurs commence à endiguer le flux d’informations personnelles dans la sphère publique et à exiger des comptes des entreprises qui traitent des données personnelles, le système devra se corriger lui-même.

L’aspect encourageant de l’IA générative est qu’à la différence des modèles actuels de publicité et de marketing, elle n’a pas besoin d’impliquer des informations personnelles à aucun stade. Les données de pré-formation et d’affinage n’ont pas besoin d’inclure des informations personnelles identifiables ou d’autres données personnelles, et les utilisateurs n’ont pas besoin de les exposer au cours de leurs interactions avec les systèmes d’IA générative.

Pour supprimer leurs informations personnelles des données de formation, les gens peuvent aller directement à la source et supprimer leurs profils des différents courtiers de données (y compris les sites de recherche de personnes) qui agrègent les dossiers publics, les mettant en circulation sur le marché ouvert. Les services d’élimination de données personnelles automatisent le processus, le rendant rapide et facile. Bien sûr, la suppression de données personnelles de ces entreprises a de nombreux autres avantages et aucun inconvénient.

Les gens génèrent également des données personnelles lorsqu’ils interagissent avec des logiciels, y compris l’IA générative. Pour endiguer le flux de ces données, les utilisateurs devront être plus conscients que leurs interactions sont enregistrées, examinées, analysées et partagées. Leurs options pour éviter cela se résument à restreindre ce qu’ils révèlent aux systèmes en ligne et à utiliser des LLM sur appareil, open source, partout où cela est possible. Les gens, dans l’ensemble, font déjà un bon travail pour moduler ce qu’ils discutent en public – nous devons simplement étendre ces instincts dans le domaine de l’IA générative.

David Balaban est un chercheur en sécurité informatique avec plus de 17 ans d'expérience dans l'analyse des logiciels malveillants et l'évaluation des logiciels antivirus. David dirige les projets MacSecurity.net et Privacy-PC.com qui présentent des opinions d'experts sur les questions de sécurité de l'information contemporaines, notamment l'ingénierie sociale, les logiciels malveillants, les tests de pénétration, l'intelligence des menaces, la vie privée en ligne et le piratage de chapeau blanc. David a une solide expérience de dépannage des logiciels malveillants, avec une récente concentration sur les contre-mesures contre les rançongiciels.