Angle d’Anderson
Protection des invites contre les fuites de données LLM

Opinion Une intéressante soumission IBM NeurIPS 2024 soumission de fin 2024 réapparue sur Arxiv la semaine dernière. Elle propose un système qui peut intervenir automatiquement pour protéger les utilisateurs de la soumission d’informations personnelles ou sensibles dans un message lorsqu’ils ont une conversation avec un grand modèle de langage (LLM) tel que ChatGPT.

Exemples de mock-up utilisés dans une étude utilisateur pour déterminer les moyens par lesquels les personnes préfèrent interagir avec un service d’intervention de prompt. Source: https://arxiv.org/pdf/2502.18509
Les mock-ups ci-dessus ont été utilisés par les chercheurs d’IBM dans une étude pour tester les frictions potentielles des utilisateurs à ce type d’« ingérence ».
Bien que peu de détails soient donnés sur la mise en œuvre de l’interface utilisateur, on peut supposer que cette fonctionnalité pourrait être intégrée à un plugin de navigateur communicant avec un cadre LLM « pare-feu » local; ou qu’une application pourrait être créée pour se connecter directement à (par exemple) l’API OpenAI, recréant ainsi le programme autonome téléchargeable d’OpenAI pour ChatGPT, mais avec des garanties supplémentaires.
Cela étant dit, ChatGPT lui-même censure automatiquement les réponses aux invites qui contiennent des informations critiques, telles que des détails bancaires:

ChatGPT refuse de s’engager dans des invites qui contiennent des informations de sécurité critiques perçues, telles que des détails bancaires (les détails de l’invite ci-dessus sont fictifs et non fonctionnels). Source: https://chatgpt.com/
Cependant, ChatGPT est beaucoup plus tolérant en ce qui concerne les différents types d’informations personnelles – même si la diffusion de telles informations pourrait ne pas être dans le meilleur intérêt de l’utilisateur (dans ce cas, peut-être pour diverses raisons liées au travail et à la divulgation):

L’exemple ci-dessus est fictif, mais ChatGPT n’hésite pas à engager une conversation avec l’utilisateur sur un sujet sensible qui constitue un risque potentiel pour la réputation ou les revenus (l’exemple ci-dessus est totalement fictif).
Dans le cas ci-dessus, il aurait peut-être été préférable d’écrire: ‘Quelle est la signification d’un diagnostic de leucémie sur la capacité d’une personne à écrire et sur sa mobilité?’
Le projet IBM identifie et réinterprète de telles demandes d’un point de vue « personnel » à un point de vue « générique ».

Schéma du système IBM, qui utilise des LLM locaux ou des heuristiques basées sur le NLP pour identifier les informations sensibles dans les invites potentielles.
Ceci suppose que les informations recueillies par les LLM en ligne, à ce stade naissant de l’adoption enthousiaste du public de l’IA de conversation, ne seront jamais transmises à des modèles ultérieurs ou à des cadres publicitaires ultérieurs qui pourraient exploiter les requêtes de recherche des utilisateurs pour fournir une publicité ciblée.
Bien que aucun tel système ou arrangement ne soit connu actuellement, aucune telle fonctionnalité n’était disponible non plus au début de l’adoption d’Internet dans les années 90; depuis, le partage d’informations entre domaines pour alimenter une publicité personnalisée a conduit à divers scandales, ainsi qu’à paranoïa.
Par conséquent, l’histoire suggère qu’il serait préférable de nettoyer les invites LLM maintenant, avant que de telles données n’accumulent en volume, et avant que nos soumissions LLM ne finissent par être stockées dans des bases de données cycliques permanentes et/ou des modèles, ou d’autres structures et schémas basés sur les informations.
Rappelez-vous moi?
Un facteur qui pèse contre l’utilisation d’invites LLM « génériques » ou nettoyées est que, franchement, la possibilité de personnaliser une API LLM coûteuse telle que ChatGPT est assez convaincante, du moins à l’état actuel de l’art – mais cela peut impliquer l’exposition à long terme d’informations privées.
Je demande souvent à ChatGPT de m’aider à formuler des scripts PowerShell et des fichiers BAT pour automatiser des processus, ainsi que sur d’autres questions techniques. À cette fin, je trouve utile que le système mémorise définitivement des détails sur le matériel que j’ai disponible; mes compétences techniques existantes (ou leur absence); et divers autres facteurs environnementaux et règles personnalisées:

ChatGPT permet à un utilisateur de développer un « cache » de mémoires qui seront appliquées lorsque le système considère les réponses à des invites futures.
Inévitablement, cela conserve des informations sur moi stockées sur des serveurs externes, soumises à des conditions et des modalités qui peuvent évoluer avec le temps, sans aucune garantie que OpenAI (bien que cela puisse être n’importe quel autre fournisseur LLM important) respecte les conditions qu’il établit.
En général, cependant, la capacité de construire un cache de mémoires dans ChatGPT est la plus utile en raison de la fenêtre d’attention limitée des LLM en général; sans embeddings personnalisés à long terme, l’utilisateur se sent, de manière frustrante, comme s’il conversait avec une entité souffrant d’amnésie antérograde.
Il est difficile de dire si les nouveaux modèles seront éventuellement suffisamment performants pour fournir des réponses utiles sans avoir besoin de mettre en cache des mémoires, ou de créer des GPT personnalisés stockés en ligne.
Amnésie temporaire
Bien qu’il soit possible de rendre les conversations ChatGPT « temporaires », il est utile d’avoir l’historique de la conversation comme référence qui peut être distillée, lorsque le temps le permet, en un enregistrement local plus cohérent, peut-être sur une plateforme de prise de notes; mais dans tous les cas, nous ne pouvons pas savoir exactement ce qui arrive à ces « conversations jetables » (bien que OpenAI déclare qu’elles ne seront pas utilisées pour la formation, elle ne déclare pas qu’elles sont détruites), sur la base de l’infrastructure ChatGPT. Tout ce que nous savons, c’est que les conversations ne figurent plus dans notre historique lorsque « Conversations temporaires » est activé dans ChatGPT.
Diverses controverses récentes indiquent que les fournisseurs d’API tels qu’OpenAI ne devraient pas nécessairement être laissés en charge de la protection de la vie privée des utilisateurs, y compris la découverte de l’apparition de la mémoire, signifiant que les LLM plus grands sont plus susceptibles de mémoriser certains exemples de formation en entier, et augmentent le risque de divulgation de données spécifiques à l’utilisateur – parmi d’autres incidents publics qui ont convaincu une multitude de grandes entreprises, telles que Samsung, d’interdire les LLM pour une utilisation interne à l’entreprise.
Pensez différemment
Cette tension entre l’utilité extrême et le risque potentiel manifeste des LLM nécessitera des solutions inventives – et la proposition d’IBM semble être un modèle de base intéressant dans cette ligne.

Trois reformulations basées sur IBM qui équilibrent l’utilité et la vie privée. Dans la bande la plus basse (rose), nous voyons une invite qui est au-delà de la capacité du système à la nettoyer de manière significative.
L’approche d’IBM intercepte les paquets sortants vers un LLM au niveau du réseau et les réécrit si nécessaire avant que la version originale ne puisse être soumise. Les intégrations GUI plus élaborées présentées au début de l’article ne sont que des illustrations de l’endroit où une telle approche pourrait aller, si elle était développée.
Bien sûr, sans une agence suffisante, l’utilisateur peut ne pas comprendre qu’il reçoit une réponse à une reformulation légèrement différente de sa soumission originale. Ce manque de transparence est équivalent à un pare-feu du système d’exploitation qui bloque l’accès à un site Web ou à un service sans en informer l’utilisateur, qui peut alors chercher à tort d’autres causes du problème.
Invites en tant que risques pour la sécurité
La perspective d’une « intervention d’invite » se compare bien à la sécurité de Windows, qui a évolué d’un patchwork de produits commerciaux (optionnels) dans les années 90 à un ensemble non optionnel et rigoureusement appliqué d’outils de défense réseau qui viennent avec une installation Windows, et qui nécessitent un certain effort pour les désactiver ou les réduire.
Si la sanitation des invites évolue comme les pare-feu réseau l’ont fait au cours des 30 dernières années, la proposition du document d’IBM pourrait servir de modèle pour l’avenir: en déployant un LLM entièrement local sur la machine de l’utilisateur pour filtrer les invites sortantes dirigées vers des API LLM connues. Ce système devrait naturellement intégrer des cadres GUI et des notifications, donnant aux utilisateurs le contrôle – à moins que les politiques administratives ne le remplacent, comme c’est souvent le cas dans les environnements commerciaux.
Les chercheurs ont effectué une analyse d’une version open source du dataset ShareGPT pour comprendre à quelle fréquence la vie privée contextuelle est violée dans des scénarios du monde réel.
Llama-3.1-405B-Instruct a été employé comme modèle « juge » pour détecter les violations de l’intégrité contextuelle. À partir d’un grand ensemble de conversations, un sous-ensemble de conversations à tour de rôle a été analysé en fonction de la longueur. Le modèle juge a ensuite évalué le contexte, les informations sensibles et la nécessité pour l’achèvement de la tâche, conduisant à l’identification de conversations contenant des violations potentielles d’intégrité contextuelle.
Un sous-ensemble plus petit de ces conversations, qui ont démontré des violations définitives de la vie privée contextuelle, a été analysé plus en détail.
Le cadre lui-même a été mis en œuvre à l’aide de modèles plus petits que les agents de conversation typiques tels que ChatGPT, pour permettre un déploiement local via Ollama.

Schéma du système d’intervention d’invite.
Les trois LLM évalués étaient Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; et DeepSeek-R1-Distill-Llama-8B.
Les invites des utilisateurs sont traitées par le cadre en trois étapes: identification du contexte; classification des informations sensibles; et reformulation.
Deux approches ont été mises en œuvre pour la classification des informations sensibles: classification dynamique et classification structurée: la classification dynamique détermine les détails essentiels en fonction de leur utilisation dans une conversation spécifique; la classification structurée permet de spécifier une liste pré définie d’attributs sensibles qui sont toujours considérés comme non essentiels. Le modèle reformule l’invite si elle détecte des détails sensibles non essentiels en les supprimant ou en les reformulant pour minimiser les risques de confidentialité tout en maintenant l’utilité.
Règles de la maison
Bien que la classification structurée en tant que concept ne soit pas bien illustrée dans le document d’IBM, elle est la plus similaire à la méthode « Private Data Definitions » de l’initiative Private Prompts, qui fournit un programme autonome téléchargeable qui peut réécrire les invites – bien que sans la capacité d’intervenir directement au niveau du réseau, comme l’approche d’IBM le fait (au lieu de cela, l’utilisateur doit copier et coller les invites modifiées).

L’exécutable Private Prompts permet une liste de substitutions alternatives pour le texte saisi par l’utilisateur.
Dans l’image ci-dessus, nous pouvons voir que l’utilisateur Private Prompts peut programmer des substitutions automatisées pour les instances d’informations sensibles. Dans les deux cas, pour Private Prompts et la méthode d’IBM, il semble peu probable qu’un utilisateur ayant suffisamment de présence d’esprit et de perspicacité personnelle pour établir une telle liste ait réellement besoin de ce produit – bien qu’il puisse être construit au fil du temps à mesure que les incidents se produisent.
Dans un rôle d’administrateur, la classification structurée pourrait fonctionner comme un pare-feu ou un censeur pour les employés; et dans un réseau domestique, il pourrait, avec quelques ajustements difficiles, devenir un filtre de réseau domestique pour tous les utilisateurs du réseau; mais en fin de compte, cette méthode est arguablement redondante, puisqu’un utilisateur qui pourrait la configurer correctement pourrait également s’autocensurer efficacement dès le départ.
L’opinion de ChatGPT
Puisque ChatGPT a récemment lancé son outil de recherche approfondie pour les utilisateurs payants, j’ai utilisé cette fonctionnalité pour demander à ChatGPT d’examiner la littérature connexe et de me donner une « vision cynique » du document d’IBM. J’ai reçu la réponse la plus défensive et dérisoire que le système ait jamais donnée lorsqu’on lui a demandé d’évaluer ou d’analyser une nouvelle publication:

ChatGPT-4o a une faible opinion du projet IBM.
‘Si les utilisateurs ne font pas confiance à OpenAI, Google ou Anthropic pour gérer leurs données de manière responsable,’ ChatGPT soutient. ‘pourquoi feraient-ils confiance à une couche de logiciel tiers située entre eux et l’IA? L’intermédiaire lui-même devient un nouveau point de défaillance – potentiellement enregistrant, traitant de manière incorrecte ou même fuyant des données avant qu’elles n’atteignent même l’LLM. Cela ne résout rien s’il ne crée qu’une nouvelle entité pour exploiter les données des utilisateurs.’
Cette objection semble intéressée et non applicable, compte tenu de l’histoire de projets open source qui bénéficient réellement aux utilisateurs finaux grâce aux efforts concertés et à long terme des développeurs et des contributeurs de la communauté; et compte tenu du potentiel croissant des appareils mobiles pour exécuter – et même former – des LLM légers. Certainement, dans ce cas, l’utilisation n’est pas terriblement exigeante.
Ensuite, ChatGPT manque confiantement le point d’avoir un LLM léger fournir une surveillance de la saisie vers un LLM commercial qui ne pourrait pas être exécuté sur une machine locale (parce que le LLM est trop grand, et que permettre l’accès local est trop risqué pour la société qui le fabrique):
‘Un filtrage de confidentialité efficace nécessite de comprendre la saisie avant de décider ce qu’il faut supprimer. Si un intermédiaire est suffisamment intelligent pour reconnaître les données sensibles (noms, adresses, détails financiers), alors il traite et analyse déjà ces données – ce qui signifie qu’il doit stocker ou examiner la chose même qu’il est censé effacer.
‘Cela introduit une contradiction: a) Un filtre stupide (substitution de base de regex) sera inefficace et manquera des risques de confidentialité subtils. b) Un filtre intelligent (réécriveur basé sur LLM) doit traiter la saisie complète, ce qui le rend tout aussi dangereux que l’LLM d’origine.
‘Si vous faites suffisamment confiance à l’intermédiaire pour lire et réécrire vos saisies, pourquoi ne pas faire simplement confiance à l’LLM lui-même?’
La réponse à la dernière question est que le LLM local est destiné à être entièrement du côté de l’utilisateur, et inévitablement open source, avec un besoin minimal ou nul d’accès au réseau. Une version commerciale équivalente, bien intentionnée au départ, serait éventuellement vulnérable aux changements de l’entreprise et aux modifications des conditions de service, alors qu’une licence open source appropriée empêcherait ce type de ‘corruption inévitable’.
ChatGPT a également soutenu que la proposition d’IBM « brise l’intention de l’utilisateur », car elle pourrait interpréter une invite dans une alternative qui affecte son utilité. Cependant, il s’agit d’un problème beaucoup plus large dans la sanitation des invites, et non spécifique à ce cas d’utilisation.
En conclusion (en ignorant sa suggestion d’utiliser des LLM locaux « à la place », qui est exactement ce que le document d’IBM propose), ChatGPT a estimé que la méthode d’IBM représente un obstacle à l’adoption en raison du « frottement de l’utilisateur » de la mise en œuvre de méthodes d’avertissement et d’édition dans un chat.
Ici, ChatGPT peut avoir raison; mais si une pression significative est exercée en raison d’incidents publics supplémentaires, ou si les profits dans une zone géographique sont menacés par une réglementation croissante (et que l’entreprise refuse d’abandonner simplement la région touchée), l’histoire de la technologie grand public suggère que les garanties finiront par ne plus être optionnelles de toute façon.
Conclusion
Nous ne pouvons pas raisonnablement attendre qu’OpenAI mette en œuvre des garanties du type de celles proposées dans le document d’IBM, et dans le concept central qui se trouve derrière; du moins, pas efficacement.
Et certainement pas mondialement; tout comme Apple bloque certaines fonctionnalités d’iPhone en Europe, et que LinkedIn a des règles différentes pour exploiter les données de ses utilisateurs dans différents pays, il est raisonnable de suggérer qu’une entreprise d’IA fera défaut aux conditions les plus rentables et les plus tolérables pour chaque nation dans laquelle elle opère – dans chaque cas, aux dépens du droit de l’utilisateur à la confidentialité des données, si nécessaire.
Premièrement publié jeudi 27 février 2025
Mis à jour jeudi 27 février 2025 15:47:11 en raison d’un lien Apple incorrect – MA












