Entretiens
Patricia Thaine, PDG de Private AI – Série d’entretiens

Patricia Thaine est la co-fondatrice et PDG de Private AI, une candidate au doctorat en informatique à l’Université de Toronto et une affiliée postdoctorale à l’Institut Vector, où elle effectue des recherches sur le traitement du langage naturel préservant la vie privée, avec un accent sur la cryptographie appliquée. Elle mène également des recherches sur les méthodes computationnelles pour le déchiffrement des langues perdues.
Patricia est lauréate de la bourse postdoctorale du CRSNG, de la bourse de recherche RBC, de la bourse d’études supérieures Beatrice « Trixie » Worsley en informatique et de la bourse d’études supérieures de l’Ontario. Elle compte huit ans d’expérience dans la recherche et le développement de logiciels, notamment au Laboratoire de développement du langage de McGill, au Laboratoire de linguistique computationnelle de l’Université de Toronto, au Département de linguistique de l’Université de Toronto et à l’Agence de la santé publique du Canada.
Qu’est-ce qui vous a initialement attiré vers l’informatique ?
La capacité de résoudre des problèmes et d’être créatif en même temps. C’est comme un métier. Vous pouvez voir vos idées de produits prendre vie, comme un menuisier qui construit des meubles. Comme je l’ai entendu dire à quelqu’un un jour : la programmation est l’outil de création ultime. Le fait que les produits que vous construisez puissent être utilisés par des personnes partout dans le monde est un avantage supplémentaire.
Pouvez-vous discuter de l’histoire de la création de Private AI et de la façon dont elle est née de votre observation qu’il y a un manque d’outils faciles à intégrer pour préserver la vie privée ?
À travers la parole et l’écriture, certaines de nos informations les plus sensibles sont produites et transmises aux entreprises dont nous utilisons les services. Lorsque nous avons considéré quels produits NLP nous allions construire, il y avait une couche de confidentialité que nous devions intégrer, qui tout simplement n’existait pas sur le marché. Pour utiliser des solutions de confidentialité, les entreprises devaient soit transférer les données de leurs utilisateurs à un tiers, soit utiliser des solutions open source de mauvaise qualité qui ne suffisaient pas à protéger correctement la confidentialité des utilisateurs, soit construire une solution en interne avec très peu d’expertise en matière de confidentialité. Nous avons donc décidé de nous concentrer sur la création des meilleurs produits possibles pour les développeurs et les équipes d’IA qui ont besoin que les sorties des technologies améliorant la confidentialité fonctionnent facilement pour leurs besoins.
Pourquoi l’IA préservant la vie privée est-elle importante ?
Environ 80 pour cent des informations produites sont non structurées et l’IA est la seule façon de donner un sens à toutes ces données. Elle peut être utilisée pour le bien, comme aider à détecter les chutes chez une population âgée, ou pour le mal, comme profiler et suivre les individus des populations sous-représentées. Le fait de garantir que la confidentialité est intégrée dans les logiciels que nous créons rend beaucoup plus difficile l’utilisation de l’IA d’une manière préjudiciable.
Comment la confidentialité est-elle un avantage concurrentiel ?
Il y a de nombreuses raisons, mais voici quelques-unes :
- De plus en plus d’utilisateurs se soucient de la confidentialité et, à mesure que les consommateurs deviennent plus instruits, cette préoccupation augmente : 70 pour cent des consommateurs sont préoccupés par la confidentialité de leurs données.
- Il est beaucoup plus facile de faire des affaires avec d’autres entreprises si vous avez des protocoles et des technologies de protection et de confidentialité des données appropriés.
- Lorsque vous avez construit vos produits d’une manière préservant la confidentialité, vous gardez mieux trace des points de vulnérabilité dans votre service et, en particulier grâce à la minimisation des données, vous vous débarrassez des données dont vous n’avez pas besoin et qui pourraient vous causer des problèmes en cas de cyberattaque.
Pouvez-vous discuter de l’importance de la confidentialité des données d’entraînement et de la raison pour laquelle elle est susceptible d’être inversée ?
C’est une excellente question et il faut absolument plus d’éducation sur ce sujet. De manière simpliste, les modèles d’apprentissage automatique mémorisent les informations. Plus les modèles sont grands, plus ils mémorisent les cas de bord. Cela signifie que les informations sur lesquelles ces modèles ont été formés peuvent être révélées en production. Cela a été démontré dans plusieurs articles de recherche, notamment The Secret Sharer : Evaluating and Testing Unintended Memorization in Neural Networks et Extracting Training Data from Large Language Models.
Il a également été démontré que les informations personnelles peuvent être extraites des embeddings de mots et, pour ceux qui ont des doutes sur le fait que cela constitue un véritable problème, il y a eu un scandale cette année lorsqu’un chatbot coréen d’amour écrivait les détails des utilisateurs dans les conversations avec d’autres utilisateurs.
Quels sont vos points de vue sur l’apprentissage fédéré et la confidentialité des utilisateurs ?
L’apprentissage fédéré est un excellent pas en avant lorsque le cas d’utilisation le permet. Cependant, il est toujours possible d’extraire des informations sur les entrées d’un utilisateur à partir des mises à jour de poids envoyées au cloud à partir de l’appareil d’un utilisateur, il est donc important de combiner l’apprentissage fédéré avec d’autres technologies améliorant la confidentialité (confidentialité différentielle et cryptographie homomorphique / calcul sécurisé entre plusieurs parties). Chaque technologie améliorant la confidentialité doit être choisie en fonction du cas d’utilisation – aucune ne peut être utilisée comme un marteau pour résoudre tous les problèmes. Nous passons en revue l’arbre de décision ici. Un grand avantage est que vous n’envoyez jamais vos données brutes en dehors de votre appareil. Un grand inconvénient est que si vous avez besoin de données pour déboguer un système ou voir s’il est formé correctement, il devient beaucoup plus difficile de les obtenir. L’apprentissage fédéré est un excellent début avec de nombreux problèmes non résolus sur lesquels la recherche et l’industrie travaillent.
Private AI permet aux développeurs d’intégrer l’analyse de confidentialité avec plusieurs lignes de code pour garantir la confidentialité, comment cela fonctionne-t-il ?
<p Notre technologie fonctionne comme une API REST que nos utilisateurs envoient des requêtes POST avec le texte qu'ils veulent supprimer, désidentifier ou pseudonymiser / augmenter avec des données réalistes. Certains de nos clients nous envoient des transcriptions d'appels qui doivent être supprimées pour être conformes à la PCI, tandis que d'autres nous envoient des conversations complètes afin qu'ils puissent ensuite utiliser les informations pour former des chatbots, des analyseurs de sentiments ou d'autres modèles NLP. Nos utilisateurs peuvent également choisir les entités qu'ils ont besoin de conserver ou même d'utiliser comme métadonnées pour suivre où les données personnelles sont stockées. Nous supprimons la douleur de devoir former un système précis pour détecter et remplacer les informations personnelles dans des données très sales.
Pourquoi la confidentialité des appareils IoT est-elle un problème actuel et quels sont vos points de vue sur la résolution de ce problème ?
En fin de compte, la meilleure façon de résoudre un problème de confidentialité est très dépendante du cas d’utilisation, et les appareils IoT ne sont pas différents. Alors que certains cas d’utilisation peuvent s’appuyer sur le déploiement sur le bord, l’inférence sur le bord et l’apprentissage fédéré préservant la confidentialité (par exemple, le sens des foules dans les villes intelligentes), d’autres cas d’utilisation peuvent avoir besoin de s’appuyer sur l’agrégation de données et l’anonymisation (par exemple, les informations sur la consommation d’énergie). Cela étant dit, les appareils IoT sont un exemple parfait de la façon dont la confidentialité et la sécurité doivent aller de pair. Ces appareils sont notoirement vulnérables aux cyberattaques, il n’y a donc que tant que les technologies améliorant la confidentialité peuvent faire sans résoudre les vulnérabilités fondamentales des appareils. D’un autre côté, sans réfléchir aux moyens d’améliorer la confidentialité des utilisateurs, les informations collectées à l’intérieur de nos foyers peuvent être partagées, non contrôlées, avec des parties inconnues, ce qui rend extrêmement difficile la garantie de la sécurité de ces informations. Nous avons deux fronts à améliorer ici et le projet de législation sur la sécurité des appareils IoT en cours de rédaction par la Commission européenne pourrait finir par être ce qui pousse les fabricants d’appareils à prendre leurs responsabilités envers la sécurité et la confidentialité des consommateurs au sérieux.
Y a-t-il autre chose que vous aimeriez partager sur Private AI ?
Nous sommes un groupe d’experts en confidentialité, en langage naturel, en traitement de la parole, en traitement d’images, en déploiement de modèles d’apprentissage automatique dans des environnements à ressources limitées, soutenus par M12, le fonds de capital-risque de Microsoft (MSFT ).
Nous nous assurons que les produits que nous créons, en plus d’être très précis, sont également efficaces sur le plan computationnel, vous n’aurez donc pas une facture cloud massive à la fin du mois. De plus, les données de nos clients ne sont jamais transférées à nous – tout est traité dans leur propre environnement.
Je vous remercie pour cette excellente interview, pour en savoir plus, visitez Private AI.












