Interviews
Patricia Thaine, CEO bei Private AI – Interview-Serie

Patricia Thaine ist Mitbegründerin und CEO von Private AI, eine PhD-Kandidatin der Informatik an der Universität Toronto und eine Postgraduierte Affiliate am Vector Institute, die Forschung zu privacy-preserving Natural Language Processing betreibt, mit Schwerpunkt auf angewandter Kryptographie. Sie betreibt auch Forschung zu computergestützten Methoden für die Entschlüsselung verlorener Sprachen.
Patricia ist Empfängerin des NSERC-Postgraduate-Stipendiums, des RBC-Graduierten-Stipendiums, des Beatrice “Trixie” Worsley-Graduierten-Stipendiums in Informatik und des Ontario-Graduierten-Stipendiums. Sie hat acht Jahre Erfahrung in Forschung und Softwareentwicklung, einschließlich des McGill Language Development Lab, des Computational Linguistics Lab der Universität Toronto, des Departments für Linguistik der Universität Toronto und der Public Health Agency of Canada.
Was hat Sie ursprünglich zur Informatik hingezogen?
Die Fähigkeit, Probleme zu lösen und gleichzeitig kreativ zu sein. Es ist wie ein Handwerk. Sie können Ihre Produktideen zum Leben erwecken, ähnlich wie ein Tischler Möbel baut. Wie ich einmal jemanden sagen hörte: Programmieren ist das ultimative kreative Werkzeug. Die Tatsache, dass die Produkte, die Sie bauen, skaliert und von Menschen auf der ganzen Welt verwendet werden können, ist wie ein Sahnehäubchen.
Können Sie die Entstehungsgeschichte hinter Private AI erzählen und wie sie aus Ihrer Beobachtung entstand, dass es einen Mangel an Tools gibt, die einfach zu integrieren sind, um die Privatsphäre zu schützen?
Durch Sprache und Schrift werden einige unserer sensitivsten Informationen produziert und an die Unternehmen übertragen, deren Dienste wir nutzen. Als wir überlegten, welche NLP-Produkte wir bauen sollten, gab es eine Ebene der Privatsphäre, die wir integrieren mussten, die einfach nicht auf dem Markt existierte. Um Privatsphäre-Lösungen zu verwenden, mussten Unternehmen entweder die Daten ihrer Benutzer an einen Dritten übertragen, subpar-Open-Source-Lösungen verwenden, die nicht ausreichten, um die Privatsphäre der Benutzer ordnungsgemäß zu schützen, oder eine Lösung in-house mit sehr wenig Expertenwissen in Privatsphäre bauen. Wir entschieden uns also, uns auf die Erstellung der besten Produkte für Entwickler und AI-Teams zu konzentrieren, die die Ausgaben von Privatsphäre-Technologien leicht in ihre Bedürfnisse integrieren können.
Warum ist privacy-preserving AI wichtig?
Ungefähr 80 Prozent der produzierten Informationen sind unstrukturiert und AI ist die einzige Möglichkeit, Sinn aus all diesen Daten zu machen. Es kann für gute Zwecke verwendet werden, wie zum Beispiel, um Stürze bei einer älteren Bevölkerung zu erkennen, oder für schlechte Zwecke, wie zum Beispiel, um Individuen von unterrepräsentierten Gruppen zu profilieren und zu verfolgen. Die Gewährleistung, dass Privatsphäre in die Software integriert ist, die wir erstellen, macht es viel schwieriger, dass AI auf eine schädliche Weise verwendet wird.
Wie ist Privatsphäre ein Wettbewerbsvorteil?
Es gibt viele Gründe, aber hier sind nur einige:
- Mehr und mehr Benutzer kümmern sich um die Privatsphäre und mit der zunehmenden Bildung der Verbraucher wächst diese Sorge: 70 Prozent der Verbraucher sind besorgt über die Privatsphäre ihrer Daten.
- Es ist viel einfacher, Geschäfte mit anderen Unternehmen zu machen, wenn Sie ordnungsgemäße Datenschutz- und Privatsphäre-Protokolle und -Technologien haben.
- Wenn Sie Ihre Produkte auf eine privacy-preserving Weise erstellen, halten Sie besser track, wo die Schwachstellen in Ihrem Service sind und durch Datenminimierung eliminieren Sie die Daten, die Sie nicht benötigen und die Sie in Schwierigkeiten bringen, wenn ein Cyberangriff passiert.
Können Sie die Bedeutung von Trainingsdaten-Privatsphäre erörtern und warum sie anfällig für Reverse-Engineering ist?
Diese Frage ist sehr wichtig und es muss viel mehr Bildung darüber geben. Einfach ausgedrückt, memorisieren Machine-Learning-Modelle Informationen. Je größer die Modelle, desto mehr memorisieren sie Randfälle. Was dies bedeutet, ist, dass die Informationen, die diese Modelle während des Trainings gelernt haben, in der Produktion wieder gegeben werden können. Dies wurde in mehreren Forschungsarbeiten gezeigt, einschließlich The Secret Sharer: Evaluating and Testing Unintended Memorization in Neural Networks und Extracting Training Data from Large Language Models.
Es wurde auch gezeigt, dass personenbezogene Informationen aus Wort-Embeddings extrahiert werden können und für diejenigen, die Zweifel an diesem Problem haben, gab es auch einen Skandal in diesem Jahr, als ein koreanischer Love-Bot Benutzerdetails in Chats mit anderen Benutzern schrieb.
Was sind Ihre Ansichten zu federated Learning und Benutzer-Privatsphäre?
Federated Learning ist ein großer Schritt, wenn der Anwendungsfall es zulässt. Es ist jedoch immer noch möglich, Informationen über die Eingaben eines Benutzers aus den Gewichtsaktualisierungen zu extrahieren, die an die Cloud von einem bestimmten Benutzergerät gesendet werden, daher ist es wichtig, federated Learning mit anderen privacy-enhancing Technologien (differenzielle Privatsphäre und homomorphe Verschlüsselung/sichere Multiparty-Berechnung) zu kombinieren. Jede privacy-enhancing Technologie muss je nach Anwendungsfall ausgewählt werden – keine kann als Hammer verwendet werden, um alle Probleme zu lösen. Wir gehen über den Entscheidungsbaum hier. Ein großer Vorteil ist, dass Sie Ihre Rohdaten nie außerhalb Ihres Geräts senden. Ein großer Nachteil ist, dass es viel schwieriger wird, Daten zu erhalten, um ein System zu debuggen oder zu sehen, ob es ordnungsgemäß trainiert wird. Federated Learning ist ein guter Anfang mit vielen ungelösten Problemen, an denen Forschung und Industrie arbeiten.
Private AI ermöglicht es Entwicklern, Privatsphäre-Analyse mit mehreren Code-Zeilen zu integrieren, um die Privatsphäre zu gewährleisten, wie funktioniert das?
Unsere Technologie läuft als REST-API, an die unsere Benutzer POST-Anfragen mit dem Text senden, den sie redigieren, anonymisieren oder pseudonymisieren möchten. Einige unserer Kunden senden Call-Transkripte, die redigiert werden müssen, um PCI-konform zu sein, während andere ganze Chats senden, damit sie die Informationen verwenden können, um Chatbots, Sentiment-Analyser oder andere NLP-Modelle zu trainieren. Unsere Benutzer können auch wählen, welche Entitäten sie behalten oder sogar als Metadaten verwenden möchten, um zu verfolgen, wo personenbezogene Daten gespeichert sind. Wir nehmen den Schmerz weg, ein genaues System zu trainieren, um personenbezogene Informationen in sehr unordentlichen Daten zu erkennen und zu ersetzen.
Warum ist Privatsphäre für IoT-Geräte ein aktuelles Problem und was sind Ihre Ansichten zur Lösung?
Letztendlich ist die beste Möglichkeit, ein Privatsphäre-Problem zu lösen, sehr anwendungsabhängig, und IoT-Geräte sind keine Ausnahme. Während einige Anwendungen auf Edge-Deployment, Edge-Inferenz und privacy-preserving federated Learning (z. B. Crowd-Sensing in Smart Cities) angewiesen sein können, benötigen andere Anwendungen möglicherweise Datenaggregation und Anonymisierung (z. B. Energieverbrauchsinformationen). Mit anderen Worten, IoT-Geräte sind ein perfektes Beispiel dafür, wie Privatsphäre und Sicherheit Hand in Hand gehen müssen. Diese Geräte sind berüchtigt unsicher gegenüber Cyberangriffen, daher kann es nur so viel tun, um die Privatsphäre zu verbessern, ohne die grundlegenden Gerätevulnerabilitäten zu beheben. Andererseits kann ohne die Berücksichtigung von Möglichkeiten, die Benutzer-Privatsphäre zu verbessern, die in unseren Häusern gesammelten Informationen an unbekannte Parteien weitergegeben werden, was es sehr schwierig macht, die Sicherheit der Informationen zu gewährleisten. Wir haben zwei Fronten, auf denen wir verbessern müssen, und der Entwurf der Gesetzgebung der Europäischen Kommission zu IoT-Gerätesicherheit könnte das sein, was die Gerätehersteller dazu bringt, ihre Verantwortung gegenüber der Sicherheit und Privatsphäre der Verbraucher ernst zu nehmen.
Gibt es noch etwas, das Sie über Private AI teilen möchten?
Wir sind eine Gruppe von Experten in Privatsphäre, natürlicher Sprache, gesprochener Sprache, Bildverarbeitung, Machine-Learning-Modell-Deployment in Umgebungen mit begrenzten Ressourcen, unterstützt von M12, dem Venture-Fonds von Microsoft (MSFT ).
Wir stellen sicher, dass die Produkte, die wir erstellen, neben ihrer hohen Genauigkeit auch rechnerisch effizient sind, sodass Sie am Ende des Monats keine massive Cloud-Rechnung haben. Außerdem werden die Daten unserer Kunden niemals zu uns übertragen – alles wird in ihrer eigenen Umgebung verarbeitet.
Vielen Dank für das großartige Interview, um mehr zu erfahren, besuchen Sie Private AI.












