Entrevistas
Patricia Thaine, CEO de Private AI – Serie de entrevistas

Patricia Thaine es la cofundadora y CEO de Private AI, una candidata a doctorado en Ciencias de la Computación en la Universidad de Toronto y una afiliada de posgrado en el Instituto Vector que realiza investigaciones sobre procesamiento de lenguaje natural con privacidad, con un enfoque en criptografía aplicada. También realiza investigaciones sobre métodos computacionales para la descifrar lenguas perdidas.
Patricia es receptora de la beca de posgrado NSERC, la beca de posgrado RBC, la beca de posgrado Beatrice “Trixie” Worsley en Ciencias de la Computación y la beca de posgrado de Ontario. Tiene ocho años de experiencia en investigación y desarrollo de software, incluyendo en el Laboratorio de Desarrollo del Lenguaje de McGill, el Laboratorio de Lingüística Computacional de la Universidad de Toronto, el Departamento de Lingüística de la Universidad de Toronto y la Agencia de Salud Pública de Canadá.
¿Qué te atrajo inicialmente a la informática?
La capacidad de resolver problemas y ser creativa al mismo tiempo. Es como un oficio. Puedes ver cómo tus ideas de productos cobran vida, al igual que un carpintero construye muebles. Como escuché a alguien decir una vez: la programación es la herramienta creativa definitiva. El hecho de que los productos que construyes puedan escalarse y ser utilizados por personas en cualquier parte del mundo es como la guinda del pastel.
¿Puedes discutir la historia de origen de Private AI y cómo surgió de tu observación de que falta herramientas fáciles de integrar para preservar la privacidad?
A través del habla y la escritura, producimos y transferimos algunas de nuestras informaciones más sensibles a las empresas cuyos servicios utilizamos. Cuando estábamos considerando qué productos de NLP construir, había una capa de privacidad que tendríamos que integrar que simplemente no existía en el mercado. Para utilizar soluciones de privacidad, las empresas necesitaban transferir los datos de sus usuarios a un tercero, utilizar soluciones de código abierto de baja calidad que no eran adecuadas para proteger la privacidad del usuario, o construir una solución en casa con muy poca experiencia en privacidad. Así que decidimos centrarnos en crear los mejores productos posibles para desarrolladores y equipos de IA que necesitan que los resultados de las tecnologías de privacidad sean fáciles de utilizar para sus necesidades.
¿Por qué es importante la IA con privacidad?
Aproximadamente el 80 por ciento de la información producida es no estructurada y la IA es la única forma de darle sentido a todos esos datos. Puede ser utilizada para el bien, como ayudar a detectar caídas en una población anciana, o para el mal, como perfilizar y rastrear a individuos de poblaciones subrepresentadas. Asegurarse de que la privacidad esté integrada en el software que creamos hace que sea mucho más difícil que la IA se utilice de manera perjudicial.
¿Cómo es la privacidad una ventaja competitiva?
Hay muchas razones, pero aquí hay algunas:
- Más y más usuarios se preocupan por la privacidad y, a medida que los consumidores se vuelven más educados, esta preocupación está creciendo: 70 por ciento de los consumidores se preocupan por la privacidad de sus datos.
- Es mucho más fácil hacer negocios con otras empresas si tienes protocolos y tecnologías de protección y privacidad de datos adecuados.
- Cuando has construido tus productos de manera que preserven la privacidad, estás llevando un mejor seguimiento de dónde están los puntos de vulnerabilidad en tu servicio y, especialmente a través de la minimización de datos, te deshaces de los datos que no necesitas y que podrían meterte en problemas cuando ocurre un ciberataque.
¿Puedes discutir la importancia de la privacidad de los datos de entrenamiento y por qué es susceptible a la ingeniería inversa?
Esta es una gran pregunta y hay que educar mucho más sobre esto. Simplísticamente, los modelos de aprendizaje automático memorizan información. Cuanto más grandes son los modelos, más información memorizan sobre casos de esquina. Lo que esto significa es que la información sobre la que se entrenaron esos modelos puede ser revelada en producción. Esto se ha demostrado en varios artículos de investigación, incluyendo The Secret Sharer: Evaluating and Testing Unintended Memorization in Neural Networks y Extracting Training Data from Large Language Models.
También se ha demostrado que la información personal puede ser extraída de las incrustaciones de palabras y, para aquellos que tengan dudas sobre que este es un problema real, también hubo un escándalo este año cuando un chatbot de amor coreano escribía detalles de los usuarios en conversaciones con otros usuarios.
¿Cuáles son tus puntos de vista sobre el aprendizaje federado y la privacidad del usuario?
El aprendizaje federado es un gran paso cuando el caso de uso lo permite. Sin embargo, todavía es posible extraer información sobre las entradas de un usuario de las actualizaciones de peso enviadas al cloud desde el dispositivo de un usuario en particular, así que es importante combinar el aprendizaje federado con otras tecnologías de privacidad (privacidad diferencial y criptografía homomórfica/cómputo seguro de partes múltiples). Cada tecnología de privacidad debe ser elegida según el caso de uso – ninguna puede ser utilizada como un martillo para resolver todos los problemas. Repasamos el árbol de decisión aquí. Una gran ventaja es que nunca envías tus datos sin procesar fuera de tu dispositivo. Una gran desventaja es que, si necesitas datos para depurar un sistema o ver si se está entrenando correctamente, se vuelve mucho más difícil obtenerlos. El aprendizaje federado es un gran comienzo con muchos problemas sin resolver que la investigación y la industria están trabajando.
Private AI permite a los desarrolladores integrar análisis de privacidad con varias líneas de código para garantizar la privacidad, ¿cómo funciona?
Nuestra tecnología se ejecuta como una API REST a la que nuestros usuarios envían solicitudes POST con el texto que desean redactar, desidentificar o seudonimizar/aumentar con datos realistas. Algunos de nuestros clientes envían transcripciones de llamadas que deben ser redactadas para cumplir con la norma PCI, mientras que otros envían conversaciones completas para que puedan utilizar la información para entrenar chatbots, analíticas de sentimiento u otros modelos de NLP. Nuestros usuarios también pueden elegir qué entidades necesitan conservar o incluso utilizar como metadatos para rastrear dónde se almacenan los datos personales. Nosotros nos encargamos del dolor de cabeza de tener que entrenar un sistema preciso para detectar y reemplazar información personal en datos muy desordenados.
¿Por qué la privacidad para los dispositivos IoT es un problema actual y cuáles son tus puntos de vista sobre cómo solucionarlo?
En última instancia, la mejor manera de solucionar un problema de privacidad es muy dependiente del caso de uso, y los dispositivos IoT no son diferentes. Mientras que algunos casos de uso pueden depender de la implementación de borde, la inferencia de borde y el aprendizaje federado con privacidad (por ejemplo, el sentido de la multitud en ciudades inteligentes), otros casos de uso pueden necesitar depender de la agregación de datos y la anonimización (por ejemplo, la información de uso de energía). Dicho esto, los dispositivos IoT son un ejemplo perfecto de cómo la privacidad y la seguridad deben ir de la mano. Estos dispositivos son notoriamente inseguros a los ciberataques, así que solo hay tanto que pueden hacer las tecnologías de privacidad sin arreglar las vulnerabilidades básicas del dispositivo. Por otro lado, sin pensar en formas de mejorar la privacidad del usuario, la información recopilada desde dentro de nuestros hogares puede ser compartida, sin control, con partes desconocidas, lo que hace que sea extremadamente difícil garantizar la seguridad de la información. Tenemos dos frentes para mejorar aquí y la legislación borrador que está siendo escrita por la Comisión Europea sobre la seguridad de los dispositivos IoT podría ser lo que hace que los fabricantes de dispositivos tomen en serio su responsabilidad hacia la seguridad y la privacidad de los consumidores.
¿Hay algo más que te gustaría compartir sobre Private AI?
Somos un grupo de expertos en privacidad, lenguaje natural, lenguaje hablado, procesamiento de imágenes, implementación de modelos de aprendizaje automático en entornos de recursos bajos, respaldados por M12, el fondo de capital de riesgo de Microsoft (MSFT ).
Nos aseguramos de que los productos que creamos, además de ser muy precisos, también sean computacionalmente eficientes para que no tengas una factura de cloud masiva en tus manos al final del mes. Además, los datos de nuestros clientes nunca se transfieren a nosotros – todo se procesa en su propio entorno.
Gracias por la gran entrevista, para aprender más visita Private AI.












