Entrevistas

Amy Steier, Científica Principal de Aprendizaje Automático en Gretel.ai – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Amy Steier es la Científica Principal de Aprendizaje Automático en Gretel.ai, la plataforma de ingeniería de privacidad más avanzada del mundo. Gretel hace que sea fácil integrar la privacidad por diseño en el tejido de la tecnología impulsada por datos. Sus bibliotecas de código abierto basadas en inteligencia artificial están diseñadas para transformar, anonimizar y sintetizar información sensible.

Amy es una científica de aprendizaje automático y datos muy experimentada, con más de 20 años de experiencia. Su pasión es el análisis de grandes cantidades de datos y descubrir la inteligencia oculta que se esconde en ellos utilizando técnicas de aprendizaje automático, minería de datos, inteligencia artificial y estadísticas. Ella es muy hábil en modelado predictivo, clasificación, agrupación, detección de anomalías, visualización de datos, métodos de conjunto, recuperación de información, análisis de ciberseguridad, NLP, modelos de recomendación y análisis de comportamiento del usuario.

¿Qué te atrajo inicialmente a perseguir una carrera en ciencias de la computación y aprendizaje automático?

Mi amor puro y sin reservas por los datos. El poder, el misterio, la intriga y el potencial de los datos siempre me han fascinado. La ciencia de la computación y el aprendizaje automático son herramientas para aprovechar ese potencial. También es muy divertido trabajar en un campo donde el estado del arte avanza tan rápidamente. Me encanta la intersección entre la investigación y el producto. Es muy satisfactorio tomar ideas de vanguardia, llevarlas un poco más allá y luego adaptarlas a necesidades de producto tangibles.

Para los lectores que no están familiarizados, ¿podrías explicar qué es el dato sintético?

El dato sintético es el dato que se parece y se comporta como el dato original, pero que también es lo suficientemente diferente como para satisfacer algún caso de uso. El caso de uso más común es la necesidad de proteger la privacidad de la información en el dato original. Otro caso de uso es la necesidad de crear datos adicionales para aumentar el tamaño del conjunto de datos original. Otro caso de uso es ayudar a abordar un desequilibrio de clases o tal vez un sesgo demográfico en el conjunto de datos original.

El dato sintético nos permite seguir desarrollando nuevos y innovadores productos y soluciones cuando los datos necesarios para hacerlo de otra manera no estarían presentes o disponibles.

¿Cómo funciona la plataforma Gretel para crear datos sintéticos a través de API?

Las API de ingeniería de privacidad de Gretel permiten ingerir datos en Gretel y explorar los datos que podemos extraer. Estas son las mismas API utilizadas por nuestra Consola. Al exponer las API a través de una interfaz intuitiva, esperamos empoderar a los desarrolladores y científicos de datos para construir sus propias flujos de trabajo alrededor de Gretel.

Mientras que la consola hace que crear datos sintéticos sea muy fácil, las API permiten integrar la creación de datos sintéticos en su flujo de trabajo. Me encanta usar las API porque me permiten personalizar la creación de datos sintéticos para un caso de uso muy particular.

¿Podrías discutir algunas de las herramientas que ofrece Gretel para ayudar a evaluar la calidad de los datos sintéticos?

Después de la creación de datos sintéticos, Gretel generará un Informe de Datos Sintéticos. En este informe, puedes ver la Puntuación de Calidad de Datos Sintéticos (SQS), así como una calificación de Nivel de Protección de Privacidad (PPL).

La puntuación SQS es una estimación de qué tan bien los datos sintéticos generados mantienen las mismas propiedades estadísticas que el conjunto de datos original. En este sentido, la puntuación SQS se puede considerar como una puntuación de utilidad o una puntuación de confianza de que las conclusiones científicas extraídas del conjunto de datos sintético serían las mismas si se hubiera utilizado el conjunto de datos original.

La Puntuación de Calidad de Datos Sintéticos se calcula combinando las métricas de calidad individuales: Estabilidad de la Distribución de Campos, Estabilidad de la Correlación de Campos y Estabilidad de la Estructura Profunda.

La Estabilidad de la Distribución de Campos es una medida de qué tan bien los datos sintéticos mantienen las mismas distribuciones de campos que en los datos originales. La Estabilidad de la Correlación de Campos es una medida de qué tan bien se mantienen las correlaciones entre campos en los datos sintéticos. Y, finalmente, la Estabilidad de la Estructura Profunda mide la integridad estadística de distribuciones y correlaciones de múltiples campos. Para estimar esto, Gretel compara un Análisis de Componentes Principales (ACP) calculado primero en los datos originales, y luego nuevamente en los datos sintéticos.

¿Cómo funcionan los filtros de privacidad de Gretel?

Los Filtros de Privacidad de Gretel fueron el resultado de mucha investigación sobre la naturaleza de los ataques adversarios a los datos sintéticos. Los Filtros de Privacidad evitan la creación de datos sintéticos con debilidades comúnmente explotadas por adversarios. Tenemos dos Filtros de Privacidad, el primero es el Filtro de Similitud, y el segundo es el Filtro de Valores Atípicos. El Filtro de Similitud evita la creación de registros sintéticos que sean demasiado similares a un registro de entrenamiento. Estos son objetivos principales de los adversarios que buscan obtener información sobre los datos originales. El segundo Filtro de Privacidad es el Filtro de Valores Atípicos. Este evita la creación de registros sintéticos que serían considerados valores atípicos en el espacio definido por los datos de entrenamiento. Los valores atípicos revelados en un conjunto de datos sintéticos pueden ser explotados por ataques de inferencia de membresía, inferencia de atributos y una amplia variedad de otros ataques adversarios. Son un serio riesgo para la privacidad.

¿Cómo puede el dato sintético ayudar a reducir el sesgo en la inteligencia artificial?

La técnica más común es abordar el sesgo de representación de los datos que alimentan a un sistema de inteligencia artificial. Por ejemplo, si hay un fuerte desequilibrio de clases en sus datos, o tal vez exista un sesgo demográfico en sus datos, Gretel ofrece herramientas para ayudar a medir el desequilibrio y luego resolverlo en los datos sintéticos. Al eliminar el sesgo en los datos, a menudo se elimina el sesgo en el sistema de inteligencia artificial construido sobre los datos.

Claramente, disfrutas aprendiendo sobre nuevas tecnologías de aprendizaje automático, ¿cómo te mantienes al día con todos los cambios?

Leo, leo y luego leo un poco más, jaja. Me gusta empezar mi día leyendo sobre nuevas tecnologías de aprendizaje automático. Medium me conoce muy bien. Me gusta leer artículos en Towards Data Science, Analytics Vidhya y boletines como The Sequence. Facebook (META ) AI, Google (GOOGL ) AI y OpenMined tienen excelentes blogs. Hay una gran cantidad de buenas conferencias para seguir, como NeurIPS, ICML, ICLR, AISTATS.

También disfruto de herramientas que rastrean rutas de citas, ayudan a encontrar artículos similares a los que te gustan y que se familiarizan con tus intereses específicos y siempre están vigilando en el fondo para encontrar un artículo que podría interesarte. Zeta Alpha es una herramienta que uso mucho.

Finalmente, no se puede subestimar el beneficio de tener colegas con intereses similares. En Gretel, el equipo de aprendizaje automático rastrea artículos de investigación relevantes para los campos que exploramos y con frecuencia nos reunimos para discutir artículos interesantes.

¿Cuál es tu visión para el futuro del aprendizaje automático?

El acceso fácil a los datos iniciará una gran era de innovación en el aprendizaje automático, lo que a su vez impulsará la innovación en una amplia gama de campos, como la salud, las finanzas, la fabricación y las ciencias biológicas. Históricamente, muchos avances innovadores en el aprendizaje automático se pueden atribuir a grandes cantidades de datos ricos. Sin embargo, históricamente, mucha investigación ha sido obstaculizada por la incapacidad de acceder o compartir datos debido a preocupaciones de privacidad. A medida que herramientas como Gretel eliminen esta barrera, el acceso a los datos se democratizará. La comunidad de aprendizaje automático en su conjunto se beneficiará del acceso a conjuntos de datos grandes y ricos, en lugar de solo unas pocas empresas élite.

¿Hay algo más que te gustaría compartir sobre Gretel?

Si amas los datos, amarás Gretel (así que claramente, yo amo Gretel). El acceso fácil a los datos ha sido la espina dorsal de todos los científicos de datos que he conocido. En Gretel, nos enorgullecemos de haber creado una consola y un conjunto de API que hacen que la creación de datos privados y compartibles sea tan simple como sea posible. Creemos profundamente que los datos son más valiosos cuando se comparten.

Gracias por la gran entrevista y por compartir tus conocimientos, los lectores que deseen aprender más pueden visitar Gretel.ai.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.