Entrevistas
Roshanak Houmanfar, VP de Productos de Aprendizaje Automático en Integrate.ai – Serie de Entrevistas

Roshanak (Ro) Houmanfar es la VP de productos de aprendizaje automático para integrate.ai, una empresa que ayuda a los desarrolladores a resolver los problemas más importantes del mundo sin arriesgar datos sensibles. Ro tiene un talento especial para encontrar nuevas formas de simplificar conceptos complejos de inteligencia artificial y conectarlos con las necesidades de los usuarios. Aprovechando esta experiencia, se encuentra a la vanguardia de la misión de integrate.ai para democratizar el acceso a la tecnología de privacidad mejorada.
¿Qué te atrajo inicialmente a la ciencia de datos y el aprendizaje automático?
Comencé mi viaje en robótica. Después de experimentar con los diferentes ángulos de la robótica y quemar un laboratorio de soldadura, llegué a la conclusión de que me atraía más el lado de la inteligencia artificial de mi campo, y eso me llevó al maravilloso mundo del aprendizaje automático.
¿Puedes describir tu rol actual y cómo es un día típico para ti?
Soy la VP de Producto en integrate.ai, una empresa de SaaS que ayuda a los desarrolladores a resolver los problemas más importantes del mundo sin arriesgar datos sensibles. Estamos construyendo herramientas para el aprendizaje automático y el análisis de datos de forma segura para el futuro distribuido de los datos.
En mi día a día, trabajo con nuestros equipos en diferentes funciones para lograr tres cosas:
Pensar en el futuro de la inteligencia y cómo podemos darle forma para que resuelva los problemas más críticos
Entender los puntos débiles de nuestros clientes y cómo podemos innovar para hacer que su trabajo sea más impactante y eficiente.
Asegurarme de que nuestra visión y la retroalimentación de los clientes siempre se consideren en el desarrollo del producto, trabajando en colaboración con nuestros equipos para entregar las mejores características.
Los datos sintéticos están actualmente de moda en el aprendizaje automático, pero integrate.ai tiene un enfoque un poco contrariano. ¿Cuáles son algunas aplicaciones en las que los datos sintéticos pueden no ser una opción deseable?
Para entender cuándo los datos sintéticos no son la mejor solución, es importante entender primero cuándo sí lo son. Los datos sintéticos son mejores cuando el objetivo de modelado tiene una pequeña cantidad de datos reales disponibles o ninguno en absoluto, por ejemplo, en problemas de inicio en frío y en el entrenamiento de modelos basados en texto e imagen. A veces, simplemente no hay suficientes datos para entrenar un modelo, lo que es cuando los datos sintéticos brillan como solución.
Sin embargo, los datos sintéticos se están utilizando cada vez más en situaciones en las que existen muchos datos reales, pero esos datos están siloizados debido a regulaciones de privacidad, costos de centralización o otros obstáculos de interoperabilidad. Esto es un uso abusivo de los datos sintéticos. En estos casos de uso, es difícil determinar el nivel correcto de abstracción para la creación de datos sintéticos, lo que resulta en datos sintéticos de baja calidad que pueden causar sesgos innatos u otros problemas que son difíciles de depurar. Además, los modelos entrenados con datos sintéticos no se comparan con los entrenados con datos reales de alta calidad y granularidad.
Integrate.ai se especializa en ofrecer soluciones de aprendizaje federado, ¿puedes describir qué es el aprendizaje federado?
En el aprendizaje automático tradicional, todos los datos de entrenamiento del modelo deben estar centralizados en una base de datos. Con el aprendizaje federado, los modelos pueden entrenarse en conjuntos de datos descentralizados y distribuidos, o datos que residen en dos o más bases de datos separadas y no pueden moverse fácilmente. Funciona de tal manera que se entrenan partes del modelo de aprendizaje automático donde se encuentran los datos, y se comparten los parámetros del modelo entre los conjuntos de datos participantes para producir un modelo global mejorado. Y como no se mueven datos dentro del sistema, las organizaciones pueden entrenar modelos sin obstáculos como regulaciones de privacidad y seguridad, costos o preocupaciones de centralización.
En general, los datos de entrenamiento accesibles con el aprendizaje federado son de mucha mayor calidad, ya que los datos centralizados tienden a perder granularidad a expensas de la facilidad de acceso en un solo lugar.
¿Cómo puede una empresa identificar los mejores casos de uso para el aprendizaje federado?
El aprendizaje federado es una pila de tecnología de aprendizaje automático diseñada para situaciones en las que acceder a los datos o llevarlos a la infraestructura tradicional del aprendizaje automático con lagos de datos centralizados es doloroso. Si experimenta alguno de los siguientes síntomas, el aprendizaje federado es para usted:
- Ofrece productos inteligentes impulsados por análisis y aprendizaje automático, y no puede crear efectos de red para sus productos porque los datos son propiedad de sus clientes.
- Está trabajando en acuerdos de servicio maestro o acuerdos de compartición de datos para obtener acceso a datos de sus socios.
- Está pasando mucho tiempo formando contratos de colaboración con sus socios, particularmente en situaciones en las que el resultado de esta asociación de datos es incierto para usted.
- Se sienta en una gran cantidad de datos y quiere monetizar sus conjuntos de datos, pero tiene miedo de las implicaciones para su reputación.
- Ya está monetizando sus datos, pero está pasando mucho tiempo, esfuerzo y dinero para hacer que los datos sean seguros para compartir.
- Su infraestructura se ha quedado atrás durante el movimiento a la nube, pero todavía necesita análisis y aprendizaje automático.
- Tiene muchas filiales que pertenecen a la misma organización, pero no pueden compartir datos directamente entre sí.
- Los conjuntos de datos con los que está tratando son demasiado grandes o costosos para mover, así que ha decidido no usarlos o sus tuberías ETL le cuestan mucho.
- Tiene una aplicación u oportunidad que cree que puede tener un impacto significativo, pero no tiene los datos para hacer que suceda.
- Sus modelos de aprendizaje automático se han estancado y no sabe cómo mejorarlos más.
La privacidad diferencial se utiliza a menudo en conjunto con el aprendizaje federado, ¿qué es esto específicamente?
La privacidad diferencial es una técnica para garantizar la privacidad al mismo tiempo que aprovecha el poder del aprendizaje automático. Utilizando matemáticas diferentes a las técnicas de desidentificación estándar, la privacidad diferencial agrega ruido durante el entrenamiento del modelo local, preservando la mayoría de las características estadísticas del conjunto de datos mientras limita el riesgo de que los datos de cualquier individuo sean identificados.
En implementaciones ideales, la privacidad diferencial acerca el riesgo a cero, mientras que los modelos de aprendizaje automático mantienen un rendimiento similar, brindando toda la seguridad necesaria para la desidentificación de datos, sin reducir la calidad de los resultados del modelo.
La privacidad diferencial está incluida en la plataforma de integrate.ai de forma predeterminada, para que los desarrolladores puedan asegurarse de que los parámetros del modelo no puedan inferir datos individuales.
¿Puedes describir cómo funciona la plataforma de aprendizaje federado de integrate.ai?
Nuestra plataforma aprovecha las tecnologías de aprendizaje federado y privacidad diferencial para desbloquear una serie de capacidades de aprendizaje automático y análisis en datos que de otro modo serían difíciles o imposibles de acceder debido a la privacidad, la confidencialidad o los obstáculos técnicos. Las operaciones como el entrenamiento de modelos y el análisis se realizan localmente, y solo se agregan los resultados finales de manera segura y confidencial.
integrate.ai se ofrece como una herramienta para desarrolladores, que permite integrar estas capacidades en casi cualquier solución con un kit de desarrollo de software (SDK) fácil de usar y un servicio en la nube para la gestión de extremo a extremo. Una vez integrada la plataforma, los usuarios finales pueden colaborar en conjuntos de datos sensibles mientras los custodios de datos mantienen el control total. Las soluciones que incorporan integrate.ai pueden servir como herramientas de experimentación efectivas y servicios listos para producción.
¿Cuáles son algunos ejemplos de cómo se puede utilizar esta plataforma en diagnósticos de precisión?
Una de las redes de socios con la que estamos trabajando, la Iniciativa de Compartir Autismo, recopila información relacionada con el diagnóstico del autismo, así como muestras de datos genómicos para comprender las conexiones entre los diferentes genotipos y fenotipos con los diagnósticos de autismo. Cada sitio de datos individual no tiene suficientes conjuntos de datos para hacer que los modelos de aprendizaje automático funcionen, pero colectivamente crean un tamaño de muestra significativo. Sin embargo, mover datos supone un alto riesgo para la seguridad y la privacidad, y debido a las regulaciones y las políticas hospitalarias, estos institutos de investigación siempre han optado por no compartir.
En una red diferente, con una configuración similar, los investigadores están interesados en mejorar la asignación de ensayos clínicos a pacientes utilizando una visión más holística de la historia de cada paciente.
Los diferentes institutos de investigación involucrados tienen acceso a información variada sobre cada paciente: un laboratorio tiene acceso a sus escaneos médicos, otro laboratorio tiene acceso a su información genómica, y otro instituto tiene los resultados de sus ensayos clínicos. Pero estas diferentes organizaciones no pueden compartir información directamente entre sí.
Con la solución de integrate.ai, cada organización puede acceder a los datos de los demás para sus objetivos sin mover los datos lejos de los custodios de datos y, por lo tanto, cumplir con sus políticas internas.
¿Puedes discutir la importancia de hacer que la privacidad sea comprensible y cómo integrate.ai lo permite?
Hacer que la privacidad sea comprensible significa abrir muchas puertas a empresas y organizaciones que históricamente estaban cerradas debido a la naturaleza ambigua del riesgo. Las regulaciones de privacidad como el GDPR, el CCPA y el HIPAA son increíblemente complejas y pueden variar según la industria, la región y el tipo de datos, lo que hace que sea difícil para las organizaciones determinar qué proyectos de datos son seguros en términos de privacidad. En lugar de perder el tiempo y la mano de obra verificando cada casilla, la plataforma de aprendizaje federado de integrate.ai ofrece privacidad diferencial, criptografía homomórfica y computación segura de múltiples partes, para que los desarrolladores y los custodios de datos puedan estar tranquilos sabiendo que sus proyectos cumplirán automáticamente con los requisitos regulatorios, sin la molestia de saltar a través de cada categoría.
¿Hay algo más que te gustaría compartir sobre integrate.ai?
La solución de integrate.ai es una herramienta increíblemente amigable para los desarrolladores que permite el aprendizaje automático y el análisis de datos de forma segura y respetuosa con la privacidad en conjuntos de datos sensibles. A través de API fáciles de usar, toda la complejidad de la cumplimiento regulatorio y los contratos sobre datos sensibles se abstrae. La solución de integrate.ai permite a los científicos de datos y a los desarrolladores de software gestionar sus cargas de trabajo de forma segura con un impacto mínimo en su infraestructura y flujos de trabajo actuales.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar integrate.ai.












