Entrevistas
Fabiana Clemente, Co-fundadora y Directora de Datos de YData – Serie de Entrevistas

Fabiana Clemente es la co-fundadora y Directora de Datos de YData. YData es una startup de inteligencia artificial que creó la primera solución de desarrollo centrada en datos para combinar la descubierta, mejora y escalabilidad de datos en una sola plataforma.
¿Qué te atrajo inicialmente a la inteligencia artificial y el aprendizaje automático?
Mi formación es en Matemáticas Aplicadas, donde tuve la oportunidad de aprender y entender cómo podemos extraer información de los datos, así como hacerlo utilizando código. En ese momento no era tan atractivo como el aprendizaje automático, pero definitivamente fue lo que despertó mi pasión por el área.
¿Puedes compartir la historia detrás de YData?
Como científica de datos que ha trabajado para startups y empresas, he tenido mi parte de luchas – a veces el acceso a los datos estaba bloqueado bajo el pretexto de seguridad o privacidad, otras veces el acceso era fácil, pero la calidad de los datos no estaba cerca de lo que se necesitaba para construir soluciones basadas en inteligencia artificial. Sabiendo que estas luchas son muy frecuentes en la mayoría de las organizaciones, nos inspiró a iniciar la empresa con el objetivo de ayudar a estos equipos a superar estos obstáculos, acelerando su desarrollo de inteligencia artificial con datos mejorados.
¿Puedes describir para nuestra audiencia qué es el dato sintético?
El dato sintético se considera cualquier dato que no se generó en el mundo real, es decir, cualquier dato creado artificialmente. Hay métodos que permiten la generación de datos sintéticos – desde estrategias basadas en reglas hasta el uso de modelos de aprendizaje automático o profundo para aprender esas “reglas” para nosotros. En YData, adoptamos y nos especializamos en una estrategia basada en aprendizaje profundo para generar nuevos datos que mantengan el comportamiento de eventos del mundo real sin preocupaciones sobre privacidad.
¿Qué hace que el dato sintético sea tan importante?
Cuanto más las organizaciones comprendan la importancia de los datos para impulsar sus negocios, más se entenderá la importancia y el papel del dato sintético. Recopilar datos reales no solo es costoso y lleva tiempo, sino que a veces es imposible. Para construir aplicaciones de inteligencia artificial, los datos son un requisito estricto – es aquí donde el dato sintético viene al rescate. La capacidad de generar escenarios no vistos o simplemente desbloquear el acceso a los datos es clave para evolucionar en un mundo donde pioneros como Andrew Ng afirman que convertirse en centrado en datos es clave para una adopción exitosa de la inteligencia artificial.
En coches autónomos o actividades de automatización de maquinaria, ya podemos percibir la importancia del dato sintético, así que diría que es solo natural que esta comprensión se extienda a todos los verticales de la industria.
¿Cómo genera YData datos sintéticos?
YData se basa principalmente en modelos generativos profundos para aprender los atributos estadísticos y las correlaciones entre variables de los datos originales. Esto permite al modelo generar un conjunto de datos estadísticamente relevante que tiene el mismo valor empresarial que el original, sin permitir la trazabilidad a los registros originales.
YData está impulsando esta tecnología hacia adelante y es la empresa detrás de la Comunidad de Datos Sintéticos – un grupo de expertos en ciencia de datos comprometidos con evangelizar y ayudar a cualquier persona que desee aprender y utilizar esta tecnología.
¿Cómo ayuda la plataforma de YData a descubrir y desbloquear nuevas fuentes de datos?
La plataforma de YData incluye conectores integrados para cualquier tipo de base de datos, almacén de datos o lago de datos, lo que permite a los usuarios acceder fácilmente a metadatos relevantes y comprender si los datos existentes son útiles para responder a la pregunta comercial que tienen en mente – sin siquiera mirar los registros reales.
¿Puedes compartir algunos detalles sobre la comunidad de código abierto de Datos Sintéticos?
Los datos sintéticos están solo en sus primeros días y, por lo tanto, la conciencia de cómo se generan, los beneficios o las limitaciones aún no son ampliamente conocidos por una audiencia más amplia. Por esta razón, en YData decidimos tomar un enfoque más educativo al crear la Comunidad de Datos Sintéticos – además de ser un lugar para intercambiar ideas o obtener ayuda de expertos en el campo de los datos sintéticos, también es un lugar donde científicos de datos y otros perfiles técnicos pueden comenzar su viaje en datos sintéticos, con algunos de los algoritmos más interesantes de la literatura.
Además, también ofrecemos una perspectiva sobre la calidad de los datos, para que los científicos de datos puedan comprender primero los datos con los que están trabajando, antes de sintetizar o mejorar la síntesis de datos. Estamos verdaderamente comprometidos con ayudar a los equipos de datos a volverse cada vez más centrados en los datos.
YData recientemente anunció $2.7 millones en financiamiento para acelerar su expansión internacional. ¿Puedes compartir algunos detalles sobre lo que esto significa para el futuro de la empresa y su estrategia de expansión?
YData nació internacional – sabíamos que esta tecnología necesita adoptantes tempranos que suelen estar en los países más sofisticados. Por esta razón, nuestros primeros clientes ya estaban fuera de Portugal, en toda Europa, y ahora estamos estableciendo una presencia en Norteamérica también. Esta financiación nos permitirá fortalecer nuestra presencia en ambos continentes, no solo comercialmente, sino también para crecer el equipo: somos un equipo completamente distribuido, lo que nos permite contratar al mejor talento, dondequiera que estén.
¿Hay algo más que te gustaría compartir sobre YData?
YData está empujando los límites de la inteligencia artificial centrada en datos y creando una nueva categoría: DataPrepOps – aunque es un nombre feo, es un dolor que la mayoría de las empresas enfrentan hoy en día cuando se trata del desarrollo de ciencia de datos. La tendencia de la calidad de los datos sigue creciendo y, después de las tuberías de datos y la observabilidad de los datos, la calidad de los datos para los equipos de ciencia de datos todavía está en su infancia y YData está emergiendo como un líder de pensamiento en la preparación de datos.
Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar YData.












