Entrevistas

Xavier Conort, Co-Fundador y CPO de FeatureByte – Serie de Entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Xavier Conort es un visionario científico de datos con más de 25 años de experiencia en datos. Comenzó su carrera como actuario en la industria de seguros antes de pasar a la ciencia de datos. Es un competidor de Kaggle de alto rango y fue el Jefe de Científicos de Datos en DataRobot antes de co-fundar FeatureByte.

FeatureByte está en una misión para escalar la inteligencia artificial empresarial, simplificando radicalmente y industrializando los datos de inteligencia artificial. La plataforma de ingeniería y gestión de características permite a los científicos de datos crear y compartir características y pipelines de datos de producción listos en minutos, en lugar de semanas o meses.

Comenzó su carrera como actuario en la industria de seguros antes de pasar a la ciencia de datos, ¿qué causó este cambio?

Un momento definitorio fue ganar el GE Flight Quest, una competencia organizada por GE con un premio de $250,000, donde los participantes tenían que predecir retrasos en vuelos domésticos de EE. UU. Debo parte de ese éxito a una práctica valiosa de seguros: el modelado en dos etapas. Este enfoque ayuda a controlar el sesgo en las características que carecen de representación suficiente en los datos de entrenamiento disponibles. Junto con otras victorias en Kaggle, este logro me convenció de que mi experiencia como actuario me brindaba una ventaja competitiva en el campo de la ciencia de datos.

Durante mi viaje en Kaggle, también tuve el privilegio de conectarme con otros científicos de datos entusiastas, incluidos Jeremy Achin y Tom De Godoy, que más tarde se convertirían en los fundadores de DataRobot. Compartimos un trasfondo común en seguros y habíamos logrado éxitos notables en Kaggle. Cuando finalmente lanzaron DataRobot, una empresa especializada en AutoML, me invitaron a unirme a ellos como Jefe de Científicos de Datos. Su visión de combinar las mejores prácticas de la industria de seguros con el poder del aprendizaje automático me emocionó, presentando una oportunidad para crear algo innovador y de impacto.

En DataRobot y fue instrumental en la creación de su hoja de ruta de ciencia de datos. ¿Qué tipo de desafíos de datos enfrentó?

El desafío más significativo que enfrentamos fue la calidad variable de los datos proporcionados como entrada a nuestra solución AutoML. Este problema a menudo resultó en una colaboración laboriosa entre nuestro equipo y los clientes o resultados decepcionantes en la producción si no se abordaba adecuadamente. Los problemas de calidad provenían de múltiples fuentes que requirieron nuestra atención.

Uno de los desafíos principales surgió del uso generalizado de herramientas de inteligencia empresarial para la preparación y gestión de datos. Si bien estas herramientas son valiosas para generar información, carecen de las capacidades necesarias para garantizar la corrección en el momento adecuado para la preparación de datos de aprendizaje automático. Como resultado, las filtraciones en los datos de entrenamiento podrían ocurrir, lo que lleva a un ajuste excesivo y a un rendimiento del modelo inexacto.

La falta de comunicación entre científicos de datos y ingenieros de datos fue otro desafío que afectó la precisión de los modelos durante la producción. Las inconsistencias entre las fases de entrenamiento y producción, que surgían de la falta de alineación entre estos dos equipos, podrían impactar el rendimiento del modelo en un entorno real.

¿Cuáles fueron algunos de los principales conocimientos adquiridos de esta experiencia?

Mi experiencia en DataRobot resaltó la importancia de la preparación de datos en el aprendizaje automático. Al abordar los desafíos de la generación de datos de entrenamiento de modelos, como la corrección en el momento adecuado, las brechas de experiencia, el conocimiento de dominio, las limitaciones de las herramientas y la escalabilidad, podemos mejorar la precisión y la confiabilidad de los modelos de aprendizaje automático. Llegué a la conclusión de que simplificar el proceso de preparación de datos e incorporar tecnologías innovadoras será fundamental para desbloquear el verdadero potencial de la inteligencia artificial y cumplir con sus promesas.

También escuchamos de su co-fundador Razi Raziuddin sobre la historia de la génesis detrás de FeatureByte, ¿podríamos obtener su versión de los eventos?

Cuando discutí mis observaciones e ideas con mi co-fundador Razi Raziuddin, nos dimos cuenta de que compartíamos una comprensión común de los desafíos en la preparación de datos para el aprendizaje automático. Durante nuestras discusiones, compartí con Razi mis conocimientos sobre los avances recientes en la comunidad MLOps. Pude observar el surgimiento de almacenes de características y plataformas de características que las empresas de tecnología con enfoque en inteligencia artificial implementan para reducir la latencia de la entrega de características, fomentar la reutilización de características o simplificar la materialización de características en datos de entrenamiento, al mismo tiempo que garantizan la consistencia entre el entrenamiento y la entrega. Sin embargo, era evidente para nosotros que todavía había una brecha en la satisfacción de las necesidades de los científicos de datos. Razi compartió conmigo sus conocimientos sobre cómo la pila de datos moderna ha revolucionado la inteligencia empresarial y el análisis, pero no se está aprovechando completamente para la inteligencia artificial.

Se hizo evidente para Razi y para mí que teníamos la oportunidad de hacer un impacto significativo simplificando radicalmente el proceso de ingeniería de características y brindando a los científicos de datos y a los ingenieros de aprendizaje automático las herramientas y la experiencia de usuario adecuadas para la experimentación y la entrega de características sin problemas.

¿Cuáles fueron algunos de sus mayores desafíos al hacer la transición de científico de datos a emprendedor?

La transición de científico de datos a emprendedor requirió que cambiara de una perspectiva técnica a una mentalidad empresarial más amplia. Si bien tenía una base sólida en la comprensión de los puntos de dolor, la creación de una hoja de ruta, la ejecución de planes, la construcción de un equipo y la gestión de presupuestos, encontré que crear el mensaje adecuado que realmente resonara con nuestra audiencia objetivo era uno de mis mayores obstáculos.

Como científico de datos, mi enfoque principal siempre había sido analizar e interpretar datos para derivar información valiosa. Sin embargo, como emprendedor, necesitaba redirigir mi pensamiento hacia el mercado, los clientes y el negocio en general.

Afortunadamente, pude superar este desafío aprovechando la experiencia de alguien como mi co-fundador Razi.

Escuchamos de Razi sobre por qué la ingeniería de características es tan difícil, en su opinión, ¿qué la hace tan desafiante?

La ingeniería de características tiene dos desafíos principales:

  1. Transformar columnas existentes: esto implica convertir los datos en un formato adecuado para los algoritmos de aprendizaje automático. Técnicas como la codificación one-hot, el escalado de características y métodos avanzados como las transformaciones de texto y de imágenes se utilizan. La creación de nuevas características a partir de las existentes, como las características de interacción, puede mejorar significativamente el rendimiento del modelo. Bibliotecas populares como scikit-learn y Hugging Face brindan un amplio apoyo para este tipo de ingeniería de características. Las soluciones AutoML también buscan simplificar el proceso.
  2. Extraer nuevas columnas de datos históricos: los datos históricos son fundamentales en dominios de problemas como los sistemas de recomendación, marketing, detección de fraude, fijación de precios de seguros, puntuación crediticia, previsión de demanda y procesamiento de datos de sensores. Extraer columnas informativas de estos datos es un desafío. Ejemplos incluyen el tiempo transcurrido desde el último evento, las agregaciones sobre eventos recientes y las incrustaciones de secuencias de eventos. Este tipo de ingeniería de características requiere experiencia en el dominio, experimentación, sólidas habilidades de codificación y conocimientos de ingeniería de datos, así como un profundo conocimiento de la ciencia de datos. Factores como la fuga de tiempo, el manejo de grandes conjuntos de datos y la ejecución eficiente del código también necesitan consideración.

En general, la ingeniería de características requiere experiencia, experimentación y la construcción de pipelines de datos complejos y ad hoc en ausencia de herramientas diseñadas específicamente para ello.

¿Podría compartir cómo FeatureByte capacita a los profesionales de la ciencia de datos mientras simplifica las pipelines de características?

FeatureByte capacita a los profesionales de la ciencia de datos simplificando todo el proceso de ingeniería de características. Con un SDK de Python intuitivo, permite la creación y extracción rápidas de características de tablas de eventos y artículos XLarge. La computación se maneja de manera eficiente aprovechando la escalabilidad de plataformas de datos como Snowflake, DataBricks y Spark. Los cuadernos facilitan la experimentación, mientras que el intercambio y la reutilización de características ahorran tiempo. La auditoría garantiza la precisión de las características, mientras que la implementación inmediata elimina los dolores de cabeza de la gestión de pipelines.

Además de las capacidades ofrecidas por nuestra biblioteca de código abierto, nuestra solución empresarial proporciona un marco integral para la gestión y organización de operaciones de inteligencia artificial a escala, incluyendo flujos de trabajo de gobernanza y una interfaz de usuario para el catálogo de características.

¿Cuál es su visión para el futuro de FeatureByte?

Nuestra visión última para FeatureByte es revolucionar el campo de la ciencia de datos y el aprendizaje automático, permitiendo a los usuarios desbloquear su pleno potencial creativo y extraer un valor sin precedentes de sus activos de datos.

Estamos particularmente emocionados con el rápido progreso en la inteligencia artificial generativa y los transformadores, lo que abre un mundo de posibilidades para nuestros usuarios. Además, estamos dedicados a democratizar la ingeniería de características. La inteligencia artificial generativa tiene el potencial de reducir la barrera de entrada para la ingeniería de características creativa, haciéndola más accesible a una audiencia más amplia.

En resumen, nuestra visión para el futuro de FeatureByte gira en torno a la innovación continua, aprovechando el poder de la inteligencia artificial generativa y democratizando la ingeniería de características. Nosotros aspiramos a ser la plataforma de referencia que permita a los profesionales de datos transformar datos brutos en entrada acción para el aprendizaje automático, impulsando avances y progresos en diversas industrias.

¿Tiene algún consejo para emprendedores aspirantes de inteligencia artificial?

Defina su espacio, manténgase enfocado y acogedor con la novedad.

Al definir el espacio que desea poseer, puede diferenciarse y establecer una fuerte presencia en ese área. Investigue el mercado, comprenda las necesidades y los puntos de dolor de los clientes potenciales y esfuercese por brindar una solución única que aborde efectivamente esos desafíos.

Defina su visión a largo plazo y establezca metas claras a corto plazo que se alineen con esa visión. Concéntrese en construir una base sólida y brindar valor en su espacio elegido.

Finalmente, mientras es importante mantener el enfoque, no se aleje de abrazar la novedad y explorar nuevas ideas dentro de su espacio definido. El campo de la inteligencia artificial está en constante evolución, y los enfoques innovadores pueden abrir nuevas oportunidades.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar FeatureByte.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.