Entrevistas
Anais Dotis-Georgiou, Developer Advocate en InfluxData – Serie de entrevistas

Anais Dotis-Georgiou es una defensora de desarrolladores para InfluxData con una pasión por hacer que los datos sean hermosos mediante el uso de Análisis de Datos, Inteligencia Artificial y Aprendizaje Automático. Ella toma los datos que recopila, hace una mezcla de investigación, exploración e ingeniería para traducir los datos en algo de función, valor y belleza. Cuando no está detrás de una pantalla, se la puede encontrar fuera dibujando, estirando, patinando o persiguiendo un balón de fútbol.
InfluxData es la empresa que construye InfluxDB, la base de datos de series temporales de código abierto utilizada por más de un millón de desarrolladores en todo el mundo. Su misión es ayudar a los desarrolladores a construir sistemas inteligentes y en tiempo real con sus datos de series temporales.
¿Puedes compartir un poco sobre tu camino desde ser asistente de investigación hasta convertirte en defensora de desarrolladores líder en InfluxData? ¿Cómo ha influido tu experiencia en análisis de datos y aprendizaje automático en tu papel actual?
Obtuve mi título universitario en ingeniería química con un enfoque en ingeniería biomédica y eventualmente trabajé en laboratorios realizando desarrollo de vacunas y detección de autismo prenatal. A partir de ahí, comencé a programar robots de manipulación de líquidos y ayudé a los científicos de datos a entender los parámetros para la detección de anomalías, lo que me hizo más interesada en la programación.
Luego me convertí en representante de desarrollo de ventas en Oracle (ORCL ) y me di cuenta de que realmente necesitaba centrarme en la codificación. Realicé un bootcamp de codificación en la Universidad de Texas en análisis de datos y pude entrar en la tecnología, específicamente en las relaciones con los desarrolladores.
Vine de un fondo técnico, así que eso ayudó a dar forma a mi papel actual. Aunque no tenía experiencia en desarrollo, podía relacionarme y empatizar con personas que tenían un fondo de ingeniería y mente, pero que también estaban tratando de aprender software. Así que, cuando creé contenido o tutoriales técnicos, pude ayudar a los nuevos usuarios a superar desafíos técnicos mientras colocaba la conversación en un contexto que era relevante e interesante para ellos.
Tu trabajo parece combinar creatividad con experiencia técnica. ¿Cómo incorporas tu pasión por hacer que los datos sean “hermosos” en tu trabajo diario en InfluxData?
Últimamente, me he centrado más en la ingeniería de datos que en el análisis de datos. Aunque no me enfoco tanto en el análisis de datos como solía, todavía disfruto mucho de las matemáticas; creo que las matemáticas son hermosas y saltaré a la oportunidad de explicar las matemáticas detrás de un algoritmo.
InfluxDB ha sido una piedra angular en el espacio de datos de series temporales. ¿Cómo ves la influencia de la comunidad de código abierto en el desarrollo y evolución de InfluxDB?
InfluxData está muy comprometida con la arquitectura de datos abierta y el ecosistema de Apache. El año pasado anunciamos InfluxDB 3.0, el nuevo núcleo para InfluxDB escrito en Rust y construido con Apache Flight, DataFusion, Arrow y Parquet; lo que llamamos la pila FDAP. A medida que los ingenieros de InfluxData continúan contribuyendo a esos proyectos upstream, la comunidad continúa creciendo y el conjunto de proyectos de Apache Arrow se vuelve más fácil de usar con más características y funcionalidades, y una mayor interoperabilidad.
¿Cuáles son algunos de los proyectos o contribuciones de código abierto más emocionantes que has visto recientemente en el contexto de datos de series temporales y IA?
Ha sido genial ver la adición de LLMs que se reutilizan o se aplican a series temporales para la predicción de cero disparos. Autolab tiene una colección de modelos de lenguaje de series temporales de código abierto, y TimeGPT es otro ejemplo excelente.
Además, varias bibliotecas de procesamiento de flujos de código abierto, incluyendo Bytewax y Mage.ai, que permiten a los usuarios aprovechar e incorporar modelos de Hugging Face, son bastante emocionantes.
¿Cómo garantiza InfluxData que sus iniciativas de código abierto sigan siendo relevantes y beneficiosas para la comunidad de desarrolladores, particularmente con los avances rápidos en IA y aprendizaje automático?
Las iniciativas de InfluxData siguen siendo relevantes y beneficiosas centrándose en contribuir a proyectos de código abierto que las empresas de IA también aprovechan. Por ejemplo, cada vez que InfluxDB contribuye a Apache Arrow, Parquet o DataFusion, beneficia a todas las demás tecnologías y empresas de IA que las aprovechan, incluyendo Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace y más.
Los modelos de lenguaje de series temporales se están volviendo cada vez más vitales en el análisis predictivo. ¿Puedes elaborar sobre cómo estos modelos están transformando la predicción y detección de anomalías de series temporales?
Los modelos de lenguaje de series temporales superan a los modelos lineales y estadísticos, mientras también proporcionan predicción de cero disparos. Esto significa que no necesitas entrenar el modelo en tus datos antes de usarlo. No hay necesidad de ajustar un modelo estadístico, que requiere un profundo conocimiento en estadísticas de series temporales.
Sin embargo, a diferencia del procesamiento de lenguaje natural, el campo de las series temporales carece de conjuntos de datos de gran escala accesibles públicamente. La mayoría de los modelos preentrenados existentes para series temporales se entrenan en tamaños de muestra pequeños, que contienen solo unos pocos miles; o tal vez solo cientos; de muestras. Aunque estos conjuntos de datos de referencia han sido instrumentales en el progreso de la comunidad de series temporales, sus tamaños de muestra limitados y falta de generalidad plantean desafíos para el preentrenamiento de modelos de aprendizaje profundo.
Esto es lo que creo que hace que los modelos de lenguaje de series temporales de código abierto sean difíciles de encontrar. Los TimesFM de Google (GOOGL ) y los Tiny Time Mixers de IBM se han entrenado en conjuntos de datos masivos con cientos de miles de millones de puntos de datos. Con TimesFM, por ejemplo, el proceso de preentrenamiento se realiza utilizando Google Cloud TPU v3; 256, que consiste en 256 núcleos TPU con un total de 2 terabytes de memoria. El proceso de preentrenamiento tarda aproximadamente diez días y da como resultado un modelo con 1.200 millones de parámetros. El modelo preentrenado se ajusta luego en tareas y conjuntos de datos específicos utilizando una tasa de aprendizaje más baja y menos épocas.
Con suerte, esta transformación implica que más personas pueden hacer predicciones precisas sin un profundo conocimiento del dominio. Sin embargo, requiere mucho trabajo para sopesar los pros y los contras de aprovechar modelos computacionalmente costosos como los modelos de lenguaje de series temporales desde una perspectiva de costo financiero y ambiental.
Esta publicación del blog de Hugging Face detalla otro ejemplo excelente de predicción de series temporales.
¿Cuáles son las ventajas clave de usar modelos de lenguaje de series temporales sobre métodos tradicionales, especialmente en términos de manejo de patrones complejos y rendimiento de cero disparos?
La ventaja crítica es no tener que entrenar y volver a entrenar un modelo en tus datos de series temporales. Esto elimina idealmente el problema de aprendizaje automático en línea de monitorear el desplazamiento de tu modelo y activar el nuevo entrenamiento, idealmente eliminando la complejidad de tu tubería de predicción.
Tampoco necesitas luchar para estimar las correlaciones entre series o las relaciones para modelos estadísticos multivariantes. La variabilidad adicional agregada por las estimaciones a menudo daña las predicciones resultantes y puede hacer que el modelo aprenda correlaciones espurias.
¿Puedes proporcionar algunos ejemplos prácticos de cómo se han implementado modelos como TimesFM de Google, TinyTimeMixer de IBM y MOMENT de AutoLab en escenarios del mundo real?
Esto es difícil de responder; ya que estos modelos están en su infancia relativa, poco se sabe sobre cómo las empresas los utilizan en escenarios del mundo real.
En tu experiencia, ¿qué desafíos enfrentan típicamente las organizaciones al integrar modelos de lenguaje de series temporales en su infraestructura de datos existente, y cómo pueden superarlos?
Los modelos de lenguaje de series temporales son tan nuevos que no conozco los desafíos específicos que enfrentan las organizaciones. Sin embargo, imagino que enfrentarán los mismos desafíos que enfrentan al incorporar cualquier modelo de IA en su tubería de datos. Estos desafíos incluyen:
- Problemas de compatibilidad e integración de datos: Los modelos de lenguaje de series temporales a menudo requieren formatos de datos específicos, marca de tiempo consistente y intervalos regulares, pero la infraestructura de datos existente puede incluir datos de series temporales no estructurados o inconsistentes dispersos en diferentes sistemas, como bases de datos heredadas, almacenamiento en la nube o flujos en tiempo real. Para abordar esto, los equipos deben implementar tuberías ETL (extraer, transformar, cargar) robustas para preprocesar, limpiar y alinear los datos de series temporales.
- Escalabilidad y rendimiento del modelo: Los modelos de lenguaje de series temporales, especialmente los modelos de aprendizaje profundo como los transformadores, pueden ser intensivos en recursos, requiriendo recursos de cómputo y memoria significativos para procesar grandes volúmenes de datos de series temporales en tiempo real o casi en tiempo real. Esto requeriría que los equipos desplieguen modelos en plataformas escalables como Kubernetes o servicios de aprendizaje automático administrados en la nube, aprovechen la aceleración de GPU cuando sea necesario y utilicen marcos de procesamiento distribuido como Dask o Ray para parallelizar la inferencia del modelo.
- Interpretación y confiabilidad: Los modelos de series temporales, particularmente los modelos de lenguaje complejos, pueden considerarse “cajas negras”, lo que hace difícil interpretar las predicciones. Esto puede ser particularmente problemático en industrias reguladas como las finanzas o la atención médica.
- Privacidad y seguridad de los datos: Manejar datos de series temporales a menudo implica información sensible, como datos de sensores de IoT o transacciones financieras, por lo que garantizar la seguridad y el cumplimiento de los datos es fundamental al integrar los modelos de lenguaje. Las organizaciones deben garantizar que las tuberías de datos y los modelos cumplan con las mejores prácticas de seguridad, incluyendo cifrado y control de acceso, y desplieguen modelos en entornos seguros y aislados.
¿Cómo ves evolucionar el papel de los modelos de lenguaje de series temporales en el campo del análisis predictivo y la IA? ¿Hay alguna tendencia o tecnología emergente que te emocione particularmente?
Un posible próximo paso en la evolución de los modelos de lenguaje de series temporales podría ser introducir herramientas que permitan a los usuarios implementar, acceder y utilizarlos más fácilmente. Muchos de los modelos de lenguaje de series temporales que he utilizado requieren entornos muy específicos y carecen de una amplia gama de tutoriales y documentación. En última instancia, estos proyectos están en sus primeras etapas, pero será emocionante ver cómo evolucionan en los próximos meses y años. Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar InfluxData.












