Entretiens

Anais Dotis-Georgiou, Développeur Advocate chez InfluxData – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Anais Dotis-Georgiou est un Développeur Advocate pour InfluxData avec une passion pour rendre les données belles en utilisant l’analyse de données, l’IA et l’apprentissage automatique. Elle prend les données qu’elle collecte, effectue un mélange de recherche, d’exploration et d’ingénierie pour traduire les données en quelque chose de fonctionnel, de valeur et de beauté. Lorsqu’elle n’est pas derrière un écran, vous pouvez la trouver à l’extérieur en train de dessiner, d’étirer, de faire du skateboard ou de poursuivre un ballon de football.

InfluxData est l’entreprise qui construit InfluxDB, la base de données de séries chronologiques open source utilisée par plus d’un million de développeurs dans le monde. Leur mission est d’aider les développeurs à créer des systèmes intelligents et en temps réel avec leurs données de séries chronologiques.

Pouvez-vous partager un peu votre parcours depuis que vous êtes devenu un Assistant de recherche jusqu’à devenir un Lead Developer Advocate chez InfluxData ? Comment votre expérience dans l’analyse de données et l’apprentissage automatique a-t-elle façonné votre rôle actuel ?

J’ai obtenu mon diplôme d’études supérieures en génie chimique avec une spécialisation en génie biomédical et j’ai ensuite travaillé dans des laboratoires pour le développement de vaccins et la détection de l’autisme prénatal. Ensuite, j’ai commencé à programmer des robots de manipulation de liquides et à aider les scientifiques des données à comprendre les paramètres pour la détection d’anomalies, ce qui m’a rendu plus intéressé par la programmation.

Ensuite, je suis devenu un représentant de développement commercial chez Oracle (ORCL ) et j’ai réalisé que je devais vraiment me concentrer sur la programmation. J’ai suivi un boot camp de codage à l’Université du Texas en analyse de données et j’ai pu intégrer le secteur de la technologie, en particulier les relations avec les développeurs.

Je venais d’un contexte technique, ce qui m’a aidé à façonner mon rôle actuel. Même si je n’avais pas d’expérience de développement, je pouvais me relater et sympathiser avec les personnes qui avaient un contexte d’ingénierie et d’esprit, mais qui essayaient également d’apprendre les logiciels. Lorsque j’ai créé du contenu ou des tutoriels techniques, j’ai pu aider les nouveaux utilisateurs à surmonter les défis techniques tout en plaçant la conversation dans un contexte qui leur était pertinent et intéressant.

Votre travail semble allier créativité et expertise technique. Comment incorporez-vous votre passion pour rendre les données “belles” dans votre travail quotidien chez InfluxData ?

Récemment, je me suis concentré plus sur l’ingénierie de données que sur l’analyse de données. Même si je ne me concentre pas autant sur l’analyse de données que je l’ai fait auparavant, j’apprécie toujours les mathématiques – je pense que les mathématiques sont belles, et je saute sur l’occasion de expliquer les mathématiques derrière un algorithme.

InfluxDB a été un élément clé dans l’espace des données de séries chronologiques. Comment voyez-vous la communauté open source influencer le développement et l’évolution d’InfluxDB ?

InfluxData est très engagé dans l’architecture de données ouverte et l’écosystème Apache. L’année dernière, nous avons annoncé InfluxDB 3.0, le nouveau noyau pour InfluxDB écrit en Rust et construit avec Apache Flight, DataFusion, Arrow et Parquet – ce que nous appelons la pile FDAP. À mesure que les ingénieurs d’InfluxData continuent à contribuer à ces projets en amont, la communauté continue de grandir et l’ensemble des projets Apache Arrow devient plus facile à utiliser avec plus de fonctionnalités et de fonctionnalités, ainsi qu’une plus grande interopérabilité.

Quels sont les projets open source ou les contributions les plus excitants que vous avez vus récemment dans le contexte des données de séries chronologiques et de l’IA ?

Il a été cool de voir l’ajout de LLMs réutilisés ou appliqués aux séries chronologiques pour la prévision à zéro tir. Autolab a une collection de modèles de langage de séries chronologiques ouverts, et TimeGPT est un autre excellent exemple.

De plus, diverses bibliothèques de traitement de flux open source, notamment Bytewax et Mage.ai, qui permettent aux utilisateurs de tirer parti et d’intégrer des modèles de Hugging Face, sont plutôt excitants.

Comment InfluxData assure-t-il que ses initiatives open source restent pertinentes et bénéfiques pour la communauté des développeurs, en particulier avec les progrès rapides de l’IA et de l’apprentissage automatique ?

Les initiatives d’InfluxData restent pertinentes et bénéfiques en se concentrant sur la contribution à des projets open source que les entreprises d’IA utilisent également. Par exemple, chaque fois qu’InfluxDB contribue à Apache Arrow, Parquet ou DataFusion, cela bénéficie à toutes les autres entreprises de technologie et d’IA qui les utilisent, y compris Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace, et plus encore.

Les modèles de langage de séries chronologiques sont de plus en plus vitaux dans l’analyse prédictive. Pouvez-vous expliquer comment ces modèles transforment la prévision et la détection d’anomalies de séries chronologiques ?

Les modèles de langage de séries chronologiques surpassent les modèles linéaires et statistiques tout en offrant une prévision à zéro tir. Cela signifie que vous n’avez pas besoin de former le modèle sur vos données avant de l’utiliser. Il n’y a pas non plus besoin de régler un modèle statistique, ce qui nécessite une expertise approfondie en statistiques de séries chronologiques.

Cependant, contrairement au traitement du langage naturel, le domaine des séries chronologiques manque de jeux de données à grande échelle accessibles au public. La plupart des modèles pré-entraînés pour les séries chronologiques sont formés sur des échantillons de petite taille, qui ne contiennent que quelques milliers – ou peut-être même quelques centaines – d’échantillons. Même si ces jeux de données de référence ont été instrumentaux dans les progrès de la communauté des séries chronologiques, leur taille d’échantillon limitée et leur manque de généralité posent des défis pour la formation de modèles d’apprentissage automatique profonds.

C’est ce que je pense qui rend les modèles de langage de séries chronologiques open source difficiles à trouver. Les TimesFM de Google (GOOGL ) et les Tiny Time Mixers d’IBM ont été formés sur des ensembles de données massifs contenant des centaines de milliards de points de données. Avec TimesFM, par exemple, le processus de pré-formation est effectué à l’aide de Google Cloud TPU v3-256, qui comprend 256 cœurs TPU avec un total de 2 To de mémoire. Le processus de pré-formation prend environ dix jours et donne lieu à un modèle avec 1,2 milliard de paramètres. Le modèle pré-formé est ensuite affiné sur des tâches et des ensembles de données spécifiques à l’aide d’un taux d’apprentissage plus faible et de moins d’itérations.

Espérons que cette transformation implique que plus de personnes peuvent faire des prévisions précises sans une connaissance approfondie du domaine. Cependant, cela nécessite beaucoup de travail pour peser le pour et le contre de l’utilisation de modèles coûteux en calcul comme les modèles de langage de séries chronologiques, tant d’un point de vue financier qu’environnemental.

Cet article de blog Hugging Face présente un autre excellent exemple de prévision de séries chronologiques.

Quels sont les avantages clés de l’utilisation de modèles de langage de séries chronologiques par rapport aux méthodes traditionnelles, en particulier en termes de gestion de modèles complexes et de performances à zéro tir ?

L’avantage critique est de ne pas avoir à former et à reformer un modèle sur vos données de séries chronologiques. Cela élimine probablement le problème d’apprentissage automatique en ligne de surveillance de la dérive de votre modèle et de déclenchement de la réformation, idéalement en éliminant la complexité de votre pipeline de prévision.

Vous n’avez pas non plus besoin de lutter pour estimer les corrélations ou les relations entre les séries chronologiques pour les modèles statistiques multivariés. La variance supplémentaire ajoutée par les estimations nuit souvent aux prévisions résultantes et peut amener le modèle à apprendre des corrélations erronées.

Pouvez-vous fournir des exemples pratiques de la manière dont des modèles comme TimesFM de Google, TinyTimeMixer d’IBM et MOMENT d’AutoLab ont été mis en œuvre dans des scénarios du monde réel ?

Ceci est difficile à répondre ; puisque ces modèles sont à leurs débuts, on sait peu de choses sur la façon dont les entreprises les utilisent dans des scénarios du monde réel.

Quels sont les défis que les organisations rencontrent généralement lors de l’intégration de modèles de langage de séries chronologiques dans leur infrastructure de données existante, et comment peuvent-elles les surmonter ?

Les modèles de langage de séries chronologiques sont si nouveaux que je ne connais pas les défis spécifiques que les organisations rencontrent. Cependant, j’imagine qu’ils seront confrontés aux mêmes défis que ceux rencontrés lors de l’intégration de tout modèle de génération d’IA dans votre pipeline de données. Ces défis incluent :

  • Problèmes de compatibilité et d’intégration des données : Les modèles de langage de séries chronologiques nécessitent souvent des formats de données spécifiques, un horodatage cohérent et des intervalles réguliers, mais l’infrastructure de données existante peut inclure des données de séries chronologiques non structurées ou incohérentes réparties sur différents systèmes, tels que des bases de données héritées, un stockage cloud ou des flux en temps réel. Pour résoudre ce problème, les équipes doivent mettre en œuvre des pipelines ETL (extraction, transformation, chargement) robustes pour prétraiter, nettoyer et aligner les données de séries chronologiques.
  • Scalabilité et performances du modèle : Les modèles de langage de séries chronologiques, en particulier les modèles d’apprentissage automatique profonds comme les transformateurs, peuvent être gourmands en ressources, nécessitant des ressources de calcul et de mémoire importantes pour traiter de grandes quantités de données de séries chronologiques en temps réel ou en quasi-temps réel. Cela nécessiterait que les équipes déployent des modèles sur des plateformes évolutives comme Kubernetes ou des services de gestion de l’IA cloud, utilisent l’accélération GPU lorsqu’il est nécessaire et utilisent des cadres de traitement distribué comme Dask ou Ray pour paralléliser l’inférence du modèle.
  • Interprétabilité et fiabilité : Les modèles de séries chronologiques, en particulier les modèles de langage complexes, peuvent être considérés comme des “boîtes noires”, ce qui rend difficile l’interprétation des prévisions. Cela peut être particulièrement problématique dans les industries réglementées comme la finance ou les soins de santé.
  • Sécurité et confidentialité des données : La gestion des données de séries chronologiques implique souvent des informations sensibles, telles que les données des capteurs IoT ou les transactions financières, il est donc essentiel de garantir la sécurité et la conformité des données lors de l’intégration de modèles de langage de séries chronologiques. Les organisations doivent veiller à ce que les pipelines de données et les modèles soient conformes aux meilleures pratiques de sécurité, y compris le cryptage et le contrôle d’accès, et déployer des modèles dans des environnements sécurisés et isolés.

En regardant vers l’avenir, comment voyez-vous le rôle des modèles de langage de séries chronologiques évoluer dans le domaine de l’analyse prédictive et de l’IA ? Y a-t-il des tendances ou des technologies émergentes qui vous excitent particulièrement ?

Une prochaine étape possible dans l’évolution des modèles de langage de séries chronologiques pourrait consister à introduire des outils qui permettent aux utilisateurs de déployer, d’accéder et d’utiliser ces modèles plus facilement. Beaucoup des modèles de langage de séries chronologiques que j’ai utilisés nécessitent des environnements très spécifiques et manquent d’une largeur de didacticiels et de documentation. En fin de compte, ces projets sont à leurs débuts, mais il sera excitant de voir comment ils évolueront dans les mois et les années à venir.

Je vous remercie pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter InfluxData.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.