Interviews
Anais Dotis-Georgiou, Developer Advocate bij InfluxData – Interviewreeks

Anais Dotis-Georgiou is een Developer Advocate voor InfluxData met een passie voor het maken van data mooi met behulp van Data Analytics, AI en Machine Learning. Ze neemt de data die ze verzamelt, doet een mix van onderzoek, exploratie en engineering om de data om te zetten in iets met functionaliteit, waarde en schoonheid. Wanneer ze niet achter een scherm zit, kun je haar buiten vinden waar ze tekent, stretcht, boardt of achter een voetbal aanzit.
InfluxData is het bedrijf dat InfluxDB bouwt, de open source time series database die door meer dan een miljoen ontwikkelaars over de hele wereld wordt gebruikt. Hun missie is om ontwikkelaars te helpen bij het bouwen van intelligente, real-time systemen met hun time series data.
Kunt u ons een beetje vertellen over uw reis van onderzoeksassistent naar Lead Developer Advocate bij InfluxData? Hoe heeft uw achtergrond in data-analyse en machine learning uw huidige rol gevormd?
Ik heb mijn bachelorgraad in chemische technologie behaald met een specialisatie in biomedische technologie en werkte vervolgens in laboratoria waar vaccinontwikkeling en prenatale autismedetectie plaatsvonden. Vervolgens begon ik met het programmeren van vloeistofhandlingsrobots en hielp ik datawetenschappers om de parameters voor anomaliedetectie te begrijpen, wat me meer interesseerde in programmeren.
Ik werd vervolgens een sales development representative bij Oracle (ORCL ) en besefte dat ik me echt moest focussen op coderen. Ik volgde een coderingsbootcamp aan de Universiteit van Texas in data-analyse en kon zo de overstap maken naar de technologie, specifiek naar developer-relaties.
Ik kwam uit een technische achtergrond, dus dat hielp bij het vormen van mijn huidige rol. Ondanks dat ik geen ervaring had met ontwikkeling, kon ik me verbinden met en empathie hebben voor mensen met een technische achtergrond en een engineeringsmentaliteit die ook probeerden te leren over software. Dus, wanneer ik inhoud of technische tutorials maakte, kon ik nieuwe gebruikers helpen om technische uitdagingen te overwinnen door het gesprek te voeren in een context die relevant en interessant voor hen was.
Uw werk lijkt creativiteit te combineren met technische expertise. Hoe voegt u uw passie voor het maken van data ‘mooi’ toe aan uw dagelijkse werk bij InfluxData?
Onlangs ben ik me meer gaan focussen op data-engineering dan op data-analyse. Hoewel ik me niet zo veel meer bezighoud met data-analyse als vroeger, geniet ik nog steeds van wiskunde – ik denk dat wiskunde mooi is en zal springen om de kans te krijgen om de wiskunde achter een algoritme uit te leggen.
InfluxDB is een hoeksteen geweest in de time series data-ruimte. Hoe ziet u de invloed van de open source-gemeenschap op de ontwikkeling en evolutie van InfluxDB?
InfluxData is zeer toegewijd aan de open data-architectuur en het Apache-ecosysteem. Vorig jaar hebben we InfluxDB 3.0 aangekondigd, de nieuwe core voor InfluxDB die is geschreven in Rust en is gebouwd met Apache Flight, DataFusion, Arrow en Parquet – wat we de FDAP-stack noemen. Naarmate de ingenieurs bij InfluxData blijven bijdragen aan die upstream-projecten, blijft de gemeenschap groeien en wordt de Apache Arrow-set van projecten gemakkelijker te gebruiken met meer functies en functionaliteit, en bredere interoperabiliteit.
Wat zijn enkele van de meest spannende open-source projecten of bijdragen die u onlangs hebt gezien in de context van time series data en AI?
Het is cool om te zien dat LLM’s worden hergebruikt of toegepast op time series voor zero-shot forecasting. Autolab heeft een collectie van open time series-taalmodellen, en TimeGPT is een ander geweldig voorbeeld.
Bovendien zijn verschillende open source-stream processing bibliotheken, waaronder Bytewax en Mage.ai, die gebruikers in staat stellen om modellen van Hugging Face te benutten en te integreren, best spannend.
Hoe zorgt InfluxData ervoor dat hun open source-initiatieven relevant en nuttig blijven voor de ontwikkelaarsgemeenschap, vooral met de snelle vooruitgang in AI en machine learning?
InfluxData-initiatieven blijven relevant en nuttig door bij te dragen aan open source-projecten die AI-specifieke bedrijven ook gebruiken. Bijvoorbeeld, elke keer dat InfluxDB bijdraagt aan Apache Arrow, Parquet of DataFusion, profiteert elk ander AI-techbedrijf dat het ook gebruikt, waaronder Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace en meer.
Time series-taalmodellen worden steeds belangrijker in predictieve analytics. Kunt u uitleggen hoe deze modellen de time series-voorspelling en anomaliedetectie transformeren?
Time series-LM’s presteren beter dan lineaire en statistische modellen en bieden ook zero-shot forecasting. Dit betekent dat u de model niet hoeft te trainen op uw data voordat u het gebruikt. Er is ook geen behoefte om een statistisch model te tunen, wat diepe expertise in time series-statistiek vereist.
Hoewel, in tegenstelling tot natuurlijke taalverwerking, het time series-veld een gebrek heeft aan openbaar toegankelijke grote datasets. De meeste bestaande pre-getrainde modellen voor time series zijn getraind op kleine steekproeven, die slechts enkele duizenden – of misschien zelfs honderden – steekproeven bevatten. Hoewel deze benchmark-datasets instrumenteel zijn geweest in de vooruitgang van de time series-gemeenschap, vormen hun beperkte steekproefgroottes en gebrek aan generaliteit uitdagingen voor het pre-trainen van diepe leermodellen.
Dat gezegd hebbende, dit is wat ik denk dat het moeilijk maakt om open source-time series-LM’s te vinden. Google’s (GOOGL ) TimesFM en IBM’s Tiny Time Mixers zijn getraind op enorme datasets met honderden miljarden datapunten. Met TimesFM, bijvoorbeeld, wordt het pre-trainingsproces uitgevoerd met Google Cloud TPU v3-256, dat bestaat uit 256 TPU-cores met een totaal van 2 terabyte geheugen. Het pre-trainingsproces duurt ongeveer tien dagen en resulteert in een model met 1,2 miljard parameters. Het pre-getrainde model wordt vervolgens fijngetuned op specifieke downstream-taken en datasets met een lagere leercurve en minder epochs.
Hopelijk impliceert deze transformatie dat meer mensen accurate voorspellingen kunnen doen zonder diepe domeinkennis. Echter, het vergt veel werk om de voor- en nadelen van het gebruik van computationeel dure modellen zoals time series-LM’s te wegen vanuit zowel een financieel als een milieuoogpunt.
Deze Hugging Face Blog-post geeft een ander geweldig voorbeeld van time series-voorspelling.
Wat zijn de belangrijkste voordelen van het gebruik van time series-LM’s boven traditionele methoden, vooral in termen van het omgaan met complexe patronen en zero-shot-prestaties?
Het kritieke voordeel is dat u geen model hoeft te trainen en opnieuw te trainen op uw time series-data. Dit elimineert hopelijk het online machine learning-probleem van het monitoren van uw modeldrift en het triggeren van opnieuw trainen, ideaal om de complexiteit van uw voorspellingspijplijn te elimineren.
U hoeft ook niet te worstelen met het schatten van cross-series-correlaties of -relaties voor multivariate statistische modellen. Extra variatie toegevoegd door schattingen kan de resulterende voorspellingen schaden en kan ertoe leiden dat het model spurieuze correlaties leert.
Kunt u enkele praktische voorbeelden geven van hoe modellen zoals Google’s TimesFM, IBM’s TinyTimeMixer en AutoLab’s MOMENT zijn geïmplementeerd in real-world scenario’s?
Dit is moeilijk om te beantwoorden; aangezien deze modellen in hun relatieve jeugd zijn, is er weinig bekend over hoe bedrijven ze in real-world scenario’s gebruiken.
Uit uw ervaring, welke uitdagingen ondervinden organisaties typisch wanneer ze time series-LM’s integreren in hun bestaande data-infrastructuur, en hoe kunnen ze deze overwinnen?
Time series-LM’s zijn zo nieuw dat ik de specifieke uitdagingen die organisaties ondervinden niet ken. Echter, ik denk dat ze dezelfde uitdagingen zullen tegenkomen als bij het integreren van elk GenAI-model in uw data-pijplijn. Deze uitdagingen omvatten:
- Data-compatibiliteit en integratieproblemen: Time series-LM’s vereisen vaak specifieke dataformaten, consistent tijdstempels en regelmatige tussenpozen, maar bestaande data-infrastructuur kan ongestructureerde of inconsistente time series-data bevatten die zijn verspreid over verschillende systemen, zoals legacy-databases, cloud-opslag of real-time streams. Om dit aan te pakken, moeten teams robuuste ETL-pijplijnen implementeren om time series-data voor te verwerken, schoon te maken en uit te lijnen.
- Model-schaalbaarheid en prestaties: Time series-LM’s, vooral diepe leermodellen zoals transformers, kunnen resource-intensief zijn en vereisen aanzienlijke reken- en geheugencapaciteit om grote volumes time series-data in real-time of near-real-time te verwerken. Dit zou teams ertoe kunnen brengen om modellen te implementeren op schaalbare platforms zoals Kubernetes of cloud-beheerde ML-diensten, GPU-versnelling te gebruiken wanneer nodig en gedistribueerde verwerkingframeworks zoals Dask of Ray te gebruiken om model-inferentie te paralleliseren.
- Interpreteerbaarheid en betrouwbaarheid: Time series-modellen, vooral complexe LM’s, kunnen als “black boxes” worden beschouwd, waardoor het moeilijk is om voorspellingen te interpreteren. Dit kan vooral problematisch zijn in gereguleerde industrieën zoals financiën of gezondheidszorg.
- Data-privacy en -beveiliging: Het omgaan met time series-data houdt vaak vertrouwelijke informatie in, zoals IoT-sensordata of financiële transactiedata, dus het waarborgen van data-beveiliging en -compliance is kritiek bij het integreren van LM’s. Organisaties moeten ervoor zorgen dat data-pijplijnen en -modellen voldoen aan de beste beveiligingspraktijken, waaronder encryptie en toegangscontrole, en modellen implementeren in beveiligde, geïsoleerde omgevingen.
Kijkend naar de toekomst, hoe ziet u de rol van time series-LM’s evolueren in het veld van predictieve analytics en AI? Zijn er enkele opkomende trends of technologieën die u bijzonder enthousiast maken?
Een mogelijke volgende stap in de evolutie van time series-LM’s kan het introduceren van tools zijn die gebruikers in staat stellen om ze gemakkelijker te implementeren, te gebruiken en te benutten. Veel van de time series-LM’s die ik heb gebruikt, vereisen zeer specifieke omgevingen en ontbreken het aan een breed aanbod van tutorials en documentatie. Uiteindelijk zijn deze projecten in hun vroege stadia, maar het zal spannend zijn om te zien hoe ze in de komende maanden en jaren evolueren.
Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen InfluxData bezoeken.












