Interviews
Anais Dotis-Georgiou, Developer Advocate bei InfluxData – Interview-Serie

Anais Dotis-Georgiou ist eine Developer Advocate für InfluxData mit einer Leidenschaft für die Erstellung schöner Daten mithilfe von Data Analytics, KI und Machine Learning. Sie nimmt die Daten, die sie sammelt, und mischt sie mit Forschung, Exploration und Ingenieurwesen, um sie in etwas Funktions-, Wert- und Schönes zu übersetzen. Wenn sie nicht hinter einem Bildschirm sitzt, kann man sie draußen beim Zeichnen, Dehnen, Boarden oder Fußballspielen finden.
InfluxData ist das Unternehmen, das InfluxDB entwickelt, die Open-Source-Zeitreihendatenbank, die von über einer Million Entwicklern auf der ganzen Welt verwendet wird. Ihre Mission ist es, Entwicklern zu helfen, intelligente, Echtzeit-Systeme mit ihren Zeitreihendaten zu bauen.
Können Sie uns ein bisschen über Ihre Reise von einer Forschungsassistentin zu einer Lead-Developer-Advocate bei InfluxData erzählen? Wie hat Ihre Ausbildung in Data-Analytics und Machine Learning Ihre aktuelle Rolle geprägt?
Ich habe meinen Bachelor-Abschluss in Chemieingenieurwesen mit Schwerpunkt Biomedizinische Ingenieurwesen erworben und habe dann in Labors gearbeitet, um Impfstoffe zu entwickeln und Autismus vor der Geburt zu erkennen. Von dort aus begann ich, Liquid-Handling-Roboter zu programmieren und Datenwissenschaftlern zu helfen, die Parameter für die Anomalie-Erkennung zu verstehen, was mich mehr für die Programmierung interessierte.
Dann wurde ich eine Vertriebsentwicklungsvertreterin bei Oracle (ORCL ) und erkannte, dass ich mich wirklich auf die Codierung konzentrieren musste. Ich besuchte einen Codier-Bootcamp an der Universität von Texas in Data-Analytics und konnte so in die Tech-Branche einsteigen, insbesondere in die Developer-Relations.
Ich kam aus einem technischen Hintergrund, was mir half, meine aktuelle Rolle zu prägen. Obwohl ich keine Entwicklungserfahrung hatte, konnte ich mich mit Menschen identifizieren und mit ihnen mitfühlen, die einen ingenieurstechnischen Hintergrund und eine entsprechende Denkweise hatten, aber auch versuchten, Software zu lernen. Wenn ich also Inhalte oder technische Tutorials erstellte, konnte ich neuen Benutzern helfen, technische Herausforderungen zu überwinden, während ich das Gespräch in einem Kontext führte, der für sie relevant und interessant war.
Ihre Arbeit scheint Kreativität mit technischer Expertise zu verbinden. Wie integrieren Sie Ihre Leidenschaft für die Erstellung schöner Daten in Ihre tägliche Arbeit bei InfluxData?
Ich habe mich in letzter Zeit mehr auf Data-Engineering als auf Data-Analytics konzentriert. Obwohl ich mich nicht so sehr auf Data-Analytics konzentriere wie früher, genieße ich es immer noch, Mathematik zu erklären – ich denke, Mathematik ist schön, und ich springe bei der Gelegenheit, die Mathematik hinter einem Algorithmus zu erklären.
InfluxDB ist ein Eckpfeiler im Bereich der Zeitreihendaten. Wie sehen Sie die Open-Source-Community die Entwicklung und Evolution von InfluxDB beeinflussen?
InfluxData ist sehr engagiert in der offenen Datenarchitektur und dem Apache-Ökosystem. Im letzten Jahr haben wir InfluxDB 3.0 angekündigt, den neuen Kern für InfluxDB, der in Rust geschrieben und mit Apache Flight, DataFusion, Arrow und Parquet – was wir den FDAP-Stack nennen – entwickelt wurde. Wenn die Ingenieure bei InfluxData weiterhin zu diesen Upstream-Projekten beitragen, wächst die Community und das Apache-Arrow-Set von Projekten wird einfacher zu verwenden, mit mehr Funktionen und Funktionalitäten und einer breiteren Interoperabilität.
Was sind einige der aufregendsten Open-Source-Projekte oder Beiträge, die Sie kürzlich im Kontext von Zeitreihendaten und KI gesehen haben?
Es ist cool zu sehen, wie LLMs für die Null-Shot-Vorhersage in Zeitreihen verwendet werden. Autolab hat eine Sammlung von offenen Zeitreihen-Sprachmodellen, und TimeGPT ist ein weiteres großartiges Beispiel.
Zusätzlich sind verschiedene Open-Source-Stream-Processing-Bibliotheken, einschließlich Bytewax und Mage.ai, die es Benutzern ermöglichen, Modelle von Hugging Face zu nutzen und zu integrieren, ziemlich aufregend.
Wie stellt InfluxData sicher, dass seine Open-Source-Initiativen für die Entwickler-Community relevant und nützlich bleiben, insbesondere angesichts der schnellen Fortschritte in KI und Machine Learning?
InfluxData-Initiativen bleiben relevant und nützlich, indem sie sich auf die Beiträge zu Open-Source-Projekten konzentrieren, die auch von KI-spezifischen Unternehmen genutzt werden. Zum Beispiel profitiert jedes Mal, wenn InfluxDB zu Apache Arrow, Parquet oder DataFusion beiträgt, jedes andere KI-Technologie- und -Unternehmen, das es nutzt, einschließlich Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace und mehr.
Zeitreihen-Sprachmodelle werden immer wichtiger in der Vorhersage-Analyse. Können Sie erläutern, wie diese Modelle die Zeitreihen-Vorhersage und die Anomalie-Erkennung verändern?
Zeitreihen-LMs überbieten lineare und statistische Modelle und bieten auch Null-Shot-Vorhersagen. Das bedeutet, dass Sie das Modell nicht auf Ihre Daten trainieren müssen, bevor Sie es verwenden. Es gibt auch keine Notwendigkeit, ein statistisches Modell zu justieren, was tiefes Fachwissen in Zeitreihen-Statistik erfordert.
Es gibt jedoch im Gegensatz zur natürlichen Sprachverarbeitung im Zeitreihen-Bereich nur wenige öffentlich zugängliche große Datensätze. Die meisten vorab trainierten Modelle für Zeitreihen sind auf kleinen Stichproben trainiert, die nur einige Tausend oder vielleicht sogar nur einige hundert Samples enthalten. Obwohl diese Benchmark-Datensätze für den Fortschritt der Zeitreihen-Community instrumental waren, stellen ihre begrenzten Stichproben und mangelnde Allgemeingültigkeit Herausforderungen für die Vorab-Training von Deep-Learning-Modellen dar.
Das ist, was ich glaube, es so schwierig macht, Open-Source-Zeitreihen-LMs zu finden. Google’s (GOOGL ) TimesFM und IBM’s Tiny Time Mixers wurden auf riesigen Datensätzen mit Hunderten von Milliarden von Datenpunkten trainiert. Mit TimesFM zum Beispiel wird der Vorab-Trainingsprozess mit Google Cloud TPU v3-256 durchgeführt, das 256 TPU-Kerne mit insgesamt 2 Terabyte Speicher enthält. Der Vorab-Trainingsprozess dauert etwa zehn Tage und resultiert in einem Modell mit 1,2 Milliarden Parametern. Das vorab trainierte Modell wird dann auf spezifische Downstream-Aufgaben und Datensätze feinjustiert, indem ein niedrigerer Lernalgorithmus und weniger Epochen verwendet werden.
Hoffentlich bedeutet diese Veränderung, dass mehr Menschen genaue Vorhersagen ohne tiefes Fachwissen treffen können. Es erfordert jedoch viel Arbeit, die Vor- und Nachteile der Nutzung rechenintensiver Modelle wie Zeitreihen-LMs aus finanzieller und umweltbedingter Sicht zu bewerten.
Dieser Hugging Face-Blog-Beitrag enthält ein weiteres großartiges Beispiel für die Zeitreihen-Vorhersage.
Was sind die Hauptvorteile der Verwendung von Zeitreihen-LMs im Vergleich zu herkömmlichen Methoden, insbesondere bei der Behandlung komplexer Muster und der Null-Shot-Leistung?
Der kritische Vorteil ist, dass Sie das Modell nicht auf Ihre Zeitreihendaten trainieren und retrainieren müssen. Dies eliminiert hoffentlich das Online-Machine-Learning-Problem, Ihr Modell zu überwachen und das Retraining auszulösen, idealerweise ohne die Komplexität Ihrer Vorhersage-Pipeline zu erhöhen.
Sie müssen sich auch nicht bemühen, die Kreuzkorrelationen oder Beziehungen für multivariate statistische Modelle zu schätzen. Die zusätzliche Varianz, die durch Schätzungen hinzugefügt wird, schadet oft den resultierenden Vorhersagen und kann dazu führen, dass das Modell spurhafte Korrelationen lernt.
Können Sie einige praktische Beispiele dafür nennen, wie Modelle wie Google’s TimesFM, IBM’s TinyTimeMixer und AutoLab’s MOMENT in realen Szenarien implementiert wurden?
Das ist schwierig zu beantworten, da diese Modelle noch in ihren Anfängen sind und wenig darüber bekannt ist, wie Unternehmen sie in realen Szenarien verwenden.
Welche Herausforderungen stellen sich typischerweise Unternehmen, wenn sie Zeitreihen-LMs in ihre bestehende Daten-Infrastruktur integrieren, und wie können sie diese überwinden?
Zeitreihen-LMs sind so neu, dass ich nicht weiß, welche spezifischen Herausforderungen Unternehmen dabei haben. Ich denke jedoch, dass sie dieselben Herausforderungen haben werden, die sie haben, wenn sie ein GenAI-Modell in ihre Daten-Pipeline integrieren. Diese Herausforderungen umfassen:
- Daten-Kompatibilitäts- und Integrationsprobleme: Zeitreihen-LMs erfordern oft spezifische Datenformate, konsistente Zeitstempel und regelmäßige Intervalle, aber die bestehende Daten-Infrastruktur kann unstrukturierte oder inkonsistente Zeitreihen-Daten enthalten, die über verschiedene Systeme verteilt sind, wie Legacy-Datenbanken, Cloud-Speicher oder Echtzeit-Streams. Um dies zu bewältigen, sollten Teams robuste ETL-Pipelines (Extract, Transform, Load) implementieren, um Zeitreihen-Daten vorzuverarbeiten, zu bereinigen und auszurichten.
- Modell-Skalierbarkeit und Leistung: Zeitreihen-LMs, insbesondere Deep-Learning-Modelle wie Transformer, können rechenintensiv sein und erfordern erhebliche Rechen- und Speicherressourcen, um große Mengen an Zeitreihen-Daten in Echtzeit oder nahezu Echtzeit zu verarbeiten. Dies erfordert, dass Teams Modelle auf skalierbaren Plattformen wie Kubernetes oder Cloud-gesteuerten ML-Diensten bereitstellen, GPU-Beschleunigung nutzen, wenn erforderlich, und verteilte Verarbeitungsframeworks wie Dask oder Ray verwenden, um Modell-Inferenz zu parallelisieren.
- Interpretierbarkeit und Vertrauenswürdigkeit: Zeitreihen-Modelle, insbesondere komplexe LMs, können als “Black-Boxen” angesehen werden, was es schwierig macht, Vorhersagen zu interpretieren. Dies kann insbesondere in regulierten Branchen wie Finanzen oder Gesundheitswesen problematisch sein.
- Daten-Sicherheit und -Privatsphäre: Die Verarbeitung von Zeitreihen-Daten beinhaltet oft sensible Informationen, wie IoT-Sensordaten oder Finanztransaktionsdaten, sodass die Gewährleistung der Daten-Sicherheit und -Privatsphäre bei der Integration von LMs kritisch ist. Unternehmen müssen sicherstellen, dass Daten-Pipelines und Modelle den besten Sicherheitspraktiken entsprechen, einschließlich Verschlüsselung und Zugriffskontrolle, und Modelle in sicheren, isolierten Umgebungen bereitstellen.
Wie sehen Sie die Rolle von Zeitreihen-LMs in der Zukunft in der Vorhersage-Analyse und KI?
Ein möglicher nächster Schritt in der Evolution von Zeitreihen-LMs könnte die Einführung von Tools sein, die es Benutzern ermöglichen, sie einfacher zu bereitstellen, zu verwenden und zu nutzen. Viele der Zeitreihen-LMs, die ich verwendet habe, erfordern sehr spezifische Umgebungen und haben nicht viele Tutorials und Dokumentationen. Letztendlich sind diese Projekte noch in ihren Anfängen, aber es wird aufregend sein, zu sehen, wie sie in den kommenden Monaten und Jahren evolvieren.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten InfluxData besuchen.












