Interviste

Anais Dotis-Georgiou, Developer Advocate di InfluxData – Serie di interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Anais Dotis-Georgiou è un Developer Advocate per InfluxData con una passione per rendere i dati belli utilizzando Data Analytics, AI e Machine Learning. Prende i dati che raccoglie, fa una miscela di ricerca, esplorazione e ingegneria per tradurre i dati in qualcosa di funzionale, di valore e di bellezza. Quando non è dietro uno schermo, la puoi trovare all’aperto a disegnare, a fare stretching, a fare skateboard o a inseguire una palla da calcio.

InfluxData è l’azienda che costruisce InfluxDB, il database di serie temporali open source utilizzato da oltre un milione di sviluppatori in tutto il mondo. La loro missione è aiutare gli sviluppatori a costruire sistemi intelligenti e in tempo reale con i loro dati di serie temporali.

Puoi condividere un po’ del tuo percorso da Assistente di ricerca a Lead Developer Advocate di InfluxData? Come ha influenzato il tuo background in data analytics e machine learning il tuo ruolo attuale?

Ho conseguito la laurea in ingegneria chimica con una specializzazione in ingegneria biomedica e ho lavorato in laboratori per lo sviluppo di vaccini e la rilevazione dell’autismo prenatale. Da lì, ho iniziato a programmare robot per la manipolazione di liquidi e ho aiutato gli scienziati dei dati a comprendere i parametri per la rilevazione delle anomalie, il che mi ha reso più interessato alla programmazione.

Poi sono diventata una rappresentante per lo sviluppo delle vendite presso Oracle (ORCL ) e ho capito che dovevo concentrarmi sulla codifica. Ho frequentato un corso di formazione per la codifica all’Università del Texas in data analytics e sono riuscita a entrare nel settore tecnologico, in particolare nelle relazioni con gli sviluppatori.

Vengo da un background tecnico, quindi questo ha aiutato a plasmare il mio ruolo attuale. Anche se non avevo esperienza di sviluppo, potevo relazionarmi ed empatizzare con le persone che avevano un background di ingegneria e mente tecnica, ma che stavano anche cercando di imparare software. Quindi, quando creavo contenuti o tutorial tecnici, potevo aiutare i nuovi utenti a superare le sfide tecniche, collocando la conversazione in un contesto che era rilevante e interessante per loro.

Il tuo lavoro sembra fondere creatività con competenze tecniche. Come incorpori la tua passione per rendere i dati “belli” nel tuo lavoro quotidiano presso InfluxData?

Ultimamente, mi sono concentrata più sull’ingegneria dei dati che sull’analisi dei dati. Anche se non mi concentro tanto sull’analisi dei dati come facevo in passato, adoro ancora la matematica – credo che la matematica sia bella e salterei all’occasione per spiegare la matematica dietro un algoritmo.

InfluxDB è stato un pilastro nello spazio dei dati di serie temporali. Come vedi l’influenza della comunità open source sullo sviluppo e l’evoluzione di InfluxDB?

InfluxData è molto impegnata nell’architettura dei dati aperti e nell’ecosistema Apache. L’anno scorso abbiamo annunciato InfluxDB 3.0, il nuovo core per InfluxDB scritto in Rust e costruito con Apache Flight, DataFusion, Arrow e Parquet – ciò che chiamiamo lo stack FDAP. Mentre gli ingegneri di InfluxData continuano a contribuire a quei progetti upstream, la comunità continua a crescere e l’insieme dei progetti Apache Arrow diventa più facile da usare con più funzionalità e funzionalità, e una maggiore interoperabilità.

Quali sono alcuni dei progetti open source più emozionanti o contributi che hai visto recentemente nel contesto dei dati di serie temporali e dell’AI?

È stato divertente vedere l’aggiunta di LLM riproposti o applicati ai dati di serie temporali per la previsione zero-shot. Autolab ha una raccolta di modelli linguistici di serie temporali aperti, e TimeGPT è un altro ottimo esempio.

Inoltre, varie librerie di elaborazione dei flussi di dati open source, tra cui Bytewax e Mage.ai, che consentono agli utenti di sfruttare e incorporare modelli da Hugging Face, sono abbastanza emozionanti.

Come fa InfluxData a garantire che le sue iniziative open source rimangano rilevanti e benefiche per la comunità degli sviluppatori, in particolare con i rapidi progressi nell’AI e nel machine learning?

Le iniziative di InfluxData rimangono rilevanti e benefiche concentrandosi sul contribuire a progetti open source che anche le aziende specifiche AI utilizzano. Ad esempio, ogni volta che InfluxDB contribuisce ad Apache Arrow, Parquet o DataFusion, ciò beneficia ogni altra tecnologia AI e azienda che li utilizza, tra cui Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace e molti altri.

I modelli linguistici di serie temporali stanno diventando sempre più vitali nell’analisi predittiva. Puoi spiegare come questi modelli stanno trasformando la previsione e la rilevazione delle anomalie dei dati di serie temporali?

I modelli linguistici di serie temporali superano i modelli lineari e statistici e forniscono anche la previsione zero-shot. Ciò significa che non è necessario addestrare il modello sui tuoi dati prima di utilizzarlo. Non c’è nemmeno bisogno di regolare un modello statistico, che richiede una profonda esperienza nella statistica dei dati di serie temporali.

Tuttavia, a differenza dell’elaborazione del linguaggio naturale, il campo dei dati di serie temporali manca di set di dati di grandi dimensioni accessibili pubblicamente. La maggior parte dei modelli pre-addestrati per i dati di serie temporali è stata addestrata su piccoli campioni, che contengono solo poche migliaia – o forse solo alcune centinaia – di campioni. Sebbene questi set di dati di riferimento siano stati strumentali nel progresso della comunità dei dati di serie temporali, le loro dimensioni di campione limitate e la mancanza di generalità rappresentano sfide per l’addestramento di modelli di apprendimento profondo.

Detto questo, credo che questo renda difficile trovare modelli linguistici di serie temporali open source. I TimesFM di Google (GOOGL ) e i Tiny Time Mixers di IBM sono stati addestrati su set di dati enormi con centinaia di miliardi di punti di dati. Con TimesFM, ad esempio, il processo di pre-addestramento viene eseguito utilizzando Google Cloud TPU v3-256, che consiste di 256 core TPU con un totale di 2 terabyte di memoria. Il processo di pre-addestramento richiede circa dieci giorni e produce un modello con 1,2 miliardi di parametri. Il modello pre-addestrato viene quindi regolato su compiti e set di dati specifici utilizzando una velocità di apprendimento più bassa e meno epoche.

Spero che questa trasformazione significhi che più persone possano effettuare previsioni accurate senza una profonda conoscenza del dominio. Tuttavia, richiede molto lavoro per valutare i pro e i contro dell’utilizzo di modelli computazionalmente costosi come i modelli linguistici di serie temporali da un punto di vista sia finanziario che ambientale.

Questo post del blog di Hugging Face fornisce un altro ottimo esempio di previsione dei dati di serie temporali.

Quali sono i vantaggi chiave dell’utilizzo dei modelli linguistici di serie temporali rispetto ai metodi tradizionali, in particolare per quanto riguarda la gestione di modelli complessi e le prestazioni zero-shot?

Il vantaggio critico è che non è necessario addestrare e riaddestrare un modello sui tuoi dati di serie temporali. Ciò elimina idealmente il problema dell’apprendimento automatico online di monitorare la deriva del modello e attivare la ri-trainazione, eliminando idealmente la complessità della tua pipeline di previsione.

Non è nemmeno necessario lottare per stimare le correlazioni tra serie o le relazioni per i modelli statistici multivariati. La varianza aggiuntiva aggiunta dalle stime spesso danneggia le previsioni risultanti e può far sì che il modello apprenda correlazioni spurie.

Puoi fornire alcuni esempi pratici di come modelli come TimesFM di Google, TinyTimeMixer di IBM e MOMENT di AutoLab siano stati implementati in scenari del mondo reale?

È difficile rispondere a questa domanda; poiché questi modelli sono ancora nella loro infanzia, poco si sa su come le aziende li utilizzano in scenari del mondo reale.

Nella tua esperienza, quali sfide affrontano generalmente le organizzazioni quando integrano i modelli linguistici di serie temporali nella loro infrastruttura di dati esistente, e come possono superarle?

I modelli linguistici di serie temporali sono così nuovi che non conosco le sfide specifiche che le organizzazioni affrontano. Tuttavia, immagino che affronteranno le stesse sfide che si verificano quando si incorpora qualsiasi modello di intelligenza generale nel proprio flusso di dati. Queste sfide includono:

  • Problemi di compatibilità e integrazione dei dati: i modelli linguistici di serie temporali richiedono spesso formati di dati specifici, timestamping coerente e intervalli regolari, ma l’infrastruttura di dati esistente potrebbe includere dati di serie temporali non strutturati o incoerenti diffusi in diversi sistemi, come database legacy, archiviazione cloud o flussi in tempo reale. Per affrontare questo, i team dovrebbero implementare pipeline ETL (estrazione, trasformazione, caricamento) robuste per pre-elaborare, pulire e allineare i dati di serie temporali.
  • Scalabilità e prestazioni del modello: i modelli linguistici di serie temporali, in particolare i modelli di apprendimento profondo come i trasformatori, possono essere intensivi in termini di risorse, richiedendo risorse di calcolo e memoria significative per elaborare grandi volumi di dati di serie temporali in tempo reale o quasi in tempo reale. Ciò richiederebbe ai team di distribuire modelli su piattaforme scalabili come Kubernetes o servizi di gestione ML cloud, sfruttare l’accelerazione GPU quando necessario e utilizzare framework di elaborazione distribuita come Dask o Ray per parallelizzare l’inferenza del modello.
  • Interpretazione e attendibilità: i modelli di serie temporali, in particolare i modelli linguistici complessi, possono essere visti come “scatole nere”, rendendo difficile interpretare le previsioni. Ciò può essere particolarmente problematico in settori regolamentati come finanza o sanità.
  • Privacy e sicurezza dei dati: la gestione dei dati di serie temporali spesso coinvolge informazioni sensibili, come dati dei sensori IoT o transazioni finanziarie, quindi assicurarsi della sicurezza dei dati e della conformità è fondamentale quando si integrano i modelli linguistici di serie temporali. Le organizzazioni devono assicurarsi che i flussi di dati e i modelli siano conformi alle migliori pratiche di sicurezza, compresa la crittografia e il controllo di accesso, e distribuire i modelli all’interno di ambienti isolati e sicuri.

Guardando avanti, come vedi l’evoluzione del ruolo dei modelli linguistici di serie temporali nel campo dell’analisi predittiva e dell’AI? Ci sono tendenze o tecnologie emergenti che ti emozionano in particolare?

Un possibile passo successivo nell’evoluzione dei modelli linguistici di serie temporali potrebbe essere l’introduzione di strumenti che consentano agli utenti di distribuire, accedere e utilizzare più facilmente questi modelli. Molti dei modelli linguistici di serie temporali che ho utilizzato richiedono ambienti molto specifici e mancano di una vasta gamma di tutorial e documentazione. Alla fine, questi progetti sono ancora nella loro infanzia, ma sarà emozionante vedere come evolveranno nei prossimi mesi e anni.

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare InfluxData.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.