Interviuri
Anais Dotis-Georgiou, Avocat Dezvoltator la InfluxData – Seria de Interviuri

Anais Dotis-Georgiou este Avocat Dezvoltator pentru InfluxData, cu o pasiune pentru a face datele frumoase prin utilizarea Analizei de Date, a Inteligenței Artificiale și a Învățării Automate. Ea ia datele pe care le colectează, face o combinație de cercetare, explorare și inginerie pentru a traduce datele în ceva de funcție, valoare și frumusețe. Când nu este în spatele unui ecran, o puteți găsi afară, desenând, întinzând, plutind sau alergând după o minge de fotbal.
InfluxData este compania care construiește InfluxDB, baza de date deschisă pentru serii de timp, utilizată de peste un milion de dezvoltatori din întreaga lume. Misiunea lor este de a ajuta dezvoltatorii să construiască sisteme inteligente și în timp real, cu datele lor din serii de timp.
Puteți să împărtășiți un pic despre drumul dvs. de la a fi asistent de cercetare la a deveni Avocat Dezvoltator Principal la InfluxData? Cum v-a influențat backgroundul dvs. în analiza de date și învățarea automată în rolul dvs. actual?
Am obținut diploma de licență în inginerie chimică, cu accent pe ingineria biomedicală și, în cele din urmă, am lucrat în laboratoare, efectuând dezvoltarea de vaccinuri și detectarea autismului prenatal. De acolo, am început să programez roboți de manipulare lichidă și am ajutat oamenii de știință să înțeleagă parametrii pentru detectarea anomaliilor, ceea ce m-a făcut să fiu mai interesat de programare.
Apoi, am devenit reprezentant de dezvoltare a vânzărilor la Oracle (ORCL ) și am realizat că trebuie să mă concentrez pe codare. Am urmat un curs de codare la Universitatea Texas, în analiza de date și am reușit să intru în tehnologie, în special în relațiile cu dezvoltatorii.
Venind dintr-un mediu tehnic, asta m-a ajutat să-mi conturez rolul actual. Deși nu aveam experiență de dezvoltare, puteam să mă raportez și să empatizez cu oamenii care aveau o pregătire inginerească și o minte tehnică, dar care încercau să învețe software. Așa că, atunci când am creat conținut sau tutoriale tehnice, am putut să ajut utilizatorii noi să depășească provocările tehnice, plasând conversația într-un context relevant și interesant pentru ei.
Lucrul dvs. pare să combine creativitatea cu expertiza tehnică. Cum integrați pasiunea dvs. pentru a face datele “frumoase” în munca dvs. de la InfluxData?
În ultima vreme, m-am concentrat mai mult pe ingineria datelor decât pe analiza de date. Deși nu mă axez pe analiza de date la fel de mult ca înainte, încă îmi place matematica – cred că matematica este frumoasă și voi sări la ocazia de a explica matematica din spatele unui algoritm.
InfluxDB a fost o piatră de temelie în spațiul datelor din serii de timp. Cum vedeți influența comunității deschise asupra dezvoltării și evoluției InfluxDB?
InfluxData este foarte dedicată arhitecturii de date deschise și ecosistemului Apache. Anul trecut am anunțat InfluxDB 3.0, noul nucleu pentru InfluxDB, scris în Rust și construit cu Apache Flight, DataFusion, Arrow și Parquet – ceea ce numim stiva FDAP. Pe măsură ce inginerii de la InfluxData continuă să contribuie la aceste proiecte upstream, comunitatea continuă să crească și setul de proiecte Apache Arrow devine mai ușor de utilizat, cu mai multe caracteristici și funcționalități, și o interoperabilitate mai largă.
Care sunt cele mai interesante proiecte deschise sau contribuții pe care le-ați văzut recent în contextul datelor din serii de timp și al inteligenței artificiale?
A fost interesant să văd adăugarea de modele de limbaj LLM, reutilizate sau aplicate pentru previziuni zero-shot. Autolab are o colecție de modele de limbaj deschise pentru serii de timp, iar TimeGPT este un alt exemplu excelent.
De asemenea, diverse biblioteci deschise de procesare a fluxurilor, inclusiv Bytewax și Mage.ai, care permit utilizatorilor să valorifice și să incorporeze modele de la Hugging Face, sunt destul de interesante.
Cum asigură InfluxData că inițiativelor sale deschise rămân relevante și benefice pentru comunitatea dezvoltatorilor, în special cu avansurile rapide în inteligența artificială și învățarea automată?
Inițiativelor InfluxData rămân relevante și benefice prin contribuția la proiecte deschise pe care și companiile de inteligență artificială le valorifică. De exemplu, de fiecare dată când InfluxDB contribuie la Apache Arrow, Parquet sau DataFusion, beneficiază toate celelalte tehnologii și companii care le valorifică, inclusiv Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace și multe altele.
Modelele de limbaj pentru serii de timp devin din ce în ce mai vitale în analiza predictivă. Puteți să explicați cum aceste modele transformă previziunile și detectarea anomaliilor pentru serii de timp?
Modelele de limbaj pentru serii de timp depășesc modelele liniare și statistice, oferind previziuni zero-shot. Acest lucru înseamnă că nu trebuie să antrenați modelul pe datele dvs. înainte de a-l utiliza. Nu este nevoie să reglați un model statistic, care necesită o expertiză profundă în statistica seriilor de timp.
Cu toate acestea, spre deosebire de procesarea limbajului natural, domeniul seriilor de timp lipsesc seturi de date mari și accesibile public. Cele mai multe modele pre-antrenate pentru serii de timp sunt antrenate pe dimensiuni mici de eșantioane, care conțin doar câteva mii – sau poate chiar sute – de eșantioane. Deși aceste seturi de date de referință au fost instrumentale în progresul comunității seriilor de timp, dimensiunile lor mici și lipsa de generalitate prezintă provocări pentru antrenarea modelelor de învățare automată.
Acesta este ceea ce cred că face ca modelele de limbaj deschise pentru serii de timp să fie greu de găsit. Modelul TimesFM de la Google (GOOGL ) și Tiny Time Mixers de la IBM au fost antrenate pe seturi de date masive, cu sute de miliarde de puncte de date. Cu TimesFM, de exemplu, procesul de pre-antrenare se face utilizând Google Cloud TPU v3–256, care constă în 256 de nuclee TPU, cu un total de 2 terabytes de memorie. Procesul de pre-antrenare durează aproximativ zece zile și rezultă într-un model cu 1,2 miliarde de parametri. Modelul pre-antrenat este apoi reglat pe sarcini specifice și seturi de date, utilizând o rată de învățare mai mică și mai puține epoci.
Sper că această transformare înseamnă că mai multe persoane pot face previziuni precise fără o expertiză profundă în domeniu. Cu toate acestea, necesită multă muncă pentru a cântări avantaje și dezavantaje ale utilizării unor modele computațional scumpe, cum ar fi modelele de limbaj pentru serii de timp, din punct de vedere financiar și de mediu.
Acest articol de blog Hugging Face prezintă un alt exemplu excelent de previziune pentru serii de timp.
Care sunt avantajele cheie ale utilizării modelelor de limbaj pentru serii de timp, în special în ceea ce privește gestionarea modelelor complexe și performanța zero-shot?
Avantajul critic este acela că nu trebuie să antrenați și să reantrenați un model pe datele dvs. din serii de timp. Acest lucru elimină, sper, problema învățării online a monitorizării modelului și a declanșării reantrenării, ideal eliminând complexitatea pipeline-ului de previziune.
Nu trebuie să vă luptați pentru a estima corelațiile sau relațiile între serii de timp pentru modelele statistice multivariate. Variația suplimentară adăugată de estimări adesea dăunează previziunilor rezultate și poate face ca modelul să învețe corelații spurii.
Puteți să oferiți exemple practice despre cum au fost implementate modele precum TimesFM de la Google, TinyTimeMixer de la IBM și MOMENT de la AutoLab în scenarii din lumea reală?
Acest lucru este dificil de răspuns; deoarece aceste modele sunt în stadii relative de început, puțin se știe despre cum le utilizează companiile în scenarii din lumea reală.
În experiența dvs., care sunt provocările pe care le întâmpină, de obicei, organizațiile atunci când integrează modele de limbaj pentru serii de timp în infrastructura de date existentă și cum le pot depăși?
Modelele de limbaj pentru serii de timp sunt atât de noi, încât nu știu care sunt provocările specifice pe care le întâmpină organizațiile. Cu toate acestea, îmi imaginez că vor confrunta aceleași provocări cu care se confruntă atunci când incorporează orice model de inteligență artificială în pipeline-ul de date. Aceste provocări includ:
- Probleme de compatibilitate și integrare a datelor: Modelele de limbaj pentru serii de timp necesită adesea formate de date specifice, timestamp-uri consistente și intervale regulate, dar infrastructura de date existentă poate include date din serii de timp nestructurate sau inconsistente, răspândite în diferite sisteme, cum ar fi baze de date legacy, stocare în cloud sau fluxuri în timp real. Pentru a aborda această problemă, echipele ar trebui să implementeze pipeline-uri robuste de ETL (extragere, transformare, încărcare) pentru a preprocesa, curăța și alinia datele din serii de timp.
- Scalabilitate și performanță a modelului: Modelele de limbaj pentru serii de timp, în special modelele de învățare automată, cum ar fi transformatorii, pot fi intensiv computațional, necesitând resurse semnificative de calcul și memorie pentru a procesa volume mari de date din serii de timp în timp real sau aproape de timp real. Acest lucru necesită ca echipele să deployeze modele pe platforme scalabile, cum ar fi Kubernetes sau servicii de machine learning gestionate în cloud, să valorifice accelerarea GPU atunci când este necesar și să utilizeze cadre de procesare distribuită, cum ar fi Dask sau Ray, pentru a paraleliza inferența modelului.
- Interpretabilitate și încredere: Modelele de limbaj pentru serii de timp, în special modelele complexe, pot fi văzute ca “cutii negre”, făcând dificilă interpretarea previziunilor. Acest lucru poate fi deosebit de problematic în industrii reglementate, cum ar fi finanțele sau sănătatea.
- Confidențialitate și securitate a datelor: Manipularea datelor din serii de timp implică adesea informații sensibile, cum ar fi date de la senzori IoT sau tranzacții financiare, astfel încât asigurarea securității și conformității datelor este crucială atunci când se integrează modele de limbaj pentru serii de timp. Organizațiile trebuie să asigure că pipeline-urile și modelele de date respectă cele mai bune practici de securitate, inclusiv criptarea și controlul accesului, și să deployeze modele în medii izolate și securizate.
Privind spre viitor, cum vă imaginați evoluția rolului modelelor de limbaj pentru serii de timp în domeniul analizei predictive și al inteligenței artificiale? Există tendințe sau tehnologii emergente care vă entuziasmează în mod special?
Un pas posibil următor în evoluția modelelor de limbaj pentru serii de timp ar putea fi introducerea unor instrumente care să permită utilizatorilor să le deployeze, să le acceseze și să le utilizeze mai ușor. Multe dintre modelele de limbaj pentru serii de timp pe care le-am utilizat necesită medii foarte specifice și lipsesc o varietate de tutoriale și documentație. În cele din urmă, aceste proiecte sunt în stadii incipiente, dar va fi interesant să vedem cum evoluează în lunile și anii următori.
Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre InfluxData ar trebui să viziteze InfluxData.












