Wywiady
Anais Dotis-Georgiou, Developer Advocate w firmie InfluxData – seria wywiadów

Anais Dotis-Georgiou jest Developer Advocate w firmie InfluxData, z pasją do tworzenia pięknych danych za pomocą Data Analytics, AI i Machine Learning. Zbiera dane, które następnie przetwarza, prowadzi badania, eksplorację i inżynierię, aby przetłumaczyć je na coś funkcjonalnego, wartościowego i pięknego. Kiedy nie siedzi przed ekranem, można ją znaleźć na zewnątrz, rysując, rozciągając, jeżdżąc na desce lub goniąc za piłką nożną.
InfluxData to firma budująca InfluxDB, otwarty czasowy serwer bazy danych używany przez ponad milion deweloperów na całym świecie. Ich misją jest pomoc deweloperom w tworzeniu inteligentnych, czasowych systemów z ich danymi szeregu czasowego.
Czy możesz opowiedzieć trochę o swojej drodze od asystenta badawczego do Lead Developer Advocate w InfluxData? Jak Twoje doświadczenie w dziedzinie analizy danych i machine learning wpłynęło na Twoją obecną rolę?
Ukończyłam studia licencjackie na kierunku inżynierii chemicznej ze specjalizacją w inżynierii biomedycznej i ostatecznie pracowałam w laboratoriach, zajmując się rozwojem szczepionek i wykrywaniem autyzmu u dzieci. Następnie zaczęłam programować roboty do manipulacji cieczami i pomagałam naukowcom zrozumieć parametry wykrywania anomalii, co zainteresowało mnie programowaniem.
Później zostałam przedstawicielem ds. rozwoju sprzedaży w firmie Oracle (ORCL ) i zrozumiałam, że muszę się skoncentrować na kodowaniu. Ukończyłam boot camp z analizy danych na Uniwersytecie Teksasu i udało mi się wejść do branży technologicznej, konkretnie do relacji z deweloperami.
Pochodzę z technicznego tła, co pomogło mi w mojej obecnej roli. Chociaż nie miałam doświadczenia w deweloperce, mogłam się utożsamiać z ludźmi, którzy mieli tło inżynierskie i starali się nauczyć oprogramowania. Kiedy tworzyłam treści lub tutoriale techniczne, mogłam pomóc nowym użytkownikom pokonać techniczne wyzwania, umieszczając rozmowę w kontekście, który był dla nich istotny i interesujący.
Twoja praca wydaje się łączyć kreatywność z ekspertyzą techniczną. Jak włączasz swoją pasję do tworzenia “pięknych” danych w swoją codzienną pracę w InfluxData?
Ostatnio bardziej skupiłam się na inżynierii danych niż na analizie danych. Chociaż nie zajmuję się już tak bardzo analizą danych, jak kiedyś, nadal bardzo lubię matematykę – uważam, że matematyka jest piękna, i skacze na okazję, aby wyjaśnić matematykę za algorytmem.
InfluxDB jest kamieniem węgielnym w przestrzeni danych szeregu czasowego. Jak widzisz wpływ społeczności open source na rozwój i ewolucję InfluxDB?
InfluxData jest bardzo zaangażowana w otwartą architekturę danych i ekosystem Apache. W zeszłym roku ogłosiliśmy InfluxDB 3.0, nowe rdzenie dla InfluxDB napisane w Rust i zbudowane z Apache Flight, DataFusion, Arrow i Parquet – co nazywamy stosem FDAP. Podczas gdy inżynierowie w InfluxData kontynuują wkład w te projekty upstream, społeczność rośnie, a projekty Apache Arrow stają się łatwiejsze w użyciu, z większą ilością funkcji i interoperacyjnością.
Jakie są najbardziej interesujące projekty open-source lub wkłady, które widziałaś ostatnio w kontekście danych szeregu czasowego i AI?
Było fajnie zobaczyć dodanie modeli LLM, które są wykorzystywane lub stosowane do danych szeregu czasowego do prognozowania zero-shot. Autolab ma kolekcję otwartych modeli językowych szeregu czasowego, a TimeGPT to kolejny świetny przykład.
Ponadto, różne otwarte biblioteki przetwarzania strumieniowego, w tym Bytewax i Mage.ai, które pozwalają użytkownikom wykorzystywać i integrować modele z Hugging Face, są bardzo interesujące.
Jak InfluxData zapewnia, że jej inicjatywy open source pozostają istotne i korzystne dla społeczności deweloperów, zwłaszcza w kontekście szybkiego postępu w AI i machine learning?
Inicjatywy InfluxData pozostają istotne i korzystne, koncentrując się na wkładzie w projekty open source, z których korzystają również firmy związane z AI. Na przykład, każdy raz, gdy InfluxDB wkłada się w Apache Arrow, Parquet lub DataFusion, korzyści czerpią z tego wszystkie inne technologie AI i firmy, które je wykorzystują, w tym Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace i wiele innych.
Czy możesz wyjaśnić, jak modele językowe szeregu czasowego przekształcają się w prognozowaniu i wykrywaniu anomalii?
Modele LLM szeregu czasowego przewyższają liniowe i statystyczne modele, a także zapewniają prognozowanie zero-shot. Oznacza to, że nie musisz trenować modelu na Twoich danych, zanim go użyjesz. Nie musisz również dostosowywać statystycznego modelu, co wymaga głębokiej wiedzy na temat statystyki szeregu czasowego.
Jednak w przeciwieństwie do przetwarzania języka naturalnego, pole danych szeregu czasowego brakuje publicznie dostępnych, dużych zbiorów danych. Większość istniejących, wstępnie wytrenowanych modeli dla danych szeregu czasowego jest trenowana na małych próbkach, które zawierają tylko kilka tysięcy – lub może nawet kilkaset – próbek. Chociaż te zestawy danych były bardzo ważne dla postępu społeczności szeregu czasowego, ich ograniczona ilość próbek i brak ogólności stanowią wyzwania dla wstępnego trenowania głębokich modeli uczenia.
To, co uważam, że sprawia, że otwarte modele LLM szeregu czasowego są trudne do znalezienia. Modele Google (GOOGL ) TimesFM i IBM Tiny Time Mixers zostały wytrenowane na ogromnych zbiorach danych z setkami miliardów punktów danych. Z modelem TimesFM, na przykład, proces wstępnego trenowania odbywa się przy użyciu Google Cloud TPU v3–256, który składa się z 256 rdzeni TPU z łączną ilością 2 terabajtów pamięci. Proces wstępnego trenowania trwa około dziesięciu dni i wynikiem jest model z 1,2 miliarda parametrów. Wstępnie wytrenowany model jest następnie dostosowywany do konkretnych zadań i zbiorów danych przy użyciu niższej stopy uczenia i mniej epok.
Mam nadzieję, że ta transformacja oznacza, że więcej ludzi będzie mogło dokonywać dokładnych prognoz bez głębokiej wiedzy na temat dziedziny. Jednak wymaga to wiele pracy, aby zważyć zalety i wady korzystania z kosztownych obliczeniowo modeli, takich jak LLM szeregu czasowego, zarówno z punktu widzenia finansowego, jak i środowiskowego.
Ten post na blogu Hugging Face zawiera kolejny świetny przykład prognozowania szeregu czasowego.
Jakie są kluczowe zalety korzystania z modeli LLM szeregu czasowego w porównaniu z tradycyjnymi metodami, zwłaszcza w odniesieniu do radzenia sobie z złożonymi wzorcami i prognozowaniem zero-shot?
Kluczową zaletą jest to, że nie musisz trenować i trenować modelu na Twoich danych szeregu czasowego. To, mam nadzieję, eliminuje problem monitorowania modelu i wyzwalania ponownego trenowania, idealnie eliminując złożoność Twojego potoku prognozowania.
Nie musisz również zmagać się z oszacowaniem korelacji między seriami lub relacjami dla modeli statystycznych wielowymiarowych. Dodatkowa wariancja dodana przez szacunki często szkodzi wynikowym prognozom i może powodować, że model uczy się fałszywych korelacji.
Czy możesz podać kilka praktycznych przykładów, jak modele takie jak Google TimesFM, IBM TinyTimeMixer i Autolab MOMENT zostały zaimplementowane w rzeczywistych scenariuszach?
To jest trudne do odpowiedzi; ponieważ te modele są w swoim relatywnym dzieciństwie, niewiele wiadomo o tym, jak firmy je wykorzystują w rzeczywistych scenariuszach.
W Twoim doświadczeniu, jakie wyzwania organizacje zwykle napotykają na przy integrowaniu modeli LLM szeregu czasowego do ich istniejącej infrastruktury danych, i jak mogą im przeciwdziałać?
Modele LLM szeregu czasowego są tak nowe, że nie znam konkretnych wyzwań, których organizacje doświadczają. Jednak wyobrażam sobie, że będą one stawać przed tymi samymi wyzwaniami, które pojawiają się przy włączaniu modeli GenAI do potoku danych. Te wyzwania obejmują:
- Problemy zgodności i integracji danych: Modele LLM szeregu czasowego często wymagają konkretnych formatów danych, spójnego znacznika czasu i regularnych interwałów, ale istniejąca infrastruktura danych może zawierać nieustrukturyzowane lub niezgodne dane szeregu czasowego, rozproszone w różnych systemach, takich jak bazy danych, magazynowanie w chmurze lub strumienie w czasie rzeczywistym. Aby rozwiązać ten problem, zespoły powinny wdrożyć solidne potoki ETL (extract, transform, load) w celu wstępnego przetworzenia, oczyszczenia i wyrównania danych szeregu czasowego.
- Skalowalność i wydajność modelu: Modele LLM szeregu czasowego, zwłaszcza głębokie modele uczenia, takie jak transformery, mogą być zasobożerne, wymagając znacznych zasobów obliczeniowych, aby przetworzyć duże ilości danych szeregu czasowego w czasie rzeczywistym lub bliskim czasowi rzeczywistemu. To wymagałoby od zespołów wdrożenia modeli na skalowalnych platformach, takich jak Kubernetes lub usługi zarządzanej ML w chmurze, wykorzystania przyspieszenia GPU, gdy jest to potrzebne, oraz wykorzystania ramowych procesów rozproszonych, takich jak Dask lub Ray, do równoległego przetwarzania modelu.
- Interpretowalność i zaufanie: Modele szeregu czasowego, zwłaszcza złożone LLM, mogą być postrzegane jako “czarne skrzynki”, co utrudnia interpretację prognoz. To może być szczególnie problematyczne w regulowanych branżach, takich jak finanse lub opieka zdrowotna.
- Bezpieczeństwo i prywatność danych: Obsługa danych szeregu czasowego często wiąże się z wrażliwymi informacjami, takimi jak dane z czujników IoT lub transakcje finansowe, więc zapewnienie bezpieczeństwa danych i zgodności jest kluczowe przy integrowaniu LLM. Organizacje muszą zapewnić, że potoki danych i modele są zgodne z najlepszymi praktykami bezpieczeństwa, w tym szyfrowaniem i kontrolą dostępu, oraz wdrożyć modele w bezpiecznych, izolowanych środowiskach.
Spójrzając w przyszłość, jak widzisz ewolucję roli modeli LLM szeregu czasowego w dziedzinie analizy predykcyjnej i AI? Czy są jakieś nowe trendy lub technologie, które szczególnie Cię ekscytują?
Możliwym następnym krokiem w ewolucji modeli LLM szeregu czasowego może być wprowadzenie narzędzi, które umożliwią użytkownikom łatwiejsze wdrożenie, dostęp i korzystanie z nich. Wiele modeli LLM szeregu czasowego, które używałam, wymagało bardzo specyficznych środowisk i brakowało im szerokiej gamy tutoriale i dokumentacji. Ostatecznie, te projekty są w swoich wczesnych stadiach, ale będzie ekscytujące zobaczyć, jak będą ewoluować w nadchodzących miesiącach i latach.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić InfluxData.












