Rozhovory

Anais Dotis-Georgiou, Developer Advocate v InfluxData – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Anais Dotis-Georgiou je Developer Advocate pro InfluxData s vášní pro vytváření krásných dat pomocí datové analýzy, umělé inteligence a strojového učení. Sbírá data, provádí výzkum, exploraci a inženýrství, aby data přetvořila na něco funkčního, hodnotného a krásného. Když není za obrazovkou, můžete ji najít venku, jak kreslí, protahuje se, jezdí na prkně nebo honí fotbalový míč.

InfluxData je společnost, která buduje InfluxDB, open source časovou databázi, kterou používá více než milion vývojářů po celém světě. Jejich mise je pomoci vývojářům budovat inteligentní, reálné systémy se svými časovými daty.

Můžete nám říct něco o své cestě od výzkumného asistenta k vedoucímu Developer Advocate v InfluxData? Jak vám vaše zkušenosti s datovou analýzou a strojovým učením pomohly ve vaší současné roli?

Dosáhla jsem bakalářského titulu v chemickém inženýrství se zaměřením na biomedicínské inženýrství a nakonec pracovala v laboratořích, kde se vyvíjely vakcíny a detekovaly prenatální autismus. Odtud jsem začala programovat roboty pro manipulaci s kapalinami a pomáhala datovým vědcům pochopit parametry pro detekci anomálií, což mě více zajímalo o programování.

Pak jsem se stala sales development representative v Oracle (ORCL ) a uvědomila jsem si, že musím se zaměřit na kódování. Absolvovala jsem kurz programování na University of Texas v datové analýze a podařilo se mi proniknout do technologií, konkrétně do developer relations.

Pocházím z technického prostředí, takže to mi pomohlo ve své současné roli. Ačkoli jsem neměla zkušenosti s vývojem, mohla jsem se ztotožnit a vcítit se do lidí, kteří měli technické zázemí a mysl, ale také se učili software. Když jsem vytvářela obsah nebo technické tutoriály, mohla jsem pomoci novým uživatelům překonat technické výzvy a umístit konverzaci do kontextu, který byl relevantní a zajímavý pro ně.

Vaše práce zdá se spojuje kreativitu s technickou odborností. Jak začleňujete svou vášeň pro vytváření krásných dat do své denní práce v InfluxData?

Nedávno jsem se více zaměřila na inženýrství dat než na datovou analýzu. Ačkoli jsem se tolik nezaměřovala na datovou analýzu, jako dříve, stále mám ráda matematiku – myslím, že matematika je krásná, a ráda bych vysvětlila matematiku za algoritmem.

InfluxDB je kamenem úlomkem v oblasti časových dat. Jak vidíte vliv open source komunity na vývoj a evoluci InfluxDB?

InfluxData je velmi zavázána k otevřené datové architektuře a ekosystému Apache. Minulý rok jsme oznámili InfluxDB 3.0, nový jádro pro InfluxDB napsané v Rustu a postavené na Apache Flight, DataFusion, Arrow a Parquet – co nazýváme FDAP stack. Jak inženýři v InfluxData pokračují ve přispívání k těmto projektům, komunita pokračuje v růstu a Apache Arrow sada projektů se stává snazší na použití s více funkcemi a funkcionalitou a širší interoperabilitou.

Jaké jsou některé z nejzajímavějších open-source projektů nebo příspěvků, které jste viděla nedávno v kontextu časových dat a umělé inteligence?

Bylo zajímavé vidět přidání LLM, které jsou repurposed nebo aplikovány na časová data pro zero-shot forecasting. Autolab má kolekci open time series language modelů a TimeGPT je další skvělý příklad.

Kromě toho jsou různé open source stream processing knihovny, včetně Bytewax a Mage.ai, které umožňují uživatelům využít a začlenit modely z Hugging Face, velmi zajímavé.

Jak InfluxData zajišťuje, aby její open source iniciativy zůstaly relevantní a prospěšné pro vývojářskou komunitu, zejména s rychlým rozvojem umělé inteligence a strojového učení?

Iniciativy InfluxData zůstávají relevantní a prospěšné tím, že se zaměřují na přispívání k open source projektům, které využívají i AI-specifické společnosti. Například každý příspěvek InfluxDB k Apache Arrow, Parquet nebo DataFusion prospěje každé jiné AI technologie a společnosti, které je využívají, včetně Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace a dalších.

Časová řada jazykových modelů se stává stále důležitější v prediktivní analýze. Můžete vysvětlit, jak tyto modely transformují časovou řadu forecasting a detekci anomálií?

Časová řada LMs překonává lineární a statistické modely a také poskytuje zero-shot forecasting. To znamená, že nemusíte trénovat model na vašich datech předtím, než jej použijete. Nemusíte také ladit statistický model, který vyžaduje hluboké znalosti časové řady statistiky.

Jedná se o to, že časová řada LMs je stále v raném stádiu a chybí jim dostatečné množství veřejně dostupných velkých datových sad. Většina existujících předtrénovaných modelů pro časová data je trénována na malých vzorcích, které obsahují pouze několik tisíc – nebo možná dokonce několik set – vzorků. Ačkoli tyto benchmark datové sady byly sehrály důležitou roli v pokroku časové řady komunity, jejich omezené velikosti vzorků a nedostatečná obecnost představují výzvy pro předtrénování hlubokých učících se modelů.

To je to, co si myslím, že dělá open source časová řada LMs těžko dostupné. Google (GOOGL ) TimesFM a IBM Tiny Time Mixers byly trénovány na masivních datech s miliardami datových bodů. S TimesFM, například, je předtrénovací proces proveden pomocí Google Cloud TPU v3-256, který se skládá z 256 TPU jader s celkovou kapacitou 2 terabytů paměti. Předtrénovací proces trvá přibližně deset dní a vede k modelu s 1,2 miliardami parametrů. Předtrénovaný model je pak fine-tuned na konkrétní downstream úkoly a datové sady pomocí nižšího učení a méně epoch.

Doufám, že tato transformace znamená, že více lidí bude moci dělat přesné předpovědi bez hlubokých znalostí domény. Nicméně, vyžaduje to hodně práce, aby se vyvážily výhody a nevýhody využívání výpočetně náročných modelů, jako jsou časová řada LMs, z finančního a environmentálního hlediska.

Tento Hugging Face Blog post detailně popisuje další skvělý příklad časového forecasting.

Jaké jsou klíčové výhody používání časové řady LMs oproti tradičním metodám, zejména z hlediska zvládání složitých vzorců a zero-shot výkonu?

Kritická výhoda spočívá v tom, že nemusíte trénovat a re-trénovat model na vašich časových datech. To by mělo eliminovat online strojové učení problém monitorování modelu driftu a spouštění re-trénování, ideálně eliminuje složitost vašeho forecasting pipeline.

Nemusíte se také snažit odhadnout cross-series korelace nebo vztahy pro multivariate statistické modely. Další variance přidána odhady často poškozuje výsledné předpovědi a může způsobit, že model naučí se falešné korelace.

Můžete poskytnout einige praktické příklady, jak jsou modely, jako Google TimesFM, IBM TinyTimeMixer a AutoLab MOMENT, implementovány v reálných scénářích?

Toto je obtížné odpovědět; protože tyto modely jsou ve své relativní dětství, málo se ví o tom, jak je společnosti využívají v reálných scénářích.

Vaše zkušenosti, jaké výzvy společnosti obvykle čelí při integraci časové řady LMs do své stávající datové infrastruktury, a jak je mohou překonat?

Časová řada LMs jsou tak nové, že neznám konkrétní výzvy, kterým společnosti čelí. Nicméně, předpokládám, že budou čelit stejným výzvám, kterým čelí při začleňování jakýchkoli GenAI modelů do své datové pipeline. Tyto výzvy zahrnují:

  • Problémy s kompatibilitou a integrací dat: Časová řada LMs často vyžadují specifické formáty dat, konzistentní timestamping a pravidelné intervaly, ale stávající datové infrastruktury mohou zahrnovat nestrukturovaná nebo nekonzistentní časová data rozptýlená napříč různými systémy, jako jsou legacy databáze, cloud úložiště nebo reálné toky. Aby se tomu zabránilo, týmy by měly implementovat robustní ETL (extract, transform, load) pipeline pro předzpracování, čištění a zarovnávání časových dat.
  • Škálovatelnost a výkon modelu: Časová řada LMs, zejména hluboké učící se modely, jako jsou transforméry, mohou být náročné na zdroje, vyžadují významné výpočetní a paměťové zdroje pro zpracování velkých objemů časových dat v reálném čase nebo near-reálném čase. To by vyžadovalo, aby týmy nasadily modely na škálovatelné platformy, jako je Kubernetes nebo cloud-managed ML služby, využily akceleraci GPU, když je to potřeba, a využily distribuované zpracování frameworky, jako je Dask nebo Ray, aby paralelizovaly model inference.
  • Interpretovatelnost a důvěryhodnost: Časová řada modely, zejména komplexní LMs, mohou být považovány za “černé skříňky”, což může být problematické, zejména v regulovaných odvětvích, jako je finance nebo zdravotnictví.
  • Zabezpečení a ochrana dat: Zpracování časových dat často zahrnuje citlivé informace, jako jsou IoT senzorová data nebo finanční transakční data, takže zajištění zabezpečení a souladu s předpisy je kritické při integraci LMs. Organizace musí zajistit, aby datové pipeline a modely splňovaly nejlepší bezpečnostní postupy, včetně šifrování a přístupového řízení, a nasadily modely v bezpečných, izolovaných prostředích.

Pohledem do budoucna, jak vidíte roli časové řady LMs v oblasti prediktivní analýzy a umělé inteligence? Existují nějaké vznikající trendy nebo technologie, které vás zvláště zajímají?

Možným dalším krokem v evoluci časové řady LMs by mohlo být zavedení nástrojů, které umožňují uživatelům nasadit, získat přístup a použít je snáze. Mnoho časové řady LMs, které jsem použila, vyžadují velmi specifické prostředí a chybí jim šířka tutoriálů a dokumentace. Ultimately, tyto projekty jsou ve svých raných fázích, ale bude zajímavé sledovat, jak se budou vyvíjet v nadcházejících měsících a letech.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit InfluxData.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.