Інтерв’ю

Анаїс Дотіс-Джорджіу, Developer Advocate в InfluxData – Інтерв’ю Серія

mm
Додайте Unite.AI до бажаних джерел у Google

Анаїс Дотіс-Джорджіу – Developer Advocate в InfluxData з пристрастю до створення красивих даних за допомогою даних аналітики, штучного інтелекту та машинного навчання. Вона бере дані, які вона збирає, робить їх сумішшю досліджень, дослідження та інженерії, щоб перекласти дані в щось корисне, цінне та красиве. Коли вона не за екраном, її можна знайти на вулиці, де вона малює, розтягується, катается на дошці або гонить за м’ячем.

InfluxData – це компанія, яка будує InfluxDB, відкриту часову базу даних, яку використовують понад мільйон розробників по всьому світу. Їхня місія – допомогти розробникам створювати інтелектуальні, реальні системи з їхніми часовими даними.

Чи можете Ви розповісти про свій шлях від дослідницького асистента до лідера Developer Advocate в InfluxData? Як Ваш досвід у сфері даних аналітики та машинного навчання вплинув на Вашу поточну роль?

Я здобула ступінь бакалавра хімічної інженерії з фокусом на біомедичній інженерії та згодом працювала в лабораторіях, де проводила розробку вакцин та виявлення аутизму у дітей. Потім я почала програмувати роботів для обробки рідин та допомагала вченим зрозуміти параметри для виявлення аномалій, що зробило мене більш зацікавленою у програмуванні.

Потім я стала представником відділу продажів в Oracle (ORCL ) та зрозуміла, що мені потрібно зосередитися на програмуванні. Я пройшла курс програмування в Університеті Техасу з даних аналітики та змогла увійти в сферу технологій, зокрема у сфері розробки програм.

Я походила з технічного середовища, тому це допомогло сформувати мою поточну роль. Хоча у мене не було досвіду розробки, я могла співчувати людям, які мали інженерний досвід та розум, але також намагалися вивчити програмування. Тому, коли я створювала контент чи технічні навчальні матеріали, я могла допомогти новим користувачам подолати технічні труднощі, розмістивши розмову в контексті, який був актуальним та цікавим для них.

Ваша робота здається поєднанням творчості з технічною експертизою. Як Ви вплітаєте свій інтерес до створення “красивих” даних у свою повсякденну роботу в InfluxData?

Останнім часом я більше зосереджена на інженерії даних, ніж на даних аналітиці. Хоча я не зосереджуюся на даних аналітиці так сильно, як раніше, я все ще дуже люблю математику – я вважаю математику красивою та з радістю поясню математичні основи алгоритмів.

InfluxDB став одним з основних елементів у сфері часу ряду даних. Як Ви бачите вплив відкритої спільноти на розвиток та еволюцію InfluxDB?

InfluxData дуже прив’язана до відкритої архітектури даних та екосистеми Apache. У минулому році ми оголосили про InfluxDB 3.0, нове ядро для InfluxDB, написане на мові Rust та побудоване з використанням Apache Flight, DataFusion, Arrow та Parquet – те, що ми називаємо стеком FDAP. Коли інженери InfluxData продовжують внесок у ці апстрім-проекти, спільнота продовжує розвиватися, а набір проектів Apache Arrow стає легшим у використанні з більшою кількістю функцій та можливостей, а також ширшою сумісністю.

Які з відкритих проектів чи внесків Ви бачите найбільш цікавими у сфері часу ряду даних та штучного інтелекту?

Це було цікаво побачити, як додалися моделі LLM, які можна застосувати до часу ряду для прогнозування з нуля. Autolab має колекцію відкритих моделей часу ряду мови, а TimeGPT – ще один гарний приклад.

Крім того, різні відкриті бібліотеки обробки потоків даних, включаючи Bytewax та Mage.ai, які дозволяють користувачам використовувати та включати моделі з Hugging Face, досить цікаві.

Як InfluxData забезпечує актуальність та користь своїх відкритих ініціатив для спільноти розробників, особливо з урахуванням швидкого розвитку штучного інтелекту та машинного навчання?

Ініціативи InfluxData залишаються актуальними та корисними, зосереджуючись на внеску у відкриті проекти, які також використовуються компаніями, орієнтованими на штучний інтелект. Наприклад, кожен раз, коли InfluxDB вносить свій внесок у Apache Arrow, Parquet чи DataFusion, це приносить користь кожній іншій компанії, яка використовує ці технології, включаючи Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace та інші.

Часові ряди мовних моделей стають дедалі важливішими у прогнозувальній аналітиці. Чи можете Ви розповісти про те, як ці моделі трансформують прогнозування часу ряду та виявлення аномалій?

Моделі часу ряду мовних моделей перевершують лінійні та статистичні моделі, а також забезпечують прогнозування з нуля. Це означає, що вам не потрібно тренувати модель на ваших даних перед тим, як використовувати її. Також немає потреби налаштовувати статистичну модель, яка вимагає глибокого досвіду у сфері часу ряду статистики.

Однак, на відміну від обробки природної мови, у сфері часу ряду бракує публічно доступних великомасштабних наборів даних. Більшість існуючих попередньо тренованих моделей для часу ряду тренуються на малих вибірках, які містять лише кілька тисяч – або навіть сотень – зразків. Хоча ці бенчмаркові набори даних були інструментальними у прогресі спільноти часу ряду, їх обмежені розміри вибірок та брак загальності створюють проблеми для попереднього тренування глибоких моделей машинного навчання.

Це, на мою думку, робить відкриті часові ряди мовних моделей важкими для пошуку. Моделі Google (GOOGL ) TimesFM та IBM Tiny Time Mixers були треновані на величезних наборах даних з сотнями мільярдів даних. З TimesFM, наприклад, процес попереднього тренування проводиться за допомогою Google Cloud TPU v3–256, який складається з 256 ядер TPU з загальним об’ємом пам’яті 2 терабайти. Процес попереднього тренування триває близько десяти днів та результатом є модель з 1,2 мільярдами параметрів. Передтренована модель потім налаштовується на конкретні завдання та набори даних за допомогою нижчої швидкості навчання та меншої кількості епох.

Надіяється, що ця трансформація означає, що більше людей зможуть робити точні прогнози без глибокого досвіду у сфері. Однак це вимагає багато роботи, щоб зважити за та проти використання обчислювально дорогих моделей, таких як часові ряди мовних моделей, з фінансової та екологічної точки зору.

Цей пост на блозі Hugging Face містить ще один гарний приклад прогнозування часу ряду.

Які ключові переваги використання часових рядів мовних моделей над традиційними методами, особливо у сфері обробки складних закономірностей та нульової продуктивності?

Критична перевага полягає в тому, що вам не потрібно тренувати та повторно тренувати модель на ваших даних часу ряду. Це, надіяється, усуває онлайн-проблему машинного навчання щодо моніторингу моделі та запуску повторного тренування, ідеально усуваючи складність вашої прогнозувальної системи.

Ви також не需要ете боротися з оцінкою міжсерійних кореляцій чи відносин для багатовимірних статистичних моделей. Додаткова варіація, додана оцінками, часто шкодить отриманим прогнозам та може змусити модель вивчити хибні кореляції.

Чи можете Ви надати деякі практичні приклади того, як моделі, такі як Google’s TimesFM, IBM’s TinyTimeMixer та AutoLab’s MOMENT, були реалізовані у реальних сценаріях?

Це складно відповісти; оскільки ці моделі ще у своїй ранній стадії, мало що відомо про те, як компанії використовують їх у реальних сценаріях.

У Вашому досвіді, які труднощі зазвичай зустрічають організації при інтеграції часових рядів мовних моделей у свої існуючі інфраструктури даних, та як вони можуть подолати їх?

Часові ряди мовних моделей ще так нові, що я не знаю конкретних труднощів, з якими зустрічаються організації. Однак я уявляю, що вони зустрічають ті самі труднощі, з якими зустрічаються при включенні будь-якої моделі генерації штучного інтелекту у свій потік даних. Ці труднощі включають:

  • Проблеми сумісності та інтеграції даних: Часові ряди мовних моделей часто вимагають конкретних форматів даних, послідовного маркування часу та регулярних інтервалів, але існуюча інфраструктура даних може містити неструктуровані або несумісні дані часу ряду, поширені по різних системах, таких як старі бази даних, хмарне сховище або потокові дані. Щоб подолати це, команди повинні реалізувати надійні потоки ETL (видобуток, перетворення, завантаження), щоб попередньо обробити, очистити та вирівняти дані часу ряду.
  • Масштабованість та продуктивність моделі: Часові ряди мовних моделей, особливо глибокі моделі машинного навчання, такі як трансформери, можуть бути ресурсоємними, вимагаючи значних обчислювальних та пам’ятних ресурсів для обробки великих об’ємів даних часу ряду в реальному чи майже реальному часі. Це вимагатиме від команд розгортання моделей на масштабованих платформах, таких як Kubernetes або керованих сервісів машинного навчання у хмарі, використання прискорення GPU при необхідності та використання розподілених фреймворків обробки, таких як Dask чи Ray, для паралельної інференції моделі.
  • Інтерпретація та довіра: Моделі часу ряду, особливо складні мовні моделі, можуть бути розглянуті як “чорні скриньки”, що робить складним їх інтерпретацію. Це може бути особливо проблематичним у регульованих галузях, таких як фінанси чи охорона здоров’я.
  • Безпека та конфіденційність даних: Обробка даних часу ряду часто включає конфіденційну інформацію, таку як дані з чутливими датчиками IoT чи фінансовими транзакціями, тому забезпечення безпеки та конфіденційності даних є критично важливим при інтеграції мовних моделей. Організації повинні забезпечити, щоб їхні потоки даних та моделі відповідали найкращим практикам безпеки, включаючи шифрування та контроль доступу, та розгортали моделі у безпечних, ізольованих середовищах.

Як Ви бачите розвиток ролі часових рядів мовних моделей у сфері прогнозувальної аналітики та штучного інтелекту? Чи є якісь нові тенденції чи технології, які особливо Вас цікавлять?

Можливий наступний крок у розвитку часових рядів мовних моделей міг би полягати у створенні інструментів, які дозволять користувачам розгортати, отримувати доступ та використовувати їх легше. Багато часових рядів мовних моделей, які я використовувала, вимагають дуже специфічних середовищ та бракують широкого спектра навчальних матеріалів та документації. Насправді, ці проекти ще у своїй ранній стадії, але буде цікаво побачити, як вони розвиватимуться у найближчі місяці та роки.

Дякую за чудове інтерв’ю, читачам, які бажають дізнатися більше, рекомендуємо відвідати InfluxData

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.