Інтерв’ю

Джей Мішра, операційний директор Astera Software – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Джей Мішра є операційним директором (COO) у Astera Software, компанії, яка швидко зростає та надає готові до використання підприємства рішення для роботи з даними. Вони допомагають користувачам бізнесу звузити розрив між даними та інсайтами за допомогою набору користувацьких, але високопродуктивних рішень для витягання даних, якості даних, інтеграції даних, зберігання даних та електронного обміну даними, які використовуються як середніми, так і компаніями Fortune 500 у різних галузях.

Що спочатку привернуло вашу увагу до комп’ютерних наук?

У мене завжди був глибоко вкорінений інтерес до математики, і мій шлях до комп’ютерних наук був природним продовженням цього. Моя освіта в галузі математики та комп’ютерних наук була логічним продовженням світу математики до царини комп’ютерних наук, яка мене зацікавила. Особливо мене привернули увагу складні механізми алгоритмів та розширені алгоритмічні процеси, які спонукали мене до спеціалізації з алгоритмів під час вивчення магістратури з комп’ютерних наук. Відтоді мій зв’язок з комп’ютерними науками залишався сильним, і я постійно намагаюся бути в курсі останніх розробок у цій галузі.

Ви зараз операційний директор Astera, можете.tell нам, що включає ваша щоденна робота?

Як операційний директор Astera, моя роль багатоманітна, віддзеркалюючи динамічну природу нашої компанії. Я був у Astera з моменту її заснування, і мої обов’язки охоплювали різні галузі організації. Це включає все: від активної участі у розробці та кодуванні наших продуктів до забезпечення того, щоб наші функції відповідали змінюваним потребам наших клієнтів. Я тісно співпрацюю з нашими клієнтами, працюючи разом з ними, щоб вдосконалити наші рішення. Моя роль виходила за рамки просто розробки продукту, вона охоплює продажі та маркетинг, де ми представляємо наші пропозиції на ринку.

Оскільки ми перебуваємо у фазі зростання, я взяв на себе додаткові обов’язки, включаючи нагляд за нашими цілями доходу та стратегічне розширення нашого портфеля продуктів для виходу на нові ринки. По суті, я маю руку майже у кожному аспекті наших операцій, забезпечуючи, щоб ми не тільки будували виняткові продукти, але й успішно представляли їх на ринку та досягали наших бізнес-цілей.

Для читачів, які незнайомі з цим терміном, що таке зберігання даних?

Зберігання даних – це архітектурний шаблон, використовуваний для консолідації всіх даних підприємства у централізований репозиторій, який буде служити основою для генерації різних типів аналітики, звітів та панелей, які будуть представляти справжню картину стану вашого бізнесу та передбачати, як бізнес буде розвиватися в майбутньому. Для задоволення всіх цих потреб ви збираєте дані певним чином, і ця архітектура називається складом даних.

Термін фактично взятий з реального складу, де ваші товари зберігаються на організованих полицях. Але коли ви переходите до світу даних, ви збираєте дані з різних джерел. Ви збираєте дані з виробництва, вашого веб-сайту, клієнтів, продажів та маркетингу, фінансів та відділу кадрів. Ви збираєте всі дані разом, збираєте їх в одне місце, і це буде називатися складом даних і проектується певним чином, щоб звітність, особливо на основі хронології, була легкою. Це основна мета складу даних.

Які деякі з ключових тенденцій у сфері зберігання даних сьогодні?

Зберігання даних пройшло довгий шлях за останні 20-25 років. Приблизно десятиліття тому ми стали свідками появи автоматизованого зберігання даних, парадигматичного зсуву, який прискорив процес побудови моделей даних та складу даних. Нещодавно автоматизація зайняла центральне місце. Вона вирішує повторюваний характер завдань зберігання даних, оптимізуючи процеси для збереження часу та ресурсів.

Наш продукт, Astera Data Warehouse Builder, наприклад, пропонує комплексний підхід до автоматизації у сфері зберігання даних. Він охоплює все: від автоматизації конвеєрів ETL (Витягання, Перетворення, Завантаження) та моделювання даних до автоматичного завантаження даних у структури, такі як зіркові схеми чи сховища даних. Крім того, він ефективно підтримує ці структури за допомогою механізмів захоплення змінних даних (CDC). Ця всеосяжна автоматизація виникла як ключова тенденція у ландшафті зберігання даних.

Крім того, остання тенденція – злиття зберігання даних та штучного інтелекту (AI). Зокрема, генеративний AI підняв автоматизацію на новий рівень. Він не тільки автоматизує завдання, але й допомагає користувачам у процесі прийняття рішень.

Конфігурація компонентів зберігання даних, конвеєрів та точок прийняття рішень може бути керованою AI, роблячи зберігання даних більш потужним та ефективним, ніж будь-коли раніше. По суті, це автоматизація на стероїдах, і вона змінює ландшафт зберігання даних. Перетин між AI та зберіганням даних – це тенденція, яка обіцяє велике майбутнє.

Які чотири фундаментальні принципи, яких повинні дотримуватися компанії для розробки складу даних?

1. Визначення чітких цілей

Це важливо почати з розуміння того, чого ви точно потребуєте від свого складу даних. Уникайте поширеної помилки збору надмірних даних без чіткої мети. Натомість визначте конкретні цілі, яких ви хочете досягти зі своїм складом даних. Які звіти та інсайти ви шукаєте? Зосереджуючись на своїх цілях, ви можете забезпечити, що ви збираєте тільки ті дані, які мають значення, а не накопичуєте величезну кількість інформації. Враховуючи зниження вартості зберігання та обчислювальної потужності, важливо використовувати ці ресурси розумно та етично.

2. Вибір правильного архітектурного шаблону

Архітектурні шаблони дуже важливі. Вони визначають, чи буде ваше рішення зберігання даних успішним чи ні. Є різні варіанти, від зберігання даних у стилі Inmon до зіркових схем Ральфа Кімбалла, а також нових шаблонів, таких як Data Vault та підхід одного великого столу, пропонований виробниками баз даних колонок. Не всі шаблони будуть підходити для кожної ситуації.

Ми бачимо, що комбінація зіркової схеми та сховища даних все ще є найбільш поширеним шаблоном. Але, як я сказав, для кожного вимог або кожної ситуації буде інша відповідь. Тому радимо проходити це через експертів, щоб побачити, який архітектурний шаблон підходить для вашої ситуації.

3. Вибір правильних інструментів

Вони дуже важливі та роблять велику різницю знову на часі та ресурсах, необхідних для побудови рішення, а також на точності та якості вашого рішення, яке визначається продуктами, які ви будете використовувати для побудови та підтримки свого складу даних. Придійте велику увагу можливостям продукту та подивіться на продукти, які можуть виконувати більшість вимог під одним дахом. Є певні області, такі як ETL (Витягання, Перетворення, Завантаження), які грають значну роль. Якщо ви спробуєте використовувати кілька продуктів для кожної з цих областей, це буде складно. Тому подивіться на продукти, які можуть виконувати більшість, якщо не всі різні складові.

4. Ваша команда

Останнє, але не менш важливе, команда людей, яких ви збираєте для побудови свого рішення зберігання даних, є найбільш важливою частиною. Ми рекомендуємо мати когось з сильним фоном у архітектурних шаблонах даних. Що стосується складу команди, міжфункціональні команди – це найкращий спосіб зробити це, де у вас є суміш бізнес-клієнтів та людей з деяким програмним фоном або хоча б експертизи даних, а також тісна співпраця між вашими охоронцями даних, людьми, які відповідають за дані, та бізнесом. Створюючи тісну співпрацю між цими різними аспектами вашої організації, ви можете створити цілісну та ефективну команду, відповідальну за побудову та підтримку вашого рішення зберігання даних.

Успіх у сфері зберігання даних залежить від досягнення балансу між цими чотирма принципами. Ці принципи, коли вони ретельно дотримуються, довели себе рецептом успіху у нашому досвіді.

Чому компанії потребують сучасного стека даних?

Це залежить від того, як ми визначаємо “сучасний” і це постійно змінюється, іноді за рік, місяць та навіть день. Ми повинні враховувати сучасні інструменти, розроблені з урахуванням змінного ландшафту даних. За останні кілька років відбулися значні зрушення у природі та обсязі даних. Зростання великих даних змінило ландшафт даних, з даних, що надходять з джерел, таких як веб-сайти електронної комерції, баз даних виробництва та різних частин вашого бізнесу. Ці дані змінюються не тільки за обсягом, але й за своєю суттю.

У минулому дані були в основному структурованими, але тепер неструктуровані дані відіграють значну роль. Крім того, швидкість, з якою дані генеруються та стають доступними для використання, збільшилася. Ураховуючи ці зміни у даних, ми повинні постійно оцінювати та адаптувати наш інструментарій для ефективного вирішення цих еволюційних проблем даних.

Сучасний стек даних розроблений для обробки всіх варіацій структур та швидкості даних, і він добре обладнаний для адаптації до нових архітектурних шаблонів, які еволюціонували за останні кілька років. Тому, якщо ви хочете зробити найкраще використання своїх даних, ви повинні розглянути можливість модернізації свого стека даних. Це єдиний спосіб залишатися в курсі нових проблем даних.

Ми бачили, що компанії дотримуються існуючих рішень, які здаються ефективними. Це важливо визнати, що дані самі по собі є внутрішньо динамічними. Вони постійно еволюціонують, представляючи нові виклики та можливості. Існуючі рішення можуть не бути оснащені для адаптації до цих змін. Тому, щоб розкрити весь потенціал своїх даних, компанії повинні прийняти концепцію модернізації свого стека даних. Це не про те, щоб зламати те, що працює; це про те, щоб залишатися гнучкими та реагувати на еволюцію даних. Постійно оцінюючи та інтегруючи досягнення у сфері технологій даних, бізнеси можуть залишатися конкурентоспроможними та приймати обґрунтовані рішення у все більшою мірою даних світі.

Які деякі з поточних проблем управління даними, які спостерігаються в галузі?

1. Швидкість даних та інтеграція

Одним з великих викликів, з якими ми стикаємося сьогодні, є величезний обсяг даних, що надходить з різних застосунків. Якщо ви візьмете типову організацію ІТ, вони мають справу з новими застосунками, які з’являються весь час – десятки, іноді навіть сотні щороку, особливо в середніх організаціях.

Зараз всі ці застосунки генерують дані, і ці дані містять цінні інсайти. Основною проблемою тут є здатність швидко інтегрувати ці нові джерела даних у існуючі конвеєри даних та консолідувати їх у єдиний вигляд. Швидкість, з якою організації можуть адаптуватися та включити ці нові потоки даних, є найбільшим викликом, з яким ми стикаємося.

2. Різні формати даних

Іншим критичним викликом є сутність самих даних, особливо зростаюча поширеність неструктурованих даних. З неструктурованими даними є, звичайно, різні школи думок про те, як їх обробляти.

Організації повинні вирішити, чи зберігати ці дані безпосередньо у сховищах даних для подальшого використання, чи витягувати та перетворювати їх у більш структурований формат для негайного споживання. Виклик обробки неструктурованих даних залишається, і ми бачимо, що навіть середні компанії чи маленькі компанії постраждали від цього. Тому розробка ефективних стратегій для обробки неструктурованих даних є важливою.

3. Публікація та обмін даними

Хоча інтеграція даних та консолідація є важливими, здатність ефективно обмінюватися даними є не менш важливою. Організації потребують механізмів для публікації та розповсюдження даних всередині відділів, третіх сторін, партнерів та інших зацікавлених сторін. Цей виклик виходить за рамки простого забезпечення доступу до даних; він включає забезпечення безпеки даних, конфіденційності та відповідності нормативним вимогам.既然 дані стають необхідністю для бізнесу всіх розмірів, технології та продукти у цій сфері швидко еволюціонують, щоб задовольнити попит.

Які деякі способи, якими Astera інтегрувала AI у робочий процес клієнтів?

Ми розглядаємо AI на перетині з управлінням даними двома відмінними способами.

1. Покращення зручності використання генеративного AI

Наша глибока приверженість зручності використання є краєвидом нашої філософії розробки продукту. За останні 12-13 років ми побудували сильну репутацію за розробку продуктів з коротким навчанням, роблячи їх доступними навіть для некỹ thuậtних користувачів. З лише скромною кількістю тренувань люди можуть ефективно використовувати наші продукти для виконання значимих завдань зі своїми даними.

З появою генеративного AI Astera підняла зручність використання на новий рівень. Ми використали генеративний AI для створення інтерфейсу користувача, який дозволяє клієнтам взаємодіяти з продуктом за допомогою природної мови. Цей AI-керований інтерфейс спрощує завдання конфігурації, роблячи його більш інтуїтивним та ефективним для користувачів.

Крім того, Astera інтегрувала автоматизацію, керовану AI, для виконання завдань, які раніше вимагали декільох годин ручної роботи, особливо під час конфігурації продуктів управління даними. Найбільший фактор витрат на побудову рішення управління даними не був тільки покупкою продукту, а часом та зусиллями, витраченими на його конфігурацію. Ми спробували вирішити це за допомогою AI. Цей підхід суттєво скорочує час та ресурси, традиційно витрачені на конфігурацію продукту.

Як приклад, продукт Astera, ReportMiner, спрощує витягання даних з неструктурованих документів, дозволяючи користувачам створювати шаблони витягання на основі правил. AI тепер може генерувати початковий шаблон за кілька секунд, завдання, яке раніше займало два-три години для типового користувача. Перший варіант AI-генерованого шаблону може не бути досконалим, але він обробляє приблизно 90% робочого навантаження, дозволяючи користувачам зробити швидкі корективи та завершити завдання за хвилини, а не години. Це лише один приклад того, як Astera використовує AI для покращення зручності використання по всьому продукту.

Ми робимо подібні речі по всьому нашому стеку даних, де ми отримуємо значний підйом у зручності використання за допомогою штучного інтелекту.

2. Функціональність AI як інструментарію

Astera пропонує єдиний стек даних, який охоплює різні аспекти управління даними, включаючи інгестію, трансформацію, якість даних, зберігання даних, API та публікацію даних. Компанія визнає важливість надання функціональності AI як універсального інструментарію для своїх користувачів. У цьому інструментарії клієнти Astera можуть отримати доступ до AI по всьому спектру науки про дані, від побудови та розгортання моделей машинного навчання до обробки операцій машинного навчання (ML Ops). Astera також підтримує використання моделей, заснованих на відкритому коді, включаючи великі мовні моделі (LLM), та полегшує їх донастройку для конкретних випадків використання.

Ця ширша функціональність AI надає можливість користувачам Astera використовувати AI для різних завдань, пов’язаних з даними, включаючи розгортання моделей машинного навчання, реалізацію ML Ops та донастройку відкритих моделей. Крім того, Astera продовжує працювати над розширенням своєї підтримки AI, охоплюючи області, такі як векторні бази даних, пошук подібності, вкладення та інше.

Які деякі з найкращих практик для використання AI та моделей машинного навчання у управлінні даними для великих компаній?

1. Залишатися на передовому краї розробок AI та ML

Сфера великих мовних моделей розвивається швидко. Щоб отримати конкурентну перевагу, великі компанії повинні залишатися в курсі останніх досягнень. Astera, наприклад, була одним з перших, хто прийняв генеративний AI, використовуючи моделі, такі як OpenAI та LAMA. Постійний моніторинг нових технологій забезпечує, що ви добре підготовлені до їх ефективного використання.

2. Експериментувати з різними моделями та конфігураціями

За допомогою донастройки LLM ми змогли розгорнути маленькі розміри, такі як 8-13 мільярдів параметрів моделей, та розгорнути їх локально. Це щось, що добре працює для нас, і те, що ми рекомендуємо, це спробувати різні базові моделі та конфігурації та побачити, яка з них працює для вас.

Великі мовні моделі мають різні варіанти, кожен з яких має свої унікальні можливості. Створіть конфігурацію, яка дозволяє вам вибирати з широкого спектра варіантів, подібно до того, що розробники та вчені даних роблять у своїх даних про наукові дослідження.

Щоб надати можливість користувачам, ми створили систему конфігурації, яка пропонує широкий спектр варіантів, подібно до того, що розробники та вчені даних зустрічають при роботі з бібліотеками відкритого коду у своїх даних про наукові дослідження. Наша мета полягала у тому, щоб безшовно інтегрувати ці варіанти у наш продукт, забезпечуючи динамічний та адаптивний досвід для користувачів.

3. Приоритизувати локальне розгортання над API

Коли ви займаєтеся продуктами, пов’язаними з даними, зниження затримок є важливим. Покладання тільки на API для доступу до моделей AI та ML може вводити неприпустимі затримки, особливо при роботі з великими обсягами даних. Радимо пріоритизувати розгортання донастроєних моделей локально, присвячених вашій конкретній ситуації. Це може суттєво покращити час відповіді та загальну продуктивність.

Чому Astera є кращим рішенням, ніж конкуруючі платформи?

  • Рішення Astera мають безкодовий, інтуїтивний візуальний інтерфейс разом з покращеною зручністю використання, керованою AI, що робить його легким для виконання складних процесів даних для всіх користувачів, незалежно від їх технічних можливостей.
  • Автоматизаційні функції нашого стека даних скорочують повторювані ручні завдання та зберігають час та ресурси розробки.
  • Наш єдиний платформу може допомогти користувачам виконувати кінцеві процеси даних без перемикання рішень. Це усуває витрати на навчання та управління декількома ізольованими системами.

Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Astera Software.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.