Інтерв’ю
Доктор Майк Флаксман, віце-президент з продукції в HEAVY.AI – Інтерв’ю Серія

Доктор Майк Флаксман зараз є віце-президентом з продукції в HEAVY.AI, раніше обіймав посаду менеджера продукції та очолював практику просторових даних у професійних послугах. Він провів останні 20 років, працюючи у сфері просторового екологічного планування. До HEAVY.AI він заснував Geodesign Technologies, Inc. та став співзасновником GeoAdaptive LLC, двох стартапів, які застосовують технології просторового аналізу до планування. Перед тим, як стати стартапером, він був професором планування в MIT та менеджером галузі в ESRI.
HEAVY.AI – це апаратно-прискорена платформа для аналізу даних в режимі реального часу з високим впливом. Вона використовує як процесори GPU, так і CPU для швидкого запиту великих наборів даних, з підтримкою SQL та просторових даних. Платформа включає інструменти візуального аналізу для інтерактивних панелей, фільтрації та масштабованих візуалізацій даних, що дозволяє ефективно проводити аналіз великих даних у різних галузях.
Розкажіть нам про свій професійний досвід і те, що привело вас до HEAVY.AI?
До того, як я приєднався до HEAVY.AI, я провів роки в академії, врешті викладав просторовий аналіз в MIT. Я також керував невеликою консалтинговою фірмою з різними клієнтами з державного сектора. Я був залучений до проектів з географічних інформаційних систем у 17 країнах. Моя робота відводила мене від консультування організацій, таких як Міжамериканський банк розвитку, до управління технологіями географічних інформаційних систем для архітектури, інженерії та будівництва в ESRI, найбільшому розробнику географічних інформаційних систем у світі
Я пам’ятаю дуже чітко свою першу зустріч з тим, що зараз є HEAVY.AI, коли як консультант я був відповідальним за планування сценаріїв для програми охорони природи пляжів Флориди. Мої колеги і я боролися з моделюванням середовища проживання морських черепах за допомогою даних Landsat з роздільністю 30 метрів, і друг вказав мені на деякі зовсім нові і дуже актуальні дані – дані LiDAR з роздільністю 5 см. Це було саме те, що нам потрібно з наукової точки зору, але щось у 3600 разів більше, ніж те, що ми планували використовувати. Ніхто не хотів збільшувати мій бюджет навіть на якусь частину цієї суми. Тому того дня я поклав інструменти, які я використовував і викладав протягом декількох десятиліть, і пішов шукати щось нове. HEAVY.AI пройшов через ці дані так гладко і без зусиль, що я миттєво став залежним.
Пропустимо кілька років вперед, і я все ще вважаю, що те, що робить HEAVY.AI, досить унікально, а їхня рання ставка на аналітику GPU саме там, куди ще потрібно рухатися галузі. HEAVY.AI твердо зосереджений на демократизації доступу до великих даних. Це має компонент обсягу даних і швидкості обробки, звичайно, що дає кожному свій суперкомп’ютер. Але все більш важливим аспектом з появою великих мовних моделей є те, що просторове моделювання стає доступним для багатьох людей. Тепер, замість того, щоб проводити роки, вивчаючи складний інтерфейс з тисячами інструментів, ви можете просто розпочати розмову з HEAVY.AI мовою вашого вибору. Програма не тільки генерує команди, необхідні для цього, але й представляє відповідні візуалізації.
За лаштунками забезпечення легкості використання, звичайно, дуже складно. На даний момент, як віце-президент з управління продукцією в HEAVY.AI, я сильно залучений до визначення тих функцій і можливостей, які ми пріоритезуємо для наших продуктів. Мій обширний досвід у сфері географічних інформаційних систем дозволяє мені真正но зрозуміти потреби наших клієнтів і спрямовувати нашу дорожню карту розвитку відповідно.
Як ваш попередній досвід у сфері просторового екологічного планування та стартапів вплинув на вашу роботу в HEAVY.AI?
Екологічне планування – це особливо складна галузь, оскільки вам потрібно враховувати як різні потреби людини, так і природний світ. Загальне рішення, яке я вивчив рано, полягало у поєднанні методу, відомого як учасницьке планування, з технологіями дистанційного зондування та географічних інформаційних систем. Перед тим, як вирішити план дії, ми створювали кілька сценаріїв і симулювали їх позитивні та негативні впливи на комп’ютері за допомогою візуалізацій. Використання учасницьких процесів дозволило нам поєднати різні форми експертизи та вирішити дуже складні проблеми.
Хоча ми звичайно не займаємося екологічним плануванням в HEAVY.AI, цей шаблон все ще працює дуже добре в бізнес-середовищі. Тому ми допомагаємо клієнтам створити цифрові двійники ключових частин їхнього бізнесу, і ми дозволяємо їм швидко створювати та оцінювати бізнес-сценарії.
Я думаю, що мій досвід викладання дав мені глибоку емпатію до користувачів програмного забезпечення, особливо складного програмного забезпечення. Там, де один студент спотикається в одному місці, це випадково, але там, де десятки або сотні людей роблять подібні помилки, ви знаєте, що у вас є проблема з дизайном. Можливо, моя улюблена частина дизайну програмного забезпечення полягає в тому, щоб застосовувати ці знання при створенні нових поколінь систем.
Розкажіть нам, як HeavyIQ використовує обробку природної мови для сприяння дослідженням даних та візуалізації?
Сьогодні здається, що кожен і його брат рекламують нову модель генеративного ІІ, більшість з яких є забутими клонами один одного. Ми обрали зовсім інший шлях. Ми вважаємо, що точність, реплікованість та конфіденційність є суттєвими характеристиками для будь-яких інструментів бізнес-аналітики, включаючи ті, що генеруються великими мовними моделями (LLM). Тому ми ввели ці характеристики в нашу пропозицію на фундаментальному рівні. Наприклад, ми суворо обмежуємо вхідні дані моделі до корпоративних баз даних та документів всередині корпоративного периметру безпеки. Ми також обмежуємо вихідні дані до останніх HeavySQL та діаграм. Це означає, що незалежно від питання, яке ви ставите, ми спробуємо відповісти вашими даними, і ми покажемо вам точно, як ми отримали цю відповідь.
З цими гарантіями на місці, менше турбує наших клієнтів, саме як ми обробляємо запити. Але за лаштунками ще одна важлива відмінність від споживчих моделей генеративного ІІ полягає в тому, що ми суттєво дофінуємо моделі проти конкретних типів питань, які бізнес-користувачі ставлять до бізнес-даних, включаючи просторові дані. Наприклад, наша модель чудова у виконанні просторових та часових з’єднань, яких немає в класичних бенчмарках SQL, але наші користувачі використовують щодня.
Ми упаковуємо ці основні можливості в інтерфейс блокнота, який ми називаємо HeavyIQ. IQ полягає в тому, щоб зробити дослідження даних та візуалізацію такою же інтуїтивною, як і використання природної мови (NLP). Ви ставите питання англійською – наприклад, “Які були погодні умови в Каліфорнії минулого тижня?” – і HeavyIQ перекладає це в запити SQL, які наш база даних, прискорена GPU, обробляє швидко. Результати представлені не тільки у вигляді даних, але й у вигляді візуалізацій – карт, діаграм, чогось найбільш актуального. Це полягає в тому, щоб забезпечити швидке, інтерактивне запитування, особливо при роботі з великими або швидко рухомими наборами даних. Що тут важливо, так це те, що часто не перше питання, яке ви ставите, а можливо третє, яке справді доходить до основної ідеї, і HeavyIQ призначений для сприяння цьому більш глибокому дослідження.
Які основні переваги використання HeavyIQ порівняно з традиційними інструментами бізнес-аналітики для телекомунікацій, комунальних послуг та урядових агентств?
HeavyIQ виділяється в середовищах, де ви маєте справу з великомасштабними, високошвидкісними даними – саме тим типом даних, з яким працюють телекомунікаційні компанії, комунальні служби та урядові агентства. Традиційні інструменти бізнес-аналітики часто борються з об’ємом і швидкістю цих даних. Наприклад, у телекомунікаціях у вас можуть бути мільярди записів дзвінків, але саме мала частка втрачених дзвінків, на яку вам потрібно зосередитися. HeavyIQ дозволяє вам просіювати ці дані в 10-100 разів швидше завдяки нашій інфраструктурі GPU. Ця швидкість, поєднана з можливістю інтерактивного запитування та візуалізації даних, робить його невід’ємним для ризикової аналітики в комунальних службах або планування сценаріїв в режимі реального часу для урядових агентств.
Інша перевага, на яку вже звернули увагу вище, полягає в тому, що просторові та часові запити SQL надзвичайно потужні аналітично – але можуть бути повільними або складними для написання вручну. Коли система працює на “швидкості цікавості” користувачі можуть ставити як більше питань, так і більш нюансованих питань. Наприклад, інженер телекомунікаційної компанії може помітити тимчасовий сплеск відмов обладнання з системи моніторингу, мати інтуїцію, що щось пішло не так на певному об’єкті, і перевірити це за допомогою просторового запиту, який повертає карту.
Які заходи прийнято для запобігання витоку метаданих при використанні HeavyIQ?
Як описано вище, ми побудували HeavyIQ з урахуванням конфіденційності та безпеки на фундаментальному рівні. Це включає не тільки дані, але й різні види метаданих. Ми використовуємо метадані рівня стовпців і таблиць широко при визначенні, які таблиці та стовпці містять інформацію, необхідну для відповіді на запит. Ми також використовуємо внутрішні компанії документи, якщо вони надані, для допомоги в тому, що відомо як генерація, підкріплена відновленням (RAG). Останнє, мовні моделі самих себе генерують додаткові метадані. Все це, але особливо останні два, можуть бути високочутливими для бізнесу.
На відміну від третіх моделей, де ваші дані звичайно передаються на зовнішні сервери, HeavyIQ працює локально на тій же інфраструктурі GPU, що й решта нашої платформи. Це забезпечує те, що ваші дані та метадані залишаються під вашим контролем, без ризику витоку. Для організацій, які вимагають найвищих рівнів безпеки, HeavyIQ можна навіть розгорнути в цілком повітряно-ізольованому середовищі, забезпечуючи, що чутливі відомості ніколи не покидають певного обладнання.
Як HEAVY.AI досягає високої продуктивності та масштабованості з великими наборами даних за допомогою інфраструктури GPU?
Секретний соус по суті полягає в униканні руху даних, поширених у інших системах. У своєму ядрі це починається з бази даних, спеціально створеної для роботи на процесорах NVIDIA GPU. Ми працюємо над цим уже понад 10 років, і ми справді віримо, що маємо найкраще рішення, коли справа доходить до аналітики, прискореної GPU.
Навіть найкращі системи на основі CPU вичерпують пару раніше, ніж середній GPU. Статистика одного разу відбувається, коли це відбувається на CPU, вимагає розподілу даних по декількох ядрах та потім по декількох системах (так зване “горизонтальне масштабування”). Це працює добре в деяких контекстах, де речі менш критичні для часу, але загалом починає бути заблокованим на мережевій продуктивності.
Крім того, ми уникнули цього руху даних на запитах, ми також уникнули його при багатьох інших загальних завданнях. Перше з них полягає в тому, що ми можемо візуалізувати графіку без руху даних. Потім, якщо ви хочете моделювання з висновком ML, ми знову робимо це без руху даних. І якщо ви запитуєте дані великою мовною моделлю, ми знову робимо це без руху даних. Навіть якщо ви є вченим-даними і хочете запитувати дані з Python, ми знову надаємо методи для цього на GPU без руху даних.
Що це означає на практиці, так це те, що ми можемо виконувати не тільки запити, але й візуалізацію в 10-100 разів швидше, ніж традиційні бази даних на основі CPU та сервери карт. Коли ви працюєте з великими, високошвидкісними наборами даних, з якими працюють наші клієнти – такими як моделі погоди, записи дзвінків телекомунікацій або зображення з супутника – такий імпульс продуктивності абсолютно необхідний.
Як HEAVY.AI підтримує свою конкурентну перевагу в швидкозмінному ландшафті великих даних та ІІ?
Це велике питання, і про це ми думаємо постійно. Ландшафт великих даних та ІІ розвивається неймовірно швидко, з новими проривами та інноваціями, які відбуваються постійно. Це точно не шкодить, що у нас є 10-річна перевага в технології бази даних GPU.
Я думаю, що ключ для нас полягає в тому, щоб залишатися лазерно зосередженими на нашій основній місії – демократизації доступу до великих, просторових даних. Це означає постійне розширення меж того, що можливо, з аналітикою, прискореною GPU, і забезпечення того, щоб наші продукти доставляли неперевершену продуктивність та можливості в цій галузі. Велика частина цього полягає в нашому тривалому інвестуванні в розробку спеціально налаштованих мовних моделей, які真正но розуміють нюанси просторового SQL та геопросторового аналізу.
Ми побудували обширну бібліотеку навчальних даних, яка виходить далеко за межі загальних бенчмарків, щоб забезпечити, що наші інструменти конверсаційної аналітики можуть взаємодіяти з користувачами природним, інтуїтивним способом. Але ми також знаємо, що технологія сама по собі недостатня. Нам потрібно залишатися глибоко пов’язаними з нашими клієнтами та їхніми змінюваними потребами. В кінцевому підсумку наша конкурентна перевага полягає в нашому беззаступному фокусі на доставці трансформаційної цінності нашим користувачам. Ми не тільки тримаємося за ринком – ми розширюємо межі того, що можливо з великими даними та ІІ. І ми продовжимо це робити, незалежно від того, як швидко розвивається ландшафт.
Як HEAVY.AI підтримує зусилля з реагування на надзвичайні ситуації через HeavyEco?
Ми побудували HeavyEco, коли побачили, що деякі з наших найбільших клієнтів комунальних послуг мали значні труднощі просто з поглинанням сучасних моделей погоди, а також візуалізацією їх для спільних порівнянь. Це займало у одного клієнта до чотирьох годин, лише щоб завантажити дані, і коли ви стикаєтеся з швидко рухомими екстремальними погодними умовами, такими як пожежі… це просто не досить добре.
HeavyEco призначений для надання інформації в режимі реального часу в ситуаціях високої відповідальності, таких як під час лісової пожежі чи повені. У таких сценаріях вам потрібно приймати рішення швидко та на основі найкращих можливих даних. Тому HeavyEco спочатку служить професійно керованим каналом даних для авторитетних моделей, таких як ті, що походять від NOAA та USGS. На основі цих даних HeavyEco дозволяє вам запускати сценарії, будувати моделі впливу на рівні будівель та візуалізувати дані в режимі реального часу. Це дає першим респондентам критичну інформацію, якої їм потрібно, коли це найважливіше. Це полягає в тому, щоб перетворити складні, великомасштабні набори даних у дієвій інтелект, який може спрямовувати негайне прийняття рішень.
У кінцевому підсумку наша мета полягає в тому, щоб дати нашим користувачам можливість досліджувати свої дані на швидкості думки. Чи вони виконують складні просторові моделі, порівнюють прогнози погоди чи намагаються визначити закономірності у геопросторових часових рядах, ми хочемо, щоб вони могли робити це безперешкодно, без будь-яких технічних бар’єрів на їхньому шляху.
Чим відрізняється власна LLM HEAVY.AI від інших третіх LLM у плані точності та продуктивності?
Наша власна LLM спеціально налаштована для типів аналітики, на які ми зосереджені – таких як текст у SQL та текст у візуалізацію. Спочатку ми спробували традиційні треті моделі, але виявили, що вони не відповідають високим вимогам точності наших користувачів, які часто приймають критичні рішення. Тому ми дофінуємо ряд відкритих моделей та тестуємо їх проти галузевих бенчмарків.
Наша LLM значно точніша для просунутих концепцій SQL, яких потребують наші користувачі, особливо у геопросторових та часових даних. Крім того, оскільки вона працює на нашій інфраструктурі GPU, вона також більш безпечна.
Крім вбудованих можливостей моделі, ми також надаємо повністю інтерактивний інтерфейс користувача для адміністраторів та користувачів, щоб додати метадані, актуальні для галузі чи бізнесу. Наприклад, якщо базова модель не працює так, як очікувалося, ви можете імпортувати або налаштувати метадані рівня стовпців, додати інформацію щодо керівництва та отримати негайну відповідь.
Як HEAVY.AI бачить роль геопросторової та часової аналітики даних у формуванні майбутнього різних галузей?
Ми вважаємо, що геопросторова та часова аналітика даних будуть критичними для майбутнього багатьох галузей. Що ми зосереджені на цьому, так це допомога нашим клієнтам у прийнятті кращих рішень, швидше. Чи ви в телекомунікаціях, комунальних послугах, уряді чи інших галузях – мати можливість аналізувати та візуалізувати дані в режимі реального часу може бути переможцем гри.
Наша місія полягає в тому, щоб зробити такий потужний аналіз доступним кожному, а не тільки великим гравцям з величезними ресурсами. Ми хочемо забезпечити, щоб наші клієнти могли скористатися даними, які вони мають, щоб залишатися попереду та вирішувати проблеми, коли вони виникають.既然 дані продовжують зростати та ставати все більш складними, ми бачимо свою роль у тому, щоб наші інструменти еволюціонували просто поряд з ними, щоб наші клієнти завжди були готові до того, що наступне.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати HEAVY.AI.












