Інтерв’ю
Стівен Хілліон, старший віце-президент з даних і штучного інтелекту в Astronomer – Серія інтерв’ю

Стівен Хілліон є старшим віце-президентом з даних і штучного інтелекту в Astronomer, де він використовує свій широкий академічний досвід у галузі досліджень математики та понад 15 років досвіду у сфері розробки платформ машинного навчання в Кремнієвій долині. В Astronomer він очолює створення функцій Apache Airflow, спеціально розроблених для команд ML і AI, та керує внутрішньою командою даних науки. Під його керівництвом Astronomer просунувся у розвитку сучасної платформи оркестрації даних, суттєво покращивши можливості даних трубопроводів для підтримки різноманітних джерел даних та завдань за допомогою машинного навчання.
Чи можете ви поділитися інформацією про ваш шлях у галузі даних науки та штучного інтелекту, і як це сформувало ваш підхід до керівництва інженерними та аналітичними командами?
У мене був досвід у галузі досліджень математики в Берклі, перш ніж я перейшов у Кремнієву долину та працював інженером у серії успішних стартапів. Я був щасливий залишити позаду політику та бюрократію академії, але я виявив, що через кілька років мені не вистачало математики. Тому я перейшов до розробки платформ для машинного навчання та аналізу, і це майже все, що я робив з тих пір.
Моя підготовка у галузі чистої математики призвела до того, що я віддавав перевагу тому, що дані вчені називають “парсімонією” – правильний інструмент для роботи, і нічого більше. Оскільки математики схильні віддавати перевагу елегантним рішенням над складним обладнанням, я завжди намагався підкреслити простоту при застосуванні машинного навчання до бізнес-проблем. Глибоке навчання є чудовим для деяких застосунків – великі мовні моделі чудові для підсумовування документів, наприклад – але іноді проста регресійна модель є більш підходящою та легшою для пояснення.
Це було цікаво спостерігати за зміною ролі даних вчених та програмістів за останні двадцять років з моменту поширення машинного навчання. Будучи в обох ролях, я дуже усвідомлюю важливість циклу розробки програмного забезпечення (особливо автоматизації та тестування) при застосуванні до проектів машинного навчання.
Які найбільші виклики при переміщенні, обробці та аналізі неструктурованих даних для штучного інтелекту та великих мовних моделей (LLM)?
У світі Генеративного штучного інтелекту ваші дані є вашим найбільш цінним активом. Моделі все більше стають комодитизованими, тому ваша диференціація полягає у всьому тому важко здобутому інституційному знанні, яке захоплено у ваших власних та відібраних наборах даних.
Доставка правильних даних у правильний час ставить високі вимоги до ваших даних трубопроводів – і це стосується неструктурованих даних так само, як і структурованих даних, або навіть більше. Часто ви приймаєте дані з багатьох різних джерел, у багатьох різних форматах. Вам потрібно мати доступ до різноманітних методів для розбору даних та підготовки їх для використання у висновках моделі або тренуванні моделі. Вам також потрібно зрозуміти походження даних та куди вони потрапляють, щоб “показати свою роботу”.
Якщо ви робите це тільки час від часу для тренування моделі, це нормально. Ви не обов’язково повинні оперціоналізувати це. Якщо ви використовуєте модель щодня, щоб зрозуміти настрій клієнтів з онлайн-форумів, або підсумовувати та маршрутизувати рахунки, то це починає виглядати як будь-який інший оперативний трубопровід даних, який означає, що вам потрібно думати про надійність та повторюваність. Або якщо ви часто дофінуєте модель, то вам потрібно турбуватися про моніторинг точності та вартості.
Хороша новина полягає в тому, що інженери даних розробили чудову платформу, Airflow, для керування трубопроводами даних, яка вже була успішно застосована до керування розгортанням моделей та моніторингу деякими з найбільш складних команд ML. Отже, моделі можуть бути новими, але оркестрація не є.
Чи можете ви розповісти про використання синтетичних даних для дофінування менших моделей для точності? Як це порівнюється з тренуванням більших моделей?
Це потужна техніка. Ви можете вважати найкращі великі мовні моделі як ніби вони захопили те, що вони дізналися про світ, і вони можуть передати це меншим моделям шляхом генерації синтетичних даних. LLM захоплюють величезну кількість знань, здобутих з допомогою тривалого тренування на різноманітних наборах даних. Ці моделі можуть генерувати синтетичні дані, які захоплюють закономірності, структури та інформацію, які вони дізналися. Ці синтетичні дані можуть бути використані для тренування менших моделей, ефективно передаючи деякі знання з більших моделей до менших. Цей процес часто називається “дистиляцією знань” і допомагає у створенні ефективних, менших моделей, які все ще добре виконують певні завдання. І з синтетичними даними ви можете уникнути питань конфіденційності та заповнити пробіли у навчальних даних, які є малими або неповними.
Це може бути корисним для тренування більш спеціалізованої генеративної моделі штучного інтелекту, і навіть може бути більш ефективним, ніж тренування “більшої” моделі, з вищим рівнем контролю.
Дані вчені генерують синтетичні дані вже деякий час, і імпутація існувала так довго, як і існують неідIAL дані. Але вам завжди потрібно бути дуже обережним, щоб не вводити упередженість або робити неправильні припущення про розподіл даних. Тепер, коли синтез даних став так простим і потужним, вам потрібно бути ще більш обережним. Помилки можуть бути збільшені.
Відсутність різноманітності у згенерованих даних може привести до “колапсу моделі”. Модель вважає, що вона робить добре, але це тому, що вона не бачила повної картини. І, загалом, відсутність різноманітності у навчальних даних є тим, за чим команди даних повинні завжди стежити.
На базовому рівні, незалежно від того, чи використовujete синтетичні дані чи органічні дані, походження та якість є найважливішими для тренування або дофінування будь-якої моделі. Як ми знаємо, моделі є лише так добрі, як дані, на яких вони тренуються. Хоча синтетичні дані можуть бути чудовим інструментом для представлення чутливого набору даних без його розкриття або для заповнення пробілів, які можуть бути відсутні у представницькому наборі даних, вам потрібно мати паперовий слід, який показує, звідки походять дані, та бути能够 довести рівень їхньої якості.
Які інноваційні техніки ваша команда в Astronomer реалізує для покращення ефективності та надійності трубопроводів даних?
Так багато! Інфраструктура Astro, повністю керована Airflow, та Astro Hypervisor підтримують динамічне масштабування та проактивне моніторинг через розширені метрики здоров’я. Це забезпечує ефективне використання ресурсів та надійність систем у будь-якому масштабі. Astro забезпечує надійне оповіщення, орієнтоване на дані, з налаштованими сповіщеннями, які можуть бути відправлені через різні канали, такі як Slack та PagerDuty. Це забезпечує своєчасне втручання, перш ніж проблеми ескалюють.
Тести перевірки даних, юніт-тести та перевірки якості даних відіграють життєво важливу роль у забезпеченні надійності, точності та ефективності трубопроводів даних та, в кінцевому підсумку, даних, які живлять ваш бізнес. Ці перевірки забезпечують, що під час швидкої побудови трубопроводів даних для виконання термінів вони активно ловлять помилки, покращують час розробки та зменшують непередбачені помилки на задньому плані. В Astronomer ми розробили інструменти, такі як Astro CLI, щоб допомогти безшовно перевірити функціональність коду або виявити проблеми інтеграції всередині вашого трубопроводу даних.
Як ви бачите еволюцію управління генеративним штучним інтелектом, і які заходи потрібно вжити для підтримки створення більшої кількості інструментів?
Управління є обов’язковим, якщо застосування Генеративного штучного інтелекту мають бути успішними. Все це про прозорість та повторюваність. Чи знаєте ви, як ви отримали цей результат, і звідки, і ким? Airflow сам по собі вже дає вам можливість побачити, що окремі трубопроводи даних роблять. Його інтерфейс користувача був однією з причин його швидкого прийняття на ранній стадії, і в Astronomer ми доповнили це видимістю по командам та розгортанням. Ми також надаємо нашим клієнтам панелі звітів, які пропонують комплексні знання про використання платформи, продуктивність та атрибуцію витрат для інформованого прийняття рішень. Крім того, API Astro дозволяє командам програмно розгортати, автоматизувати та керувати своїми трубопроводами Airflow, мінімізуючи ризики, пов’язані з ручними процесами, та забезпечуючи безперебійну роботу у масштабі при керуванні кількома середовищами Airflow. Можливості походження закладені в платформу.
Це всі кроки до допомоги у керуванні управлінням даними, і я вважаю, що компанії всіх розмірів визнають важливість управління даними для забезпечення довіри до застосунків штучного інтелекту. Це визнання та усвідомлення буде значною мірою стимулювати попит на інструменти управління даними, і я передбачаю, що створення цих інструментів прискориться, оскільки Генеративний штучний інтелект поширюється. Але вони повинні бути частиною більшої оркестрової стека, через що ми розглядаємо це як фундаментальне для того, як ми будуємо нашу платформу.
Чи можете ви надати приклади того, як рішення Astronomer покращили операційну ефективність та продуктивність для клієнтів?
Процеси Генеративного штучного інтелекту включають складні та ресурсоємні завдання, які потрібно ретельно оптимізувати та повторно виконувати. Astro, керована платформа Apache Airflow від Astronomer, забезпечує рамку в центрі виниклого стека застосунків AI для спрощення цих завдань та підвищення здатності інновувати швидко.
Оркеструючи завдання Генеративного штучного інтелекту, бізнес може забезпечити ефективне використання обчислювальних ресурсів та оптимізацію робочих процесів у реальному часі. Це особливо важливо в середовищах, де генеративні моделі повинні бути часто оновлені або переобучені на основі нових даних.
Використовуючи можливості керування робочими процесами Airflow та можливості розгортання та масштабування Astronomer, команди можуть витратити менше часу на керування інфраструктурою та зосередитися на перетворенні даних та розробці моделей, що прискорює розгортання застосунків Генеративного штучного інтелекту та підвищує продуктивність.
Цим чином платформа Astro від Astronomer допомогла клієнтам покращити операційну ефективність Генеративного штучного інтелекту у широкому спектрі випадків використання. Серед них можна назвати відкриття продуктів електронної комерції, аналіз ризику виходу клієнтів, автоматизацію підтримки, класифікацію та підсумовування юридичних документів, отримання інформації про продукти з відгуків клієнтів та динамічне кластерування для генерації зображень продуктів.
Яка роль відіграє Astronomer у підвищенні продуктивності та масштабованості застосунків AI та ML?
Масштабованість є великим викликом для бізнесу, який використовує Генеративний штучний інтелект у 2024 році. Коли ви переходите від прототипу до виробництва, користувачі очікують, що їхні застосунки Генеративного штучного інтелекту будуть надійними та продуктивними, і що результати, які вони виробляють, будуть достовірними. Це повинно бути зроблено ефективно за витратами, і компанії всіх розмірів повинні бути能够 використовувати його потенціал. З урахуванням цього, використовуючи Astronomer, завдання можуть бути масштабовані горизонтально для динамічної обробки великої кількості джерел даних. Astro може еластично масштабувати розгортання та кластери, на яких вони розміщені, а виконання завдань на основі черги з присвяченими типами машин забезпечує більшу надійність та ефективне використання обчислювальних ресурсів. Щоб допомогти з частиною ефективності витрат, Astro пропонує функції масштабування до нуля та гібернації, які допомагають контролювати витрати, що зростають, та зменшувати витрати на хмарні обчислення. Ми також надаємо повну прозорість щодо витрат на платформу. Моя власна команда даних генерує звіти про споживання, які ми робимо доступними щодня нашим клієнтам.
Які майбутні тенденції в галузі AI та даних науки вас цікавлять, і як Astronomer готується до них?
Об’яснюваний AI є надзвичайно важливою та цікавою областю розвитку. Можливість заглянути у внутрішню роботу великих моделей є майже незвичайною. І я також цікавлюся тим, як спільнота бореться з екологічним впливом тренування та налаштування моделей. В Astronomer ми продовжимо оновлювати наш реєстр усіма останніми інтеграціями, щоб дані та команди ML могли підключитися до найкращих сервісів моделей та найбільш ефективних платформ обчислень без будь-яких зусиль.
Як ви бачите інтеграцію передових інструментів AI, таких як LLM, з традиційними системами керування даними за найближчі роки?
Ми бачили, як Databricks та Snowflake оголосили про те, як вони включили використання та розробку LLM у свої платформи. Інші СУБД та платформи ML зроблять те саме. Це чудово бачити, як інженерам даних доступні такі потужні методи прямо з командної строки або SQL-пrompt.
Мене особливо цікавить, як реляційні бази даних включають машинне навчання. Я завжди чекаю, коли методи ML будуть включені в стандарт SQL, але по якійсь причині ці дві дисципліни ніколи не спрацювали. Можливо, цього разу буде інакше.
Я дуже цікавлюся майбутнім великих мовних моделей для допомоги роботі інженера даних. Насамперед великі мовні моделі вже були особливо успішними у генерації коду, хоча перші спроби забезпечити вчених даних пропозиціями AI були сумішшю: Hex є чудовим, наприклад, тоді як Snowflake є незадовільним наразі. Але є величезний потенціал для зміни природи роботи для команд даних, набагато більше, ніж для розробників. Чому? Для програмістів підказка – назва функції або документація, але для інженерів даних є також дані. Є так багато контексту, з яким моделі можуть працювати, щоб зробити корисні та точні пропозиції.
Яка порада ви дали б аспірантам-даним вченим та інженерам AI, які хочуть зробити вплив у галузі?
Учіться, роблячи. Це надзвичайно легко побудувати застосунки зараз, і доповнити їх штучним інтелектом. Тому побудуйте щось круте, і надішліть це другу друга, який працює в компанії, яку ви шануєте. Або надішліть мені, і я обіцяю, що подивлюся!
Секрет полягає в тому, щоб знайти щось, про що ви пристрасно думаєте, і знайти добрий джерело пов’язаних даних. Друг мого друга зробив фантастичний аналіз аномальних сезонів бейсболу, починаючи з 19-го століття, і виявив деякі історії, які заслуговують на те, щоб про них зняли фільм. І деякі інженерів Astronomer недавно зібралися на вихідних, щоб побудувати платформу для самозцілювання трубопроводів даних. Я не можу уявити, що спробував би зробити щось подібне кілька років тому, але з допомогою кількох днів зусиль ми виграли хакатон Cohere та побудували основу для нового функціоналу в нашій платформі.
Дякую за чудове інтерв’ю, читачам, які хочуть дізнатися більше, слід відвідати Astronomer.












