Интервью

Стивен Хиллион, старший вице-президент по данным и ИИ в Astronomer – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Стивен Хиллион является старшим вице-президентом по данным и ИИ в Astronomer, где он использует свой обширный академический опыт в области исследований математики и более 15 лет опыта в разработке платформ машинного обучения в долине Кремния. В Astronomer он возглавляет создание функций Apache Airflow, специально разработанных для команд машинного обучения и ИИ, и руководит внутренней командой数据-науки. Под его руководством Astronomer расширил свою современную платформу оркестровки данных, значительно повысив возможности своих конвейеров данных для поддержки широкого спектра источников данных и задач с помощью машинного обучения.

Можете ли вы рассказать о своем пути в области данных и ИИ, и как это повлияло на ваш подход к руководству инженерными и аналитическими командами?

У меня был опыт в области исследований математики в Беркли, прежде чем я перешел в долину Кремния и работал инженером в серии успешных стартапов. Мне было приятно оставить позади политику и бюрократию академии, но я вскоре обнаружил, что я скучаю по математике. Итак, я перешел к разработке платформ для машинного обучения и аналитики, и это то, что я делаю с тех пор.

Мое образование в области чистой математики привело меня к предпочтению того, что данные-ученые называют «парсимонией» — правильным инструментом для работы, и ничем больше. Поскольку математики склонны отдавать предпочтение элегантным решениям над сложными машинами, я всегда пытался подчеркнуть простоту при применении машинного обучения к бизнес-задачам. Глубокое обучение отлично подходит для некоторых приложений — большие языковые модели блестящи для суммирования документов, например — но иногда простая регрессионная модель более подходящая и легче объяснить.

Было fascинiruyuschie наблюдать за сдвигом роли данных-ученого и программиста за последние двадцать лет с тех пор, как машинное обучение стало широко распространенным. Ноша両 шляпы, я очень осознаю важность цикла разработки программного обеспечения (особенно автоматизации и тестирования) при применении к проектам машинного обучения.

Каковы самые большие проблемы при перемещении, обработке и анализе неструктурированных данных для ИИ и больших языковых моделей (LLM)?

В мире Генеративного ИИ ваши данные являются вашим наиболее ценным активом. Модели становятся все более коммодитизированными, поэтому ваша дифференциация заключается во всем том трудно завоеванном институциональном знании, которое захвачено в ваших проприетарных и отобранных наборах данных.

Доставка правильных данных в правильное время предъявляет высокие требования к вашим конвейерам данных — и это применимо как к неструктурированным данным, так и к структурированным данным, или, возможно, даже больше. Часто вы принимаете данные из многих разных источников, в многих разных форматах. Вам нужен доступ к разнообразным методам для распаковки данных и подготовки их для использования в выводе модели или обучении модели. Вам также необходимо понимать происхождение данных и то, где они оканчиваются, чтобы «показать свою работу».

Если вы делаете это только изредка для обучения модели, это нормально. Вам не обязательно нужно операционализировать это. Если вы используете модель ежедневно для понимания настроений клиентов из онлайн-форумов или для суммирования и маршрутизации счетов, то это начинает выглядеть как любой другой операционный конвейер данных, который требует надежности и воспроизводимости. Или если вы часто настраиваете модель, то вам нужно беспокоиться о мониторинге точности и стоимости.

Хорошая новость заключается в том, что инженеры-данные разработали отличную платформу, Airflow, для управления конвейерами данных, которая уже была успешно применена для управления развертыванием и мониторингом моделей некоторыми из самых передовых команд машинного обучения в мире. Итак, модели могут быть новыми, но оркестровка не является такой.

Можете ли вы рассказать о использовании синтетических данных для тонкой настройки более мелких моделей для точности? Как это сравнивается с обучением более крупных моделей?

Это мощная техника. Вы можете думать о лучших больших языковых моделях как о том, что они каким-то образом инкапсулируют то, что они узнали о мире, и они могут передать это знание более мелким моделям, генерируя синтетические данные. Большие языковые модели инкапсулируют огромные объемы знаний, полученных из обширного обучения на различных наборах данных. Эти модели могут генерировать синтетические данные, которые захватывают закономерности, структуры и информацию, которую они узнали. Эти синтетические данные затем можно использовать для обучения более мелких моделей, эффективно передавая часть знаний из более крупных моделей в более мелкие. Этот процесс часто называется «дистилляцией знаний» и помогает создавать эффективные, более мелкие модели, которые все еще хорошо работают на конкретных задачах. И с синтетическими данными вы также можете избежать проблем с конфиденциальностью и заполнить пробелы в обучающих данных, которые малы или неполны.

Это может быть полезно для обучения более domaine-специфической генеративной модели ИИ и может быть даже более эффективным, чем обучение «более крупной» модели, с более высоким уровнем контроля.

Данные-ученые генерировали синтетические данные в течение некоторого времени, и имputation существовала столько же, сколько и неидеальные наборы данных. Но вы всегда должны быть очень осторожны, чтобы не вводить предубеждения или делать неверные предположения о распределении данных. Теперь, когда синтезирование данных стало так легко и мощным, вы должны быть еще более осторожны. Ошибки могут быть усилены.

Отсутствие разнообразия в сгенерированных данных может привести к «коллапсу модели». Модель думает, что она работает хорошо, но это потому, что она не увидела полной картины. И, более generally, отсутствие разнообразия в обучающих данных — это то, за чем должны всегда следить данные-команды.

На базовом уровне, будь то использование синтетических данных или органических данных, происхождение и качество имеют первостепенное значение для обучения или тонкой настройки любой модели. Как мы знаем, модели только так хороши, как данные, на которых они обучены. Хотя синтетические данные могут быть отличным инструментом для представления чувствительного набора данных без его раскрытия или для заполнения пробелов, которые могут быть оставлены в представительном наборе данных, вы должны иметь бумажный след, показывающий, откуда взялись данные, и быть в состоянии доказать их уровень качества.

Какие инновационные техники ваша команда в Astronomer реализует для улучшения эффективности и надежности конвейеров данных?

Так много! Astro’s полностью управляемая инфраструктура Airflow и Astro Hypervisor поддерживает динамическое масштабирование и проактивный мониторинг через продвинутые метрики здоровья. Это обеспечивает эффективное использование ресурсов и надежность систем в любом масштабе. Astro предоставляет прочное оповещение, ориентированное на данные, с настраиваемыми уведомлениями, которые могут быть отправлены через различные каналы, такие как Slack и PagerDuty. Это обеспечивает своевременное вмешательство до того, как проблемы эскалируют.

Тесты проверки данных, модульные тесты и проверки качества данных играют важную роль в обеспечении надежности, точности и эффективности конвейеров данных и, в конечном итоге, данных, которые управляют вашим бизнесом. Эти проверки обеспечивают, что при быстром построении конвейеров данных для выполнения сроков вы активно обнаруживаете ошибки, улучшаете время разработки и снижаете неожиданные ошибки на фоне. В Astronomer мы построили инструменты, такие как Astro CLI, чтобы помочь без проблем проверить функциональность кода или выявить проблемы с интеграцией в вашем конвейере данных.

Как вы видите эволюцию управления генеративным ИИ, и какие меры следует принять для поддержки создания более инструментов?

Управление является обязательным, если приложения генеративного ИИ будут успешными. Все это о прозрачности и воспроизводимости. Знаете ли вы, как вы получили этот результат, и откуда, и кем? Airflow сам по себе уже дает вам способ увидеть, что делают отдельные конвейеры данных. Его пользовательский интерфейс был одной из причин его быстрого принятия на ранней стадии, и в Astronomer мы дополнили это видимостью на уровне команд и развертываний. Мы также предоставляем нашим клиентам панели отчетности, которые предлагают всесторонние идеи о использовании платформы, производительности и атрибуции затрат для принятия обоснованных решений. Кроме того, API Astro позволяет командам программно развертывать, автоматизировать и управлять своими конвейерами Airflow, смягчая риски, связанные с ручными процессами, и обеспечивая бесперебойную работу в масштабе при управлении несколькими средами Airflow. Возможности происхождения встроены в платформу.

Это все шаги к помощи в управлении управлением данными, и я считаю, что компании всех размеров признают важность управления данными для обеспечения доверия к приложениям ИИ. Это признание и осведомленность будут в основном стимулировать спрос на инструменты управления данными, и я ожидаю, что создание этих инструментов будет ускоряться по мере распространения генеративного ИИ. Но они должны быть частью более крупного стека оркестровки, который является причиной, по которой мы рассматриваем это как фундаментальный для того, как мы строим нашу платформу.

Можете ли вы предоставить примеры того, как решения Astronomer улучшили операционную эффективность и производительность для клиентов?

Процессы генеративного ИИ включают сложные и ресурсоемкие задачи, которые необходимо тщательно оптимизировать и повторно выполнять. Astro, управляемая платформа Apache Airflow от Astronomer, предоставляет основу в центре развивающегося стека приложений ИИ, чтобы помочь упростить эти задачи и повысить способность быстро инновировать.

Оркестрируя задачи генеративного ИИ, предприятия могут обеспечить эффективное использование вычислительных ресурсов и оптимизацию рабочих процессов в реальном времени. Это особенно важно в средах, где генеративные модели должны быть часто обновлены или переобучены на основе новых данных.

Используя возможности управления рабочими процессами Airflow и возможности развертывания и масштабирования Astronomer, команды могут тратить меньше времени на управление инфраструктурой и сосредоточиться на трансформации данных и разработке моделей, что ускоряет развертывание приложений генеративного ИИ и повышает производительность.

Таким образом, платформа Astro от Astronomer помогла клиентам улучшить операционную эффективность генеративного ИИ в широком спектре случаев использования. Чтобы назвать несколько, случаи использования включают открытие продуктов электронной коммерции, анализ риска отказа клиентов, автоматизацию поддержки, классификацию и суммирование юридических документов, получение информации о продуктах из отзывов клиентов и динамическое выделение кластеров для генерации изображений продукта.

Какую роль играет Astronomer в повышении производительности и масштабируемости приложений ИИ и машинного обучения?

Масштабируемость является серьезной проблемой для предприятий, которые используют генеративный ИИ в 2024 году. Когда вы переходите от прототипа к производству, пользователи ожидают, что их приложения генеративного ИИ будут надежными и производительными, и что вывод, который они производят, будет заслуживающим доверия. Это необходимо делать эффективно, и предприятия всех размеров должны быть в состоянии использовать его потенциал. С учетом этого, используя Astronomer, задачи можно масштабировать горизонтально для динамической обработки большого количества источников данных. Astro может эластично масштабировать развертывания и кластеры, на которых они размещены, и очередевая обработка задач с выделенными типами машин обеспечивает большую надежность и эффективное использование вычислительных ресурсов. Чтобы помочь с эффективностью затрат, Astro предлагает функции масштабирования до нуля и гибернации, которые помогают контролировать растущие затраты и снижать расходы на облако. Мы также предоставляем полную прозрачность вокруг стоимости платформы. Свои данные-команда генерирует отчеты о потреблении, которые мы делаем доступными для наших клиентов ежедневно.

Какие будущие тенденции в ИИ и науке о данных вы рады, и как Astronomer готовится к ним?

Объяснимый ИИ является чрезвычайно важной и fascинiruyuschie областью разработки. Способность заглянуть в внутреннюю работу очень крупных моделей почти жуткая. И я также заинтересован в том, как сообщество будет бороться с воздействием на окружающую среду обучения и настройки моделей. В Astronomer мы продолжаем обновлять наш реестр со всеми последними интеграциями, чтобы данные- и ML-команды могли подключаться к лучшим сервисам моделей и наиболее эффективным платформам вычислений без каких-либо усилий.

Как вы представляете себе интеграцию передовых инструментов ИИ, таких как LLM, с традиционными системами управления данными в течение следующих нескольких лет?

Мы видели, как Databricks и Snowflake сделали объявления недавно о том, как они включают как использование, так и разработку LLM в своих платформах. Другие СУБД и платформы машинного обучения будут делать то же самое. Это здорово видеть, что инженеры-данные имеют такой легкий доступ к таким мощным методам прямо из командной строки или SQL-пrompt.

Я особенно заинтересован в том, как реляционные базы данных включают машинное обучение. Я всегда жду, когда методы машинного обучения будут включены в стандарт SQL, но по какой-то причине две дисциплины никогда не действительно сработали вместе. Может быть, в этот раз будет по-другому.

Я очень рад будущему больших языковых моделей, чтобы помочь работе инженера-данных. Для начала большие языковые модели уже были особенно успешными в генерации кода, хотя ранние усилия по обеспечению данных-ученых предложениями ИИ были смешанными: Hex великолепен, например, тогда как Snowflake не вдохновляет пока. Но есть огромный потенциал изменить природу работы для команд данных, намного больше, чем для разработчиков. Почему? Для программистов подсказка — это имя функции или документация, но для инженеров-данных есть также данные. Есть так много контекста, с которым модели могут работать, чтобы сделать полезные и точные предложения.

Какой совет вы дадите начинающим данным-ученым и инженерам ИИ, которые хотят сделать вклад в отрасль?

Учитесь, делая. Это невероятно легко строить приложения сегодня, и дополнять их искусственным интеллектом. Итак, построите что-то крутое и отправьте его другу друга друга, который работает в компании, которую вы уважаете. Или отправьте мне, и я обещаю, что я посмотрю!

Секрет в том, чтобы найти что-то, что вы увлечены, и найти хороший источник связанных данных. Друг мой сделал fascинiruyuschie анализ аномальных сезонов бейсбола, восходящих к 19 веку, и открыл истории, которые заслуживают быть снятыми в фильме. И некоторые инженеры Astronomer недавно собрались на выходных, чтобы построить платформу для самозаживления конвейеров данных. Я не могу даже представить, что я пытаюсь сделать что-то подобное несколько лет назад, но с помощью нескольких дней усилий мы выиграли хакатон Cohere и построили основу для нового ключевого функционала в нашей платформе.

Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Astronomer.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.