Интервью

Кристиан Стано, технический директор Anyscale – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Кристиан Стано, технический директор Anyscale, построил карьеру на пересечении крупномасштабной инфраструктуры искусственного интеллекта, платформ машинного обучения и распределенных вычислений. До присоединения к Anyscale он возглавлял организацию платформы AI/ML в Attentive, где он масштабировал инфраструктуру, поддерживающую персонализацию для более чем половины миллиарда подписчиков, и помогал продвигать внедрение объединенных систем вычислений на основе Ray, которые улучшили скорость разработки, снижая при этом операционные затраты. Ранее в своей карьере он работал в области кибербезопасности, облачной архитектуры и государственных инициатив по искусственному интеллекту в организациях, включая Coalfire и Deloitte, где он внес вклад в одну из первых платформ машинного обучения Министерства обороны США. Его опыт охватывает инженерию платформ искусственного интеллекта, MLOps, облачную инфраструктуру, обеспечение разработчиков и масштабирование организаций, давая ему глубокий опыт в помощи предприятиям внедрять искусственный интеллект в производство.

Anyscale – это компания, стоящая за Ray, открытой платформой распределенных вычислений, широко используемой для масштабирования искусственного интеллекта и рабочих нагрузок Python на кластерах процессоров и графических процессоров. Основанная создателями Ray из RISELab Университета Калифорнии в Беркли, компания фокусируется на упрощении развертывания, оркестровки и управления крупномасштабной инфраструктурой искусственного интеллекта для обучения, вывода, обработки данных и агентских рабочих нагрузок искусственного интеллекта. Ее платформа позволяет организациям запускать распределенные системы искусственного интеллекта в облачных и локальных средах, обеспечивая наблюдаемость, управление и оптимизацию производительности, предназначенные для современных приложений искусственного интеллекта. Ray стал основным слоем в появляющемся стеке инфраструктуры искусственного интеллекта, помогая разработчикам масштабировать рабочие нагрузки от одной машины до тысяч узлов с минимальными изменениями существующего кода Python.

Вы работали в области кибербезопасности, государственных платформ машинного обучения и гипермасштабных систем персонализации. Какие закономерности вы постоянно видите, когда организации пытаются перейти от пилотных проектов в производство?

По отраслям, три закономерности постоянно появляются. Во-первых, команды не имеют надежного пути от разработки к производству. Они могут построить модель в блокноте, но нет стандартизированного способа запустить ее в производстве. Каждое развертывание становится единичным, и каждая неудача является сюрпризом. Во-вторых, инфраструктура не может масштабироваться с потребностями. Система, которая работала в пилотном проекте, падает, когда вы кормите ее реальными объемами данных или реальным трафиком. В-третьих, команды летят вслепую. У них нет наблюдаемости, чтобы знать, как их системы фактически работают, где они собираются сломаться и когда вмешаться.

Что соединяет все три – это одна и та же корневая проблема – команды не имеют прочной умственной модели для масштабирования. Они пытаются решить все сразу, вместо того, чтобы быть намеренными в последовательности. Я думаю об этом как о трех фазах: сделать так, чтобы это работало, сделать так, чтобы это было правильно, сделать так, чтобы это было быстро. Эти фазы не являются одноразовыми вехами – эти фазы являются итеративными. Вы постоянно расставляете приоритеты между тем, что сломано прямо сейчас, и тем, что сломается в следующий раз. Команды, которые преуспевают, знают, в какой фазе они находятся и остаются дисциплинированными, не прыгая вперед, прежде чем основа будет прочной.

В Anyscale мы видим команды, которые приходят на каждом этапе. Некоторые все еще пытаются сделать так, чтобы это работало – им нужен надежный путь от разработки к производству. Другие имеют это, но тонут в операционной сложности и нуждаются в том, чтобы сделать так, чтобы это было правильно. И многие приходят к нам, потому что они построили что-то, что работает, но не могут толкнуть его к масштабу, который требует бизнес. Единый слой вычислений помогает на каждом этапе, но точка входа зависит от того, где боль наиболее сильна.

В Attentive вы помогли масштабировать системы искусственного интеллекта, поддерживающие сотни миллионов пользователей. Какие были самые большие архитектурные или организационные瓶ки, которые вам пришлось преодолеть, чтобы достичь этого уровня масштабирования?

Самым большим瓶ком была кривая сложности инфраструктуры. Когда мы толкали наши модели, чтобы включить больше данных и обслужить больше клиентов, мы столкнулись с точкой перегиба вычислений, где даже самые крупные вертикально масштабируемые узлы выбрасывали ошибки нехватки памяти, и наивное горизонтальное масштабирование не помогало. Наша вычислительная мощность не могла поспевать за масштабом наших данных.

Естественной реакцией было слоить больше инструментов, чтобы работать вокруг ограничений. Это был мой внутренний план действий из предыдущего опыта. Каждый инструмент решал узкую проблему, но добавлял операционную сложность. Наша трубопровод машинного обучения стал заплаткой из интеграций, и каждый новый случай использования означал больше шитья, больше режимов неисправности, более высоких затрат и более высокого накладных расходов для команды платформы.

Что в конечном итоге разблокировало масштаб для нас, было объединение обработки данных, обучения, вывода и обслуживания на Ray и Anyscale. Воздействие было немедленным: с драматически более низкими затратами на инфраструктуру, значительно более быстрыми циклами обучения, даже когда объемы данных росли, и способностью масштабировать модели до порядков более клиентов.

Что мотивировало ваше решение присоединиться к Anyscale на этом этапе, и как вы видите роль технического директора в формировании внедрения искусственного интеллекта в предприятиях?

Мой опыт внедрения Anyscale в Attentive фундаментально изменил мой план действий для построения платформ машинного обучения. До этого значительная часть инженерии платформ была стоимостью шитья фрагментированных систем. С Anyscale мы смогли устранить большую часть этого накладного расхода и вместо этого сосредоточиться на опыте разработчика, надежности и производительности. Этот сдвиг имел огромное влияние на производительность команд и результаты систем. Присоединение к Anyscale было возможностью работать над этой проблемой полный рабочий день и помочь другим организациям пройти через тот же переход. Как технический директор, моя роль заключается в том, чтобы взять эти реальные уроки и превратить их в повторяющиеся закономерности, которые наши клиенты могут применить при масштабировании искусственного интеллекта.

Многие предприятия все еще застряли в «пилотной фазе» искусственного интеллекта. С вашей точки зрения, что конкретно ломается, когда компании пытаются масштабировать эти ранние эксперименты в производственные системы?

Когда компании переходят от экспериментов с искусственным интеллектом в производство, что ломается, редко является только моделью – это окружающая система и операции. В некоторых случаях команды сталкиваются с ограничениями инфраструктуры на ранней стадии и не могут обучать или обслуживать в масштабе, который они хотят. Им приходится ограничивать количество клиентов или случаев использования, которые их модель обслуживает, в результате. Более часто, проблемы возникают в производстве через неожиданные краевые случаи или изменения в данных. Одной из наиболее распространенных точек неисправности является память: когда размер, распределение или модальность данных меняются, задания заканчиваются памятью и неудачно завершаются. Эти проблемы трудно предвидеть и еще труднее автоматически восстановиться. Реальность заключается в том, что неисправность в производстве искусственного интеллекта неизбежна. Цель не состоит в том, чтобы полностью избежать ее, а в том, чтобы быстро обнаружить, понять и построить самовосстанавливающиеся системы, чтобы решить ее, прежде чем она повлияет на бизнес.

Ray, платформа распределенных вычислений, созданная командой за Anyscale, набирает обороты как основа для рабочих нагрузок искусственного интеллекта. Почему распределенная реализация становится такой критической в современной инфраструктуре искусственного интеллекта?

Распределенная реализация и управление рабочими нагрузками стали основными требованиями для трубопроводов искусственного интеллекта. Современные рабочие нагрузки искусственного интеллекта по своей природе параллельны и требуют больших ресурсов. Обучение, вывод и обработка данных все требуют координации большого количества задач на процессорах и графических процессорах, часто динамически. В сегодняшнем ландшафте вычислений сложность управления этими рабочими нагрузками на ограниченных ресурсах является огромным операционным бременем. Традиционные системы не были разработаны для этого уровня сложности или масштаба. Платформы, такие как Ray, являются критически важными, потому что они позволяют командам масштабировать рабочие нагрузки без проблем от одной машины до тысяч узлов, автоматизируя основную координацию. Этот сдвиг отражает более широкий переход к вычислениям, родным для искусственного интеллекта, где инфраструктура разработана специально для закономерностей рабочих нагрузок искусственного интеллекта, а не адаптирована из более старых парадигм.

Когда больше компаний принимают Ray через платформу Anyscale, какие различия вы видите между организациями, которые стандартизируют единый подход, и теми, которые шьют фрагментированное инструментирование?

Разница между едиными платформами и фрагментированным инструментарием в конечном итоге сводится к фокусу и эффективности. Когда команды полагаются на несколько несвязанных систем, они тратят значительное количество времени на шитье этих систем вместе, управление несоответствиями и реагирование на неисправности в разных средах. Это создает операционный накладной расход и замедляет экспериментирование. Напротив, единый подход позволяет командам сосредоточить свои усилия на улучшении единой системы, что приводит к лучшей надежности, более сильной производительности и более упрощенному опыту разработчика. Это также упрощает процессы на вызов и отладки, потому что закономерности последовательны и легче понять. Результатом не является только техническая эффективность, но и организационная ясность.

На основе вашего опыта построения платформ машинного обучения, насколько важен опыт разработчика в ускорении внедрения искусственного интеллекта в команды?

Опыт разработчика является одной из наиболее высоких областей приоритета для ускорения внедрения искусственного интеллекта. Когда команды платформ инвестируют в упрощение систем, устанавливая стандартизированные рабочие процессы, шаблоны и снижая инфраструктурную сложность, они усиливают производительность каждого инженера в организации. Это особенно важно в искусственном интеллекте, где темп изменений чрезвычайно быстр и командам нужно быстро итерировать, чтобы оставаться конкурентоспособными. Улучшения в опыте разработчика напрямую переводятся в более быстрое экспериментирование, более быстрое время выхода на рынок и, в конечном итоге, более сильное влияние на бизнес. Инструменты кодирования искусственного интеллекта усиливают эти основы опыта разработчика. Во многих отношениях это наиболее масштабный способ увеличения скорости на протяжении всей организации.

Эффективность затрат становится основной проблемой, когда рабочие нагрузки искусственного интеллекта масштабируются. Какие есть наиболее упущенные способы, которыми предприятия могут снизить затраты на инфраструктуру, не жертвуя производительностью?

Когда рабочие нагрузки искусственного интеллекта масштабируются, управление затратами становится как более важным, так и более сложным. Одной из наиболее упущенных проблем является то, как быстро затраты могут спиралевидно расти из-за неэффективностей, особенно с инфраструктурой на основе графических процессоров. Большие кластеры могут запускать тысячи узлов, и если ресурсы не правильно управляются или не выключаются, затраты накапливаются быстро. Это создает форму специфичной для искусственного интеллекта распылённости, где использование вычислительных ресурсов растет быстрее, чем команды могут отслеживать или контролировать. Решение этой проблемы требует комбинации сильного управления, наблюдаемости и автоматизации, такой как автомасштабирование, автоматическое завершение и централизованное управление ресурсами. На уровне масштаба эффективность затрат не является только операционной проблемой, это фундаментальная часть системного проектирования.

Вы работали над всем, от хранилищ функций до систем вывода в реальном времени. Как вы думаете, баланс между пакетными и реальными рабочими нагрузками искусственного интеллекта эволюционирует?

Баланс между пакетными и реальными рабочими нагрузками искусственного интеллекта не изменился фундаментально – он остается вопросом требований бизнеса. Пакетная обработка обычно более экономична и легче в эксплуатации, что делает ее подходящей для многих случаев использования. Системы реального времени необходимы, когда задержка напрямую влияет на опыт пользователя или результат бизнеса, например, в приложениях для чата или обнаружении мошенничества. Оба подхода будут продолжать сосуществовать, и ключ для организаций заключается в том, чтобы построить платформы, которые могут поддерживать каждый эффективно. Решение в конечном итоге сводится к компромиссу между затратами, задержкой и надежностью.

Оглядываясь вперед, что такое «зрелая» платформа искусственного интеллекта для предприятий через 2-3 года – и как инструменты, такие как Ray, и платформы, такие как Anyscale, вписываются в это будущее?

За следующие несколько лет зрелые платформы искусственного интеллекта для предприятий будут определяться несколькими ключевыми характеристиками. Они будут полагаться на единую инфраструктуру, поддерживающую весь жизненный цикл искусственного интеллекта, от обработки данных до обучения и вывода, а не на коллекцию несвязанных инструментов. У них будет сильная эксплуатация на вторые сутки, с автоматизированной наблюдаемостью, надежностью и быстрой отладкой. Управление затратами будет предсказуемым и управляемым, позволяя организациям масштабироваться устойчиво. И, возможно, самое главное, они будут обеспечивать высокую скорость разработки, делая легко для команд перейти от идеи к производству быстро. Платформы, такие как Ray и Anyscale, играют центральную роль в этом будущем, предоставляя основу, родную для искусственного интеллекта, которая делает возможным этот уровень масштаба и эффективности.

Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Anyscale.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.