Интервью

Кори Сандерс, старший вице-президент по продукту в CoreWeave – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Кори Сандерс, старший вице-президент по продукту в CoreWeave (CRWV ), возглавляет стратегию и выполнение продукта для одной из самых быстрорастущих AI-ориентированных облачных платформ. Он отвечает за масштабирование инноваций, создание решений, разработанных специально для клиентов, и укрепление позиций CoreWeave на рынке AI-инфраструктуры. До CoreWeave Сандерс провел два десятилетия в Microsoft (MSFT ) на руководящих должностях, охватывающих облачную инженерию, платформы для конкретных отраслей, коммерческую стратегию решения и крупномасштабные партнерские отношения с предприятиями, имея глубокий опыт в объединении технической реализации и стратегии выхода на рынок.

CoreWeave – это облачный провайдер, ориентированный на AI, построенный специально для высокопроизводительных вычислений и крупномасштабных искусственных интеллектных рабочих нагрузок. Компания эксплуатирует быстро расширяющуюся сеть центров обработки данных по всей территории США и Европы, предоставляя инфраструктуру и программное обеспечение, ускоренные GPU, предназначенные для обучения AI, вывода и передовых вычислительных случаев использования. Сосредоточившись на архитектуре, разработанной для конкретных целей, а не на общей облачной архитектуре, CoreWeave стала критически важным партнером по инфраструктуре для AI-лабораторий и предприятий, ищущих производительность, масштабируемость и эффективность в масштабе.

Вы провели более 20 лет в Microsoft, работая над инженерией Windows, стратегией облачных продаж и Microsoft Cloud для отраслей. Что это прогрессирование научило вас о том, что действительно стимулирует принятие решений на уровне предприятия, и как вы применяете эти уроки сегодня в CoreWeave?

Принятие решений на уровне предприятия начинается с решения конкретной проблемы клиента. Инновации ради инноваций на самом деле не так важны для предприятия. Это о том, чтобы поставить себя на их место, чтобы понять, что действительно беспокоит их – будь то стоимость поддержки, операционная сложность, связь с клиентами или управление глобальными командами и новыми продуктами – и затем предоставление услуг, которые помогают. Они часто готовы быть инновационными в своем подходе, но наиболее важным фактором является помощь им в решении их проблемы. Наиболее частой ошибкой, которую я видел в проектировании продукта, является слишком большое увлечение “крутизной” продукта. Хотя это имеет вес в потребительском пространстве, клиенты на уровне предприятия в конечном итоге заботятся гораздо больше о полезности, чем о “крутизне”.

CoreWeave часто описывается как предлагающий инфраструктуру AI, разработанную для конкретных целей. В практическом смысле, что означает “разработанная для конкретных целей” с точки зрения продукта, и где общепurpose облачные платформы испытывают трудности с рабочими нагрузками AI?

Наибольшая польза от разработки для конкретных целей заключается в возможности сосредоточиться и предоставлять услуги без необходимости решать каждую общую задачу. Я приведу два примера: один в программном обеспечении и один в аппаратном обеспечении.

На стороне программного обеспечения наше предложение Object Storage с кэшем LOTA ориентировано конкретно на кэширование для рабочих нагрузок AI. Оно развертывается直接 на узлах GPU, предоставляет конечную точку S3 для приложения и реагирует на запросы GPU, распространяя свой кэш по нескольким узлам. Это увеличивает пропускную способность до GPU до 7 ГБ/с, что намного превышает то, что предлагают общепurpose облачные платформы. Мы можем добиться этого, потому что делаем предположения о рабочих нагрузках AI, разделах чтения/записи и макете кластера. Если клиент использовал это для размещения базы данных или электронной коммерции, это не имело бы такого же воздействия. Это и есть разработка для конкретных целей.

Пример с аппаратным обеспечением аналогичен. Учитывая наш обширный развертывание последних поколений NVIDIA (NVDA ) – многие из которых требуют жидкостного охлаждения – CoreWeave построила конкретную экспертизу и конструкции центров обработки данных для поддержки этих потребностей. В отличие от более крупных облачных платформ, которые строят для взаимозаменяемости, а затем вынуждены ретроспективно добавлять жидкостное охлаждение, CoreWeave строит центры обработки данных, ориентированные на AI, с нуля. Это приводит к снижению затрат и более высокой доступности для последних моделей.

Ниже приведено изображение кэша LOTA, упомянутого выше.

Когда клиенты впервые начинают думать о масштабировании AI, многие считают, что им нужно только получить доступ к GPU. Что они обычно осознают, чего не хватает, как только они начинают обучать или обслуживать модели в масштабе?

Учитывая сложность выполнения рабочих нагрузок на огромных кластерах GPU, окружающие услуги становятся真正щими драйверами успеха. Это включает в себя очевидные вещи, такие как хранилище и сеть, но также критически важные операционные услуги, такие как наблюдаемость, оркестровка и безопасность. Вот где CoreWeave действительно сияет с нашей предложением Mission Control. Оно предоставляет клиентам глубокое понимание здоровья узла и времени выполнения по всему их флоту, интегрируя эти знания напрямую в движок оркестровки. Это позволяет клиенту относиться к своей инфраструктуре не как к 1000 отдельным GPU, а как к единому, сплоченному сущности задания.

Каковы ваши главные приоритеты продукта прямо сейчас, чтобы улучшить результаты клиентов, будь то производительность, надежность, предсказуемость затрат или опыт разработчика?

В ядре платформы мы постоянно сосредоточены на производительности, надежности и наблюдаемости. Мы должны обеспечить, чтобы клиенты могли запускать задания повторяемым и предсказуемым образом, используя каждый TFLOP в каждом GPU. Кроме того, мы работаем над упрощением процесса подключения для клиентов, которые могут не быть знакомы со всеми колокольчиками и свистками в инструменте, таком как SLURM (который все используют, но почти все ненавидят). Наконец, мы разрабатываем дополнительные услуги и модели выставления счетов, чтобы сделать его проще инновировать и начать с малого. Сейчас экспериментирование удивительно сложно из-за высоких барьеров для входа, таких как ограничения на емкость, трехлетние обязательства и необходимость специализированных экспертов, чтобы просто начать. Мы хотим вернуть легкость инноваций на платформу AI.

По мере того, как все больше рабочих нагрузок AI переходят от обучения к выводу, как это влияет на проектирование инфраструктуры и принятие решений о дорожной карте продукта?

Это создает значительные возможности для применения существующей дифференциации CoreWeave к требованиям вывода. Например, кэш LOTA, о котором я упоминал, ориентирован на кормление GPU во время обучения; однако, мы можем взять ту же технологию, интегрировать ее в такие вещи, как KVCache, и превратить ее в мощную дифференциацию вывода. Аналогично, инструменты, такие как Mission Control, становятся еще более важными для вывода, поскольку наблюдение за здоровьем GPU имеет решающее значение для запуска высокодоступных агентных приложений.

В течение следующих одного-двух лет, что определит лидерство на рынке облачных вычислений AI, и какие возможности будут наиболее важны для клиентов?

Я думаю, что лидерство будет определяться двумя вещами. Первое – это предоставление все возрастающихся требований к масштабу для обучения. Это будет требовать достижений в наблюдаемости, мониторинге здоровья и автоматическом восстановлении. Когда вы переходите от сотен до десятков тысяч GPU, распределенных по всему миру, ручная реакция на отказы – это не вариант.

Второе – это предоставление правильных услуг для вывода и агентных рабочих нагрузок. Это требует возможностей глобального развертывания и бизнес-моделей, которые поощряют экспериментирование. Этот шаблон использования помог облачным вычислениям расти изначально, и он был несколько потерян в эпоху AI. Нам нужно вернуть его через лучшую поддержку платформы, возможности многооблачных вычислений и легкость использования в нескольких регионах.

Ранее вы возглавляли инициативы по облачным вычислениям для конкретных отраслей, таких как здравоохранение, розничная торговля, финансовые услуги, производство и суверенные облака. Какие уроки из этих вертикалей переводятся напрямую на инфраструктуру AI, а какие нет?

Генерационные сдвиги в GPU продолжают вводить новые сложности. Каждый новый выпуск приносит повышенную взаимосвязанность, большую память и большее потребление энергии, все из которых требуют от нас пересмотра наших предположений о том, как узлы соединены и как доставляется программное обеспечение. Нам необходимо оставаться беспощадными здесь, чтобы сохранить наше лидерство. С другой стороны, область, которая улучшается наиболее быстро, – это масштаб того, что клиенты могут достичь; скорость, с которой они адаптируются к более крупным вычислительным следам, впечатляет.

По мере того, как центры обработки данных и кластеры AI продолжают расти в масштабе, какие операционные проблемы оказываются наиболее трудными для решения сегодня, и какие из них улучшаются наиболее быстро?

Генерационные сдвиги GPU продолжают создавать новые сложности в проектировании и программном обеспечении. Каждый новый выпуск GPU приносит повышенную взаимосвязанность, большую память и большее потребление энергии, все из которых требуют от нас пересмотра наших предположений о том, как узлы соединены, как управляются стойки и как доставляется программное обеспечение. Нам необходимо продолжать сосредотачиваться на этой работе, чтобы сохранить наше лидерство. Те, которые улучшаются наиболее быстро, – это то, чего могут достичь клиенты с растущим масштабом вычислений.

В инфраструктуре AI надежность выходит за рамки простого времени безотказной работы. Как CoreWeave определяет надежность, и какие показатели лучше всего отражают успех с точки зрения клиента?

В масштабе главным соображением для клиента является просто выполнение задания. В огромных операциях отдельные отказы или замедления ожидаемы. Ключом является то, как мы обнаруживаем и автоматически реагируем на эти проблемы, чтобы обеспечить выполнение задания, несмотря на сложности. Это причина, по которой мы интегрируем Mission Control в более высокие услуги, такие как SUNK (Slurm на Kubernetes). Это позволяет клиентам реагировать на отказы автоматически, не теряя часов или недель работы. Для нас успех не только в времени безотказной работы узла; это успех задания.

Оглядываясь вперед, какой значительный сдвиг в инфраструктуре AI, по вашему мнению, все еще недооценен, будь то связано с эволюцией аппаратного обеспечения, специализацией стеков, требованиями суверенитета или новыми моделями развертывания?

Я считаю, что появление обучения с подкреплением (RL) в качестве обновленной части стека AI все еще недооценено. Хотя это не новая область исследования, оно было в значительной степени затенено во время первой волны разработки LLM. RL возвращается и будет играть важную роль в том, чтобы сделать услуги AI более отзывчивыми к меняющимся ландшафтам их пользователей. Из-за этого мы очень взволнованы нашей предложением серверного RL, которое у нас есть сегодня.

Благодарим за отличное интервью, читатели, желающие узнать больше, должны посетить CoreWeave.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.