Інтерв’ю

Корі Сандерс, старший віце-президент з продукту в CoreWeave – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Корі Сандерс, старший віце-президент з продукту в CoreWeave (CRWV ), очолює стратегію та виконання продукту для одного з найшвидше зростаючих хмарних платформ, орієнтованих на штучний інтелект. Він відповідає за масштабування інновацій, формування рішень, створених разом з клієнтами, та зміцнення позицій CoreWeave на ринку інфраструктури штучного інтелекту. До приходу в CoreWeave Сандерс провів два десятиліття в Microsoft (MSFT ) на керівних посадах, що охоплювали інженерію хмарних технологій, платформи для окремих галузей, комерційну стратегію рішень та партнерства з великими підприємствами, маючи глибокий досвід у поєднанні технічної реалізації та стратегії виходу на ринок.

CoreWeave – це хмарний провайдер, орієнтований на штучний інтелект, створений спеціально для високопродуктивних обчислень та великомасштабних завдань штучного інтелекту. Компанія експлуатує швидко розширювану мережу дата-центрів по всьому США та Європі, надаючи інфраструктуру та програмне забезпечення, орієнтовані на навчання, висновок та передові випадки використання. Зосереджуючись на спеціально створеній архітектурі, а не на загальній хмарній платформі, CoreWeave став критично важливим інфраструктурним партнером для лабораторій штучного інтелекту та підприємств, які шукають продуктивність, масштабованість та ефективність у великих масштабах.

Ви провели понад 20 років у Microsoft, працюючи над інженерією Windows, стратегією продажів хмарних технологій та Microsoft Cloud для галузей. Що це прогресування навчило вас про те, що справді стимулює прийняття рішень підприємствами, і як ви застосовуєте ці уроки сьогодні в CoreWeave?

Прийняття рішень підприємствами починається з вирішення конкретної проблеми клієнта. Інновації заради інновацій не є так важливими для підприємств. Це про те, щоб поставити себе на місце клієнта, щоб зрозуміти, що йому справді потрібно – чи це вартість підтримки, операційна складність, зв’язок з клієнтами чи управління глобальними командами та новими продуктами, – і потім надавати послуги, які допоможуть їм. Клієнти часто готові бути інноваційними у своєму підході, але найважливішим є допомога їм у вирішенні їхньої проблеми. Найпоширеніша помилка, яку я бачив у дизайні продукту, полягає в тому, що надто багато уваги приділяється “крутізації” продукту. Хоча це має вагу на споживчому ринку, підприємства в кінцевому підсумку більше турбуються про корисність, ніж про “крутість”.

CoreWeave часто описується як постачальник спеціально створеної інфраструктури штучного інтелекту. У практичному сенсі, що означає бути спеціально створеним з продуктової точки зору, і де загальні хмарні платформи мають труднощі з завданнями штучного інтелекту?

Найбільша перевага спеціально створеної інфраструктури полягає в можливості зосередитися та надавати послуги без необхідності вирішувати кожний загальний випадок використання. Я приведу два приклади: один у програмному забезпеченні, інший у апаратному.

На програмному рівні наша пропозиція Object Storage з кешем LOTA орієнтована конкретно на кешування для завдань штучного інтелекту. Вона розгортається безпосередньо на вузлах GPU, надає кінцеву точку S3 для програми та реагує на запити GPU, розгортаючи свій кеш по кількох вузлах. Це збільшує пропускну здатність до GPU до 7 ГБ/с, що значно перевищує те, що пропонують загальні хмарні платформи. Ми можемо досягти цього, оскільки робимо припущення про завдання штучного інтелекту щодо читання/запису та макетів кластерів. Якщо клієнт використовував би це для розміщення бази даних або сайту електронної комерції, це не мало би такого самого впливу. Це визначення спеціально створеного програмного забезпечення.

Приклад апаратного рівня подібний. У зв’язку зі своєю розгорнутою інфраструктурою останніх поколінь NVIDIA (NVDA ), багато з яких вимагають рідкого охолодження, CoreWeave побудував спеціальну експертизу та дизайн дата-центрів для підтримки цих потреб. На відміну від більших хмарних платформ, які будують для універсальності, а потім повинні додати рідке охолодження ретроспективно, CoreWeave будує дата-центри, орієнтовані на штучний інтелект, з самого початку. Це призводить до нижчих витрат та вищої доступності для останніх моделей.

Нижче зображено кеш LOTA, про який йшлося.

Коли клієнти вперше думають про масштабування штучного інтелекту, багато хто вважає, що їм потрібен лише доступ до GPU. Що вони зазвичай розуміють, чого їм бракує, коли вони починають тренувати або розгортати моделі у великих масштабах?

У зв’язку з складністю виконання завдань на великих кластерах GPU, навколишні послуги стають справжніми драйверами успіху. Це включає очевидні речі, такі як сховище та мережеві послуги, але також критично важливі операційні послуги, такі як спостереження, оркестрація та безпека. Це місце, де CoreWeave справді сяє нашою пропозицією Mission Control. Вона надає клієнтам глибокий огляд стану вузлів та часу виконання по всьому їхньому флоту, інтегруючи цю інформацію безпосередньо в двигун оркестрації. Це дозволяє клієнту розглядати свою інфраструктуру не як 1000 окремих GPU, а як єдину, цілісну сутність завдання.

Які зараз ваші головні пріоритети продукту для поліпшення результатів клієнтів, чи то продуктивності, надійності, передбачуваності вартості чи досвіду розробника?

У нашій основній платформі ми постійно зосереджені на продуктивності, надійності та спостереженні. Ми повинні забезпечити клієнтам можливість запускати завдання повторно та передбачувано, одночасно tận dụng кожної можливої операції в кожному GPU. Окрім цього, ми працюємо над спрощенням процесу налаштування для клієнтів, які можуть не бути знайомі з кожним деталями інструментів типу SLURM (який використовується всіма, але майже всі ненавидять). Нарешті, ми розробляємо додаткові послуги та моделі оплати, щоб зробити інновації легшими та дешевшими. Наразі експериментування досить складно через високі бар’єри входу, такі як обмеження потужності, трирічні зобов’язання та необхідність спеціалізованих експертів, просто щоб почати. Ми хочемо повернути легкість інновацій на платформу штучного інтелекту.

Як зміна завдань штучного інтелекту з тренувальних до висновкових впливатиме на дизайн інфраструктури та рішення щодо дорожньої карти продукту?

Це створює значні можливості застосувати існуючу диференціацію CoreWeave до вимог висновку. Наприклад, кеш LOTA, про який я згадував, зосереджений на годуванні GPU під час тренування; однак ми можемо взяти ту саму технологію, інтегрувати її в речі, такі як KVCache, і перетворити її на потужну диференціацію висновку. Подібно, інструменти типу Mission Control стають ще більш важливими для висновку, оскільки спостереження за здоров’ям GPU є критично важливим для виконання високодоступних програм.

За наступні один-два роки, що визначатиме лідерство на ринку хмарних технологій штучного інтелекту, і які можливості будуть найважливішими для клієнтів?

Я вважаю, що лідерство буде визначатися двома речами. Перше – це надання зростаючих вимог до масштабу для тренування. Це буде вимагати вдосконалень у спостереженні, моніторингу стану та автоматичному відновленні. Коли ви переходите від сотень до десятків тисяч GPU, розподілених по всьому світу, ручна реакція на відмови є недопустимою.

Друге – це надання правильних послуг для висновку та завдань агентів. Це вимагатиме можливостей глобального розгортання та бізнес-моделей, які заохочують експериментування. Цей шаблон використання був тим, що допоміг хмарам зростати спочатку, і він був частково втрачений у віці штучного інтелекту. Ми повинні повернути його через кращу підтримку платформи, багатокладові можливості та легкість використання в багаторегіонному середовищі.

Ви раніше очолювали галузеві ініціативи хмарних технологій у сфері охорони здоров’я, роздрібної торгівлі, фінансових послуг, виробництва та суверенних хмар. Які уроки з цих вертикалей перекладаються безпосередньо на інфраструктуру штучного інтелекту, а які ні?

Поколінні зміни в GPU продовжують вводити нові складності. Кожен новий реліз приносить збільшену взаємозв’язність, більшу пам’ять та більші потреби у потужності, tất of які вимагають від нас перегляду наших припущень про те, як вузли підключені та як програмне забезпечення доставляється. Нам потрібно залишатися безжалісними в цьому напрямку, щоб підтримувати наше лідерство. З іншого боку, галузь, яка покращується найшвидше, – це масштаб того, чого клієнти можуть досягти; швидкість, з якою вони адаптуються до більших обчислювальних потужностей, вражає.

Як операційні завдання інфраструктури штучного інтелекту та кластерів продовжують зростати, які операційні завдання виявляються найскладнішими для вирішення сьогодні, а які покращуються найшвидше?

Поколінні зміни в GPU продовжують створювати нові складності у дизайні та програмному забезпеченні. Кожен новий реліз приносить збільшену взаємозв’язність, більшу пам’ять, більші потреби у потужності тощо, що вимагають від нас перегляду наших припущень про те, як вузли підключені, як стійки керуються та як програмне забезпечення доставляється. Нам потрібно продовжувати зосереджуватися на цій роботі, щоб підтримувати наше лідерство. Ті, які покращуються найшвидше, – це те, чого клієнти можуть досягти з ростом масштабу обчислень.

У інфраструктурі штучного інтелекту надійність виходить за рамки простого часу безперебійного функціонування. Як CoreWeave визначає надійність, і які індикатори найкраще відображають успіх з точки зору клієнта?

У великих масштабах найбільшою турботою клієнта є просто виконання завдання. У великих операціях окремі відмови або сповільнення очікуються. Ключовим є те, як ми виявляємо та реагуємо на ці проблеми автоматично, щоб завдання було завершено, незважаючи на труднощі. Це причина, чому ми інтегруємо Mission Control у вищому рівні послуг, такі як SUNK (Slurm на Kubernetes). Це дозволяє клієнтам реагувати на відмови автоматично, не втрачаючи годин або тижнів роботи. Для нас успіх не полягає лише у часі безперебійного функціонування вузлів; це про успіх завдання.

Оглядаючи майбутнє, яка велика зміна в інфраструктурі штучного інтелекту, на вашу думку, все ще недооцінюється, пов’язана з еволюцією апаратного забезпечення, спеціалізацією стеків, вимогами суверенітету чи новими моделями розгортання?

Я вважаю, що появу навчання з підкріпленням (RL) як оновленої частини стеку штучного інтелекту все ще недооцінюють. Хоча це не нова галузь дослідження, вона була частково затінена під час першої хвилі розробки великих мовних моделей. RL повертається і відігратиме важливу роль у тому, щоб зробити послуги штучного інтелекту більш реактивними до змінних ландшафтів їхніх користувачів. Через це ми дуже раді нашій пропозиції серверного RL сьогодні.

Дякуємо за велике інтерв’ю. Читачам, які бажають дізнатися більше, рекомендуємо відвідати CoreWeave.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.