Моделі та платформи ШІ

CoreWeave підключає сотні GPU Rubin в один мульти-стійковий кластер

mm
Додайте Unite.AI до бажаних джерел у Google

CoreWeave 16 вересня 2026 року оголосив запуск мульти-стійкового NVIDIA Vera Rubin NVL72 у CoreWeave Cloud, розмістивши сотні GPU NVIDIA Rubin в один масштабований кластер для агентного ШІ. Компанія також представила дві нові можливості в CoreWeave AI Object Storage: прискорення запису між регіонами та новий рівень Archive.

Чен Голдберг, виконавчий віце-президент з продукту та інженерії в CoreWeave, сказав, що CoreWeave був першим постачальником AI‑хмари, який підтвердив і запустив Vera Rubin NVL72 і продемонстрував, що архітектура у масштабі стійки може працювати як надійний, високопродуктивний хмарний сервіс. «З мульти‑стійковим Vera Rubin ми підключаємо сотні GPU Rubin в один масштабований кластер», — сказав Голдберг, додаючи, що для клієнтів, які створюють агентний ШІ, це означає більший масштаб, швидшу ітерацію та вищу продуктивність, оскільки моделі та агенти безперервно навчаються та вдосконалюються.

Мульти‑стійкова архітектура та запуск

Один стійковий модуль Vera Rubin NVL72 поєднує 72 GPU Rubin з 36 процесорами Vera, NVIDIA NVLink 6, ConnectX-9 SuperNIC та BlueField-4 DPU. За допомогою мульти‑стійкового Vera Rubin NVL72, CoreWeave об’єднує стійки зі сотнями прискорювачів, використовуючи мережу Ethernet NVIDIA Spectrum‑X, в один масштабований кластер. CoreWeave заявив, що система забезпечує можливість навчати більші моделі, обслуговувати більш вимогливі навантаження інференції та запускати підкріплювальне навчання у великому масштабі.

За словами компанії, запуск завдань навчання та інференції на сотнях GPU Rubin важливий для багатокрокових агентних робочих навантажень, які чутливі до затримки доступу до даних, оскільки затримки можуть накопичуватись під час повторних викликів моделей та використання інструментів.

CoreWeave повідомив, що піднімає кілька стійок як єдину систему за допомогою автоматизованого керування життєвим циклом стійки, системної валідації та масштабування мережі. CoreWeave Mission Control автоматизує налаштування стійок через Rack LifeCycle Controller, виконуючи завдання, що охоплюють виявлення обладнання, оновлення прошивки, валідацію, живлення та охолодження; Racky відповідає за керування на рівні стійки, а Valvey виконує дії з охолодження. Перш ніж стійка перейде у виробництво, CoreWeave поєднує діагностику NVIDIA з повномасштабним тестуванням навантаження стійки та порівнює кожен результат, і лише стійки, які проходять цей поріг як система, переходять у виробництво.

З точки зору мережі, кожен GPU Rubin оснащений двома ConnectX-9 SuperNIC, забезпечуючи 1,6 Тб/с масштабованого з’єднання на GPU через багатоплощинні, багаторейкові шляхи. CoreWeave зазначив, що дизайн підтримує приблизно 128 000 GPU на рейку у неблокуючій тканині, і що модульна топологія дозволяє додавати стійки без переробки тканини при кожному розширенні.

AI‑Object Storage у різних регіонах

CoreWeave AI Object Storage наближає дані до робочих навантажень за допомогою LOTA (Local Object Transport Accelerator), який застосовує кероване кешування на кожному вузлі CoreWeave Kubernetes Service. CoreWeave зазначив, що LOTA забезпечує читання зі швидкістю локального NVMe, зменшує затримку в 8 разів порівняно з читанням з традиційного сховища, і надає до 7 ГБ/с пропускної здатності на GPU, масштабуючись лінійно зі зростанням кластерів.

Нове прискорення запису між регіонами дозволяє чекпоінти записувати локально в межах регіону з локальною затримкою, тоді як дані у фоновому режимі мігрують до другого віддаленого регіону. Оскільки застосунок бачить один bucket, не потрібні зміни коду, а правила доступу та збереження працюють однаково, незалежно від того, з якого регіону здійснено запис. CoreWeave заявив, що ця функція мінімізує паузу під час навчання та усуває необхідність ручного копіювання або переміщення даних між регіонами.

Друге доповнення, Archive, — це більш недорогий рівень сховища без плати за отримання даних, без плати за раннє видалення та без плати за читання з рівня. CoreWeave описав його як створений для даних, які команди інакше видалили б, наприклад чекпоінт з запуску, що майже спрацював, набір даних, необхідний для відтворення результату, або версію моделі, про яку можуть запитати через шість місяців.

«Наші набори даних охоплюють кілька регіонів, і ми не можемо дозволити, щоб наш графік навчання диктували затримки отримання даних між регіонами», — сказала Сесіль Роберт-Мішон, директор внутрішньої інфраструктури в Cohere. «CoreWeave AI Object Storage надає нам єдину структуру набору даних у різних регіонах з локальним кешуванням читань, тому нічого не чекає на мережу».

Технічні характеристики NVIDIA Vera Rubin NVL72

Сторінка продукту сторінка продукту Vera Rubin NVL72 від NVIDIA описує систему як стійковий агентний AI суперкомп’ютер, побудований на третьому поколінні дизайну стійки MGX NVL72 і тепер у повному виробництві. Опубліковані специфікації NVIDIA вказують 20,7 ТБ пам’яті HBM4 GPU з пропускною здатністю 1 400 ТБ/с, 216 ТБ/с пропускної здатності NVLink шостого покоління та 3 600 ПФЛОПС розріджених обчислень інференції NVFP4 на стійку. 36 процесорів Vera забезпечують 3 168 кастомних ядер Olympus і до 54 ТБ пам’яті LPDDR5X.

NVIDIA зазначає, що Vera Rubin NVL72 навчає моделі mixture-of-experts, використовуючи в чотири рази менше GPU порівняно з GB200 NVL72, і забезпечує інференцію за одну десяту вартості за мільйон токенів для високодинамічного, глибокого розумового агентного ШІ, з до 10‑разовим збільшенням токенів на мегават. У примітках на сторінці зазначено, що цифри інференції можуть змінюватися, а порівняння навчання є прогнозованою продуктивністю.

У оголошенні CoreWeave також вказала на свій рекорд продуктивності, посилаючись на рекордні результати бенчмарку MLPerf у інференції та навчанні та на свою позицію єдиного AI‑хмари, якій вдалося отримати найвищий Platinum‑рейтинг у обох версіях SemiAnalysis ClusterMAX 1.0 і 2.0. Компанія також зазначила, що зайняла перше місце за швидкістю інференції та співвідношенням ціна‑продуктивність моделей Kimi K2.6 і Kimi K2.7 Code від Moonshot AI у незалежному бенчмарку інференції, проведеному Artificial Analysis.

Тео Неш - це спеціаліст з генерації штучного інтелекту в Unite.AI, який займається інфраструктурою штучного інтелекту, обчисленнями та апаратними системами, які живлять сучасний штучний інтелект. Його робота зосереджена на технічних засадах великомасштабних завдань штучного інтелекту, включаючи центри даних, прискорювачі, мережування та програмні стеки, які їх поєднують.
З аналітичною та інженерно-орієнтованою перспективою Тео вивчає, як вдосконалення графічних процесорів, спеціалізованої мікросхеми, архітектур пам'яті та розподілених систем дозволяють створювати нові покоління моделей штучного інтелекту. Він приділяє особливу увагу компромісам між продуктивністю, енергоефективністю, масштабованістю та практичними обмеженнями, які формують реальне розгортання інфраструктури штучного інтелекту.
Статті, написані Тео Нешем, генеруються штучним інтелектом і перевіряються редакційною командою Unite.AI для забезпечення технічної точності, ясності та відповідальної висвітлення швидко розвивається ландшафту обчислень штучного інтелекту.