Партнерства

Crusoe підписує багаторічну угоду для забезпечення навчання та виведення Perplexity

mm
Додайте Unite.AI до бажаних джерел у Google

Crusoe 15 вересня 2026 р., оголосив багаторічне партнерство з Perplexity, згідно з яким Perplexity буде виконувати повний життєвий цикл моделей у Crusoe Cloud, навчаючи передові моделі на спеціалізованих кластерах NVIDIA GB300 NVL72 та обслуговуючи їх у виробництві через сервіс Managed Inference від Crusoe.

Оголошення, датоване Сан‑Франциско, також зобов’язує Crusoe впровадити Perplexity Enterprise Pro та Max для своїх 1 800 співробітників. За даними прес‑релізу, розгортання має забезпечити персонал пошуком у вебі та внутрішніх знань, багатокроковим дослідженням, аналізом даних та доступом до передових моделей ШІ.

У релізі продукти Perplexity охарактеризовано як працюючі в режимі реального часу для мільйонів користувачів, у середовищі, де затримка та пропускна здатність виведення є фактичним продуктом, а не теоретичними орієнтирами. Crusoe заявив, що його сервіс Managed Inference створений для виробничого рівня виведення, підсилений власними оптимізаціями та розроблений для продуктивності та вартості у популярних моделях, а Crusoe Cloud забезпечує операційну глибину та масштаб, що відповідає зростанню Perplexity.

Заяви керівництва

Співзасновник і CEO Crusoe Чейз Лочміллер заявив, що найшвидше розвиваються компанії ШІ потребують інфраструктури, яка встигає за всім життєвим циклом моделей і масштабується разом з їхнім зростанням. «Perplexity будує майбутнє того, як люди знаходять відповіді, і Crusoe є ключовим партнером у цьому, від першого електрона до останнього токену», — сказав Лочміллер.

Співзасновник і CEO Perplexity Аравінд Срінавіс зазначив, що робота ШІ у масштабах Perplexity означає, що кожна мілісекунда затримки відчувається користувачами. Він охарактеризував Crusoe як створений навколо цього обмеження, назвавши його високопродуктивним, низьколатентним виведенням, підкріпленим апаратним забезпеченням наступного покоління.

Діон Харріс, старший директор з HPC та рішень інфраструктури ШІ у NVIDIA, зазначив, що сучасний ШІ потребує уніфікованої обчислювальної архітектури від досліджень до розгортання. Працюючи на базі NVIDIA GB300 NVL72 та NVIDIA InfiniBand, Харріс сказав, що Crusoe Cloud дозволяє Perplexity навчати, тонко налаштовувати та обслуговувати передові моделі у виробництві з тією швидкістю та ефективністю, які вимагає агентний ШІ.

Платформа GB300 NVL72

Спеціалізовані кластери навчання, зазначені в угоді, працюють на NVIDIA GB300 NVL72, яку NVIDIA описує як повністю охолоджену рідинною системою, масштабну стійку, що інтегрує 72 графічних процесори Blackwell Ultra та 36 процесорів Grace на базі Arm. У публікації NVIDIA зазначено 130 ТБ/с пропускної здатності NVLink, 20 ТБ пам’яті GPU з пропускною здатністю до 576 ТБ/с, 37 ТБ швидкої пам’яті та 2 592 ядра CPU Arm Neoverse V2. Кожен GPU у системі отримує 800 Гб/с мережевого з’єднання через модуль вводу‑виводу ConnectX-8 SuperNIC, працюючи з Quantum‑X800 InfiniBand або платформами Ethernet Spectrum‑X.

NVIDIA стверджує, що AI‑фабрики, побудовані на GB300 NVL72, забезпечують до 50‑разового загального збільшення продуктивності виходу AI‑фабрик у порівнянні з платформами на базі Hopper. Компанія пояснює цей показник заявленим 10‑разовим покращенням реакції користувачів, вимірюваним у токенах за секунду на користувача, та 5‑разовим підвищенням пропускної здатності на мегават потужності щодо Hopper, і зазначає, що цифри є прогнозованою продуктивністю і можуть змінитися.

Сервіс керованого виведення та історія

Елемент угоди, що забезпечує виробниче обслуговування, працює на Crusoe Managed Inference, який компанія запущено у загальний доступ 20 листопада 2025 р. для виробничих навантажень виведення у Crusoe Cloud. Сервіс працює на власному інференційному двигуні Crusoe, побудованому навколо MemoryAlloy — кластерного кешу ключ‑значення, який усуває дублювання попередніх заповнень, дозволяючи GPU отримувати кеші префіксів з локальних та віддалених вузлів. Crusoe стверджує, що двигун забезпечує до 9,9‑разовий швидший час до першого токену та в 5 разів вищу пропускну здатність, порівняно з vLLM для моделі Llama-3.3-70B у розгортанні на чотирьох вузлах.

Crusoe пропонує сервіс у трьох варіантах розгортання, згідно з його сторінка продукту Managed Inference. Serverless Inference забезпечує споживання відкритих моделей за використанням через повністю керований API, орієнтований на ранні етапи навантажень, низькооб’ємний трафік та швидкі експерименти. Self‑Serve Deployments, які, за словами сторінки, тепер доступні у загальному доступі, запускають моделі, оптимізовані для пропускної здатності або реактивності, включаючи моделі, налаштовані за допомогою Serverless Fine‑Tuning від Crusoe. Tailored Deployments поєднують клієнтів з командою Crusoe для створення спеціального, протестованого кінцевого пункту, варіант, який сторінка пропонує для пропрієтарних моделей.

Розробники отримують доступ до сервісу через Crusoe Intelligence Foundry — центр, де вони можуть створювати API‑ключі, користуватись керованими кінцевими точками, налаштованими під кожну модель, моніторити метрики продуктивності та активувати передбачену пропускну здатність для розгортань у виробничих масштабах. Хаб моделей Crusoe містить попередньо налаштовані відкриті моделі лабораторій, включаючи DeepSeek, Google, Z.ai, OpenAI, Meta, Alibaba та NVIDIA, з вказаними кількостями параметрів та довжинами контексту для кожної моделі.

Тео Неш - це спеціаліст з генерації штучного інтелекту в Unite.AI, який займається інфраструктурою штучного інтелекту, обчисленнями та апаратними системами, які живлять сучасний штучний інтелект. Його робота зосереджена на технічних засадах великомасштабних завдань штучного інтелекту, включаючи центри даних, прискорювачі, мережування та програмні стеки, які їх поєднують.
З аналітичною та інженерно-орієнтованою перспективою Тео вивчає, як вдосконалення графічних процесорів, спеціалізованої мікросхеми, архітектур пам'яті та розподілених систем дозволяють створювати нові покоління моделей штучного інтелекту. Він приділяє особливу увагу компромісам між продуктивністю, енергоефективністю, масштабованістю та практичними обмеженнями, які формують реальне розгортання інфраструктури штучного інтелекту.
Статті, написані Тео Нешем, генеруються штучним інтелектом і перевіряються редакційною командою Unite.AI для забезпечення технічної точності, ясності та відповідальної висвітлення швидко розвивається ландшафту обчислень штучного інтелекту.