Партнерства

Thinking Machines Lab підписує угоду на $65 млн щорічно для Crusoe Cloud Inference

mm
Додайте Unite.AI до бажаних джерел у Google

Crusoe і Thinking Machines Lab оголосили щорічну угоду на $65 млн 23 вересня 2026 року, щоб забезпечити інференс відкритих моделей лабораторії на Crusoe Cloud, при цьому виробничі навантаження обслуговуються на спеціальному розгортанні систем NVIDIA HGX B200 через Crusoe Managed Inference.

У оголошенні, датованому Сан-Франциско, зазначено, що Thinking Machines Lab обслуговуватиме ряд виробничих навантажень, включаючи моделі Inkling, GLM 5.2 та 5.3, а також власні тонко налаштовані варіанти, на спеціальному Tailored Deployment систем NVIDIA HGX B200, підключених до мережі NVIDIA Quantum-2 InfiniBand. Crusoe охарактеризував розгортання як розроблене для високопродуктивного, економічного обслуговування у великому масштабі.

Crusoe безпосередньо запустить і підтримуватиме кластер як Tailored Deployment, який у випуску описується як спеціальний, протестований, SLA‑підтримуваний кінцевий пункт, призначений надати Thinking Machines Lab оптимальне співвідношення ціна‑продуктивність та резерв для масштабування без необхідності керувати власним стеком інференсу. У випуску Crusoe описує себе як першого у галузі вертикально інтегрованого постачальника AI‑інфраструктури.

Опції керованого інференсу та движок MemoryAlloy

На сторінці продукту Crusoe Managed Inference компанія представляє Tailored Deployments як найвищий рівень оптимізації: клієнт надає модель і визначає вимоги, а Crusoe займається рештою, забезпечуючи спеціальну, протестовану кінцеву точку, орієнтовану на пропрієтарні моделі, індивідуальну оптимізацію інференсу та продуктивність, підтримувану SLA.

Сторінка також описує Serverless Inference, споживання моделей з відкритим кодом за використанням через повністю керований API у Crusoe Intelligence Foundry, а також Self‑Serve Deployments, які тепер загальнодоступні, і які запускають моделі у Foundry з інференсом, оптимізованим для пропускної здатності або швидкості реакції, включаючи моделі, налаштовані за допомогою функції Serverless Fine‑Tuning компанії. Сам Foundry представлений як платформа для розробників, що дозволяє знаходити моделі, генерувати API‑ключі, моніторити метрики продуктивності та розгортати керовані кінцеві точки.

Crusoe заявляє, що його інференсний движок працює на базі MemoryAlloy — кластерно‑нативної пам’ятної тканини, що зберігається між вузлами та забезпечує інтелектуальне маршрутизацію для усунення надмірних обчислень попереднього заповнення. Компанія повідомляє про до 9,9‑раз швидший час до першого токену та 5‑раз вищу пропускну здатність завдяки спекулятивному декодуванню та динамічному батчуванню, показники, які вона порівнювала з vLLM, що обслуговує модель Llama‑3.3‑70B у розгортанні з чотирма вузлами.

Моделі Inkling та GLM

Угода включає названі навантаження, серед яких власна сімейство Inkling лабораторії. Thinking Machines Lab випустила Inkling 15 липня 2026 року, описуючи його як трансформер Mixture‑of‑Experts з відкритими вагами, що має 975 млрд загальних параметрів і 41 млрд активних параметрів, підтримуючи контекстне вікно до 1 млн токенів. За даними лабораторії, Inkling був попередньо навчений на 45 трильйонах токенів, що охоплюють текст, зображення, аудіо та відео, і це був перший великий тренувальний запуск лабораторії, проведений на системах NVIDIA GB300 NVL72.

Разом з Inkling лабораторія представила Inkling‑Small, легший 276‑млрд‑параметрний модель Mixture‑of‑Experts з 12 млрд активних параметрів, що має інший компроміс між продуктивністю та затримкою. Повні ваги Inkling опубліковані на Hugging Face, як у вигляді оригінального чекпоінту, так і у вигляді чекпоінту NVFP4 для ефективного інференсу на системах NVIDIA Blackwell, і модель доступна для тонкого налаштування у Tinker, платформі лабораторії для кастомізації моделей, з варіантами контекстної довжини 64 К та 256 К.

Угодою також включено GLM 5.2 та 5.3 до виробничих навантажень лабораторії у сервісі. У центрі моделей Crusoe Managed Inference зазначено GLM 5.3 від Z.ai з 753 млрд параметрів та контекстом у 1 000 000 токенів, а також GLM 5.3 Flash з 320 млрд параметрів, обидві доступні для Serverless Inference.

Заяви керівництва та заплановане розширення

“Crusoe Managed Inference швидко перевів нас від оцінки до виробництва і відповідає стандартам, яким ми притримуємось у власних системах, надаючи нам масштаб і економічну ефективність для реінвестування в дослідження, що є ядром нашої діяльності,” сказав Майл Отт, керівник ML Infra у Thinking Machines Lab.

Ерван Менард, старший віце-президент з управління продуктом у Crusoe Cloud, заявив, що Thinking Machines Lab має складну інженерну команду, яка очікує від партнерів відповідати високим вимогам у міру зростання. Він зазначив, що Crusoe створив Managed Inference, щоб надати економічно ефективну, надійну інфраструктуру, інференс та інструменти життєвого циклу моделей як сервіс, щоб компанії могли запускати обрані моделі у виробництві у великому масштабі.

Компанії зазначили, що також планують розширитися до пакетного інференсу для генерації синтетичних даних у великому масштабі, що у випуску представлено як перетворення інференсу в рушій для досліджень. Crusoe повідомив, що Thinking Machines Lab приєднується до списку клієнтів, які за менш ніж рік після запуску перевищили $100 млн підписаного ARR у Crusoe Managed Inference.

Тео Неш - це спеціаліст з генерації штучного інтелекту в Unite.AI, який займається інфраструктурою штучного інтелекту, обчисленнями та апаратними системами, які живлять сучасний штучний інтелект. Його робота зосереджена на технічних засадах великомасштабних завдань штучного інтелекту, включаючи центри даних, прискорювачі, мережування та програмні стеки, які їх поєднують.
З аналітичною та інженерно-орієнтованою перспективою Тео вивчає, як вдосконалення графічних процесорів, спеціалізованої мікросхеми, архітектур пам'яті та розподілених систем дозволяють створювати нові покоління моделей штучного інтелекту. Він приділяє особливу увагу компромісам між продуктивністю, енергоефективністю, масштабованістю та практичними обмеженнями, які формують реальне розгортання інфраструктури штучного інтелекту.
Статті, написані Тео Нешем, генеруються штучним інтелектом і перевіряються редакційною командою Unite.AI для забезпечення технічної точності, ясності та відповідальної висвітлення швидко розвивається ландшафту обчислень штучного інтелекту.